Paper Morning 2026-08-23

2026-08-23

各位早上好,周末的Paper Morning如约而至。 今天想先和大家聊一个趋势,就是AI for Science正在从“做计算”走向“做研究”。这不是说偏微分方程求解不重要了,而是我们开始看到一种更整体的智能在介入科研流程。刚好今天有几篇论文从不同角度触及了这个转变,我很乐意和大家分享我的观察。 先看这篇OmniScientist。现在的AI Scientist大多还是在文本、代码、标签或者预计算的摘要上做推理,但科学发现依赖的证据远不止这些。作者提出了一个端到端的全模态AI科学家,能够直接从异构的原始证据出发做研究。它有一个感知层加上三个自主Agent分别负责 ideation、experiment和writeup,在确定性pipeline里协作。读到这我想到一个类比:过去的AI Scientist像是一个只看文献综述做研究的科学家,而OmniScientist像是真的走进了实验室,看到了原始数据、仪器输出、甚至实验过程中的Procedural信息。这其实解决了一个根本问题——我们怎么让AI不仅仅复现论文的结论,而是真正像研究者一样处理原始证据?这对AI4S的意义在于,当模型能够处理多模态的科学数据时,它或许能发现一些人类研究者容易忽略的跨模态关联。 那么有了这样的AI研究者,它的能力边界在哪里呢?接下来这篇SWE-bench Science很有意思。它构建了一个针对科学软件工程的基准测试,包含来自98个GitHub仓库的119个任务,覆盖20个科学领域。作者把任务分成三类:issue驱动型、专家探索型和工程集成型。结果很有意思,即使是最强的Claude Code Opus-5,在pass@1上也达不到50%。这说明什么?科学软件和普通软件开发非常不同——它往往是科学仪器的组成部分,代码bug可能直接影响科学结论的正确性。我们现在的大模型在通用编程上很强,但在处理科学代码这种特殊场景时还有明显短板。这也提醒我们,AI4S的发展不能只关注模型本身,对科学软件工程的关注同样关键。 有了更强的AI研究者,接下来一个问题就是:怎么让它有合适的任务来训练?这里就涉及到两篇相关工作。 FACET解决的是任务合成中的信息一致性问题。它关注的是,当我们生成terminal任务时,指令、环境、参考解、可执行验证器这些 artifacts 之间必须保持一致,否则任务可能无解或评估错误。FACET通过重建相关Agent技能成信息丰富的场景,然后实现并修复可执行任务来保证这种一致性。读这篇论文时我想到,这其实是在解决一个很实际的问题:我们能不能系统化地生成高质量的训练数据,让AI学会做科学研究?过去我们常关注预训练数据规模,但科学任务的多样性和一致性同样是制约AI Scientist能力的瓶颈。 EnvHarness则从另一个角度切入。它提出一个问题:现在的LLM Agent在静态环境中学习,但这些环境是人工构建的,无法感知Agent的弱点,Agent变强后环境就过时了。EnvHarness通过一个可编程的插件层来重塑静态环境的行为,而不修改底层逻辑,同时保持原有验证器有效,并且能够自动化生成适配Agent当前能力的环境。看到这我特别兴奋,因为这其实是在为Agent构建一个“自适应训练场”。想象一下,当Agent在某个科学任务上表现不好时,环境能够自动调整,生成更有针对性的挑战。这对于训练能够做复杂科学推理的Agent来说,可能是一个重要的基础设施。 最后回到4DAnyone,它做的是从单目视频重建4D人体。虽然看似是计算机视觉的工作,但它用到了Gaussian Splatting这种显式的辐射场表达,而且在生成多视角一致视频时遇到了bounded-attention-context的问题——当目标视角超过单次前向传播的容量时,分组会导致跨视角的appearance guidance减弱。这个问题在科学模拟中其实很常见:我们做大规模PDE求解时,如何在计算资源受限下保持全局一致性?这种跨领域的类比很有意思。 好,让我总结一下今天的整体观察。这五篇论文其实指向同一个方向:AI for Science正在从工具走向研究者。我们看到从证据处理能力(OmniScientist)、到科学软件能力(SWE-bench Science)、到训练任务生成(FACET)、到自适应环境(EnvHarness),一个完整的AI Scientist生态正在被构建。神经算子求解当然还是核心能力,但当这些能力被整合进更大的研究范式时,AI4S可能会迎来一个从“辅助计算”到“参与发现”的范式转变。这值得我们持续关注。 祝大家周末愉快,Paper Morning下周继续。

本期涉及论文