Paper Morning 2026-08-15

2026-08-15

各位早上好,欢迎来到Paper Morning。 今天想先从一篇让我觉得有点“野心勃勃”的论文聊起。Intern-S2-Preview,中文可以叫它“科学智能体基础模型”。大家知道,这两年基础模型的预训练范式从NLP、CV一路火到科学计算,但我们做的多是PDE求解器、分子property预测这类单一任务。这篇工作想要更进一步——他们训练了一个能够“通吃”科学问题的智能体基础模型。具体来说,这个模型先在渲染过的科学文档、交错图像文本数据、以及各种科学语料上做多模态预训练,然后在之上套了一层统一的后训练流程,包括监督微调、可扩展的多任务强化学习、黑白盒智能体强化学习,以及策略蒸馏。也就是说,它不仅要有科学理解能力,还要能调用工具、能在长程任务中保持推理连贯性。这其实回应了我们一直关心的问题:foundation model的预训练范式,能不能真正迁移到科学发现的全流程?过去我们谈AI for Science,往往是针对某个特定PDE、某个特定分子任务训练一个模型,但真正的科学发现需要的是能跨任务、跨模态、持续推理的系统性能力。Intern-S2-Preview算是往这个方向迈出的有意思的一步。当然,它能做到什么程度,还要看实际场景中的表现。 说完科学智能体,另一篇论文把我们的视线拉回到了一个更根本的问题上——我们到底能不能理解AI模型自己在“想什么”。Mechanist这个工作很有意思,它的标题就很直接:把AI当作科学仪器,用来发现智能的机制。作者构建了一个以可解释性为中心的知识图谱,收录了大约13000篇论文,还整合了一个跨26个领域、包含4300万篇论文的多学科数据库。然后他们训练了一个智能体系统,能够自主在这个知识网络里遨游,生成关于AI模型能力来源的新假设,甚至设计实验来验证这些假设。这听起来有点像是“AI for AI”的意思。我们做AI for Science,常常关心的是怎么用AI来帮助我们求解PDE、发现新材料,但有没有想过,AI本身也可以成为我们理解智能机制的工具?当模型越来越复杂、越来越大的时候,传统的可解释性方法已经有点跟不上了,而Mechanist提供了一种可能的方向——让AI自己去探索AI。当然,这个工作的成熟度还有待检验,但它提出的问题本身是值得我们思考的。 接下来两篇论文虽然看起来偏机器人方向,但我觉得背后有个共同的线索值得拎出来跟大家分享,那就是世界模型的发展。DreamX-Phi 1.0是一个动作条件的视频世界模型,用于机器人操作。给定一帧图像、一个语言指令和一系列动作,它能预测未来的观测结果。但这里有个关键问题:画面逼真不等于预测正确——机器人可能动的是错误的手臂,或者丢掉了操作的对象。为了解决这个问题,他们在注意力机制里注入了每个手臂的SE(3)变换,用类似PRoPE的几何编码来保持手臂身份和刚体运动结构。同时他们加了一个轻量级的深度分支来建模场景几何,还用了SAM3来处理小物体的追踪。这篇工作的贡献更多在工程细节上,核心思路其实是用几何先验来约束世界模型的输出,让它不仅看起来真实,而且物理上可信。这和我们做PDE求解时强调的“物理一致性”是一个道理——模型输出不能只是统计意义上的正确,还要满足基本的物理规律。 第四篇Alaya-EVOKE则从另一个角度切入世界模型。他们关注的是一个核心矛盾:交互式世界模型需要持久记忆、响应式交互和长视野生成,但这三个需求互相冲突。用denoiser的context或者key-value cache来维护历史,成本会随着session长度线性增长,导致必须在记忆容量和生成长度之间做trade-off。EVOKE的解法是把持久的世界状态外部化,用一个相机索引的世界状态银行来存储场景几何,只有与当前视角相关的信息才会被retrieve出来,这样denoiser的context就能保持bounded。同时他们重新设计了teacher模型,让它能够支持长视野的交互式生成,而不是只依赖少步生成的蒸馏。这篇工作提出的“外部化状态”这个思路,其实和我们科学计算中“模型与仿真分离”的理念很相似——与其把所有东西都塞进模型参数里,不如用显式的结构化表示来管理复杂度和记忆。 最后一篇PlayWorld则把关注点拉回到了评估上。他们认为视频世界模型已经有了不少进展,但怎么公平地比较这些模型仍然是个难题。传统的做法是给定固定的action sequence来评测,但实际使用中,人类玩家是通过追求长视野目标来评估模型的——比如转身360度看环境是否一致,或者走进水里看水波纹是否真实。不同的模型在同一个目标下可能采取完全不同的action sequence,所以固定action的评测方式并不公平。他们的解决方案是用多模态的agent玩家来评估世界模型。这个工作虽然方法上比较直接,但它提出的问题很重要——我们怎么评估一个科学计算模型?同样的道理,如果只做固定的测试集,可能无法真正反映模型在实际科学问题中的表现。评估范式的创新,往往和模型本身的创新一样重要。 好了,今天的五篇论文聊完了。如果要我提炼一个整体观察的话,我会说:这一波AI4S的研究,正在从“做单一任务的模型”快速走向“做系统”——无论是能调用工具、持续推理的科学智能体,还是能自主探索AI机制的可解释性系统,抑或是能长程交互、保持物理一致性的世界模型,核心都是把AI当作一个完整的“系统”来设计,而不只是某个具体问题的求解器。这种范式转变,其实在NLP里已经发生过一次了——从BERT式的encoder-decoder到GPT式的生成式智能体。现在,科学计算领域也在经历类似的迁移。我们接下来要关注的,可能不只是某个新架构、新loss function,而是这些系统层面上的整合能力。好,今天的Paper Morning就到这里,我们明天见。

本期涉及论文