各位早上好,Paper Morning又和大家见面了。
今天想和大家聊几篇最近很有意思的论文,它们有一个共同的主题:AI agent正在从“工具”向“能力”演进,而这个演进正在深刻改变我们做科学的方式。
先说第一篇,Metis: Memory Foundation Model。这篇工作提出了一个很根本的问题:为什么agent的记忆能力还要依赖外部模块?作者认为,记忆应该是模型内部的一种原生能力,而不是外挂的数据库。他们把原生记忆定义为两个东西:一是模型主干内持久且动态演化的记忆状态,二是通过模型计算自主存储和调用信息的原生记忆过程。这个思路其实和我们在neural operator里讨论的“状态保持”很像——过去我们用RNN或者隐式层来记住历史信息,现在他们要把这种能力进一步体系化。做完之后,agent就可以在更长的上下文里保持一致性和连续推理能力。我觉得这为未来构建“科研agent”打了一个很重要的架构基础。
说完记忆,我们来看看物理世界建模。PhiZero: A World Model Built Around Physical Language 这篇很有意思,它不走预测像素的老路,而是让模型先学会一种“物理语言”——也就是对世界状态转移的紧凑离散表示,然后用这种语言来推理未来,最后再把推理结果渲染成视频。这种“reason-then-render”的范式让我想到我们在PDE求解里做的事:找到一个紧凑的表示来捕捉系统的底层动力学,然后在这个表示空间里进行操作。无论是用神经网络逼近算子,还是用离散 token 捕捉物理规律,核心逻辑都是一样的——找到好的表示,就等于解决了一半的问题。物理语言的价值在于,它让隐含在像素里的物理规律变得可解释、可推理了。
接下来这篇,Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement,更直接地和我们的领域相关了。它构建了一个叫OpenMLE的全栈系统,用来研究AI如何自己改进AI——也就是递归自我改进。他们定义了四个原子程序演化操作:draft、improve、debug、crossover,然后用执行反馈来训练模型做这些操作。这让我想到一个很有意思的问题:如果AI可以自己改进机器学习工程,那能不能让它来改进科学发现的工作流?比如自动设计实验、自动搜索材料配方、自动优化物理模拟的边界条件。recursive self-improvement这个范式一旦成熟,对AI for Science的效率提升将是巨大的。
当然,光有推理能力不够,agent还要能实际操作。Qwen-UI-Agent 展示了一个面向真实环境的GUI agent,能在手机、电脑、网页等多种界面上操作,还能结合命令行执行。它的一个特点是统一动作空间,把GUI操作和CLI执行混在一起,一次模型调用就能生成一批动作。这种“能说会做”的能力,对于未来构建自动化科研平台非常重要——想象一下,一个agent可以自己打开模拟软件、修改参数、运行计算、分析结果。
最后,AskChem 带来了一个基础设施层面的创新。它把化学文献检索的粒度从“文档”推进到了“claim”——也就是具体的科学主张。每个claim都有DOI和原文出处作为证据。这样一来,科学家或者AI agent就可以直接获取经过验证的claim,而不需要自己从全文里慢慢淘金。这其实呼应了我们一直在说的:AI for Science需要的不仅是模型,更是一套完整的基础设施来组织科学知识。
好,让我们回头看看今天的这几篇论文在说什么。记忆的原生化、物理世界的语言化、agent的自我改进、操作能力的通用化、知识组织的claim化——这些方向看似独立,但其实都在指向同一个趋势:AI正在从“辅助工具”变成“能动的智能体”,而这种能动性正在被迁移到科学研究的核心环节。我们过去关心的是怎么用神经网络求解PDE、怎么设计更好的算子架构,但现在我们也要开始关心:怎么让AI能够自主地设计实验、发现知识、改进方法论。这条路可能比单纯提升某个具体任务的准确率更有意义,也更值得我们投入精力去探索。
好了,今天的播报就到这里,我们明天见。