Paper Morning 2026-08-02
2026-08-02
各位早上好,今天是周日,Paper Morning准时开播。
先从一篇挺有野心的文章说起。Metis这个工作想解决一个问题:现在的AI Agent依赖外部记忆模块,但这些记忆其实是"外挂"的,跟模型本身是割裂的。作者提出"记忆foundation model"的概念,让模型拥有原生记忆能力——模型内部有一个持久且动态变化的记忆状态,同时具备自主存储和利用信息的原生记忆过程。这不是简单增加一个context window,而是让记忆成为模型架构的一部分。想想看,这其实呼应了我们之前聊过的"agent memory"这个被长期忽视的角落。当模型能够 endogenous 地记住和检索信息,它和外部世界的交互方式会发生根本变化。
顺着这个思路,第二篇论文 PhiZero 提出了一个很有趣的观察:现有的物理世界模型直接在像素空间预测未来,但这种隐式表达让底层物理规律变得难以捉摸。PhiZero的思路是,先让模型从视频里学习一种"物理语言"——对世界状态转换的紧凑离散表示,然后用这种语言去推理未来会怎样,最后再渲染成视频。这相当于在感知和生成之间加了一层"物理推理层"。这个设计让我想起人是怎么理解世界的:我们不是记住每一帧画面,而是用语言抽象出"物体 会从A滚到B"这样的物理规律。PhiZero就是在尝试让模型做到这件事。
第三篇 Frontis-MA1 很有意思,它直接指向了一个更大胆的目标——AI的递归自我改进。作者构建了一个叫OpenMLE的系统,是机器学习工程的完整测试环境。然后在这个环境里训练一个35B的模型作为"元进化agent",让它能够自己改进ML代码。这四个原子操作——draft、improve、debug、crossover——既是训练时的操作,也是推理时搜索的基本单元。这意味着AI不再只是执行任务,而是在学习"如何改进自己完成任务的方式"。当然,这目前还是在相对可控的ML工程场景下,但它打开了一扇门。
第四篇 Qwen-UI-Agent 则是把agent往前推向了真实世界。它不再满足于某个单一环境,而是要成为一个"通用执行器":手机、电脑、网页、命令行都能操作,还能跨平台执行长时序任务。这里有个技术细节我很欣赏:它的action space统一了GUI操作和CLI执行,在一个模型turn里就能生成一批action。这其实反映了我们之前讨论的趋势——agent正在从"单一技能"走向"多模态通用操作能力"。
最后一篇 AskChem 看起来是给化学领域做的,但它背后的思路值得扩展。传统文献检索是找"相关文档",但科学家真正需要的是"这个具体发现来自哪篇论文的哪句话"。AskChem把检索单位从文档推进到了claim——每个论文被拆解成带出处标注的原子主张,然后在上面构建层级分类和检索结构。这让我想到,其实在很多科学领域,我们都需要这样的claim-level基础设施,而不只是document-level的搜索。
今天这五篇论文放在一起看,有一个很清晰的趋势:AI agent正在从"依赖外部工具"向"内生能力"转变。Metis让记忆成为模型原生能力,PhiZero让物理推理成为内在过程,Frontis-MA1让自我改进成为训练目标,Qwen-UIAgent让多模态操作成为统一能力,AskChem让领域知识成为结构化资产。这些工作不只是在堆功能,而是在重新定义"智能体"应该具备什么样的核心能力。当这些能力逐渐汇聚,我们离真正自主的科研agent可能又近了一步。