Paper Morning 2026-08-07
2026-08-07
各位早上好,Paper Morning又和大家见面了。
今天想先从一个我们领域特别关心的话题聊起,就是foundation model的预训练范式正在发生什么样的变化。过去一年里,大家都在谈“统一模型”,从视觉到语言再到多模态,但真正的问题是:当我们把不同模态放在一起训练时,它们到底在怎样交换信息?这直接关系到我们怎么设计AI4S的预训练策略。
第一篇论文就深入探讨了这个“物理机制”。作者在合成数据和真实大规模数据上做了系统实验,发现了一些挺有意思的现象。知识流动并不是对称的,语言、视觉理解、视觉生成这三个方向的知识迁移模式差异很大。更关键的是,数据复杂度决定了模态之间是协同还是竞争关系——当数据足够复杂时,模态会相互促进;而当数据变得稀疏或者任务过于简单,模态之间反而会“抢资源”。这个发现对我们做科学数据的预训练特别有意义,因为我们经常面临的数据挑战就是:某些物理模态的数据量远少于另一些,怎么让它们协同而不是竞争,可能是设计PDE foundation model的关键。
那么,沿着agent这个方向,今天有两篇论文都很有意思。第二篇叫ABSeeker,做的是长程搜索agent的训练方法。它提出的核心问题是:现有的agent训练方法,无论是监督微调还是强化学习,都把一条轨迹上的所有步骤同等对待,但实际上在一个长程任务里,有些步骤是对的,有些是错的,有些是冗余的。作者的思路很直接——把轨迹级别的稀疏信号转换成步骤级别的密集监督信号,即使整个任务失败了,也能识别出其中哪些动作其实是有价值的。这让我想到我们在训练科学模拟agent的时候,其实也面临类似问题:一个复杂的多步物理推理过程,怎么区分哪些中间步骤的贡献更大?这种方法论上的突破,可能比单纯扩大模型规模更有启发性。
第三篇论文ToolArtist则是在图像生成领域做了一次agent化的尝试。它把推理、工具调用和图像生成统一到一个policy里,不再是固定的工作流,也不是只控制某一部分,而是让模型自己决定什么时候该调用外部工具,什么时候该调用内部的生成能力。这其实呼应了我们一直在聊的趋势:agent能力正在从“工具”变成“模型本身的能力”。但这里也留下了一个问题需要进一步观察:当工具调用和模型原生能力深度耦合之后,它的可控性和可解释性会变成什么样?
不过说到可解释性和可靠性,今天的第四篇论文给我们泼了一盆冷水。研究个性化LLM的学者发现了一个他们称为“过度推断”的现象:模型会基于很少的证据就“脑补”出用户的各种属性,而且这种现象非常普遍——12个模型无一例外,都有35%到49%的声称内容是过度推断出来的。更值得关注的是,模型的自监测机制并不能有效纠正这个问题。这个发现其实和我们在AI4S里的一些担忧是相通的:当模型生成物理模拟结果时,我们有多大把握区分它是在“推断”还是在“推理”?这个边界可能比我们想象的更模糊。
最后,第五篇论文转向了一个更面向用户的应用场景——视频世界模型里的社交互动。HelloWorld让模型生成的角色能够响应用户按键,与镜头产生眼神接触、点头、挥手这些社交动作。这看起来像是一个偏娱乐向的工作,但它实际上触及了一个很重要的问题:世界模型怎么理解“交互”?当物理模拟需要和用户意图结合时,怎么让模型知道什么时候该“回应”,什么时候该“继续”?这种社会性交互的训练方式,或许能为我们构建更可控的物理模拟环境提供一些启发。
好了,今天的播报接近尾声。让我提炼一下今天的整体观察:这几篇论文其实都在回答同一个深层问题——当我们把基础模型推向更复杂、更自主的能力时,怎么保证它仍然可靠、可控、可解释?从多模态预训练的机制研究,到agent训练方法的创新,再到对模型幻觉和过度推断的系统性审视,这个线索其实非常清晰。我们在追求更强的agent能力,但必须同时建立起对模型行为更深入的理解。这可能才是下一阶段最值得我们投入的方向。