Paper Morning 2026-08-29

2026-08-29

各位早上好,今天是周末,Paper Morning准时开播了。 今天的几篇论文有一个共同的底层关切:怎样让AI agent在物理世界里更好地学习和推理。这个问题看起来像是传统的机器人或具身智能议题,但今天的几项工作把它推向了更本质的层面——从数据、评估到训练范式,都在重新思考agent的构建方式。 第一篇关于游戏开发作为世界模型数据引擎的工作很有意思。作者指出,现在训练世界模型的主流思路是堆数据、堆算力,但这种思路其实漏掉了一个关键问题:数据质量。他们做了一个很妙的类比:代码agent为什么能快速进步?因为代码是可执行的,编译器和运行时可以提供高精度的reward信号。但空间生成领域呢?长期以来依赖的是CLIP分数这种模糊的代理信号,根本不足以支撑强化学习的训练。作者认为游戏开发恰恰填补了这个空白——游戏引擎里的场景本质上是一个可执行的世界规格,引擎本身就能给出精确的反馈。这样一来,就能在RL后训练中获得真正有信号的学习信号,而不是在模糊的相似度度量里打转。这个思路对做neural operator和PDE求解的朋友们其实很有启发:我们是不是也可以思考,在科学计算任务里,什么样的“引擎”可以提供类似的精确信号? 顺着世界模型这个话题,第二篇论文直接问了另一个根本性的问题:现在的视频生成模型离真正的世界模型还有多远?作者提出了一个概念叫“概率对齐”,意思是世界模型不仅要能生成一条合理的轨迹,还要能正确地建模在相同初始条件下多种可能的演化结果。他们发现现有评估只看单条视频的质量,完全没有测试模型是否能正确恢复行为分布。为此他们设计了PAWBench这个benchmark。这让我想到,这其实也是在呼应科学计算里的一个核心挑战——不确定性量化。我们做PDE求解的时候,经常需要考虑解的分布而不只是一个确定解。视频生成领域现在面临的这个问题,某种程度上和我们正在探索的神经算子处理不确定性问题,是同一类深层需求。 第三篇工作JIT-Agent则把注意力从模型本身转移到了agent的“ harness”——也就是支撑agent运行的那套框架,包括记忆管理、规划策略、动作协议和工具编排。作者有一个很犀利的观察:agent的能力不完全取决于底层大模型,harness设计有时候才是决定性因素。但问题是harness设计长期以来都是人工的、任务特定的,根本不可扩展。JIT-Agent的思路是训练一个专门的模型,根据给定任务动态合成和修复harness,让它能自我进化。这实际上是把agent的架构设计本身变成了一个可学习的问题。这个思路让我想起神经operator里大家一直在讨论的“架构自动设计”,看来在agent系统层面也正在发生类似的范式转变。 第四篇论文TTPO关注的是测试时训练的问题。他们发现最近在数学推理上进展很大的RL和自蒸馏方法都依赖真实标签,这就限制了测试时的适应能力。用多数投票的伪标签是个自然选择,但问题在于错误的投票会污染teacher,误导每一个token。他们观察到一个关键的非对称性:与伪标签不一致的rollout通常是错的,不管投票本身对不对。基于这个观察,TTPO用对称目标蒸馏一致的rollout,同时用分组RL惩罚不一致的rollout。这篇工作的意义可能不只是数学推理——它实际上在探索一个更根本的问题:如何在没有真实信号的情况下,让模型在测试时也能持续学习。这和我们关心的科学计算场景也有潜在联系,毕竟现实中的物理系统往往缺乏完美的标签。 最后一篇UrbanGround把目光投向了一个非常具体但重要的问题:现在的多模态大模型agent能否把局部感知转化为空间行动能力?他们在香港构建了一个真实规模的3D城市沙盒,让agent可以在第一人称视角下探索和导航。结果发现,从静态图像理解到动态空间行动之间,存在着显著的gap。这项工作对做具身智能和物理模拟的人来说是一个很好的提醒:仅仅能在单帧图像上做理解是不够的,真正需要的是在时序交互中保持一致的推理能力。 今天的五篇论文串起来看,有一个清晰的脉络:无论是世界模型的训练数据、评估基准、agent架构、测试时适应,还是具身智能的空间推理,所有人都在试图回答同一个根本问题——如何让AI agent在物理世界中获得可靠的学习和推理能力。这个趋势让我觉得,AI for science的下一个突破点,可能不在于模型本身变得多大,而在于我们能否建立起一套完整的、可持续的、与物理世界紧密耦合的学习基础设施。这种基础设施式的思考,可能比单纯追求某个具体任务的提升更有长期价值。

本期涉及论文