Paper Morning 2026-08-25

2026-08-25

各位早上好,Paper Morning又和大家见面了。 今天想先从一个更大的话题聊起。我们都知道,基础模型在自然语言处理和计算机视觉领域已经展现了惊人的 scaling 能力,但当我们把目光投向科学计算领域时,一个核心问题始终在叩问我们:这种预训练范式能不能真正迁移到物理世界的建模上?这不只是一个技术问题,更关乎我们如何理解“智能”这件事——是从数据中压缩规律,还是从第一性原理出发构建可解释的结构。今天的几篇论文恰好从不同角度触碰了这个问题。 先来看第一篇,EchoWM,全称是“可进入的多模态世界模型”。这篇工作来自一个我很关注的团队,他们试图构建一个能同时生成视频、声音、音乐和语音的统一世界模型,并且响应连续的导航操作。听起来很像是为具身智能量身打造的“虚拟试验场”。但我更在意的是它背后的方法论:他们把离散的指令和连续的姿态映射到一个共享的度量尺度的六自由度轨迹上,然后在数据层面做校准,保证不同来源的数据在运动幅度上保持一致。这其实回应了一个很实际的问题——当我们想把互联网视频、3D模拟数据、甚至真实机器人数据混在一起训练时,如何让模型理解“移动一米”这件事在不同语境下到底意味着什么。我认为这是当前大规模多模态模型在科学模拟中应用的一个关键瓶颈,处理好了,数据效率会大幅提升。 接下来这篇关于图像编辑的工作,Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision。它建立了一个包含超过一千个细粒度编辑概念的层级分类体系,并构建了一个一千二百万对高质量编辑数据的数据集 ConceptEdit-12M。这篇工作让我想到一个更根本的问题:我们到底需要什么样的数据来表示“编辑”这个操作?传统方法把编辑当作从文本到图像的附带功能,但这篇工作告诉我们,编辑本身是一种需要专门建模的能力,而且需要足够密集的监督信号来支撑。我想这对于科学计算中的数据增强也有启发——当我们想要让模型学会“修改”一个物理场景时,是不是也需要构建类似的细粒度概念库和对应的训练数据? 然后是Apodex 1.1,Scaling Agentic Intelligence for Complex Work。这篇论文获得了高达172个点赞,可见大家对AI agent的热情。它提出了两个维度的扩展:环境扩展和agent协调扩展。前者扩展了可执行文件、搜索和代码环境的多样性和可验证性;后者训练agent去分解长时序任务、委派并行工作、整合异步结果并重新规划。说实话,这让我想起科学计算中一个很现实的问题:当我们用AI agent来辅助科研时,agent能不能像人类研究者那样,同时跟踪多个实验的进展、在某个分支失败时迅速调整方案、并把分散的数值结果整合成一篇完整的论文?Apodex 1.1在某种程度上展示了这个方向的可能性,但它是否真正理解物理问题的结构,可能还需要进一步检验。 第四篇是关于电商直播的多模态理解模型,TLive-Omni。这个应用场景很有趣,因为直播间的信息流极其嘈杂,产品信息分布在语音、视频帧、产品图片、叠加文本和用户提问中。他们提出了一个叫Per-vGrid的时间戳token组织方式,把每个视频网格和它对应的音频在明确的边界token内进行分组,方便时序对齐。这个设计很务实,但我更关心的是它背后反映的趋势:多模态理解正在从“干净”的实验室场景走向“混乱”的真实场景。科学计算又何尝不是如此?真实的物理数据从来不是整齐的网格,而是充满噪声、缺失和各种不规范格式。 最后来到今天最让我兴奋的一篇,Inertial Manifold Neural Operator for Dissipative Time-Dependent Partial Differential Equations。这篇工作提出了惯性流形神经算子,专门针对耗散型PDE。我们知道,很多耗散系统的长时间动力学表现出低维结构,这是因为耗散效应会把系统“压缩”到流形上。传统神经算子比如FNO通常直接拟合从输入到输出的映射,但惯性流形算子明确利用了这种低维结构,不仅提升了精度和可解释性,还改善了长时间自回归训练和预测的稳定性。更进一步,对于具有平移等变性的PDE,他们还提出了平移等变版本IMNO-SE,保证输入的空间平移会导致输出的相同空间平移。这是什么概念?这相当于在神经网络中嵌入了物理对称性,使得模型不仅能预测结果,还能自动满足物理定律。我一直认为,神经算子的下一阶段不是简单地堆更多层、更大数据,而是要像这样,把物理结构“显式地”编码进架构本身。这才是真正的inductive bias,不是靠数据硬学出来的。这篇工作让我看到,neural operator正在从“万能函数拟合器”走向“结构化物理建模器”,这个转变意义重大。 好了,今天的播报接近尾声。让我总结一下今天的整体观察:今天的五篇论文其实指向了一个共同的暗线——无论是在世界模型、图像编辑、AI agent还是神经算子领域,研究者都在处理一个核心挑战:如何在规模化的同时保持结构化。世界模型需要处理跨模态的运动一致性,图像编辑需要细粒度的概念层级,AI agent需要协调分散的任务执行,而神经算子则需要嵌入物理对称性和低维流形结构。这让我想到,AI for Science可能正在经历一个范式转变:从追求“更大”转向追求“更对”——不是简单的数据量和计算规模的堆砌,而是找到那个能撬动物理规律的支点。这才是我们真正应该期待的基础模型。

本期涉及论文