Paper Morning 2026-07-23
2026-07-23
各位早上好,今天周四,Paper Morning如约而至。
今天想和大家聊一个我觉得特别有意思的趋势,就是世界模型这个概念,最近在计算机视觉那边火得不行,但我觉得它的思路其实和我们科学计算领域正在探索的方向有很多可以对话的地方。
先来看第一篇,Mage-Flow,一个高效的原生的4B规模的图像生成基础模型。这篇工作的核心贡献是提出了一个协同设计的生成堆栈,包括一个轻量级高保真的潜在tokenizer Mage-VAE,以及一个使用 rectified flow matching 训练的原分辨率多模态扩散Transformer。作者特别强调了一个叫做anchor-latent regularization的技术,使得VAE的重建质量和公开的强VAEs相当,但是tokenization的成本降低了一个数量级以上。我看这篇论文的视角是,它其实在解决一个foundation model的老大难问题:如何在效率和能力之间取得平衡。对于我们做科学计算的人来说,这个问题特别眼熟——我们要训一个PDE的foundation model,数据量、模型规模、推理速度,这三者之间的tradeoff也是天天要面对的。Mage-Flow用tokenizer层面的创新来缓解这个矛盾,这个思路或许可以迁移到科学数据的tokenization上,比如怎么处理复杂的物理场数据,怎么设计更高效的潜在表示。
接下来这个工作就更有意思了,AlayaWorld,一个交互式的长时序世界模型。传统游戏开发需要大量人工的资产生产、动画、物理和编程工作,而视频世界模型可以即时从用户输入生成交互式环境。AlayaWorld生成长达24帧每秒的540p和720p视频,基于一个15B的视频扩散Transformer,通过相机轨迹和可切换的文本提示来自回归生成短潜在块。这篇工作的关键在于它解决了四个紧密耦合的能力:交互性、持久时空一致性、稳定的长时序生成和高效响应。我看到这里的时候就在想,这不就是我们在科学模拟中追求的东西吗?我们要模拟一个物理系统,需要的也是长期稳定、能够交互、保持物理一致性,世界模型领域的这些进展或许能给科学计算中的数字孪生、实时仿真一些启发。
第三篇AlayaRenderer-Flash可以看作是第二篇的技术深化。原版的AlayaRenderer从物理引擎导出的结构化世界状态合成RGB帧,保持场景结构而不改变底层世界动力学,这其实是另一种世界建模的路径,用户可以控制但不会破坏物理规律。但是原版太慢了,只有0.56帧每秒。AlayaRenderer-Flash把它重新表述为几步自回归流模型,引入了轻量级设计,从0.56帧提升到31.54帧,达到了可玩的速度。这个进步幅度很惊人,也让我想到科学可视化中的一个类似挑战:怎么让高保真的物理模拟实时化?虽然领域不同,但是这种few-step自回归的思路、这种把计算压力从单次推理转移到latent space的策略,可能是通用的。
第四篇ABot-World-0更激进,它实现了在单张桌面GPU上的无限交互式世界rollout。这是一个动作条件的视频世界模型,支持实时长时序闭环交互,数据来源包括AAA游戏、仿真引擎和互联网视频。他们提出了一个叫做LongForcing的技术来对齐长时序自 rollout和扩展视野的教师模型,缓解累积的分布漂移和自回归漂移问题。这篇论文拿到了200个upvotes,是今天最热的。我注意到一个细节,它特别强调了raw keyboard actions作为输入,这意味着它追求的是完全可控的、低层次的交互,而不是高级语义指令。这让我想到一个问题:我们在做物理仿真的时候,是不是也往往过度依赖高级抽象,而忽略了低层次控制的可能性?强化学习里的action space设计,可能和物理模拟中的控制粒度是一个道理。
最后一篇是一篇可解释性的工作,研究文本到图像的扩散Transformer在去噪过程中内部到底在干什么。作者提出了一个结合注意力分解和跨token span、head、layer定向干预的因果可解释性框架。他们发现了一件事很有意思:结构token,也就是所谓的Text Template Tokens,虽然在编码器输出时几乎没有prompt特定信息,但是它们在图像到文本的注意力中成为了主导的sink,充当隐式的语义寄存器,因果性地维持了DiT内部的对象身份。这个发现对理解生成模型很有帮助,也让我想到,我们训练PDE神经网络的时候,是不是也有很多这样隐式的结构在起作用?可能模型学到了一些我们没有显式设计但很重要的内部表示。
好了,今天五篇论文都聊完了,我有一个整体的观察:这波世界模型的热潮,其实和我们AI4S领域正在探索的operator learning、foundation model有很多方法论上的共振。计算机视觉那边在解决长时序一致性、实时推理、可控性这些问题,我们这边在做PDE求解器的时候,面临的挑战本质上是相似的——都是怎么处理复杂的时空动态,怎么在保真度和效率之间取得平衡,怎么让模型不仅能预测还能交互。今天的论文展示了一条可能的路径:用latent space的表示学习来降低计算复杂度,用自回归的结构来获得长程一致性,用teacher-student蒸馏来控制漂移。这些思路,或许值得我们AI4S的研究者认真借鉴一下。
好了,今天的播报就到这里,我们明天早上继续。