Paper Morning 2026-08-12
2026-08-12
各位早上好,今天Paper Morning开播。
最近agent领域特别热闹,咱们聊聊几篇有意思的工作。
先说第四篇,On-Policy Self-Distillation without Any Supervision,这篇提出了无监督的on-policy自蒸馏。传统上蒸馏需要外源监督信号,但这篇工作让模型自己当老师,用多数投票构建伪标签,然后在"不一致"的地方做知识蒸馏。这个思路让我想到科学计算里的一个老问题:我们训练PDE求解器的时候,是否也需要这种自我一致性来约束解的物理合理性?比如流体模拟中,模型输出的速度场是否满足连续性方程,或许也可以用类似的自洽性来约束。
第三篇Beyond Pixels讲的是从视频先验到4D世界的生成。这篇的核心贡献是提出了latent-to-4D的方法,不再依赖RGB重建,而是直接利用视频模型的latent space。这让我想到最近AI4S里一个很火的思路:我们能不能把预训练视频模型学到的物理先验,直接迁移到科学问题的时空建模上?比如流体力学里的湍流、液滴演化,这些现象在视频数据里已经学到了大量时空相关性。
第二篇Co-Evolution是关于agent系统的共演化。这篇survey把agent的自我进化分成了三个阶段,从agent之间的对抗协作,到agent与环境的交互,最后到元层面的共演化。这让我想到科学模拟里的一个根本问题:我们在训练物理世界模型的时候,是不是也该考虑模型和模拟环境之间的共演化?比如用神经网络PINNs求解PDE时,解和方程本身是否也可以形成一种共演化关系?
第一篇ComBodied Agents提出的是以人为中心的agent范式。这篇工作很有趣,它把人的状态和能动性放在建模的核心位置,而不是单纯把工具当作执行器。这让我想到一个问题:我们在做AI4S的时候,是否也该更多关注"人-机协同"这个维度?比如科学家如何和PDE求解器agent配合,各自发挥比较优势,这可能是未来科学发现的一个新范式。
第五篇BDH-CQ是今天最火的一篇,551个upvotes,讲的是in-context learning结合递归 latent reasoning。这个模型在推理时不输出中间步骤,而是在高维latent空间里做迭代计算。有趣的是它在ARC-AGI上以极低的计算成本达到了新的帕累托前沿。这让我想到一个更大的问题:科学计算里的很多问题,比如 PDE 求解,本质上也是在做"推理"——从方程和边界条件"推理"出解。那么这种 latent reasoning 的范式,能否迁移到更复杂的科学推理任务上?
今天这几篇论文看似分散,但我觉得有一个共同的脉络:都在探索"自我"这个维度——自蒸馏、自一致性、自演化latent reasoning。这可能反映了当前AI研究的一个转向:不依赖外部监督,而是挖掘模型内部的结构化知识。对我们做AI4S的人来说,这个趋势值得关注,因为它可能为科学计算中的无监督或弱监督学习提供新的思路。