Paper Morning 2026-08-11

2026-08-11

各位早上好,Paper Morning又和大家见面了。 今天想先从一个大家都在思考的问题开始:当我们谈论大模型能力的时候,究竟在谈论什么?最近有几篇论文很有意思,它们不约而同地在回答一个更根本的问题——模型怎么才能自己变强? 第一篇关于无监督自我蒸馏。各位可能知道,蒸馏一直是让小模型学习大模型能力的有效手段,但这篇工作问了一个更激进的问题:能不能只靠模型自己就完成蒸馏?他们的方法叫做U-OPSD,简单说就是让模型生成多个回答,然后用一个“自我一致性”的阈值来筛选出多数认同的答案,再让模型去学习那些和多数答案不一致的样本。整个过程不依赖任何外部标签或者更大模型的监督。这件事为什么重要呢?它其实在逼近一个理想状态:模型能不能像人一样,通过自我反思来修正自己的想法?这让我想到我们在做PDE求解器的时候,也在追求类似的目标——能不能让求解器自己发现并修正错误,而不是依赖标注数据来告诉它什么是对。 第二篇BDH-CQ是一个很有野心的尝试。他们想要在in-context learning的基础上加入“隐式推理”。具体做法是用一个 recurrent memory 来持续更新模型的内部状态,然后在这个高维隐空间里做迭代计算,而不是把中间步骤说出来。听起来是不是有点眼熟?这其实有点像是把system 2的思维过程压缩到了隐空间里。他们在ARC-AGI这个基准上达到了29.5%的pass@2,而且每次推理只花七厘钱。这个数字最让人震惊的不是准确率,而是成本——它打破了我们之前看到的成本-准确率的帕累托前沿。这让我想到一个问题:我们做科学计算的时候,是不是也可以用类似的思路?把复杂的迭代求解过程用隐式推理来实现,从而大幅降低计算成本? 接下来这篇Ouroboros就更有意思了。这是一个“自我进化”的编码agent,它的核心理念是让agent的代码、工具、prompt都通过“被审查的提交”来改进自己。换句话说,它不只是执行任务,还会在每次执行之后反思自己的不足,然后更新自己的工具链。这在AI4S里其实对应着一个很大的命题:我们能不能构建一个会自我进化的科学计算系统?现在的很多AI4S pipeline都是静态的,调参之后就用,不会根据新问题来修改自己。Ouroboros给了一个思路,但它目前主要还是在coding场景,离真正的科学计算还有距离。 第四篇Macaron-V1提出了一套更完整的开放持续学习框架。他们有两个核心目标:一个是自适应,一个是协作。自适应体现在递归地改进模型和 harness 的配对,协作则通过 Mixture-of-LoRA 来实现——冻结一个基座模型,然后挂载多个专家适配器,根据用户的需求动态选择使用哪一个。这其实解决了一个很实际的问题:当我们有了一个很大的基座模型之后,怎么让它在不同任务上都能保持高效?这和我们做 neural operator 时经常遇到的权衡很像——是训练一个全能模型,还是针对不同物理问题训练专门的模型?Macaron-V1选择了后者,但用了一种更灵活的方式来做。 最后这篇SWE-Bench ProMax提出了一个新的代码重构基准。大家知道,现有的benchmark很多都饱和了,而且质量参差不齐——他们审计发现近60%的未解决实例包含有问题的测试。代码重构需要跨文件的协调修改,是对agent能力的一个更真实的检验。这个工作让我想到,我们在构建科学计算的benchmark时,是不是也面临类似的问题?很多现有的PDE基准太简化了,真正有挑战的是跨尺度、多物理的复杂问题,但这些问题的标注成本极高,怎么设计高质量的评估框架,本身就是一个需要解决的问题。 好,让我来做今天的收尾。今天这几篇论文看似分散,但其实都指向同一个趋势:大模型正在从“被动的工具”向“能动的自我改进者”转变。无论是从自己生成的数据中学习,还是在隐空间里做推理,抑或是通过反馈循环来进化自己的能力,核心都是让模型减少对外部信号的依赖。这种趋势对于AI4S意味着什么?我们一直在说的“数据驱动的科学发现”,能不能进一步变成“自我驱动的科学发现”?当然,路还很长,但今天的工作至少让我们看到了这种可能性。好了,各位今天也辛苦了,我们明天再见。

本期涉及论文