Paper Morning 2026-08-19

2026-08-19

各位早上好,Paper Morning开播了。 今天想和大家聊聊一个正在悄悄发生的变化,你会发现最近AI agent领域出现了一波从“模型能力”转向“系统能力”的研究浪潮。换句话说,大家不再只卷模型参数,转而在训练范式、部署方式、执行架构这些工程层面下功夫了。我们今天聊的几篇论文,恰好折射出这个趋势。 第一篇是关于agent skill机制的系统性研究。Skill可以理解为把一些常用知识打包成现成的技能包,让agent在推理时直接调用,而不是临时学习。这几年大家用得很多,但它到底什么时候有效、为什么有效、什么时候会失灵,其实一直没被好好研究过。这篇论文就做了这么一件事:设计了大量对照实验,分离出representation、outcome annotation、retrieval difficulty、cross-framework robustness这些因素对skill效果的影响。然后又做了一个对比研究,把定量实验和轨迹分析结合起来。最后他们清洗了8135条实验记录,保留了238条有效的未配对记录来分析。得出的结论很有意思:skill在大多数情况下能提升任务成功率,但它的有效性高度依赖于任务类型和skill本身的表述方式,而且在跨框架使用时鲁棒性会明显下降。这篇工作的价值在于,它不是在统计“skill有没有用”,而是在回答“为什么有用”以及“边界在哪里”,这为我们后面设计更可靠的agent系统提供了很重要的经验。 如果说第一篇是在反思agent的现有组件,那接下来这篇就是在重新思考模型的部署方式。FreeToken是一个面向边缘设备的MoE模型服务系统。现在大家都在推前沿的开源模型,但这些模型假设的是数据中心级别的算力,普通人根本跑不动。FreeToken的思路很有意思,它不把个人电脑当成一块小GPU,而是当成一个统一的弹性推理平台。它把整个服务栈重新设计了一遍,从模型布局、专家 residency、CPU-GPU协同执行、agent状态复用,到运行时内存管理,全部围绕两个现实情况来优化:一是agent workload的执行模式会不断变化,二是边缘硬件的资源配置每台机器都不一样。它不采用固定的offloading策略,而是动态地把计算和模型状态映射到当前实际可用的资源上。这篇工作的意义在于,它让我们看到边缘设备不只是“省电版”的服务器,而是一种需要全新系统设计的计算平台。随着agent应用越来越普及,这种边缘原生的推理系统可能会变得非常重要。 第三篇是一个benchmark paper,但这个benchmark不太一样。ASI-Bench想评估的不是AI能不能正确回答问题,而是AI能不能探索未知、创造新知识,并把新想法转化为可验证的结果。大家知道,现在大部分benchmark考的还是模型有没有学会人类已有的知识,但ASI这个概念要更进一步,要求AI能够在一定程度上自主做研究。ASI-Bench是第一个同时评估AI创新探索能力和自主科学执行能力的benchmark,而且它设计了一个很特别的机制:在同一个研究过程中逐步撤除人类的方法论指导,看看AI在失去“拐杖”之后还能走多远。这个benchmark的出现其实反映了一个很大的范式转变:我们以前总是问AI“能不能解决问题”,现在开始问它“能不能发现问题”。这个转变的影响可能超出agent本身,会关系到整个AI for Science的评估体系。 接下来这篇是关于训练方法的。我们知道强化学习在单轮对话的LLM微调上效果不错,但一旦涉及到长程的agent推理,问题就来了:交互路径变得非常branching,reward信号又非常稀疏。传统RL的局限性就暴露出来了——它需要大量的反向传播,显存消耗太大,根本finetune不动大模型;另外credit assignment在长程任务上也变得极其困难。这篇论文提出用evolution strategies也就是进化策略来替代RLfinetune长程agent。它的核心观点是ES有三个关键优势:一是模型可扩展性,ES可以做full-parameter优化但只需要极少的推理级GPU显存,这就让finetune大模型变得可行;二是灵活性,ES只需要一个轻量级的黑盒反馈接口,对reward model的要求大大降低;三是credit assignment更直接,因为它直接对整个轨迹做评估,不需要在中间步骤上做复杂的梯度分配。实验结果显示,这种方法在长程agent任务上取得了显著提升。这篇工作让我们看到,除了强化学习,还有别的路可以走,而且可能更适合当下的算力约束。 最后一篇非常有意思,它的名字叫StateM,做的事情和我们刚才聊的都不太一样。它不是改模型,也不是改训练方法,而是改agent的运行时系统。它的核心洞察是:长程agent经常会因为一些执行层面的问题而失败——比如状态追踪丢失、之前学到的教训没有复用、已知流程被跳过、或者过早停止——即使底层的模型本身是能独立解决这些步骤的。它的方案是harness scaling,围绕一个agent原生的运行时来下功夫,这个运行时把执行组织成持久的state、phase-local的context、可检查的transition、可恢复的runbook、以及版本化的程序实践。在Terminal-Bench 2.1上,它把GPT-5.5 xhigh从83.1%提升到了92.1%,GPT-5.6 Sol Ultra是91.9%,而用GPT-5.6 Sol xhigh配合StateM达到了95.3%的原始准确率。而且runbook可以直接迁移到GPT-5.6上,不需要改动。这篇工作的意义在于它验证了一个重要的观点:有时候提升agent性能不一定要改模型架构或者训练数据,优化执行系统本身就能带来巨大的收益。它拿下了361个votes,是今天这几篇里最受欢迎的。 好,我们来总结一下今天的话题。今天聊的五篇论文看起来主题分散,但从根上讲,它们都在回答一个共同的问题:怎么让agent不只是“能做事”,而是“可靠地、高效地、可扩展地做事”。skill研究在反思现有组件的边界,FreeToken在探索新的部署范式,ASI-Bench在重新定义评估目标,ESOpt在寻找更可行的训练路线,而StateM在证明执行系统的优化空间巨大。这几篇文章连在一起,描绘了一幅清晰的图景:AI agent的竞争正在从“模型能力”的单点突破,转向“系统能力”的全面比拼。这可能才是接下来几年最值得关注的方向。 好了,今天的播报就到这里,我们明天早上见。

本期涉及论文