2026年10月4日ResearchBenchmarkAgents

Agents Are Systems, Not Models:54% 的方差,只是因为重跑了一次

同一套 agent 配置跑两次,答案经常不一样。新论文 Agents Are Systems, Not Models(arXiv 2610.01618,作者里有 Cordelia Schmid)把这事量化了:结果方差里大约 54% 来自原样重跑,而不是改了任何设置。可大多数 agent 榜单只报一次结果。

实验设定是让一个 coding agent 在四个科学任务上,找到并正确运行一个已发表的专业模型。作者调了五个旋钮:任务信息、推理、自我验证、时间预算、底座模型。最大的杠杆是你告诉 agent 什么。任务信息的影响超过时间预算,也超过模型大小,还顺带降成本、提升校准。旋钮之间还会互相作用:多给时间,只有在 agent 信息够、或者模型够强能用上时间时才有用。

最扎心的发现在验证上。在提示词里叫 agent 检查答案,它的验证行为几乎不变。给它一个专门的验证工具,行为就大变。叫它做没用,给它造个工具才有用。这跟本周 Robinson 那篇批评 OpenAI 的文章在组织层面讲的是同一个道理。

这已经是一周内第三篇说「harness 和配置比模型更能决定结果」的论文,前两篇是 Finding the Right Fit 和 Mingbird。报一个 agent 分数却不报配置和重跑次数,等于报了一个贴着模型名字的噪音。基准和 1.8 万多条轨迹都已公开。

链接:arxiv.org/abs/2610.01618
← 上一篇
Offrun:一个 Mac 工作台管住 Claude Code、Codex、Grok Build,免费
下一篇 →
Mingbird:小模型干不成活,锅在 harness 不在模型
← 返回所有文章

评论

加载中...
>_