2026年10月4日ResearchSkillsCoding

人写的 skill 打赢 agent 自己写的,两篇论文结论一致

这周两篇论文对「自我进化 agent」给出了同一个不太舒服的结论:人写的 skill,比 agent 给自己写的更值钱。

第一篇 Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents(arXiv 2609.30725)翻了 1200 条 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的轨迹。三个浪费习惯:重复检索已经检索过的东西、生成几乎一样的脚本、反复重跑测试,出现在 79% 到 98% 的任务里,最多吃掉 22.75% 的任务成本。然后作者在另外 1 万条轨迹上试了解法。agent 从自己轨迹里总结出来的 skill,又碎又只适用于那条轨迹。开发者设计的 skill 给的是高层指导,成本最多降 41.73%,大约是 agent 自写 skill 最好成绩的两倍。最顺理成章的工程解法「结构感知检索」,有时反而让成本涨了 28.14%。

第二篇 RASO(arXiv 2609.38024,Hugging Face 每日榜 46 赞)出发点一样:网上公开分享的 skill 已经有几百万个,大多数 skill 优化方法却视而不见,从零开始烧 rollout 去打磨。RASO 先检索相关的现成 skill,跨领域、跨 harness 做适配,再在执行反馈引导下边改边检索。在四个 agent 基准、两个模型上都赢了不用检索的基线。

合起来看:让 agent 把一件事做好,最便宜的办法是把人已经想明白的东西交给它,再按它的 harness 改一改。自己写的 skill 不是没用,但眼下只是次优解。公开 skill 库正在变成真资产,而「跨 harness 适配」这一步,才是值得去造的那块。

链接:arxiv.org/abs/2609.30725 以及 arxiv.org/abs/2609.38024
← 上一篇
Incident-Arena:前沿 agent 修真实线上故障,成功率不到 65%
下一篇 →
超级用户日报: 2026-10-04
← 返回所有文章

评论

加载中...
>_