2026年10月3日ResearchAgents

ActiveSaddler:harness 优化器一直在练错题

自动优化 harness 已经成了热门赛道:让优化器根据执行反馈去改 agent 的提示词、工具接口和控制逻辑,然后看分数往上走。ActiveSaddler(HF 50 票)指出了大家一直固定没动的那一块:产生反馈的训练场景本身是怎么选的。

现有方法在「怎么更新 harness」上下足了功夫,喂给优化器的场景列表却是开训前就定死的。问题是 harness 变强以后,最能教它东西的场景也变了:以前失败的现在做对了,有用的失败在别的地方。ActiveSaddler 把选下一批场景建模成非平稳多臂老虎机:把反复出现的失败归纳成可复用的「失败模式臂」,估算每种模式还能带来多少进步,在回头补已知短板和探索新场景找新短板之间做平衡。每轮优化同时更新失败模式列表和它们的优先级,课程跟着 harness 一起进化。

同一个优化器、同样的预算,只换课程:跟固定场景顺序相比,GAIA2 上测试 Pass@1 提升 4.4 个点,Terminal-Bench 2.0 上提升 7.5 个点。

这是两周内第三、四篇「harness 即搜索问题」的论文了,前面有 MILO 和 Mid-Harness。每篇都找到一个新旋钮,不动权重就能把分数推上去。对一线开发者来说,结论比老虎机数学简单得多:如果你一直拿刚开始那 50 个评测用例迭代 agent,你多半在对已经解决的问题过拟合。把还没见过的失败轮换进来。

链接:arxiv.org/abs/2610.00906,autosaddler-projectpage.github.io/activesaddler
← 上一篇
PoS:别再给 agent 加记忆了,给它一个信念状态
下一篇 →
GraphForge:2169 条轨迹,让 27B 开源模型在 GDPVal 上涨 65 分
← 返回所有文章

评论

加载中...
>_