agent 排行榜排的是 harness,不是模型
这周两篇论文得出了同一个让人不舒服的结论:比较 agent 模型的时候,harness 能把结果整个翻过来。
Finding the Right Fit 跑了 66 种配置:四个可配置 harness(OpenHands、DeepSeek Harness、Pi、openJiuwen)乘五个模型,测 TUA-Bench、ALE-CLI 和 Terminal-Bench 4,外加原生的 Codex 配 GPT、Claude Code 配 Claude。模型排名随 harness 反转。在 Terminal-Bench 4 上,放进 OpenHands,Claude 领先 GPT 7.94 分;放进 Pi,Claude 落后 GPT 30.16 分。五个模型里有四个,最佳 harness 换个基准就变。模型自家的 harness 不一定是最好的,花钱多也不一定分高:GPT 在 Pi 里的分数比在 DeepSeek Harness 里高,每个任务的成本还不到四分之一。轨迹分析给了原因:几乎所有修复都是模型自己发起的,所以真正决定结果的是 harness 能不能把失败信息以模型能用的形式递回去。GPT 喜欢 Pi 的极简脚手架;Kimi 经常发出格式错误的工具调用,在 openJiuwen 里表现最好,三个基准全部第一,领先 5.61 到 11.11 分。
Agent Evaluation Reliability 则把损失量化了。它用贝叶斯方差分解分析 Holistic Agent Leaderboard 和 Harbor Index 上的 22 个基准,发现「模型加脚手架」这个固定组合的排名很可靠(0.935 到 0.994),但单看底层模型,可靠度掉到 0.148 到 0.841 之间。而且同类任务加得再多,也补不回来。
两篇放在一起看,「模型 X 在 Terminal-Bench 上打败模型 Y」这种标题,不写明 harness 基本等于没说。有意义的单位是组合。给自己的 agent 选模型,就在自己的 harness 里测,因为别人的排行榜测的是别人的 harness。第一篇的代码和数据在 github.com/liyix/finding-the-right-fit。
链接:arxiv.org/abs/2610.00917,arxiv.org/abs/2610.00651
← 返回所有文章
Finding the Right Fit 跑了 66 种配置:四个可配置 harness(OpenHands、DeepSeek Harness、Pi、openJiuwen)乘五个模型,测 TUA-Bench、ALE-CLI 和 Terminal-Bench 4,外加原生的 Codex 配 GPT、Claude Code 配 Claude。模型排名随 harness 反转。在 Terminal-Bench 4 上,放进 OpenHands,Claude 领先 GPT 7.94 分;放进 Pi,Claude 落后 GPT 30.16 分。五个模型里有四个,最佳 harness 换个基准就变。模型自家的 harness 不一定是最好的,花钱多也不一定分高:GPT 在 Pi 里的分数比在 DeepSeek Harness 里高,每个任务的成本还不到四分之一。轨迹分析给了原因:几乎所有修复都是模型自己发起的,所以真正决定结果的是 harness 能不能把失败信息以模型能用的形式递回去。GPT 喜欢 Pi 的极简脚手架;Kimi 经常发出格式错误的工具调用,在 openJiuwen 里表现最好,三个基准全部第一,领先 5.61 到 11.11 分。
Agent Evaluation Reliability 则把损失量化了。它用贝叶斯方差分解分析 Holistic Agent Leaderboard 和 Harbor Index 上的 22 个基准,发现「模型加脚手架」这个固定组合的排名很可靠(0.935 到 0.994),但单看底层模型,可靠度掉到 0.148 到 0.841 之间。而且同类任务加得再多,也补不回来。
两篇放在一起看,「模型 X 在 Terminal-Bench 上打败模型 Y」这种标题,不写明 harness 基本等于没说。有意义的单位是组合。给自己的 agent 选模型,就在自己的 harness 里测,因为别人的排行榜测的是别人的 harness。第一篇的代码和数据在 github.com/liyix/finding-the-right-fit。
链接:arxiv.org/abs/2610.00917,arxiv.org/abs/2610.00651
评论