2026年10月4日ResearchOpen SourceAgents

Mingbird:小模型干不成活,锅在 harness 不在模型

把一个 4B 模型塞进为云端前沿模型设计的 harness,它会散架。工具定义撑爆上下文,自我纠错越纠越偏,示例死循环,任务悄悄就放弃了。Mingbird(arXiv 2610.02001)认为这些大部分是 harness 的锅,于是专门给小模型造了一个来证明。

这是一个面向 Windows 和 Ollama 的本地优先 harness,十个机制,每个对应补一种小模型的失败模式。最值得说的三个:按字节算的预填充预算,保证工具定义不吃掉上下文;一个「收工闸门」,在接受「做完了」之前把任务重读一遍;按动作签名做循环检测。在作者的 LRAB 基准上(4 个 harness 乘 4 个 2B 到 35B 的开源模型乘 18 个真实任务,288 个格子全部公开),Mingbird 得 0.886,goose 0.631,opencode 0.479,agent-mini 0.405。在 tau2-bench 上它是 0.856,对手 0.791 和 0.737。

最有意思的是前沿模型那组测试。同样 18 个任务,同一个前沿模型换 harness,分数从 0.997 掉到 0.478。结构合理的几个框架之间差距在 0.072 以内。一个烂 harness 能把顶级模型砍掉一半。

作者对局限很坦白:自建基准、单台机器、单次打分,同一晚重跑分数就能波动 0.069,跟大多数单个机制的效果一样大。但光是收工闸门,三次重复里配对提升就有 0.10。「说做完之前,先把题再读一遍」,这一行思路今天谁都能抄进自己的 agent。

链接:arxiv.org/abs/2610.02001
← 上一篇
Agents Are Systems, Not Models:54% 的方差,只是因为重跑了一次
下一篇 →
技能串联劫持 agent 成功率 74%,而防御会把正经活也搞砸
← 返回所有文章

评论

加载中...
>_