2026年10月3日ResearchAgents

Agent Error Dataset:5 万次失败,第一次修正就大多奏效

agent 跑失败了,通常就是记个零分扔掉。Agent Error Dataset(AED,HF 46 票)认为这是 agent 训练里最浪费的习惯,因为一次失败里装着学习所需的一切:agent 看到了什么,选了什么,环境怎么回应的。

AED 收集了 50228 对错误与诊断,来自 9961 个源任务,覆盖 33 个环境、19 类 harness、23 个策略模型。原始轨迹和执行元数据都保留了,任何人都可以重新诊断某次失败,而不必重跑整个 rollout。一条五步流水线收集自然发生的失败,为每个失败生成诊断和修正方案,再对照记录的证据核查。环境支持回放的,就把修正方案和「从同一检查点原样重试」做对比。

最关键的数字:在 3062 对匹配回放中,第一次提出的修正就把验证器通过率从 18.4% 拉到 51.1%。也就是说,找准那一步错误决策换掉它,效果接近重试碰运气的三倍。用 1656 个任务的完整诊断微调 Qwen3-8B,它在「到底哪一步错了」上与教师标签的一致率从 47.2% 升到 63.6%,超过最强的提示词基线 54.7%。

实际启示:「找出出错的那一步」是一项可训练的技能,小模型也学得会。这让一个便宜的失败诊断模型成为 agent 技术栈里现实可行的组件,坐在执行者旁边读它的轨迹。项目页在 agenterrordata.apodex.com。

链接:arxiv.org/abs/2609.40111
← 上一篇
Argo-Bench:75 亿行数据,按后果给 agent 打分
下一篇 →
超级用户日报: 2026-10-03
← 返回所有文章

评论

加载中...
>_