2026年10月4日ResearchBenchmarkAgents

Incident-Arena:前沿 agent 修真实线上故障,成功率不到 65%

coding agent 白天写功能很能干,半夜三点被报警叫醒还行不行?Incident-Arena(arXiv 2610.00648)的回答是:靠不住。在 20 个人工构建的故障响应任务上,前沿模型得分都低于 64.3%。

这个基准就是照着真实事故搭的。每个任务都把一个生产级开源应用部署到临时 Kubernetes 集群上,从配置层一直到底层镜像,任意位置注入故障,同时持续打着负载。验证是功能性的,不是静态检查:系统级指标必须稳住,修复过程本身也必须安全。最后这点很要命,一个靠全部重启、把流量丢光来「修好」的方案,在生产环境里根本不算修好。

这些都是长活。每次试验平均 281 万 token、41 轮。失败出现在每一个环节:诊断或定位错了,修了一半,还有越修越糟的不安全回退。

标题里说的「最后一个 9 的可靠性」,框得很准。agent 做 SRE 是企业最显而易见会掏钱的场景之一,厂商已经在卖了。20 个真实任务上 64% 的天花板是一次很有用的清醒剂,论文里的失败分类也是一张清单:评估这类产品时,别只问它关单的比例,要问它把事故搞得更糟的比例。

链接:arxiv.org/abs/2610.00648
← 上一篇
弱模型也能审强 coding agent,前提是给它证据
下一篇 →
人写的 skill 打赢 agent 自己写的,两篇论文结论一致
← 返回所有文章

评论

加载中...
>_