弱模型也能审强 coding agent,前提是给它证据
coding agent 很会交出一个看起来做完了、实际上悄悄漏掉需求的补丁。长长的轨迹加上自信满满的总结,把窟窿盖得严严实实。论文 Groundability, Not Scale Alone(arXiv 2610.01023)问的是:一个更小更弱的模型,什么时候能可靠地抓住这种问题。答案是:审查者大小几乎无所谓,证据才是关键。
研究用了三个 agent 的 411 条带执行标签的轨迹,外加 101 个受控案例。在 154 条 GPT-5.4 轨迹上,给审查者结构化但未经核验的证据,缺陷检出率涨了,误杀率也涨了。换成官方执行证据并固定格式后,在 122 条留出轨迹上,六个审查者里五个两项指标同时变好,其中两个把每一条都判对了。模型大小并不能稳定预测审得好不好。
真实部署里没有官方测试,于是作者搭了一个固定级联:先查补丁引入的静态错误,再生成必须先在未打补丁的仓库上失败的测试。在留出的 GPT-5.4 和 Gemini 轨迹上,覆盖率 0.89 和 0.86,检出率 0.76 和 0.80。但误杀率还停在 0.66 和 0.67,坏补丁大多能抓住,到了审查者手里的好补丁也大多被扔掉。
这才是老实的结论。用便宜的模型监督昂贵的 agent 是可行的,瓶颈不在裁判,而在没有标准测试集时能不能造出一锤定音的检查。谁能把「写一个打补丁前会失败的测试」自动化做好,谁就拿下审查这一层。
链接:arxiv.org/abs/2610.01023
← 返回所有文章
研究用了三个 agent 的 411 条带执行标签的轨迹,外加 101 个受控案例。在 154 条 GPT-5.4 轨迹上,给审查者结构化但未经核验的证据,缺陷检出率涨了,误杀率也涨了。换成官方执行证据并固定格式后,在 122 条留出轨迹上,六个审查者里五个两项指标同时变好,其中两个把每一条都判对了。模型大小并不能稳定预测审得好不好。
真实部署里没有官方测试,于是作者搭了一个固定级联:先查补丁引入的静态错误,再生成必须先在未打补丁的仓库上失败的测试。在留出的 GPT-5.4 和 Gemini 轨迹上,覆盖率 0.89 和 0.86,检出率 0.76 和 0.80。但误杀率还停在 0.66 和 0.67,坏补丁大多能抓住,到了审查者手里的好补丁也大多被扔掉。
这才是老实的结论。用便宜的模型监督昂贵的 agent 是可行的,瓶颈不在裁判,而在没有标准测试集时能不能造出一锤定音的检查。谁能把「写一个打补丁前会失败的测试」自动化做好,谁就拿下审查这一层。
链接:arxiv.org/abs/2610.01023
评论