RuleEvolve:你的 CLAUDE.md 是手调的,一个进化循环能调得更好
现在稍微认真一点的 coding agent 配置都有一份规则文件,CLAUDE.md、AGENTS.md 或者 .cursorrules。几乎全是手写的,出了问题才改一下,从来没量过效果。杜克大学 Neil Zhenqiang Gong 组(Zhengyuan Jiang、Reachal Wang 等人)的 RuleEvolve,把这份文件当成一个可以优化的对象。
做法是进化循环。维护一个候选规则集的池子。每一轮,LLM 变异器基于现有候选写出变体,评审模块打分,表现最好的留在池子里。agent 不动,模型不动,进化的只有规则文本。
作者在两个 coding agent 框架、四个底座模型、三个 benchmark 上做了测试。RuleEvolve 在代码功能正确性、代码长度、以及生成成本(token 用量)上,胜过手工规则,也胜过已有的提示词优化方法。摘要里没有给一个单一的头条数字,主张是:在整张实验网格上,你优化哪个维度,它就在哪个维度赢。
有意思的是和同一周的另一个发现放在一起看:开发者手写的 skill 降本效果大约是 agent 自己合成的两倍。这两个结论其实不冲突。人的先验是比白纸更好的起点,而进化循环是比「出事才去改一下」的人更好的编辑。实际可用的配方是:用你自己的 CLAUDE.md 当初始种子,让循环去改,评审用你信得过的。评审是最要紧的那一环,对着一个弱评审调出来的规则文件,学会的是讨好评审。
链接:arxiv.org/abs/2610.00650
← 返回所有文章
做法是进化循环。维护一个候选规则集的池子。每一轮,LLM 变异器基于现有候选写出变体,评审模块打分,表现最好的留在池子里。agent 不动,模型不动,进化的只有规则文本。
作者在两个 coding agent 框架、四个底座模型、三个 benchmark 上做了测试。RuleEvolve 在代码功能正确性、代码长度、以及生成成本(token 用量)上,胜过手工规则,也胜过已有的提示词优化方法。摘要里没有给一个单一的头条数字,主张是:在整张实验网格上,你优化哪个维度,它就在哪个维度赢。
有意思的是和同一周的另一个发现放在一起看:开发者手写的 skill 降本效果大约是 agent 自己合成的两倍。这两个结论其实不冲突。人的先验是比白纸更好的起点,而进化循环是比「出事才去改一下」的人更好的编辑。实际可用的配方是:用你自己的 CLAUDE.md 当初始种子,让循环去改,评审用你信得过的。评审是最要紧的那一环,对着一个弱评审调出来的规则文件,学会的是讨好评审。
链接:arxiv.org/abs/2610.00650
评论