GraphForge:2169 条轨迹,让 27B 开源模型在 GDPVal 上涨 65 分
办公类 agent 卡在训练数据上。要学会读一堆文件、调度工具、交付成果,它需要建立在大量真实文件上、结果可校验的任务。用模型生成文件,看着假、也不够多样;用真实文件却没有针对任务的校验,质量没法保证。GraphForge(HF 33 票)用一个结构同时解决两头:证据图。
流程从对应真实职业的种子出发,用来控制任务多样性。每个种子组装一个由真实文件构成的工作区,再建一张描述这些文件之间关系的图。任务描述和评分细则都从这张图里推出来,所以每条要求都有工作区里的文件撑腰,每条评分项都指向验证它所需的具体文件。先跑一次 rollout 检验任务是否真的可做,再由一个修订 agent 对照原始文件修好任务和细则,然后才开始收集训练轨迹。
数据量不大,回报不小。只用 2169 条 GraphForge 轨迹微调 Qwen3.6-27B,在 OpenHands 下 GDPVal 升到 1445.7(加 65.7);在 Claude Code 下,Workspace-Bench-Lite 升到 63.7(加 7.7),SpreadsheetBench II 升到 24.0(加 13.7)。再用锚定证据的细则从模型自己的 rollout 里挑最好的做拒绝采样微调,三个基准都继续涨。
容易被忽略的重点是那份细则。一份绑定到具体文件的评分细则不只是打分器,还是可以拿来训练的筛选信号。大多数「AI 同事」产品缺的正是这块验证器。细则锚定在证据上,活就可检查;可检查的活,就能训练。
链接:arxiv.org/abs/2609.38923
← 返回所有文章
流程从对应真实职业的种子出发,用来控制任务多样性。每个种子组装一个由真实文件构成的工作区,再建一张描述这些文件之间关系的图。任务描述和评分细则都从这张图里推出来,所以每条要求都有工作区里的文件撑腰,每条评分项都指向验证它所需的具体文件。先跑一次 rollout 检验任务是否真的可做,再由一个修订 agent 对照原始文件修好任务和细则,然后才开始收集训练轨迹。
数据量不大,回报不小。只用 2169 条 GraphForge 轨迹微调 Qwen3.6-27B,在 OpenHands 下 GDPVal 升到 1445.7(加 65.7);在 Claude Code 下,Workspace-Bench-Lite 升到 63.7(加 7.7),SpreadsheetBench II 升到 24.0(加 13.7)。再用锚定证据的细则从模型自己的 rollout 里挑最好的做拒绝采样微调,三个基准都继续涨。
容易被忽略的重点是那份细则。一份绑定到具体文件的评分细则不只是打分器,还是可以拿来训练的筛选信号。大多数「AI 同事」产品缺的正是这块验证器。细则锚定在证据上,活就可检查;可检查的活,就能训练。
链接:arxiv.org/abs/2609.38923
评论