Spatial Memory Agent:权重冻住、不调工具,照样打赢微调
三天里第三篇论文,从不同角度得出同一个结论:能力现在长在系统层,不在权重里。Spatial Memory Agent 拿一个冻住的视觉语言模型,零参数更新、零外部工具调用,在它测过的每一个 base model 分组里都拿了最高宏平均。arXiv 2608.12743,8 月 13 日提交,HuggingFace 30 赞,在审。
机制是一个两阶段循环。训练阶段,SMA 去问 VLM,拿回一个预测和一个奖励,然后跑一轮验证器引导的反思,把这次经历蒸馏成一条紧凑的、可迁移的经验。不是存轨迹,也不是缓存答案,是一条经验——意思是通用到能用在没见过的情境上。每条经验带一个迁移可靠性分数,这个分数会根据它在后续部署里到底有没有帮上忙来更新。推理阶段,冻住的模型把相关经验检索出来,放进上下文里推理。
那个可靠性分数是最值得抄的部分。大多数记忆系统只会不停地存和取,然后悄悄腐烂——烂记忆和好记忆堆在一起,没有任何机制能把它们分开。给每条经验按下游成败打分、让分数能涨能衰,等于给这个存储装了新陈代谢。挣不到被检索资格的记忆,就不会再被检索。
结果:五个空间基准、四个不同底座 VLM,每个 base model 分组的宏平均都是第一,20 项评测里大部分拿到最佳准确率。四个底座这一点才是关键,否则就只是撞对了一个组合——机制本身能跨骨干迁移。
把它和昨天的 DarwinX(演化 harness)、AutoDesign(优化元 harness)排在一起,这个规律已经藏不住了。三个互不相干的团队,三套不同机制,一个共同结论:前沿模型是你租来的固定资产,你真正拥有、真正能改进的是包在它外面的那套系统。当权重是唯一的杠杆时,微调是答案。现在它不是了,而论证这件事的论文堆积速度,远快于有人拿它做出产品的速度。
← 返回所有文章
机制是一个两阶段循环。训练阶段,SMA 去问 VLM,拿回一个预测和一个奖励,然后跑一轮验证器引导的反思,把这次经历蒸馏成一条紧凑的、可迁移的经验。不是存轨迹,也不是缓存答案,是一条经验——意思是通用到能用在没见过的情境上。每条经验带一个迁移可靠性分数,这个分数会根据它在后续部署里到底有没有帮上忙来更新。推理阶段,冻住的模型把相关经验检索出来,放进上下文里推理。
那个可靠性分数是最值得抄的部分。大多数记忆系统只会不停地存和取,然后悄悄腐烂——烂记忆和好记忆堆在一起,没有任何机制能把它们分开。给每条经验按下游成败打分、让分数能涨能衰,等于给这个存储装了新陈代谢。挣不到被检索资格的记忆,就不会再被检索。
结果:五个空间基准、四个不同底座 VLM,每个 base model 分组的宏平均都是第一,20 项评测里大部分拿到最佳准确率。四个底座这一点才是关键,否则就只是撞对了一个组合——机制本身能跨骨干迁移。
把它和昨天的 DarwinX(演化 harness)、AutoDesign(优化元 harness)排在一起,这个规律已经藏不住了。三个互不相干的团队,三套不同机制,一个共同结论:前沿模型是你租来的固定资产,你真正拥有、真正能改进的是包在它外面的那套系统。当权重是唯一的杠杆时,微调是答案。现在它不是了,而论证这件事的论文堆积速度,远快于有人拿它做出产品的速度。
评论