Loop 日报: 2026年8月17日
autoresearch 昨天从一种氛围变成了一件可以下载的东西。一份研究发布出来,附带了开源权重模型的完整轨迹、草稿本和推理流,连实验配置一起放出,而在这个领域真正动手的人,讨论的重点不是结论而是这批数据本身。往下看,实操层面的主线一致到有点无聊,但这种无聊是好事:没有指标的循环只是昂贵的噪音,「保留还是回滚」这个决定才是产品的全部,而真正决定一个循环是复利还是漂移的,是模型外面那层 harness,不是模型。最有价值的其实是失败报告。自我改进的循环会以极高的速度继承你的预处理 bug。一次不该成功的成功,会被永久存成一个可复用的技能。而一个没有外部检查点的循环,只会更快地奖励漂移。
#1
@oscarmoxon
https://x.com/oscarmoxon/status/2088738661244514473
他称这是同类中的第一份 auto-research 研究,而且刻意分成三部分:前沿系统今天能做到什么、它们怎么失败、以及递归自我改进的地平线上还有什么。中间那部分正是这个领域一直在跳过的。大多数公开的 autoresearch 演示只展示成功的那条轨迹,悄悄把循环跑偏的那些次数扔掉,所以一份把失败模式当作一等结果来处理的研究,比又一份精彩集锦有用得多。
https://x.com/oscarmoxon/status/2088738661244514473
他称这是同类中的第一份 auto-research 研究,而且刻意分成三部分:前沿系统今天能做到什么、它们怎么失败、以及递归自我改进的地平线上还有什么。中间那部分正是这个领域一直在跳过的。大多数公开的 autoresearch 演示只展示成功的那条轨迹,悄悄把循环跑偏的那些次数扔掉,所以一份把失败模式当作一等结果来处理的研究,比又一份精彩集锦有用得多。
#2
@tokenbender
https://x.com/tokenbender/status/2088738655833907468
他对同一份发布的反应直指那个平时没人肯给的资产:开源权重模型的完整轨迹、草稿本、推理流,以及实验配置。他的原话是,全球上百家做 autoresearch 的创业公司正对这批数据流口水。这确实是这个领域现在真正的瓶颈。谁都能描述一个循环,但几乎没有人公开循环在那些一无所获的运行里到底想了什么,而那恰恰是训练或评估下一个循环最需要的材料。
https://x.com/tokenbender/status/2088738655833907468
他对同一份发布的反应直指那个平时没人肯给的资产:开源权重模型的完整轨迹、草稿本、推理流,以及实验配置。他的原话是,全球上百家做 autoresearch 的创业公司正对这批数据流口水。这确实是这个领域现在真正的瓶颈。谁都能描述一个循环,但几乎没有人公开循环在那些一无所获的运行里到底想了什么,而那恰恰是训练或评估下一个循环最需要的材料。
#3
@eliebakouch
https://x.com/eliebakouch/status/2088745056564109682
他那份致谢名单基本就是一张「谁在认真研究循环」的地图:METR 的评测、Recursive_SI、Keller Jordan 的 modded-nanogpt 以及所有参与那次 speedrun 的人,还有 Karpathy 的 nanogpt 和 autoresearch,正是后者把很多人(包括他自己)拉进这个方向的。modded-nanogpt 这条线比看上去更重要:一个有固定目标和公开记分板的公共 speedrun,是最干净的 autoresearch 基准,因为指标毫无歧义,而所有改进都可以靠重放来验证。
https://x.com/eliebakouch/status/2088745056564109682
他那份致谢名单基本就是一张「谁在认真研究循环」的地图:METR 的评测、Recursive_SI、Keller Jordan 的 modded-nanogpt 以及所有参与那次 speedrun 的人,还有 Karpathy 的 nanogpt 和 autoresearch,正是后者把很多人(包括他自己)拉进这个方向的。modded-nanogpt 这条线比看上去更重要:一个有固定目标和公开记分板的公共 speedrun,是最干净的 autoresearch 基准,因为指标毫无歧义,而所有改进都可以靠重放来验证。
#4
@iScienceLuvr
https://x.com/iScienceLuvr/status/2088759372457652578
他称赞了 Prime Intellect 这次实验,然后做了一件更多人该做的事:说出自己实际在用什么。他自己的 autoresearch 实验主要跑在 GPT-5.6 Sol 上,现在在考虑要不要换成 Claude,至少换成 Kimi K3。他对这份研究提的问题很尖锐:prime-agent 提升了 Kimi-K3,但没测它是否也能提升 Sol 和 Fable,所以这个增益到底属于 harness,还是属于它被调教时针对的那个特定模型,现在说不清。
https://x.com/iScienceLuvr/status/2088759372457652578
他称赞了 Prime Intellect 这次实验,然后做了一件更多人该做的事:说出自己实际在用什么。他自己的 autoresearch 实验主要跑在 GPT-5.6 Sol 上,现在在考虑要不要换成 Claude,至少换成 Kimi K3。他对这份研究提的问题很尖锐:prime-agent 提升了 Kimi-K3,但没测它是否也能提升 Sol 和 Fable,所以这个增益到底属于 harness,还是属于它被调教时针对的那个特定模型,现在说不清。
#5
@suoyu007
https://x.com/suoyu007/status/2088628735767409077
关于 Prime Intellect 到底开源了什么,这是最清楚的一版描述。prime-agent 是一个自我改进的 RLM harness:agent 活在一个持久的 REPL 里,通过写 Python 来调用工具而不是填工具 schema,把子 agent 当成普通函数调用来生成,并根据历史运行的证据给自己的 playbook 打补丁。他最后那句最关键:它是为长任务设计的,不是为聊天演示。所有设计选择都是从这一点推导出来的,尤其是那个持久 REPL——它让状态能在多次迭代之间存活,而不是每次从对话记录里重建。
https://x.com/suoyu007/status/2088628735767409077
关于 Prime Intellect 到底开源了什么,这是最清楚的一版描述。prime-agent 是一个自我改进的 RLM harness:agent 活在一个持久的 REPL 里,通过写 Python 来调用工具而不是填工具 schema,把子 agent 当成普通函数调用来生成,并根据历史运行的证据给自己的 playbook 打补丁。他最后那句最关键:它是为长任务设计的,不是为聊天演示。所有设计选择都是从这一点推导出来的,尤其是那个持久 REPL——它让状态能在多次迭代之间存活,而不是每次从对话记录里重建。
#6
@DanKornas
https://x.com/DanKornas/status/2088726164244173152
他把 Autoresearch 作为一个自主迭代 skill 发布出来,支持 Claude Code、OpenCode 和 Codex,机制窄得让人舒服:先建立基线、做一处聚焦的改动、验证结果、保留或回滚。验证是机械的,测试、基准、评分或任何可测量的结果都行,指标一变差就自动回滚。迭代默认有次数上限,无限运行必须显式开启;一共十四条命令,覆盖规划、调试、修复、安全审计、场景探索、回归检查和发布;Claude Code 版本还额外带 hook 级别的护栏。MIT 协议。
https://x.com/DanKornas/status/2088726164244173152
他把 Autoresearch 作为一个自主迭代 skill 发布出来,支持 Claude Code、OpenCode 和 Codex,机制窄得让人舒服:先建立基线、做一处聚焦的改动、验证结果、保留或回滚。验证是机械的,测试、基准、评分或任何可测量的结果都行,指标一变差就自动回滚。迭代默认有次数上限,无限运行必须显式开启;一共十四条命令,覆盖规划、调试、修复、安全审计、场景探索、回归检查和发布;Claude Code 版本还额外带 hook 级别的护栏。MIT 协议。
#7
@aftaab___
https://x.com/aftaab___/status/2088730843502248273
一句话把整个品类总结得比大多数长贴都好:没有指标、没有保留/回滚循环的 agent,只会生成昂贵的噪音。他接着说,autoresearch 看起来正是让 Claude Code 或 Codex 真正产生复利的那块缺失拼图。「复利」这个词是关键。一个没有记分板的编码 agent,产出的是一堆看起来都挺合理的 diff;同一个 agent 加上基线和回滚规则,产出的是一个单调改进的产物,而两者在「每单位真实进展的成本」上差距巨大。
https://x.com/aftaab___/status/2088730843502248273
一句话把整个品类总结得比大多数长贴都好:没有指标、没有保留/回滚循环的 agent,只会生成昂贵的噪音。他接着说,autoresearch 看起来正是让 Claude Code 或 Codex 真正产生复利的那块缺失拼图。「复利」这个词是关键。一个没有记分板的编码 agent,产出的是一堆看起来都挺合理的 diff;同一个 agent 加上基线和回滚规则,产出的是一个单调改进的产物,而两者在「每单位真实进展的成本」上差距巨大。
#8
@tonytonggg
https://x.com/tonytonggg/status/2088661811105300682
昨天最有用的一份失败报告。自我改进的循环会高速继承你的预处理 bug。他修过最诡异的一个 bug 是分类器跟自己意见不一致——同一张脸裁剪方式不同,embedding 就不同。把裁剪标准化之后就好了。他的结论正好纠正当下的风向:图谱是好看的那一页 slide,数据一致性才是工程。如果你的指标测的其实是一个预处理产物,自主循环就会径直朝那个产物优化过去,而且比人类做得更快更彻底。
https://x.com/tonytonggg/status/2088661811105300682
昨天最有用的一份失败报告。自我改进的循环会高速继承你的预处理 bug。他修过最诡异的一个 bug 是分类器跟自己意见不一致——同一张脸裁剪方式不同,embedding 就不同。把裁剪标准化之后就好了。他的结论正好纠正当下的风向:图谱是好看的那一页 slide,数据一致性才是工程。如果你的指标测的其实是一个预处理产物,自主循环就会径直朝那个产物优化过去,而且比人类做得更快更彻底。
#9
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2088706577205432740
关于 agentic loop 效率的真实数字,来自 thehypedotnews 在同样三个构建任务上跑的实验:Grok 4.6 花了 13.11 美元,GPT-5.6 Sol 花了 20.18 美元。差距来自 Grok 的编码步子更大,201 次模型调用对 338 次。但他挑出来当作真正故事的那个数字是:输入 token 里有 93% 到 98% 是缓存读取。这些运行 Grok 消耗了约 2000 万 token,Sol 约 2600 万,而作者估算,如果没有 prompt 缓存,成本会高出大约四倍。循环的经济学,现在基本上就是缓存的经济学。
https://x.com/rohanpaul_ai/status/2088706577205432740
关于 agentic loop 效率的真实数字,来自 thehypedotnews 在同样三个构建任务上跑的实验:Grok 4.6 花了 13.11 美元,GPT-5.6 Sol 花了 20.18 美元。差距来自 Grok 的编码步子更大,201 次模型调用对 338 次。但他挑出来当作真正故事的那个数字是:输入 token 里有 93% 到 98% 是缓存读取。这些运行 Grok 消耗了约 2000 万 token,Sol 约 2600 万,而作者估算,如果没有 prompt 缓存,成本会高出大约四倍。循环的经济学,现在基本上就是缓存的经济学。
#10
@jerryjliu0
https://x.com/jerryjliu0/status/2088752023420248352
他的观点是模型路由应该做在 harness 层而不是 gateway 层,说服力来自他讲得足够具体。每个任务都由「模型组合 + agent harness」共同解决,而每个任务需要不同的组合才能落在精度与成本的帕累托前沿上。在 gateway 层优化,你就丢掉了 harness 里编码的全部上下文,只能在补全这一层做优化;在 harness 层优化,你既能事先做出模型选择,也能在 agent 循环运行当中做。他更强的那个论断是:模型组合和 harness 形状是被共同优化出来的,所以脱离其中一个,另一个基本不成立。
https://x.com/jerryjliu0/status/2088752023420248352
他的观点是模型路由应该做在 harness 层而不是 gateway 层,说服力来自他讲得足够具体。每个任务都由「模型组合 + agent harness」共同解决,而每个任务需要不同的组合才能落在精度与成本的帕累托前沿上。在 gateway 层优化,你就丢掉了 harness 里编码的全部上下文,只能在补全这一层做优化;在 harness 层优化,你既能事先做出模型选择,也能在 agent 循环运行当中做。他更强的那个论断是:模型组合和 harness 形状是被共同优化出来的,所以脱离其中一个,另一个基本不成立。
#11
@arvidkahl
https://x.com/arvidkahl/status/2088703233212747843
关于循环为什么需要外部验证,这是最完整的一份陈述:测试是唯一能可靠保证「改动不会产生 agentic loop 范围之外的副作用」的手段。大多数 agent 只看它必须编辑的那几个文件,从不看其他会与之交互的部分。他要的是单元测试、功能测试、集成测试和端到端测试,再加上 fuzz 或变异测试来抓边界情况;harness 那边则要显式写明测试应该长什么样、要覆盖什么、怎么 mock 外部依赖、以及 agent 到底有没有权限删改已有测试。至于下一个显而易见的问题——生成的测试本身也容易出错——他的解法是让另一个模型做对抗性 review。
https://x.com/arvidkahl/status/2088703233212747843
关于循环为什么需要外部验证,这是最完整的一份陈述:测试是唯一能可靠保证「改动不会产生 agentic loop 范围之外的副作用」的手段。大多数 agent 只看它必须编辑的那几个文件,从不看其他会与之交互的部分。他要的是单元测试、功能测试、集成测试和端到端测试,再加上 fuzz 或变异测试来抓边界情况;harness 那边则要显式写明测试应该长什么样、要覆盖什么、怎么 mock 外部依赖、以及 agent 到底有没有权限删改已有测试。至于下一个显而易见的问题——生成的测试本身也容易出错——他的解法是让另一个模型做对抗性 review。
#12
@pauliusztin_
https://x.com/pauliusztin_/status/2088604119065911735
他正在从零复刻一个 Claude Code,最核心的发现是所有人都低估的那一条:一个最朴素的编码 agent 循环小得惊人,难的是让它变得可用所需要的一切。他第一次尝试想同时把 TUI、循环、工具、skills、记忆和压缩都做出来,结果架构复杂到无法推理,于是他研究了 Claude Code、OpenCode、Aider 和 Pi 之后重来。有两个细节值得记:新的人类指令没法安全地随便插进去,所以他的 harness 会把引导、追问和中止都缓冲起来,只在工具调用之间的安全边界注入;每完成一轮就写进一份只追加的 JSONL 日志,这正是会话可恢复、失败可调试的前提。
https://x.com/pauliusztin_/status/2088604119065911735
他正在从零复刻一个 Claude Code,最核心的发现是所有人都低估的那一条:一个最朴素的编码 agent 循环小得惊人,难的是让它变得可用所需要的一切。他第一次尝试想同时把 TUI、循环、工具、skills、记忆和压缩都做出来,结果架构复杂到无法推理,于是他研究了 Claude Code、OpenCode、Aider 和 Pi 之后重来。有两个细节值得记:新的人类指令没法安全地随便插进去,所以他的 harness 会把引导、追问和中止都缓冲起来,只在工具调用之间的安全边界注入;每完成一轮就写进一份只追加的 JSONL 日志,这正是会话可恢复、失败可调试的前提。
#13
@MaziyarPanahi
https://x.com/MaziyarPanahi/status/2088698685123170570
一个小而真实的双模型循环。他先写了个极简的 agent 循环让 Qwen 来做游戏,觉得这样够糙也够灵活;然后让 Codex 去调 Qwen,要一份素材清单和每张图的生成指令,再把这部分交给 Codex 循环执行,因为 Codex 本来就带 OpenAI 的图像生成 skill。这个模式值得抄:开放式的构建交给便宜灵活的循环,重复性的生成阶段交给已经有原生工具的那个 harness。
https://x.com/MaziyarPanahi/status/2088698685123170570
一个小而真实的双模型循环。他先写了个极简的 agent 循环让 Qwen 来做游戏,觉得这样够糙也够灵活;然后让 Codex 去调 Qwen,要一份素材清单和每张图的生成指令,再把这部分交给 Codex 循环执行,因为 Codex 本来就带 OpenAI 的图像生成 skill。这个模式值得抄:开放式的构建交给便宜灵活的循环,重复性的生成阶段交给已经有原生工具的那个 harness。
#14
@0xNeoNat
https://x.com/0xNeoNat/status/2088694726719594595
一句必要的泼冷水。看着一套改写知识库的 agent 配置,他指出这本质上就是把 git 分支用在了知识库上:写到一个分支、由一个 critic 审 diff、干净就合并。这么做没什么问题,但认清它是「披着 agent loop 名字的成熟版本控制纪律」是有用的。今天真正能跑通的循环设计,大部分就是这个,把话说破反而更容易分辨什么是新东西、什么只是换了个名字。
https://x.com/0xNeoNat/status/2088694726719594595
一句必要的泼冷水。看着一套改写知识库的 agent 配置,他指出这本质上就是把 git 分支用在了知识库上:写到一个分支、由一个 critic 审 diff、干净就合并。这么做没什么问题,但认清它是「披着 agent loop 名字的成熟版本控制纪律」是有用的。今天真正能跑通的循环设计,大部分就是这个,把话说破反而更容易分辨什么是新东西、什么只是换了个名字。
#15
@Secondmindsys
https://x.com/Secondmindsys/status/2088673951610204513
agent 记忆真正危险的地方不是遗忘,而是把错的东西记得太久。一条过去的指令,写下来时是有用的,三周后是过期的,等环境一变就变成有害的;决策、偏好、检索到的事实、学到的技能和成功过的工作流,全都一样。所以持久记忆带来的是一个比存储更难的问题:过去的东西里,哪些还配影响下一个决策?这个问题正是长时间运行的自我改进循环崩掉的地方——记忆不做修剪的循环,会不断从已经不成立的条件里重新推导出结论。
https://x.com/Secondmindsys/status/2088673951610204513
agent 记忆真正危险的地方不是遗忘,而是把错的东西记得太久。一条过去的指令,写下来时是有用的,三周后是过期的,等环境一变就变成有害的;决策、偏好、检索到的事实、学到的技能和成功过的工作流,全都一样。所以持久记忆带来的是一个比存储更难的问题:过去的东西里,哪些还配影响下一个决策?这个问题正是长时间运行的自我改进循环崩掉的地方——记忆不做修剪的循环,会不断从已经不成立的条件里重新推导出结论。
#16
@TechThought_org
https://x.com/TechThought_org/status/2088461261356794094
一份新研究提出了 SkillMisevo-Gym,用来追踪自我改进的 agent 会如何随时间保留潜在不安全的例程。它点出的机制正是无人值守跑循环的人该担心的:当一次偶然的成功被固化成永久策略,对齐风险就开始复利,而不是停留在局部。任何把成功轨迹提升为可复用技能库的系统,天然都有这个失败模式,因为「它成功过一次」这个信号,远比存储机制暗示的要弱得多。
https://x.com/TechThought_org/status/2088461261356794094
一份新研究提出了 SkillMisevo-Gym,用来追踪自我改进的 agent 会如何随时间保留潜在不安全的例程。它点出的机制正是无人值守跑循环的人该担心的:当一次偶然的成功被固化成永久策略,对齐风险就开始复利,而不是停留在局部。任何把成功轨迹提升为可复用技能库的系统,天然都有这个失败模式,因为「它成功过一次」这个信号,远比存储机制暗示的要弱得多。
#17
@nykdotdev
https://x.com/nykdotdev/status/2088458274030911545
只有一句话,但点名了确切的失败:自我改进的 agent 需要有检查点的输出评测,否则这个循环奖励的就是漂移。如果没有一份放在循环之外、固定不变的评测,系统就会朝着「循环此刻恰好在测的东西」优化,而那个东西会随着迭代一点点滑走。上面那些 autoresearch 设计里的保留/回滚基线,就是对这件事的具体回答。
https://x.com/nykdotdev/status/2088458274030911545
只有一句话,但点名了确切的失败:自我改进的 agent 需要有检查点的输出评测,否则这个循环奖励的就是漂移。如果没有一份放在循环之外、固定不变的评测,系统就会朝着「循环此刻恰好在测的东西」优化,而那个东西会随着迭代一点点滑走。上面那些 autoresearch 设计里的保留/回滚基线,就是对这件事的具体回答。
#18
@cyrilXBT
https://x.com/cyrilXBT/status/2088542962854629672
他把 Opus 5 换成了 DeepSeek V4-Flash,说基本等于免费,并指向一套有人搞出来的做法:把它的子 agent 当作自我改进循环跑在 Codex 里面。他给的步骤只有三步:克隆 codex-self-improving-loop 仓库、把一张「3 loop workflow」的图当规格丢给 agent、完事。用图当规格这个细节最有意思,而且它是更大趋势的一个活例子:当模型层被商品化,被分享和抄袭的就不再是权重,而是循环的形状。
https://x.com/cyrilXBT/status/2088542962854629672
他把 Opus 5 换成了 DeepSeek V4-Flash,说基本等于免费,并指向一套有人搞出来的做法:把它的子 agent 当作自我改进循环跑在 Codex 里面。他给的步骤只有三步:克隆 codex-self-improving-loop 仓库、把一张「3 loop workflow」的图当规格丢给 agent、完事。用图当规格这个细节最有意思,而且它是更大趋势的一个活例子:当模型层被商品化,被分享和抄袭的就不再是权重,而是循环的形状。
#19
@0xClandestine
https://x.com/0xClandestine/status/2088760775489798537
他说自己曾经花掉人生中好几天去优化上一代的 27b,代价高、耗时长、进展慢。他的判断是协作式 auto-research 会改写这个叙事,并号召大家一起做。这是个值得追踪的具体主张:不是说一个循环在单次优化上能赢过人类,而是说很多人对着同一个目标各自跑循环,会产生一种个人苦干从来没有过的复利。
https://x.com/0xClandestine/status/2088760775489798537
他说自己曾经花掉人生中好几天去优化上一代的 27b,代价高、耗时长、进展慢。他的判断是协作式 auto-research 会改写这个叙事,并号召大家一起做。这是个值得追踪的具体主张:不是说一个循环在单次优化上能赢过人类,而是说很多人对着同一个目标各自跑循环,会产生一种个人苦干从来没有过的复利。
#20
@stretchcloud
https://x.com/stretchcloud/status/2088485836593811629
他对 DeepSeek 开源 harness 的解读里,跟本栏目最相关的是这一点:重点不只是工具是插件,而是模型适配器、会话日志、以及 agent loop 本身都是插件,配置层面即可替换,不用改一行源码。背后那篇论文把这件事形式化成「时空可组合性」,即 agent 执行图里的每一个组件都能跨时间和环境被替换。如果循环本身是一个配置级组件,那循环设计就变成了可以做 A/B 测试的东西,而不是每试一种就得重写一个 harness——这恰好是「对 harness 本身做 autoresearch」的前提条件。
https://x.com/stretchcloud/status/2088485836593811629
他对 DeepSeek 开源 harness 的解读里,跟本栏目最相关的是这一点:重点不只是工具是插件,而是模型适配器、会话日志、以及 agent loop 本身都是插件,配置层面即可替换,不用改一行源码。背后那篇论文把这件事形式化成「时空可组合性」,即 agent 执行图里的每一个组件都能跨时间和环境被替换。如果循环本身是一个配置级组件,那循环设计就变成了可以做 A/B 测试的东西,而不是每试一种就得重写一个 harness——这恰好是「对 harness 本身做 autoresearch」的前提条件。
#21
@teortaxesTex
https://x.com/teortaxesTex/status/2088774991986770283
一句带名字的行业判断。每一家认真的实验室都在跑递归自我改进:OpenAI 有一个他称之为「AGI 实习生」的内部系统,几周就能扩一次规模;Kimi 在做,GLM 在做;连被各种黑的 DeepSeek,在一个大致 Opus 4.8 级别的模型背后,他估计每天都在 autoresearch 上烧掉万亿级 token。具体数字站不站得住另说,值得琢磨的是结构性的那一点:autoresearch 已经从一个公开的研究议题,变成了没人需要对外发表的内部产能。
https://x.com/teortaxesTex/status/2088774991986770283
一句带名字的行业判断。每一家认真的实验室都在跑递归自我改进:OpenAI 有一个他称之为「AGI 实习生」的内部系统,几周就能扩一次规模;Kimi 在做,GLM 在做;连被各种黑的 DeepSeek,在一个大致 Opus 4.8 级别的模型背后,他估计每天都在 autoresearch 上烧掉万亿级 token。具体数字站不站得住另说,值得琢磨的是结构性的那一点:autoresearch 已经从一个公开的研究议题,变成了没人需要对外发表的内部产能。
#22
@lastktn
https://x.com/lastktn/status/2088529122448285887
针对吴恩达说 agent 已经处理了他几乎全部任务、且自我改进的编排会在三到六个月内成为标准基础设施这一点,有用的是他的重新表述:自我改进不代表 agent 变聪明了,而是循环变紧了。这在今天的生产环境里具体长这样:agent 实时记录自己的失败状态、子 agent 用调整过的参数拉起来重试、评测节点在任何动作提交之前先检查输出质量、记忆层把纠正过的运行喂回活跃上下文。差距在 harness 设计,不在模型权限。
https://x.com/lastktn/status/2088529122448285887
针对吴恩达说 agent 已经处理了他几乎全部任务、且自我改进的编排会在三到六个月内成为标准基础设施这一点,有用的是他的重新表述:自我改进不代表 agent 变聪明了,而是循环变紧了。这在今天的生产环境里具体长这样:agent 实时记录自己的失败状态、子 agent 用调整过的参数拉起来重试、评测节点在任何动作提交之前先检查输出质量、记忆层把纠正过的运行喂回活跃上下文。差距在 harness 设计,不在模型权限。
#23
@mrgadgetstudio
https://x.com/mrgadgetstudio/status/2088748567905096104
一个干净的三级阶梯:按要求写代码、自主维护产品、改进自己的工作流。他的判断是 Anthropic 已经摸到了第三级,因为 Claude 的 routines 会根据失败被调整,第二天表现更好。他很小心地补了一句:这不是自我训练,只是朝自我改进 agent 方向的一个早期反馈回路。这个区分值得保留,因为现在被叫作自我改进的东西,大部分是脚手架更新,不是权重更新。
https://x.com/mrgadgetstudio/status/2088748567905096104
一个干净的三级阶梯:按要求写代码、自主维护产品、改进自己的工作流。他的判断是 Anthropic 已经摸到了第三级,因为 Claude 的 routines 会根据失败被调整,第二天表现更好。他很小心地补了一句:这不是自我训练,只是朝自我改进 agent 方向的一个早期反馈回路。这个区分值得保留,因为现在被叫作自我改进的东西,大部分是脚手架更新,不是权重更新。
#24
@betterhn50
https://x.com/betterhn50/status/2088637336007393532
昨天挂在 Hacker News 前排:用 Codex 做 auto-research,把一个 kernel 加速了 232 倍。kernel 优化是这类循环最理想的形状——一个可编辑的文件,加上一个几秒钟就返回单个数字的基准,而这恰好是「保留还是回滚」不需要人类判断就能工作的条件。让它被疯传的是那个倍数,但让它可复制的是可测量性,不是模型。
https://x.com/betterhn50/status/2088637336007393532
昨天挂在 Hacker News 前排:用 Codex 做 auto-research,把一个 kernel 加速了 232 倍。kernel 优化是这类循环最理想的形状——一个可编辑的文件,加上一个几秒钟就返回单个数字的基准,而这恰好是「保留还是回滚」不需要人类判断就能工作的条件。让它被疯传的是那个倍数,但让它可复制的是可测量性,不是模型。
📡 生态产品雷达
生态产品雷达
prime-agent(Prime Intellect)— 本周的自我改进 RLM harness,持久 REPL、子 agent 即函数、会给自己 playbook 打补丁
Claude Code — autoresearch skill 和循环脚手架最常见的宿主
Codex — 另一个默认的循环宿主,也是那个 232 倍 kernel 案例的执行者
Autoresearch skill(DanKornas)— 基线、一处改动、验证、保留或回滚,指标变差自动回滚
DeepSeek Harness — agent loop 本身成为可替换插件的地方
Kimi K3 — prime-agent 被拿来做测量的那个模型
GPT-5.6 Sol 与 Grok 4.6 — 在循环成本和步长上被对比的两个模型
modded-nanogpt — 给 autoresearch 提供了干净共享基准的那条 speedrun 血脉
prime-agent(Prime Intellect)— 本周的自我改进 RLM harness,持久 REPL、子 agent 即函数、会给自己 playbook 打补丁
Claude Code — autoresearch skill 和循环脚手架最常见的宿主
Codex — 另一个默认的循环宿主,也是那个 232 倍 kernel 案例的执行者
Autoresearch skill(DanKornas)— 基线、一处改动、验证、保留或回滚,指标变差自动回滚
DeepSeek Harness — agent loop 本身成为可替换插件的地方
Kimi K3 — prime-agent 被拿来做测量的那个模型
GPT-5.6 Sol 与 Grok 4.6 — 在循环成本和步长上被对比的两个模型
modded-nanogpt — 给 autoresearch 提供了干净共享基准的那条 speedrun 血脉
评论