Loop 日报: 2026-10-05
这个周末的循环案例分成了泾渭分明的两派。一派把循环放到硬目标上,并配一个外部裁判:一个 autoresearch 循环写出了经过形式化验证的以太坊编码库,速度超过 Go 原版,另一组审计 agent 一直找证明漏洞,找到彻底放弃为止;Meta 的一条流水线让 Claude Code 和 Codex 互相审查对方的研究改动,比任何一个单独跑高出 17 个百分点。另一派在争论循环到底是什么。Alexandr Wang 把它归结为几份 markdown 文件、几个定时任务和一个指标;OpenRouter 的 Alex Atallah 说整套 agent 循环组件只是入场门票;好几位开发者反驳说,护城河恰恰在没人演示的无聊部分:停止条件、预算、权限和故障恢复。代码之外,循环开进了 3D 打印机,开进了一套受孟德尔遗传学启发的圆填充搜索,也产出了 36 篇物理论文,只是最后仍然要人类专家来签字。
#1
@GiulioRebuffo
https://x.com/GiulioRebuffo/status/2106866511440724276
GiulioRebuffo 花了大约 12 天,用 Bend 语言做了一个经过形式化验证的 SSZ 实现(以太坊共识层的编码格式),从 YAML 生成数据结构,同时生成 setter、编码器、解码器和哈希函数的证明。最初的规格和生成器是人在 AI 协助下写的;实现和性能优化则交给了 Karpathy 式的 autoresearch 循环。第三步接上一组跑 GLM-5.3 的审计 agent,专门篡改实现、看证明能不能抓到,连跑 8 小时后再也找不出漏洞,在编解码路径上彻底放弃。最终结果编码、解码都比 Go 的 fastssz 快(只有 hash_tree_root 还慢 5 倍),还能通过 FFI 直接在 Prysm 客户端里跑。
https://x.com/GiulioRebuffo/status/2106866511440724276
GiulioRebuffo 花了大约 12 天,用 Bend 语言做了一个经过形式化验证的 SSZ 实现(以太坊共识层的编码格式),从 YAML 生成数据结构,同时生成 setter、编码器、解码器和哈希函数的证明。最初的规格和生成器是人在 AI 协助下写的;实现和性能优化则交给了 Karpathy 式的 autoresearch 循环。第三步接上一组跑 GLM-5.3 的审计 agent,专门篡改实现、看证明能不能抓到,连跑 8 小时后再也找不出漏洞,在编解码路径上彻底放弃。最终结果编码、解码都比 Go 的 fastssz 快(只有 hash_tree_root 还慢 5 倍),还能通过 FFI 直接在 Prysm 客户端里跑。
#2
@dair_ai
https://x.com/dair_ai/status/2106529236676976773
dair_ai 介绍了 Meta 的论文 RankEvolve,研究怎么让自动研究 agent 变可靠:一个无声的 bug,比如评测数据泄露或梯度断开,就能让几个小时的训练和之后每一轮迭代全部作废。它用一份编译好的协议强制执行每个研究阶段和关卡,并让 Claude Code 和 Codex 作为两个独立节点,互相审查、修复对方的改动。在预算相同的情况下,两者组合把执行准确率从最好的单一产品的 45.8% 提到 62.5%。在开源推荐模型 HSTU 上迭代 12 轮,MovieLens-20M 上的 NDCG@10 比论文公布值高出 4.48%。
https://x.com/dair_ai/status/2106529236676976773
dair_ai 介绍了 Meta 的论文 RankEvolve,研究怎么让自动研究 agent 变可靠:一个无声的 bug,比如评测数据泄露或梯度断开,就能让几个小时的训练和之后每一轮迭代全部作废。它用一份编译好的协议强制执行每个研究阶段和关卡,并让 Claude Code 和 Codex 作为两个独立节点,互相审查、修复对方的改动。在预算相同的情况下,两者组合把执行准确率从最好的单一产品的 45.8% 提到 62.5%。在开源推荐模型 HSTU 上迭代 12 轮,MovieLens-20M 上的 NDCG@10 比论文公布值高出 4.48%。
#3
@mafolebaraka
https://x.com/mafolebaraka/status/2106851976151781584
mafolebaraka 整理了 Alexandr Wang 在 Y Combinator 演讲里讲自己团队怎么跑 agent 的那一段:markdown 文件、定时任务、找准指标。一份纯文本写目标和约束,一个定时任务叫醒 agent,再配一个定义清楚、带评测的成功标准来发现偏离;跑一轮、看结果、改指令、再跑。Wang 的说法是,循环搭对了,一群 agent 能顶过 100 个工程师;难点已经不是写代码,而是定指标,因为成功定义得不好,agent 群会高效地打中错误的靶子。整理者也提醒,演讲其余部分是在推销 Meta,但这一段是真实的运作描述。
https://x.com/mafolebaraka/status/2106851976151781584
mafolebaraka 整理了 Alexandr Wang 在 Y Combinator 演讲里讲自己团队怎么跑 agent 的那一段:markdown 文件、定时任务、找准指标。一份纯文本写目标和约束,一个定时任务叫醒 agent,再配一个定义清楚、带评测的成功标准来发现偏离;跑一轮、看结果、改指令、再跑。Wang 的说法是,循环搭对了,一群 agent 能顶过 100 个工程师;难点已经不是写代码,而是定指标,因为成功定义得不好,agent 群会高效地打中错误的靶子。整理者也提醒,演讲其余部分是在推销 Meta,但这一段是真实的运作描述。
#4
@abishekv
https://x.com/abishekv/status/2106769492277961036
abishekv 的观点是:agent 外面那层代码应该定义环境(上下文、记忆、工具、权限、护栏、评测),推理怎么走留给模型,因为把推理路径写死,系统就会继承写它的人的盲点。例子是 Karpathy 的 autoresearch:只给 agent 一个目标和一个评测,它自己发现把批大小减半效果更好,因为在固定算力预算内能多走几步优化。没人告诉它去那里找。在作者看来,还缺的一块是模拟环境,让 agent 有个安全的地方,去发现没人想到要它找的东西。
https://x.com/abishekv/status/2106769492277961036
abishekv 的观点是:agent 外面那层代码应该定义环境(上下文、记忆、工具、权限、护栏、评测),推理怎么走留给模型,因为把推理路径写死,系统就会继承写它的人的盲点。例子是 Karpathy 的 autoresearch:只给 agent 一个目标和一个评测,它自己发现把批大小减半效果更好,因为在固定算力预算内能多走几步优化。没人告诉它去那里找。在作者看来,还缺的一块是模拟环境,让 agent 有个安全的地方,去发现没人想到要它找的东西。
#5
@XSeyvion
https://x.com/XSeyvion/status/2106504630301560972
XSeyvion 转述了 Matthew Schwartz 的报告:开源工作台 BootLoops 加上 Claude,在 18 个领域产出了 36 篇论文稿,把模型推着完成了精确的科学计算。但在结果真正具备科学价值之前,仍然需要人类专家介入。要点在分工:agent 起草和计算,专家验证和签字。
https://x.com/XSeyvion/status/2106504630301560972
XSeyvion 转述了 Matthew Schwartz 的报告:开源工作台 BootLoops 加上 Claude,在 18 个领域产出了 36 篇论文稿,把模型推着完成了精确的科学计算。但在结果真正具备科学价值之前,仍然需要人类专家介入。要点在分工:agent 起草和计算,专家验证和签字。
#6
@kannappan
https://x.com/kannappan/status/2106827786396541196
kannappan 在伦敦 AI Science 黑客松上做了一个 autoresearch 演化框架,把孟德尔遗传学用在代码合成上,把候选程序当成会遗传、会重组性状的个体。它被用来攻两个经典搜索问题:圆填充,以及球面上不出现五点共面的问题。这是一个小例子,代表一种趋势:把「保留或丢弃」这一步换成基于种群的搜索。
https://x.com/kannappan/status/2106827786396541196
kannappan 在伦敦 AI Science 黑客松上做了一个 autoresearch 演化框架,把孟德尔遗传学用在代码合成上,把候选程序当成会遗传、会重组性状的个体。它被用来攻两个经典搜索问题:圆填充,以及球面上不出现五点共面的问题。这是一个小例子,代表一种趋势:把「保留或丢弃」这一步换成基于种群的搜索。
#7
@MWsatware
https://x.com/MWsatware/status/2106804840898970086
MWsatware 把为 3D 打印机转换模型的每一步都交给一个 agent 循环,配上视觉,还直接连着打印机。产出里有行星齿轮,还有一个据作者调研、几周前还不存在这种形态的齿轮箱。模型学会了解读工具返回的结果并据此创造,下一个实验是织一件套头毛衣。
https://x.com/MWsatware/status/2106804840898970086
MWsatware 把为 3D 打印机转换模型的每一步都交给一个 agent 循环,配上视觉,还直接连着打印机。产出里有行星齿轮,还有一个据作者调研、几周前还不存在这种形态的齿轮箱。模型学会了解读工具返回的结果并据此创造,下一个实验是织一件套头毛衣。
#8
@a16z
https://x.com/a16z/status/2106444310187290762
a16z 剪了一段 OpenRouter 联合创始人 Alex Atallah 的访谈,回应「大家都在做同一个东西」的吐槽:一个 agent 循环,加通知、第三方连接器、上下文管理、记忆、沙箱、agent 式网页搜索,最上面再放一个常驻 agent。Atallah 的回答是,这些只是新的入场标配,就像 2005 年每个网站都得有数据库、用户表和登录页,真正的差异化在它们之上。这条接近 50 万次浏览,把 agent 循环从「产品」重新定义成了「基础设施」,评论区马上有人问:谁会像当年网页那套东西被框架吸收一样,把它收进框架里。
https://x.com/a16z/status/2106444310187290762
a16z 剪了一段 OpenRouter 联合创始人 Alex Atallah 的访谈,回应「大家都在做同一个东西」的吐槽:一个 agent 循环,加通知、第三方连接器、上下文管理、记忆、沙箱、agent 式网页搜索,最上面再放一个常驻 agent。Atallah 的回答是,这些只是新的入场标配,就像 2005 年每个网站都得有数据库、用户表和登录页,真正的差异化在它们之上。这条接近 50 万次浏览,把 agent 循环从「产品」重新定义成了「基础设施」,评论区马上有人问:谁会像当年网页那套东西被框架吸收一样,把它收进框架里。
#9
@AGTPinsights
https://x.com/AGTPinsights/status/2106515522305302920
AGTPinsights 总结了 Atallah 在同一期播客里更完整的论点:10 个专职 agent 胜过 1 个通用 agent,因为每个只干一件事,就能准确看出是谁在出错;通用 agent 会把失败藏在跨领域的衔接里。Atallah 设想的形态是:一批纵向专注、各自带质检的子 agent,加一个负责协调的幕僚长 agent。Atallah 还提到,像 Jev 这样的决策模型可能成为 agent 的对齐层,用来检查一次工具调用或 agent 之间的一条消息。Harrison Chase 说自己团队内部也在争这个问题。
https://x.com/AGTPinsights/status/2106515522305302920
AGTPinsights 总结了 Atallah 在同一期播客里更完整的论点:10 个专职 agent 胜过 1 个通用 agent,因为每个只干一件事,就能准确看出是谁在出错;通用 agent 会把失败藏在跨领域的衔接里。Atallah 设想的形态是:一批纵向专注、各自带质检的子 agent,加一个负责协调的幕僚长 agent。Atallah 还提到,像 Jev 这样的决策模型可能成为 agent 的对齐层,用来检查一次工具调用或 agent 之间的一条消息。Harrison Chase 说自己团队内部也在争这个问题。
#10
@free_ai_guides
https://x.com/free_ai_guides/status/2106398901985317191
free_ai_guides 给出一套「先定停止条件」的循环做法:没有「完成」定义的 agent 一直循环,不叫坚持,只叫烧钱。动手前先用四样东西定义完成:目标、证据、约束、上下文;然后按计划、执行、验证、学习一轮轮跑,直到碰到真正的关卡。如果验证判断任务不可能完成,就上报而不是无限循环;主观性的检查交给独立评审;整个循环底下还压着一个轮数和成本上限。
https://x.com/free_ai_guides/status/2106398901985317191
free_ai_guides 给出一套「先定停止条件」的循环做法:没有「完成」定义的 agent 一直循环,不叫坚持,只叫烧钱。动手前先用四样东西定义完成:目标、证据、约束、上下文;然后按计划、执行、验证、学习一轮轮跑,直到碰到真正的关卡。如果验证判断任务不可能完成,就上报而不是无限循环;主观性的检查交给独立评审;整个循环底下还压着一个轮数和成本上限。
#11
@rai_anshu81786
https://x.com/rai_anshu81786/status/2106629074106081385
rai_anshu81786 读了 Meta 的主动记忆管理论文,针对的是长周期 agent 任务里记忆和状态逐渐衰减的问题。做法是在后台对记忆跑一个定时任务,允许它主动介入 agent 循环,而不是等 agent 自己想起来去取。论文报告长周期任务准确率有提升,这也符合一个趋势:把记忆从被动的仓库变成循环里的主动参与者。
https://x.com/rai_anshu81786/status/2106629074106081385
rai_anshu81786 读了 Meta 的主动记忆管理论文,针对的是长周期 agent 任务里记忆和状态逐渐衰减的问题。做法是在后台对记忆跑一个定时任务,允许它主动介入 agent 循环,而不是等 agent 自己想起来去取。论文报告长周期任务准确率有提升,这也符合一个趋势:把记忆从被动的仓库变成循环里的主动参与者。
#12
@dinodaizovi
https://x.com/dinodaizovi/status/2106717462465065321
dinodaizovi 提议把一体化的工作台拆成三块:agent 循环本身只需要调用推理接口;会话数据掌管上下文窗口,并根据追加进来的 token 的来源拥有一个「身份」;工具则由上下文里的工具调用请求触发。这样工具就可以按会话身份授权,再按各自的作用单独隔离。这是一种安全优先的循环读法:权限挂在来源上,而不是挂在进程上。
https://x.com/dinodaizovi/status/2106717462465065321
dinodaizovi 提议把一体化的工作台拆成三块:agent 循环本身只需要调用推理接口;会话数据掌管上下文窗口,并根据追加进来的 token 的来源拥有一个「身份」;工具则由上下文里的工具调用请求触发。这样工具就可以按会话身份授权,再按各自的作用单独隔离。这是一种安全优先的循环读法:权限挂在来源上,而不是挂在进程上。
#13
@kbsingh
https://x.com/kbsingh/status/2106752689161851029
kbsingh 在 OpenCode 里用 DeepSeek 4.1 Flash 时遇到一个故障:工具调用过程中,模型跳出了工具上下文,把原始的 DSML 标签直接吐到输出区,整个 agent 循环随之终止,上下文也没更新。让它「从断的地方接着来」也不行,因为模型没有可用的循环记忆,只能退回到上上一条提示。有人回复说别的量化模型也有同样症状:工具调用跑一阵就乱掉,然后循环几个小时。这提醒大家,工具调用格式是长时间本地循环里最脆弱的一环。
https://x.com/kbsingh/status/2106752689161851029
kbsingh 在 OpenCode 里用 DeepSeek 4.1 Flash 时遇到一个故障:工具调用过程中,模型跳出了工具上下文,把原始的 DSML 标签直接吐到输出区,整个 agent 循环随之终止,上下文也没更新。让它「从断的地方接着来」也不行,因为模型没有可用的循环记忆,只能退回到上上一条提示。有人回复说别的量化模型也有同样症状:工具调用跑一阵就乱掉,然后循环几个小时。这提醒大家,工具调用格式是长时间本地循环里最脆弱的一环。
#14
@cristian_le0
https://x.com/cristian_le0/status/2106817965706658202
cristian_le0 建议,跑自动研究的人都加一个环节:开跑前让 agent 先问人几个问题,确认假设和评测标准。目的是一开始就把自动研究者引到对的方向上,避免错误在多轮迭代里越滚越大。这相当于研究循环版的「规格访谈」,编码用户现在交活之前也都在这么做。
https://x.com/cristian_le0/status/2106817965706658202
cristian_le0 建议,跑自动研究的人都加一个环节:开跑前让 agent 先问人几个问题,确认假设和评测标准。目的是一开始就把自动研究者引到对的方向上,避免错误在多轮迭代里越滚越大。这相当于研究循环版的「规格访谈」,编码用户现在交活之前也都在这么做。
#15
@0xtomdaniel
https://x.com/0xtomdaniel/status/2106551884739936624
0xtomdaniel 说,真正让系统自主起来的,是意识到 agent 升级给人的问题,其实可以交给另一个 agent 来处理。从那以后,系统才算真正自主,而不再是一串等人回复的提醒。作者接下来打算把一个新发布的技能接进 Karpathy 式的自动研究循环。
https://x.com/0xtomdaniel/status/2106551884739936624
0xtomdaniel 说,真正让系统自主起来的,是意识到 agent 升级给人的问题,其实可以交给另一个 agent 来处理。从那以后,系统才算真正自主,而不再是一串等人回复的提醒。作者接下来打算把一个新发布的技能接进 Karpathy 式的自动研究循环。
#16
@BTCMax21
https://x.com/BTCMax21/status/2106336680701776302
BTCMax21 列出了实际跑下来,让一个完整的递归 agent 循环难以持续的原因。有个 bot 一直在问它早就有的信息,比如电话号码,因为机密是按 bot 分别存的,而不是集中存放。网站改了控件位置,agent 也会因为和上次看到的不一样而犯糊涂。这些都是琐碎的问题,但演示之后把循环搞崩的,正是它们。
https://x.com/BTCMax21/status/2106336680701776302
BTCMax21 列出了实际跑下来,让一个完整的递归 agent 循环难以持续的原因。有个 bot 一直在问它早就有的信息,比如电话号码,因为机密是按 bot 分别存的,而不是集中存放。网站改了控件位置,agent 也会因为和上次看到的不一样而犯糊涂。这些都是琐碎的问题,但演示之后把循环搞崩的,正是它们。
#17
@undefinedKi
https://x.com/undefinedKi/status/2106775535787323649
undefinedKi 讲解了 Karpathy 的 autoresearch(现在已经 9.2 万星),点出了大家容易略过的细节。指令里明确告诉 agent 永远别停、别问要不要继续,因为人可能在睡觉;人只改 program.md,Karpathy 称之为研究组织的代码;还有一条简洁规则:为一点点提升加 20 行凑合代码的改动直接扔掉,分数相同但代码更少的则保留。作者的推广是:凡是有一个要打败的数字、一个可改的文件、每次运行时间固定的问题,都能这样通宵磨下去。
https://x.com/undefinedKi/status/2106775535787323649
undefinedKi 讲解了 Karpathy 的 autoresearch(现在已经 9.2 万星),点出了大家容易略过的细节。指令里明确告诉 agent 永远别停、别问要不要继续,因为人可能在睡觉;人只改 program.md,Karpathy 称之为研究组织的代码;还有一条简洁规则:为一点点提升加 20 行凑合代码的改动直接扔掉,分数相同但代码更少的则保留。作者的推广是:凡是有一个要打败的数字、一个可改的文件、每次运行时间固定的问题,都能这样通宵磨下去。
#18
@chelsearustrum
https://x.com/chelsearustrum/status/2106474396433223698
chelsearustrum 分享了搭「生成、评估、修复」循环的心得:评估环节逐条检查每一条规则,修复环节拿到这些评估再去修。实际经验包括:保持整洁,给角色、语气和输出都定好结构,推理要平衡,别动不动用「绝不」规则矫枉过正;还有一条经验法则:人能看懂的指令,模型大概也能看懂。这个循环还变成了一个成本旋钮:可以选便宜模型多跑几轮,也可以选强模型少跑几轮。
https://x.com/chelsearustrum/status/2106474396433223698
chelsearustrum 分享了搭「生成、评估、修复」循环的心得:评估环节逐条检查每一条规则,修复环节拿到这些评估再去修。实际经验包括:保持整洁,给角色、语气和输出都定好结构,推理要平衡,别动不动用「绝不」规则矫枉过正;还有一条经验法则:人能看懂的指令,模型大概也能看懂。这个循环还变成了一个成本旋钮:可以选便宜模型多跑几轮,也可以选强模型少跑几轮。
#19
@nickvernij
https://x.com/nickvernij/status/2106755793764721008
nickvernij 正在搭一套 autoresearch 循环,专门寻找专用模型能在领域任务上以更低价格打败前沿模型的机会。这个循环的目标不是单个基准,而是一个市场缺口:找到小模型能赢的领域,再去训练它。这是在回复同一期播客时说的,节目里 Amjad Masad 也提到,模型将来可能会现场训练出更小的领域替代品。
https://x.com/nickvernij/status/2106755793764721008
nickvernij 正在搭一套 autoresearch 循环,专门寻找专用模型能在领域任务上以更低价格打败前沿模型的机会。这个循环的目标不是单个基准,而是一个市场缺口:找到小模型能赢的领域,再去训练它。这是在回复同一期播客时说的,节目里 Amjad Masad 也提到,模型将来可能会现场训练出更小的领域替代品。
#20
@Unplugged_kk
https://x.com/Unplugged_kk/status/2106746215345922457
Unplugged_kk 的看法是:自主机器学习研究先需要的是预算上限,然后才是更多 GPU。清单很短:限定 GPU 小时数、固定代码和数据版本、保存所有产物、评测提升停滞就停。没有一套可信的评测,就只是在把噪音自动化。
https://x.com/Unplugged_kk/status/2106746215345922457
Unplugged_kk 的看法是:自主机器学习研究先需要的是预算上限,然后才是更多 GPU。清单很短:限定 GPU 小时数、固定代码和数据版本、保存所有产物、评测提升停滞就停。没有一套可信的评测,就只是在把噪音自动化。
#21
@michael_chomsky
https://x.com/michael_chomsky/status/2106574123480551598
michael_chomsky 持相反立场:在 autoresearch 时代,现成的训练 API 已经有点过时,就算是方便的托管微调,限制也太多。主张是直接给模型裸 GPU,让它随时拉起 8 张、12 张甚至更多,基础模型也让它自己挑。这把本周的争论摆得很清楚:一边是严控预算的循环,一边是开放算力的循环。
https://x.com/michael_chomsky/status/2106574123480551598
michael_chomsky 持相反立场:在 autoresearch 时代,现成的训练 API 已经有点过时,就算是方便的托管微调,限制也太多。主张是直接给模型裸 GPU,让它随时拉起 8 张、12 张甚至更多,基础模型也让它自己挑。这把本周的争论摆得很清楚:一边是严控预算的循环,一边是开放算力的循环。
#22
@shaundevan_
https://x.com/shaundevan_/status/2106773711160242630
shaundevan_ 自己也在用自动研究,但认为生产环境里的 agent,尤其在企业里,不该放任自由。在复杂的生产环境中,系统按作者写好的推理去走,恰恰是重点,因为你知道它会怎么表现。这是对「让 agent 自己去发现」观点的有效平衡:探索型循环和生产型循环需要的自由度不一样。
https://x.com/shaundevan_/status/2106773711160242630
shaundevan_ 自己也在用自动研究,但认为生产环境里的 agent,尤其在企业里,不该放任自由。在复杂的生产环境中,系统按作者写好的推理去走,恰恰是重点,因为你知道它会怎么表现。这是对「让 agent 自己去发现」观点的有效平衡:探索型循环和生产型循环需要的自由度不一样。
#23
@Ja5mineEgg
https://x.com/Ja5mineEgg/status/2106597559523229759
Ja5mineEgg 给 Claude 布置过一些任务,它估计要两三个月才能完成,结果一个小时、一段很长的 agent 循环之后,成果完美无缺。这个小故事说明模型至今仍很不会估自己的工作量:估算是照着人类的工期来的,而循环把工作压缩了。
https://x.com/Ja5mineEgg/status/2106597559523229759
Ja5mineEgg 给 Claude 布置过一些任务,它估计要两三个月才能完成,结果一个小时、一段很长的 agent 循环之后,成果完美无缺。这个小故事说明模型至今仍很不会估自己的工作量:估算是照着人类的工期来的,而循环把工作压缩了。
#24
@de1lymoon
https://x.com/de1lymoon/status/2106745564410867933
de1lymoon 梳理了 OpenAI 新推出的托管 agent 会话:一次 sessions.create 调用就定义好任务、模型、工具和环境,工作台由 OpenAI 来跑。运行环境可以选 OpenAI 托管(和 Codex、ChatGPT 同一套沙箱)、自托管或不要;工具按需加载定义;子 agent 默认最多并行 6 个;vault 负责把凭证交给 MCP 工具;旧上下文自动压缩,经验存进 MEMORY.md。卖点是 agent 循环本身变成托管服务,开发者只需挑工具和环境。
https://x.com/de1lymoon/status/2106745564410867933
de1lymoon 梳理了 OpenAI 新推出的托管 agent 会话:一次 sessions.create 调用就定义好任务、模型、工具和环境,工作台由 OpenAI 来跑。运行环境可以选 OpenAI 托管(和 Codex、ChatGPT 同一套沙箱)、自托管或不要;工具按需加载定义;子 agent 默认最多并行 6 个;vault 负责把凭证交给 MCP 工具;旧上下文自动压缩,经验存进 MEMORY.md。卖点是 agent 循环本身变成托管服务,开发者只需挑工具和环境。
#25
@Cisco_research
https://x.com/Cisco_research/status/2106791644620054579
Cisco_research 提到,DeepSeek Harness 已在全球公开预览,这是一个开源 agent 运行时,一切都是插件,连 agent 循环本身也是。创作者模式可以在对话里直接写好并安装一个插件,桌面和网页端都能用。加上 Claude Code mods 和 OpenAI 的托管会话,三方现在都把循环做成了可以替换、可以定制的东西。
https://x.com/Cisco_research/status/2106791644620054579
Cisco_research 提到,DeepSeek Harness 已在全球公开预览,这是一个开源 agent 运行时,一切都是插件,连 agent 循环本身也是。创作者模式可以在对话里直接写好并安装一个插件,桌面和网页端都能用。加上 Claude Code mods 和 OpenAI 的托管会话,三方现在都把循环做成了可以替换、可以定制的东西。
#26
@MarcosRGjr
https://x.com/MarcosRGjr/status/2106492451175239965
MarcosRGjr 从运维角度解读了 Claude Code mods:一段段小的 TypeScript 函数挂在 agent 循环上,可以改写提示词、拦截或重试工具调用、批准或拒绝权限、从工具输出里抹掉机密、替换界面,/diff 这类内置功能现在也能换掉。Team 和 Enterprise 版会先加载一套安全默认配置,用户 mod 无法覆盖权限拒绝规则。结论是:agent 运行时刚刚变成了可编程平台,同时也是一个没有沙箱的插件面,没有信任边界的可扩展性,就是 agent 集群的新攻击面。
https://x.com/MarcosRGjr/status/2106492451175239965
MarcosRGjr 从运维角度解读了 Claude Code mods:一段段小的 TypeScript 函数挂在 agent 循环上,可以改写提示词、拦截或重试工具调用、批准或拒绝权限、从工具输出里抹掉机密、替换界面,/diff 这类内置功能现在也能换掉。Team 和 Enterprise 版会先加载一套安全默认配置,用户 mod 无法覆盖权限拒绝规则。结论是:agent 运行时刚刚变成了可编程平台,同时也是一个没有沙箱的插件面,没有信任边界的可扩展性,就是 agent 集群的新攻击面。
#27
@techNmak
https://x.com/techNmak/status/2106765347793858563
techNmak 发布了一本关于工作台工程的技术手册,出发点是:一个能干的模型本身不是 agent,总得有东西决定模型看到什么上下文、能用哪些工具、哪些状态在步骤之间保留、哪些操作要审批、什么时候重试、什么时候停、怎么验证真的完成了。手册覆盖 agent 循环、agent 与电脑的接口、MCP、技能、上下文压缩、沙箱、凭证、提示注入、执行预算、评估循环、幂等性和长时运行的恢复。最尖锐的一点是:工具或脚手架加多了,如果带来了新模型已不需要的歧义,agent 反而会变差。
https://x.com/techNmak/status/2106765347793858563
techNmak 发布了一本关于工作台工程的技术手册,出发点是:一个能干的模型本身不是 agent,总得有东西决定模型看到什么上下文、能用哪些工具、哪些状态在步骤之间保留、哪些操作要审批、什么时候重试、什么时候停、怎么验证真的完成了。手册覆盖 agent 循环、agent 与电脑的接口、MCP、技能、上下文压缩、沙箱、凭证、提示注入、执行预算、评估循环、幂等性和长时运行的恢复。最尖锐的一点是:工具或脚手架加多了,如果带来了新模型已不需要的歧义,agent 反而会变差。
#28
@sengorakualpha
https://x.com/sengorakualpha/status/2106300230064914510
sengorakualpha 下一个要发布的是 microloop,一个面向本地模型的受监督 agent 循环,护栏写死在代码里,有风险的操作必须用户点头。同一位开发者之前做了 README 生成器 docwrite。带明确审批关卡的本地模型循环,是这个月小开发者们反复在做的项目。
https://x.com/sengorakualpha/status/2106300230064914510
sengorakualpha 下一个要发布的是 microloop,一个面向本地模型的受监督 agent 循环,护栏写死在代码里,有风险的操作必须用户点头。同一位开发者之前做了 README 生成器 docwrite。带明确审批关卡的本地模型循环,是这个月小开发者们反复在做的项目。
#29
@CodyBontecou
https://x.com/CodyBontecou/status/2106432192947875972
CodyBontecou 七个月前做过一个概念验证:用 llama.cpp 在手机上跑本地模型,在 agent 循环里读写手机的文件系统。随着手机成为常驻个人 agent 的目标平台,这个项目在一串讨论移动端 agent 的帖子里又被翻了出来。有意思的是,整个循环完全在设备上跑,中间没有服务器。
https://x.com/CodyBontecou/status/2106432192947875972
CodyBontecou 七个月前做过一个概念验证:用 llama.cpp 在手机上跑本地模型,在 agent 循环里读写手机的文件系统。随着手机成为常驻个人 agent 的目标平台,这个项目在一串讨论移动端 agent 的帖子里又被翻了出来。有意思的是,整个循环完全在设备上跑,中间没有服务器。
#30
@leonardoalt
https://x.com/leonardoalt/status/2106677678564577419
leonardoalt 指出,验证 Rust 代码至今仍然极其困难,是个悬而未决的大问题;但借助 autoresearch,在 Lean 里也能做到 Rust 级别的性能。思路是用可验证的语言写,再让优化循环去追平速度差距,对性能不敏感的地方接受一点损失。这和本周 GiulioRebuffo 在 Bend 上押的是同一个注。
https://x.com/leonardoalt/status/2106677678564577419
leonardoalt 指出,验证 Rust 代码至今仍然极其困难,是个悬而未决的大问题;但借助 autoresearch,在 Lean 里也能做到 Rust 级别的性能。思路是用可验证的语言写,再让优化循环去追平速度差距,对性能不敏感的地方接受一点损失。这和本周 GiulioRebuffo 在 Bend 上押的是同一个注。
#31
@bhaskarmelkani
https://x.com/bhaskarmelkani/status/2106757637920510432
bhaskarmelkani 描述了一个用于日常工作的简单改进循环:人们一直在纠正 AI,但大多数教训在对话结束时就没了。把反复出现的纠正做成可复用的技能,测一测,让第 N+1 个任务比第 N 个做得更好。这其实是把 autoresearch 的「保留或丢弃」规则,从基准分数换成了用户自己的反馈。
https://x.com/bhaskarmelkani/status/2106757637920510432
bhaskarmelkani 描述了一个用于日常工作的简单改进循环:人们一直在纠正 AI,但大多数教训在对话结束时就没了。把反复出现的纠正做成可复用的技能,测一测,让第 N+1 个任务比第 N 个做得更好。这其实是把 autoresearch 的「保留或丢弃」规则,从基准分数换成了用户自己的反馈。
📡 生态产品雷达
生态产品雷达
Karpathy 的 autoresearch:依旧是参照标准,大约一半有实质内容的帖子都引用它,从形式化验证到批大小的意外发现。
Claude Code 和 Codex:越来越多地被放进同一个循环里,一个写一个审,Meta 的 RankEvolve 是最清楚的例子。
OpenRouter 和 Atallah 那期播客:周末关于「循环只是入场标配」和「10 个专职 agent 对 1 个通用 agent」争论的源头。
GPT-6.1 Sol 和 OpenAI 托管 agent 会话:托管循环的选项,主打便宜到可以直接拿来跑循环。
Claude Code Mods 和 DeepSeek Harness:两个把 agent 循环开放出来、允许改写的插件层。
Karpathy 的 autoresearch:依旧是参照标准,大约一半有实质内容的帖子都引用它,从形式化验证到批大小的意外发现。
Claude Code 和 Codex:越来越多地被放进同一个循环里,一个写一个审,Meta 的 RankEvolve 是最清楚的例子。
OpenRouter 和 Atallah 那期播客:周末关于「循环只是入场标配」和「10 个专职 agent 对 1 个通用 agent」争论的源头。
GPT-6.1 Sol 和 OpenAI 托管 agent 会话:托管循环的选项,主打便宜到可以直接拿来跑循环。
Claude Code Mods 和 DeepSeek Harness:两个把 agent 循环开放出来、允许改写的插件层。
评论