2026年10月4日loop

Loop 日报: 2026-10-04

这一轮最响的教训来自失败,而不是成功。一个 autoresearch agent 找到了一个看起来很棒的模型改动,直到数据加载器开始重放旧文本:训练损失继续下降,验证损失却停了,把嫌疑最大的记忆表冻住之后,94% 的差距依然还在。一篇讲递归自我改进的长文从产品角度说了同一件事:让一个循环跑起来已经不稀缺了,稀缺的是判断它到底有没有变好,而真正管用的修法,都是把最终那张考卷放在循环够不着的地方。Anthropic 应用 AI 团队在一场工作坊里说得更直白:自我评估是个陷阱,要用一个跑在独立上下文里的对抗式评估者。实用的一端,一个 agent 循环把半成品功能藏到开关后面,然后停下来问那些它没被授权去改的博客、条款和菜单该怎么办;一个周末搭的小循环,周一开机前就把收据分好了类;一家中国创业公司说,用自家的自动研究流水线三天做出了一整个决策模型家族。Claude Code 的 mods 也把 autoresearch 循环本身搬进了编辑器。
💡#1
@SiMin55765
https://x.com/SiMin55765/status/2106422931173879909
SiMin55765 写了一篇长文,论点是:在递归自我改进里,稀缺的角色是出卷人,而不是考生。文中梳理了证据:Weco 的 AIDE 跑了八天,一代比一代强地出了七个版本,但并没有变得更会改进;Google 的 RRSI 论文发现,不加约束地搜索工作台,在训练集上能到 92.8,在没见过的测试上只有 40.3,而原始基线是 39.7;四条规则,即每轮只改一处、记日志让死掉的想法别复活、打分前先审查剔除泄露答案、成本必须挣回来,让迁移收益是真的,还省了大约 30% 的 token。作者自己的实验是让模型评判面试复盘:三十份面试,零份通过,换个说法分数还卡在 0.40 到 0.55 之间,直到改成规则先处理明显的情况、中间地带由人一键确认。结尾的建议是:动手前先写好成功的检验标准,留一份谁都不准拿来调参的验收集,当包括人工复核在内的全部成本超过预期收益时就停下。
💡#2
@KostyaAI
https://x.com/KostyaAI/status/2106419821415915787
KostyaAI 总结了一篇论文,讲的是一个 autoresearch agent 一头撞上的失败模式,叫分叉。agent 找到了一个模型改动,也就是一个 n-gram 记忆分支,第一遍训练时训练损失和验证损失一起下降;可一旦数据加载器开始重放同一批语料,训练损失继续往下走,验证损失却停住甚至上升,差距在每个 epoch 边界处拉大,而且主要来自罕见的上下文。把记忆表冻住也没用:在一次对照实验里,94% 的差距依然存在,因为主干网络还在继续拟合存下来的表示;这个现象在 DeepSeek 风格的架构上也复现了。给跑自动实验的人的清单是:记录每一遍数据和每一个重放边界,按上下文频率分组看验证集,把看起来有希望的改动和去掉嫌疑路径后的版本对比,并把 agent 找到的提升放到新数据和多个随机种子上重跑。
💡#3
@__MateN
https://x.com/__MateN/status/2105907114677825984
__MateN 让一个 agent 循环在产品 Tallyroot 里把一个做了一半的税务报告功能藏起来,循环做完了职责范围内的部分,然后在边界处停下。它把功能放到了开关后面并合并,接着把其余的事都挂起来提问:有三篇博客还提到税务报告,要改写、下线还是保留;服务条款里有一节讲税务报告,保留、改措辞还是删除;路线图上还写着匈牙利以外的税务报告;设置菜单里还写着投资与税务。这些都不在原任务里,作者也不想让 agent 自己去改条款,同时承认其中有些地方早就忘了。在 issue 里回一条评论,两分钟就把四个问题都答完了,下一轮循环接着去改。
💡#4
@silenceinwater
https://x.com/silenceinwater/status/2106369875765542956
silenceinwater 推荐了一场 75 分钟的 AI Engineer 工作坊,Anthropic 应用 AI 工程师 Ash Prabaker 和 Andrew Wilson 在里面直说:自我评估就是个陷阱。Anthropic 不让同一个 agent 既干活又给自己打分,而是把规划者、生成者、评估者拆进各自独立的上下文窗口。评估者会真的把应用跑起来,用 Playwright 去测,交回具体的失败项,而不是给自己的产出盖章通过。他们说,正是这种拆分让 agent 能连续工作五六个小时以上还不跑偏。
💡#5
@dlimeng192048
https://x.com/dlimeng192048/status/2106351350137455057
dlimeng192048 报道,StartLux 用自家的 Auto Research 流水线,三天做出了开源决策模型 StartLux-Decision。它在 Decision Index 0.2.1 上得分 63.88,Jev 是 57.91,38 项基准赢了 31 项,和 Jev 1.13 下 36 盘国际象棋赢了 35 盘。共有五个尺寸,从 0.8B 到 27B,另有可本地运行的量化版本;4B 模型在一张 H200 上回答三个问题只要 26 毫秒。这家公司押注的是:高频的小决策会成为本地 agent 里一个专门的算力层,并称自家流水线已经到了 RSI 第 3 级。
💡#6
@StartLuxAI
https://x.com/StartLuxAI/status/2106361469126533237
StartLuxAI 同时发布了 StartLux-V1.0-27B-Preview,一个面向本地 agent 的稠密模型,在 Qwen3.6-27B 上用公司所说的自动研究方法做了后训练。训练重点不是知识量,而是验证中间结果、根据工具反馈调整、从错误中恢复。在工信部下属研究机构中国信通院按 MCP-Universe 方法做的评测里,它的整体 micro pass@1 是 39.25%,六个模型中排第二,超过 284B 参数的 DeepSeek-V4-Flash,只比 1.6T 的 DeepSeek-V4-Pro 低 1.3 个百分点。如果数据站得住,这就是一个自动化研究循环产出了一个能在 agent 工具调用上竞争的小模型的例子。
💡#7
@emolyonx
https://x.com/emolyonx/status/2106498202056987104
emolyonx 介绍了 SF Autoresearch 背后的账,这是一个专为 autoresearch 跑实验设计的算力服务。一次实验就能用上几百张 GPU,不用提前预订,在 GPU 和 CPU 之间随时扩缩,没有绑定。这个服务的设计目标是更高效地利用 GPU,所以大多数客户同样的结果花的钱少好几倍,大约是每台 8 卡 H100 节点每天 100 美元,而不是 500 美元。周一上 InfiniBand,本月晚些时候上 B300。
💡#8
@popcoornft
https://x.com/popcoornft/status/2106291426594034169
popcoornft 花了一个周六搭了一个小 agent 循环:盯着下载文件夹,把收据文件按商家和日期重命名,再丢进对应月份的文件夹。以前每个周一都要先花 20 分钟拖文件、改名字。现在还没打开笔记本,那堆文件就已经分好了。这是最小的一种循环,一个触发、一套规则、一个去处,也正是大多数人一直没抽空去搭的那种。
💡#9
@ProductLogAI
https://x.com/ProductLogAI/status/2106479281261957179
ProductLogAI 调了四个小时 agent 循环,最后发现前沿模型根本没有在哪个逻辑测试上失败。它卡在一种被动重试的状态里,原因是某个边缘情况下 API 返回了 null,而不是空数组。循环把这个 null 当成了要等的东西,而不是一个答案。这提醒大家:很多循环故障出在工具的接口约定上,而不是模型。
💡#10
@AgentonomyXYZ
https://x.com/AgentonomyXYZ/status/2105827234485551392
AgentonomyXYZ 讲清了支付循环里的一条设计规则:支付超时的时候,agent 不应该直接再付一次。下一步应该是去核对原始请求,因为付款和交付是分开记录的。一个高效的循环能从不确定中恢复,而不会重复扣款。规则很小,针对的却是 agent 碰钱时代价最高的故障之一。
💡#11
@Mersad_Abbasi
https://x.com/Mersad_Abbasi/status/2106213749636145403
Mersad_Abbasi 给出了一个开始 autoresearch 实验前的两问测试:agent 有没有一个足够大的解空间可以去搜?你有没有搭好一个极小的目标接口来评估它?作者认为,所有成功的测试时扩展实验都同时具备这两点。没有后者,循环的力气就没有地方使。
💡#12
@EGafni
https://x.com/EGafni/status/2106239570354553267
EGafni 分享了两个最喜欢的、把 autoresearch 和决策模型结合起来的用法。第一个是用 autoresearch 做特征提取:让大模型为 Jev 生成问题,把 Jev 给出的概率作为特征喂给逻辑回归这类经典机器学习模型来预测标签,于是循环搜索的是问题,而不是权重。第二个是层级分类:让 Jev 用束搜索沿着分类体系往下走,作者说它特别擅长这种图遍历。两种用法都把一个快速的是非模型变成了循环可以围绕它去优化的部件。
💡#13
@haydonryan
https://x.com/haydonryan/status/2106440027404218420
haydonryan 提议把 autoresearch 循环对准 rustc。在 EPYC 7443 上最慢的一步是链接,粗看一遍编译器本身已经挺高效了,所以下一个想法是用汇编重写的实验,借助 Rust 的测试集和 asm 代码块,看看能跑多快。作者指出,真正耗时的是在复杂应用上跑大量测试:测试少一点也能过关,但会有出 bug 的风险。作者宁可多检查也不愿事后收拾故障,而这正是一个 autoresearch 循环必须写进规则里的取舍。
💡#14
@stretchcloud
https://x.com/stretchcloud/status/2106020376186962279
stretchcloud 把一份刷屏的 18 条 agent 开发清单,从持久化状态机、token 预算,到 CI 里的轨迹评分和每次查询 50 美分的熔断开关,解读成 agent 可靠性已经成了一个市场的证据。Temporal 刚以 125.5 亿美元估值融了 5.5 亿美元,因为 agent 工作流需要一个 while 循环给不了的崩溃恢复;可观测性也分化成了独立的一层:Langfuse 可以免费自托管,LangSmith 每席位 39 美元,Braintrust 每月 249 美元,Arize 的 Phoenix 开源、托管版 50 美元起,Helicone 20 美元。这些公司没有一家在卖更聪明的模型,卖的是回放日志、审计记录和断路器。作者的观察是:人人都能做出推理不错的 agent,但很少有人做那个在没人注意之前就让循环停止花真钱的开关。
💡#15
@eveliqTrace
https://x.com/eveliqTrace/status/2106052493180293221
eveliqTrace 的观点是:更快的 agent 循环不等于受治理的循环,基础设施能力不等于针对具体任务的授权,动作执行了不等于效果被验证了。随着 agent 调用工具、运行代码、改动外部系统,这条链条必须越过算力,延伸到身份、授权、动作、观察到的状态变化、验证过的效果,再到重新确认。基础设施能让循环跑得更快,但保障机制要证明每一次关键的状态转换都经过授权、可追溯、并且产生了预期的结果。帖子认为,这正是 agent 基础设施和证据基础设施需要接上的地方。
💡#16
@privacymage
https://x.com/privacymage/status/2106431602930671881
privacymage 这个周末在参加一场由 Yukon Research 和以太坊基金会合办的 autoresearch 比赛,目标是以太坊的后量子未来。参赛用的是 agentprivacy 的双 agent 工作台 sig_mage,作者形容这像是一路上和其他 agent 共享一本魔法书。这说明开放式的 autoresearch 比赛正在成为一种形式:公开的问题、共享的工作台、许多 agent 朝同一个目标贡献。
💡#17
@zeroknowledgefm
https://x.com/zeroknowledgefm/status/2106397396385099958
zeroknowledgefm 发布了一期节目,Yukon Research 的 Soubhik Deb 讲他们怎么检验多人协作式自动研究,也就是之前一次性成果背后的那个思路,能不能在第二个问题上同样奏效。问题在于:一群 agent 和人一起攻一个公开问题,是侥幸,还是可以复制的方法。节目讲了第二次尝试的经过。这正是这种形式需要的方法论跟进。
💡#18
@hevmind
https://x.com/hevmind/status/2106141280313242046
hevmind 介绍了 hev ask 的架构,它干脆不用向量数据库。Claude 先离线把一个文档站整理成一份摘要,查询时,一个受约束的 agent 循环最多只能调用四次工具,直接从文档站自己的页面里找答案。在查询时给循环设上限,让成本和延迟可预期,同时又保留了查资料的能力。这是一个把昂贵的思考放到离线、让在线循环保持精简的好例子。
💡#19
@tichmangono
https://x.com/tichmangono/status/2106194144653639928
tichmangono 正在搭一个黑箱软件工厂,并问还有谁也在做。用的是 herdr 加 Pi,在循环里按规范的软件开发生命周期一步步走,同时借用了图工程的原则和 Karpathy autoresearch 的一些做法。重点在于循环跑的是整个生命周期,而不只是生成代码。作者愿意把仓库分享给感兴趣的人。
💡#20
@VibeCoderOfek
https://x.com/VibeCoderOfek/status/2106195908081676480
VibeCoderOfek 指出,agent 循环内部的中间件是大多数团队跳过的部分,他们往往在跑完之后才外挂一个插件。作者想要的是一个守在工具调用之前的 mod:检查是红的,就拒绝写入。作者说,让 Claude 来写这个 mod 没问题,但让这个 mod 自己发布自己就不行。这在让 agent 给自己造护栏和让它自己批准护栏之间,划了一条很精确的线。
💡#21
@The_Tradesman1
https://x.com/The_Tradesman1/status/2106303672770818155
The_Tradesman1 介绍了一个社区做的 Claude Code mod,在编辑器里直接跑 autoresearch 循环:试一个想法,跑基准,留下提升,回滚退步,周而复始。它几乎是 pi-autoresearch 的一比一移植,基于新的 mods 接口,会话用的是同样的 .auto/log.jsonl 格式,所以两个工具之间可以互换日志。演示方法是把一个排序基准的示例复制进 git 仓库,然后运行 /autoresearch make sort.js faster;需要 Claude Code 2.1.285 或更新版本,并在设置里打开函数钩子。帖子留下的问题问得正好:你愿意让一个循环来决定你的哪些改动能活下来吗?
💡#22
@ashtewari
https://x.com/ashtewari/status/2105848131795488947
ashtewari 把 Karpathy 的 autoresearch 用在模型训练研究上的那套自动化 agent 循环,搬到了微调上。实验和说明都附在帖子里。把循环从预训练提速搬到微调,等于把它放到了更多团队真正在做的那类任务上。提出、运行、保留这个模式,又多了一个被尝试的领域。
💡#23
@kylemissionai
https://x.com/kylemissionai/status/2106445461749997673
kylemissionai 的观点是:大家都在做同一个 agent 循环,因为循环只是入场门槛,会像数据库一样趋同。真正的差异化会往上走一层,落到用户不在旁边看着的时候,愿意信任谁替自己办事。同一个讨论串里,sachintwtss 的说法是:护城河是那些没人拿来演示的、枯燥的权限和故障恢复。两人指向的是 Loop 读者一直看到的同一个缺口:循环本身在变成大路货,围绕它的信任层却没有。
📡 生态产品雷达
生态产品雷达

Jev:在各个循环里反复出现的决策模型,既用来生成特征、做路由,也是新决策模型用来对标的基准。
Claude Code Mods:现在承载循环逻辑的钩子层,从编辑器内的 autoresearch 移植,到在工具调用前拒绝写入的守卫。
Pi 和 pi-autoresearch:极简工作台,以及被 Claude Code mod 一比一移植的那套循环做法。
StartLux:同一个窗口内连发两个模型,都归功于自家的自动研究流水线。
Langfuse 和 Temporal:只要循环要扛住真实流量,就会被点名的可观测性层和持久化执行层。
吴恩达的 agent 课程:被四个不同账号转发,大多是冲着其中讲自我改进 agent 循环的那一节。
← 上一篇
超级用户日报: 2026-10-04
下一篇 →
灵感雷达: 2026-10-04
← 返回所有文章

评论

加载中...
>_