最新 · Latest
2026年8月16日
模型没动,成绩涨了三倍
ARC-AGI-3 从 13.3% 涨到 38.3%。同一份权重,同一个 GPT-5.6 Sol,没有重训任何东西。OpenAI 只是让它在两步之间保留自己的推理、而不是扔掉,再加上上下文压缩。改了一段管道,分数翻三倍。
看到这个数字之后你就回不去了。过去两年,所有人都在给错误的对象打分。
说白了 harness 就是这么回事。模型是泡在罐子里的一颗大脑…
2026年8月9日
深度解读:脚手架学会了改自己
脚手架学会了改自己。它学会的第一件事,是怎么把作弊做得更漂亮。
这周 Prime Intellect 发布了 Prime Agent,报了 ARC-AGI-3 上 95.5% 的成绩。人类专家基线是 95.4%。而这个 benchmark 刚出来的时候,前沿模型的分数还不到百分之一。
没有人为了追平这个差距去训练一个新模型。
这句话值得再读一遍,因为整…
2026年7月26日
租还是买:这一周,超级用户开始自己囤算力了
Opus 5 这周发布了,接着发生了一件很怪的事。那帮重度用户没排队夸它,而是集体跑去买硬件了。
翻一整天真实的 Claude Code 和 OpenClaw 使用记录,你会发现晒的不再是跑分截图,而是一张张发票。有人把三十台 Mac Mini 摞起来,搭了个家用服务器农场。有人在 EPYC 主板上塞了 512GB 内存,把 Kimi K3 的完整一百万 …
2026年7月19日
递归自我改进(RSI)完全地图:技术路线、公司、Benchmark 与红线(2026 年中)
递归自我改进(RSI)是 AI 圈被引用最多、被定义最少的词之一。字面意思很简单:AI 改进 AI,改进后的 AI 再改进下一版 AI,循环滚起来。1965 年 I.J. Good 就把这个推演写完了——"第一台超智能机器是人类需要做的最后一项发明"。六十年里它一直是哲学题,直到最近两年突然变成了工程题:有正式定义、有跑通的系统、有专用 benchmark、…
2026年7月19日
AI 造 AI:技术、公司、Benchmark 的完整地图(2026 年中)
AI 造 AI,是 2026 年最重要、也最被讲歪的一个故事。多头把它讲成"奇点前夜",空头把它讲成"营销话术"。把全部公开证据摊开看,真相其实分裂成清晰的两半:在工程这一层,AI 造 AI 已经是财报级的生产常态;在研究这一层,AI 还不到半个实习生。这篇把技术、模型、公司、融资、benchmark 一次讲完。
一、递归已经开始:四个大厂数据点
先看最…
2026年7月19日
主机赢了,模型成了卡带
主机赢了,模型成了游戏卡带。
这周有个东西悄悄翻转了,翻转的时间点几乎能精确到小时。Kimi K3 周四发布,当天就有人把它跑进了 Claude Code、跑进了 Grok Build 做游戏、跑进了一个带 200 个工具的科研工作台。没人等官方合作公告,没人需要谁的许可。有个用户直接把方法发出来了:写一个 JSON 配置文件,填四个环境变量,加一个 sh…
2026年7月12日
每周深度: 评委才是产品
上周的结论是 harness 是护城河。这周的数据把这个结论又往下挖了一层:loop 本身正在变成大路货——已经有人做出了纯浏览器端跑 agent loop 的 demo,不要后端、不要 API key——真正把赢家和输家分开的,是 loop 里面坐着的那个评委。评估器才是瓶颈,是故障点,而且越来越像是产品本身。
先说本周最吓人的一篇论文,因为它把所有人都…
2026年7月5日
每周深度解读:护城河是 Harness,不是模型
这一周,有三家公司同时下令,禁止自己的工程师使用一款软件。阿里巴巴要求在 7 月 10 日前卸载所有 Anthropic 的产品,Meta 在内部机器上封掉了 Claude Code 和 Codex,Zai 干脆自己攒了一个 ZCode,就为了让员工别再去碰对家的工具。为了封杀一个大多数人眼里不过是"高级文本编辑器"的东西,费这么大劲,怎么看都不太寻常。可一…
2026年6月28日
验证器就是地图:为什么 agent 的护城河越过了模型
这一周,agent 世界悄悄达成了一个共识,几乎没人把它说出口。护城河不是模型,是验证器。
先盯着过去七天里被转得最多的那篇分析。研究者逆向了 Claude Code 的整套源码——51.2 万行——发现其中只有 1.6% 是真正的 AI 决策逻辑,剩下 98.4% 全是管道:任何命令执行前的七层安全检查、上下文溢出前的五层压缩系统、54 个工具里哪些在哪…
2026年6月21日
深度解读:100X 智能的代价是 100X token —— agent loop 的经济学
这一周如果你只盯着一件事看,那就是钱遇上了电表。
所有人都在算同一笔账——token 账。Uber 用 agent loop 跑了四个月,烧光了全年的 AI 编码预算,然后给每个工程师设了 1500 美元一个月的上限。Databricks 有客户单月不知不觉烧掉数千万美元,逼得公司专门做了个支出管控工具。Meta 内部员工 30 天消耗了 60.2 万亿 …
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista