最新 · Latest
2026年8月16日
Spatial Memory Agent:权重冻住、不调工具,照样打赢微调
三天里第三篇论文,从不同角度得出同一个结论:能力现在长在系统层,不在权重里。Spatial Memory Agent 拿一个冻住的视觉语言模型,零参数更新、零外部工具调用,在它测过的每一个 base model 分组里都拿了最高宏平均。arXiv 2608.12743,8 月 13 日提交,HuggingFace 30 赞,在审。
机制是一个两阶段循环。训…
2026年8月16日
PlayWorld 让 agent 亲自去玩世界模型,因为固定动作脚本根本没法比模型
世界模型评测的正中间有一个测量学 bug,PlayWorld 是第一个把它当回事的基准。如果你的评测方式是喂一段固定动作序列然后给画面打分,你就默认了所有模型达成同一个结果需要同一串动作。它们不需要。让模型 A 走到目标的那串动作,可能跟模型 B 需要的完全不是一回事。也就是说固定动作条件下的评测压根不是一个跨模型比较。论文 arXiv 2608.13552…
2026年8月16日
Alaya-EVOKE 把记忆搬出模型,成本曲线就躺平了
交互式世界模型有一个无聊但致命的问题:交互越久历史越长,而只要这段历史活在模型的工作记忆里,成本就是二次增长,会话就会死。Alaya-EVOKE 的答案是干脆不在模型里存历史。论文 arXiv 2608.13546,8 月 13 日提交,作者 Yuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng …
2026年8月16日
CLI-Anything:别再教 agent 点按钮了,直接给它生成一个命令行
Agent 用不好专业软件,这事大家心照不宣,然后用三种都不太行的办法绕过去。用视觉去操 GUI,按钮一挪就崩。用现成的公开 API,覆盖面大概只有软件本身能力的五分之一。或者干脆重写一个玩具版本,假装那是同一个东西。HKUDS 把这三条路看了一遍,选了第四条:对着真正的后端生成一个真正的命令行。项目在 https://github.com/HKUDS/CL…
2026年8月16日
1500 次提交换来 232 倍加速,loop engineering 到底长什么样
Sankalp Shubham 打了 GPU Mode 的 qr_v2 赛题——批量方阵 compact-Householder QR 分解,B200 上的 FP32 CUDA——最后拿到相对 baseline 232 倍的加速。几何平均从 419000 微秒压到 1805 微秒,183 人里排第 12。整个过程 14 天、1500 多次提交,而这些代码基本…
2026年8月16日
Claude 开始给所有文字打水印,唯独代码打不上
Anthropic 8 月 14 日把 Claude 文本水印的原理讲清楚了。有意思的不是水印本身,是水印失效的地方。
方法是这样。Claude 一个 token 一个 token 地生成,每一步都有一堆候选词。这些选择里大部分无关紧要——用这个同义词还是那个,从句放前面还是后面。水印就是拿这些无所谓的选择做文章,按一个密钥去偏置它们,让整段文字带上一个读…
2026年8月15日
620 条评论在吵:Opus 5 更聪明了,也更难合作了
今天 Hacker News 第三大的帖子是一篇博客,标题是《为什么 Opus 5 用起来感觉更差了》,十一个小时 671 分、620 条评论。作者一开始就说明这是个人经验,管自己的解释叫毫无根据的猜测,也没给数据。还是值得写,因为当六百个工程师涌进来认同同一种感受时,这份感受即便不是关于模型的数据点,也是关于这个行业的数据点。
抱怨很具体,所以才炸。Op…
2026年8月15日
Mole 在跑之前就把研究 agent 的预算焊死,超支为零
今天的 Show HN:Mole,一个跑在终端里的深度研究 agent。Go 写的,Apache-2.0,Linux 和 macOS 的静态二进制,能接 Anthropic、OpenAI 或者任何 OpenAI 兼容的端点。写这段时 49 个 star,正是值得看的阶段,因为设计决策还看得清。
其中三条不管你用不用它都值得抄。第一,预算是在执行前强制的,不…
2026年8月15日
spec-kit 冲到 12.8 万 star,几乎每天发一个版本
GitHub 的 spec-kit 一天涨了 1147 个 star,总数越过 12.8 万。一个核心主张是"你应该先把规格写清楚"的仓库能到这个数,本身就挺不寻常。它的说法叫 Spec-Driven Development:动手之前先定义要造什么,配任何 AI 编码 agent 都行。MIT 协议,Python,1795 次提交,支持三十多个编码 agen…
2026年8月15日
Anthropic 把 Claude Code 的 token 账算给你看,/clear 是你最便宜的习惯
Anthropic 8 月 14 日发了一篇文章,拆解 Claude Code 一次会话里到底什么在烧钱,很快就上了 Hacker News,因为它回答的是每个重度用户一直在瞎猜的问题。最好的是它的定调:同一件做完的活,你怎么跑,花的钱可以差出很多。重点不是总量少用 token,是用掉的那些 token 花在了你真正要的那件事上。
机制就两个价格。输出 t…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista