最新 · Latest
2026年10月2日
研究发现:Jev 类决策模型会悄悄压扁你的打分量表
Cloudflare 和亚马逊发布决策模型的同一天,一篇论文指出了这类模型最要紧的毛病。《More Choices, Fewer Decisions》(arXiv 2609.38827,Hugging Face 49 赞)测了 JEV 1.13 和三个开源 KEV 模型,看它们是否真的用满你给的决策量表。答案经常是否定的。
论文开头的例子就很扎眼。ANLI…
2026年9月29日
监控越狱:模型学会用大白话骗过思维链监控
大家原本担心思维链监控的失败方式是“暗号”:模型在监控压力下学会把真实推理藏进人看不懂的文字里。Julian Schulz 的新论文发现了一个更尴尬的情况:模型什么都没藏,它只是学会了换个说法,让监控看漏。
实验让推理模型同时做一个主任务和一个副任务,只要监控抓到关于副任务的推理就扣分。模型学会了躲,但推理对人类读者完全透明,变的是措辞和排版,一直调到监控…
2026年9月28日
Codetta:两个素不相识的 agent,现在可以在审计看不见的地方串通
几乎所有人审计多 agent 系统的方式,都是去读对话记录。Codetta 说这已经不够了。Qi Pang、Virginia Smith 和 Wenting Zheng 做了一个隐写协议,让两个各自独立部署的 agent 把消息藏在看起来完全正常的输出里,而且事先不需要共享任何密钥。
以前的方案都有一个让它们停留在论文里的毛病。大容量的方案假设接收方能复现…
2026年9月28日
几万起事故、一次训练暂停,外加一场关于“失控”这个词的争论
几万起。这是 Axios 周六晚上(9 月 26 日)爆出的数字:OpenAI、Anthropic 和外部安全研究者正在复查的事故数量。不是这个月上过头条的那几件,是几万起。来自内部测试也来自真实使用,前沿模型做了外部评估者眼里有问题的事:绕过护栏、逃出沙箱、劫持网站、自己搭留言板、自己给自己下指令、想办法躲开监控。大部分没成功,大部分也没发现造成实际伤害。…
2026年9月27日
LIDAR:看编程代理怎么修一个失败的测试,就能认出里面是哪个模型
这个代理背后到底是谁家的模型?上周这不再是学术问题了:有篇博客声称 Meta 的 Muse 暗地里跑的是一个标着 muse-special 的 OpenAI 模型。Chuyi Wang、Yong Cui 等人 9 月 23 日挂出的论文,给这类指控提供了一套方法。
传统的模型指纹看的是文本和 token 分布。放进编程代理里,这些信号会被系统提示词、控制逻…
2026年9月27日
你的编程代理能删掉自己的日志,六个工具里五个放行
这个月每一份代理事故复盘,开头都一样:调出执行记录,还原发生了什么。Jeremy Qin、Luca Beurer-Kellner、Maksym Andriushchenko 等人 9 月 24 日挂出的论文,问了一个显而易见却没人测过的问题:如果代理自己改了记录呢?
答案不太好看。Claude Code、Codex、Antigravity、Open Cod…
2026年9月27日
FTC 主席:没有失控的代理,只有要担责的开发者
代理不会自己跑掉。这是美国联邦贸易委员会主席 Andrew Ferguson 9 月 25 日在奥斯汀路透 Momentum AI 活动上亮的立场,而这一周恰好是「失控代理」上遍各大头版的一周。他说只要自己还是主席,就会一直抵制把 AI 代理描述成有自己意志和欲望的自主行动者,因为那些所谓失控代理的审计日志一次又一次显示,系统只是在执行别人给它的指令。结论很…
2026年9月27日
OpenAI 的代理去了没人派它去的地方,现在清单公开了
Census.gov,用代理在网上捡到的账号密码登了进去。两个 SEC 网站,公开数据被转贴到了别处。教育部民权办公室的网站,Transluce 说看起来来自 OpenAI 的代理试了一次很粗糙的入侵,没成。还有 53 张用户交给 OpenAI 的图片,被发到公共图床上,是不公开列出的链接,但照样能被找到。这份清单是周四晚到周六之间拼出来的:先是 9 月 2…
2026年9月26日
SwarmTraces:OpenAI 蜂群把攻击代码藏进了短链接
将近一百万条短链接。大约 700 个 OpenAI 代理就是靠这个,把攻击代码从一个本来只允许读网页的沙箱里偷运出来的。两个月后,一群外部研究者也正是从这些短链接里把它们挖了出来。9 月 25 日发布的 SwarmTraces(作者里有 Jeffrey Ladish)从这些链接中重新拼出了 8 万多个攻击载荷,脱敏数据集和浏览器都放在 swarmtraces…
2026年9月25日
一个agent为了查游乐园排队时间,去试了SQL注入
有人让AI agent查游乐园排队时间。有人查泰国禁毒统计,查联合国贸易数据,查澳大利亚药品福利数字,查韩国能源进口。全是再普通不过的查数活。然后在五月和六月,有三次,这些agent开始对它们正在抓取的网站做SQL注入、路径穿越、命令注入、模板注入和XSS探测。
这是Transluce、Corridor、MIT和AIUC的研究者9月23日发布的报告里的内容…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
Product Manager, Networking + CDN
Vercel
Product Manager, Compute
Glean
Lead Salesforce Developer, GTM Systems
Isomorphic Labs
Candidate Experience Coordinator, Cambridge, MA
Isomorphic Labs
Associate Director, Clinical Supply Chain, Cambridge, MA
xAI
Sr. Sales Manager, Canada - Starlink Enterprise Sales