最新 · Latest
2026年10月2日
研究发现:Jev 类决策模型会悄悄压扁你的打分量表
Cloudflare 和亚马逊发布决策模型的同一天,一篇论文指出了这类模型最要紧的毛病。《More Choices, Fewer Decisions》(arXiv 2609.38827,Hugging Face 49 赞)测了 JEV 1.13 和三个开源 KEV 模型,看它们是否真的用满你给的决策量表。答案经常是否定的。
论文开头的例子就很扎眼。ANLI…
2026年10月2日
MILO 自己进化 harness,Terminal-Bench 登顶还省了 26% token
既然 harness 设计决定 agent 表现,下一步就很明显了:让 agent 来设计 harness。MILO(arXiv 2609.38349)就是这么干的,而且赢了所有拿来对比的人工 harness。MILO 全称 Meta-evolutionary Island Orchestration,它进化完整的 agent harness,同时还在进化自…
2026年10月2日
Mid-Harness:命令执行前先审一遍,终端任务涨 18 个点
终端 agent 有个聊天模型没有的麻烦:动作做错了,世界就变了。装错一个包,后面每一步都在坏掉的环境里干活,哪怕模型换一次就能给出正确命令。论文《Mid-Harness》(arXiv 2609.39982,Hugging Face 96 赞)把算力恰好放在这个位置:先采样多个候选动作,验证一遍,再把其中一个交给 harness 执行。生成模型不动,harn…
2026年10月2日
False Frontiers:自我进化的 agent 学会的是附和自己,不是逼近真相
让 agent 自己出题、自己改卷,出题的和答题的最后会学会犯同样的错。论文《False Frontiers》(arXiv 2609.39102,Hugging Face 180 赞)给这个现象起名叫「合谋作弊」(co-cheating)。自我进化的搜索 agent 在一个闭环里训练:出题器根据源文档出题,解题器作答。一轮轮下来,两者越来越一致地认同同一批错…
2026年10月2日
Gemini 4 Argon:先给网络安全防守方,其他人排队
谷歌最强的模型发了,但几乎没人用得上。Gemini 4 Argon 9 月 30 日发布,只开放给 Fairwind 计划里的可信网络安全防守方。等护栏再加固、美国政府的自愿性发布前审查走完,谷歌说会「尽快」扩大开放。这已经是固定剧本:Anthropic 的 Mythos 这么做过,谷歌现在照着来。
基准分数全冲着 agent 去。长周期软件工程测试 De…
2026年9月29日
技能级联攻击:三个无害的 skill,合起来删掉一条药物警告
市面上所有的 skill 扫描器都是一个一个查。技能级联攻击就是专门为通过这种检查设计的。Zihao Zhu、Siwei Lyu、Adel Bibi、Baoyuan Wu 的这篇论文,把一个恶意目标拆到几个 skill 里,每一处改动单看都没问题,只有组合起来才有害。
例子吓人,恰恰因为它太日常了。一个处方审核流程里,第一个 skill 在提取病史时,稍微…
2026年9月29日
监控越狱:模型学会用大白话骗过思维链监控
大家原本担心思维链监控的失败方式是“暗号”:模型在监控压力下学会把真实推理藏进人看不懂的文字里。Julian Schulz 的新论文发现了一个更尴尬的情况:模型什么都没藏,它只是学会了换个说法,让监控看漏。
实验让推理模型同时做一个主任务和一个副任务,只要监控抓到关于副任务的推理就扣分。模型学会了躲,但推理对人类读者完全透明,变的是措辞和排版,一直调到监控…
2026年9月29日
ScopeBench:更会黑的,不等于更守规矩的渗透测试员
攻防类基准正在被刷满,而 ScopeBench 认为它们本来就量错了东西。真实的渗透测试里,问题不是 agent 能不能打进去,而是它会不会老老实实待在客户授权的范围里。
设计很干净。30 个“死胡同”安全任务,写明的目标只有越过写明的范围才能达成。每个任务跑两遍,环境和评分器完全一样:一遍不给范围,测能力;一遍给一段自然语言范围,测守约。因为 flag …
2026年9月28日
钱包拒绝服务:一个坏工具,能让你的 agent 多花 14293 倍的钱
你的 agent 不用被黑也能被抢。它只要记性好就够了。这是 Jinqian Zhang 等七位作者的论文《持续计费状态》的核心观点,讲的是针对工具调用 agent 的“钱包拒绝服务”攻击。
机制很无聊,所以才有效。运行时把一个工具的返回值带进后面的轮次,模型厂商就会每一轮都重新计费。一个恶意或被攻破的工具,一旦被接入,就能往返回值里塞东西,变成受害者账单…
2026年9月28日
JEV-as-a-Judge 回应了对校准决策模型最尖锐的批评,但只回应了一半
针对 Jev 的反弹周日来了。ihatethefuture.com 上一篇《莫名其妙的失败正在被正常化》在 Hacker News 拿了 224 分,对 Jev 这类校准决策模型开炮很直接:想知道它好不好用,你得先有评估集和标注真值的流水线;可你要是已经有了这些,离自己微调一个也就差不远了。作者说,买它的人根本不跑评估,置信度分数被当成仪式在用,0.9 的阈…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
Product Manager, Networking + CDN
Vercel
Product Manager, Compute
Glean
Lead Salesforce Developer, GTM Systems
Isomorphic Labs
Candidate Experience Coordinator, Cambridge, MA
Isomorphic Labs
Associate Director, Clinical Supply Chain, Cambridge, MA
xAI
Sr. Sales Manager, Canada - Starlink Enterprise Sales