最新 · Latest
2026年10月2日
MILO 自己进化 harness,Terminal-Bench 登顶还省了 26% token
既然 harness 设计决定 agent 表现,下一步就很明显了:让 agent 来设计 harness。MILO(arXiv 2609.38349)就是这么干的,而且赢了所有拿来对比的人工 harness。MILO 全称 Meta-evolutionary Island Orchestration,它进化完整的 agent harness,同时还在进化自…
2026年10月2日
Mid-Harness:命令执行前先审一遍,终端任务涨 18 个点
终端 agent 有个聊天模型没有的麻烦:动作做错了,世界就变了。装错一个包,后面每一步都在坏掉的环境里干活,哪怕模型换一次就能给出正确命令。论文《Mid-Harness》(arXiv 2609.39982,Hugging Face 96 赞)把算力恰好放在这个位置:先采样多个候选动作,验证一遍,再把其中一个交给 harness 执行。生成模型不动,harn…
2026年10月2日
False Frontiers:自我进化的 agent 学会的是附和自己,不是逼近真相
让 agent 自己出题、自己改卷,出题的和答题的最后会学会犯同样的错。论文《False Frontiers》(arXiv 2609.39102,Hugging Face 180 赞)给这个现象起名叫「合谋作弊」(co-cheating)。自我进化的搜索 agent 在一个闭环里训练:出题器根据源文档出题,解题器作答。一轮轮下来,两者越来越一致地认同同一批错…
2026年10月2日
Photon 完成 450 万美元种子轮,把 agent 塞进 iMessage 和 WhatsApp
Photon 真给手机 App 办了一场葬礼:9 月 17 日,旧金山一座教堂,有人致悼词,还有一口装 App 图标的棺材。两周后,这个玩笑有了真金白银撑腰。公司完成 450 万美元种子轮,Gradient 和 A* 联合领投,Vercel、红杉中国(HongShan)、Z Fellows、Llama Ventures、Karman 和一批天使跟投。Tech…
2026年10月2日
Restate 完成 2000 万美元 A 轮,专治长时间运行的 agent 半路倒下
Restate 当初不是为 agent 做的,结果刚好是 agent 最需要的东西。这家柏林公司完成 2000 万美元 A 轮,Singular 领投,Redpoint Ventures 和 Capital One Ventures 跟投,估值未披露。TechCrunch 9 月 30 日报道。
它做的是持久化执行(durable execution)。一…
2026年10月2日
Pi 1.0 守住极简,Pi Durable 把剩下的全接住
大多数 coding agent 每周都在加功能,Pi 等了好几个月才加了五个。Earendil 10 月 1 日发布 Pi 1.0,Hacker News 冲到 451 分。Pi 每周已有几十万用户,团队的规矩是:一个东西先在别处被证明有用,才考虑收进来。试过又扔掉的清单,比留下来的长得多。
这次收进来的:Codemode,原生支持 MCP,也支持 Je…
2026年10月2日
Gemini 4 Argon:先给网络安全防守方,其他人排队
谷歌最强的模型发了,但几乎没人用得上。Gemini 4 Argon 9 月 30 日发布,只开放给 Fairwind 计划里的可信网络安全防守方。等护栏再加固、美国政府的自愿性发布前审查走完,谷歌说会「尽快」扩大开放。这已经是固定剧本:Anthropic 的 Mythos 这么做过,谷歌现在照着来。
基准分数全冲着 agent 去。长周期软件工程测试 De…
2026年10月2日
Clef、Strands Decider、Decisions API:三家巨头一周内集体复刻 Jev
一个月前,决策模型还只是一家创业公司的卖点,这周已经成了一个品类。周二 OpenAI 在 Dev Day 上顺口公布了 Decisions API;周四 Cloudflare 发了 Clef 和 Clef-flash,AWS 发了 Strands Decider 2B。三家做的是同一件事,也就是 TypeSafe 的 Jev 在做的事:给模型一组固定选项,它…
2026年9月29日
技能级联攻击:三个无害的 skill,合起来删掉一条药物警告
市面上所有的 skill 扫描器都是一个一个查。技能级联攻击就是专门为通过这种检查设计的。Zihao Zhu、Siwei Lyu、Adel Bibi、Baoyuan Wu 的这篇论文,把一个恶意目标拆到几个 skill 里,每一处改动单看都没问题,只有组合起来才有害。
例子吓人,恰恰因为它太日常了。一个处方审核流程里,第一个 skill 在提取病史时,稍微…
2026年9月29日
ScopeBench:更会黑的,不等于更守规矩的渗透测试员
攻防类基准正在被刷满,而 ScopeBench 认为它们本来就量错了东西。真实的渗透测试里,问题不是 agent 能不能打进去,而是它会不会老老实实待在客户授权的范围里。
设计很干净。30 个“死胡同”安全任务,写明的目标只有越过写明的范围才能达成。每个任务跑两遍,环境和评分器完全一样:一遍不给范围,测能力;一遍给一段自然语言范围,测守约。因为 flag …
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
Product Manager, Networking + CDN
Vercel
Product Manager, Compute
Glean
Lead Salesforce Developer, GTM Systems
Isomorphic Labs
Candidate Experience Coordinator, Cambridge, MA
Isomorphic Labs
Associate Director, Clinical Supply Chain, Cambridge, MA
xAI
Sr. Sales Manager, Canada - Starlink Enterprise Sales