最新 · Latest
2026年8月16日
PlayWorld 让 agent 亲自去玩世界模型,因为固定动作脚本根本没法比模型
世界模型评测的正中间有一个测量学 bug,PlayWorld 是第一个把它当回事的基准。如果你的评测方式是喂一段固定动作序列然后给画面打分,你就默认了所有模型达成同一个结果需要同一串动作。它们不需要。让模型 A 走到目标的那串动作,可能跟模型 B 需要的完全不是一回事。也就是说固定动作条件下的评测压根不是一个跨模型比较。论文 arXiv 2608.13552…
2026年8月15日
620 条评论在吵:Opus 5 更聪明了,也更难合作了
今天 Hacker News 第三大的帖子是一篇博客,标题是《为什么 Opus 5 用起来感觉更差了》,十一个小时 671 分、620 条评论。作者一开始就说明这是个人经验,管自己的解释叫毫无根据的猜测,也没给数据。还是值得写,因为当六百个工程师涌进来认同同一种感受时,这份感受即便不是关于模型的数据点,也是关于这个行业的数据点。
抱怨很具体,所以才炸。Op…
2026年8月15日
AutoDesign:让元优化器改写 agent 的 harness,四十分钟,三美元不到
美团的 AutoDesign 是两天内第二篇 harness 进化的论文,走的是另一条路,落到同一个结论。一个元 harness 优化器指挥一个代码 agent,根据 rollout 反馈递归地改写自己的 harness。agent 跑一遍,优化器读发生了什么,agent 的脚手架被改一轮,循环。
他们测的是件很具体的事,不是 benchmark 的抽象:…
2026年8月14日
OpenART:85% 攻击成功率,漏洞在 harness 不在模型
OpenART 是一个针对 agent 的红队框架,起点是大多数安全评测忽略的一个前提:agent 活在持久环境里,第三轮做的一次状态改动可以在第九十轮左右一个决策。一万多个带状态的场景,覆盖 50 个领域,今天在 HuggingFace 拿了 159 赞。
攻击方法叫演化式马尔可夫超图攻击,设计比一个提示注入语料库阴狠得多。EMHA 是一个黑盒策略,通过…
2026年8月13日
Grok 4.6 追平 GPT-5.6 Sol,靠的是拿 agent 任务训出来的
xAI 昨天发了 Grok 4.6,Artificial Analysis 智能指数拿到 61 分,和 GPT-5.6 Sol 打平。CursorBench 3.2 是 69.9%,DeepSWE 1.1 是 65.9%,基本上每一项都比 Grok 4.5 强。输入每百万 2 美元、输出 6 美元,还有一个贵一倍的 fast 版本。距离 4.5 才两周,这个…
2026年8月12日
SWE-bench 里没人解出来的题,六成测试本身就是坏的
SWE-Bench ProMax 这篇论文里埋着一个结论,足以改变你看任何 coding agent 榜单的方式:SWE-bench Verified 中未被解决的样例里,将近 60% 的测试本身有缺陷。不是难,是坏——太窄、太宽,或者干脆就是错的。模型在这些题上失败,失败的不是软件工程能力,是「猜一个烂测试到底想要什么」的能力。
指控的另一半更难看。前沿…
2026年8月11日
oqoqo 让你成为自己的基准
oqoqo 昨天拿下 Product Hunt 第一,304 票,卖的是这个行业抱怨了两年的东西:属于你自己的私有基准,跑你自己的任务,而不是又一个没人能复现的公开榜单分数。
机制上,它拉起隔离沙箱,把你的任务集扔给你指定的 agent 去跑,然后把每一步都记下来——工具调用、重试、以及 agent 到处乱转找东西在哪的那些探索循环。接着同一批任务在不同 …
2026年8月10日
Harvey LAB:法律 agent 的真考卷,Kimi K3 考了第一
估值最高的法律 AI 公司把自己的考卷开源了,然后一个中国开源权重模型考了第一。Harvey 的 LAB(Legal Agent Benchmark)今天上了 GitHub trending:1,671 道题,覆盖 24 个法律执业领域,从并购到税务到破产,每道题用专家手写的评分标准打分,总共超过 75,000 条评分点。跟以前那些合同审查玩具级评测不一样,…
2026年8月9日
OSReward:给智能体打分的 AI 裁判集体手软
OSReward 测了一件整个 computer-use 领域一直默认可行的事:让 AI 裁判给智能体的操作打分。结论是不可行。港大 OS-Copilot 团队做了迄今最全面的 VLM 裁判评测——真实的跨平台电脑操作轨迹、多种智能体骨干、人工验证的指令、多轮人工标注的真值判定——所有最强模型全部不及格,而且错法一致:系统性的宽松偏差,把失败的运行判成成功。…
2026年8月6日
MerchantBench:开一年网店,所有 Agent 都露馅
这一轮 Hugging Face Daily Papers 上最高票的 agent 论文(83 票)是 MerchantBench(arxiv.org/abs/2607.28956),结果配得上这个票数:让 LLM agent 当电商卖家,模拟经营 365 天,最好的配置年底净资产只有人类参与者的 27.3%。不是差 27%,是只有人类的 27%。
实验设…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista