最新 · Latest
2026年8月16日
Spatial Memory Agent:权重冻住、不调工具,照样打赢微调
三天里第三篇论文,从不同角度得出同一个结论:能力现在长在系统层,不在权重里。Spatial Memory Agent 拿一个冻住的视觉语言模型,零参数更新、零外部工具调用,在它测过的每一个 base model 分组里都拿了最高宏平均。arXiv 2608.12743,8 月 13 日提交,HuggingFace 30 赞,在审。
机制是一个两阶段循环。训…
2026年8月16日
PlayWorld 让 agent 亲自去玩世界模型,因为固定动作脚本根本没法比模型
世界模型评测的正中间有一个测量学 bug,PlayWorld 是第一个把它当回事的基准。如果你的评测方式是喂一段固定动作序列然后给画面打分,你就默认了所有模型达成同一个结果需要同一串动作。它们不需要。让模型 A 走到目标的那串动作,可能跟模型 B 需要的完全不是一回事。也就是说固定动作条件下的评测压根不是一个跨模型比较。论文 arXiv 2608.13552…
2026年8月16日
Alaya-EVOKE 把记忆搬出模型,成本曲线就躺平了
交互式世界模型有一个无聊但致命的问题:交互越久历史越长,而只要这段历史活在模型的工作记忆里,成本就是二次增长,会话就会死。Alaya-EVOKE 的答案是干脆不在模型里存历史。论文 arXiv 2608.13546,8 月 13 日提交,作者 Yuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng …
2026年8月16日
1500 次提交换来 232 倍加速,loop engineering 到底长什么样
Sankalp Shubham 打了 GPU Mode 的 qr_v2 赛题——批量方阵 compact-Householder QR 分解,B200 上的 FP32 CUDA——最后拿到相对 baseline 232 倍的加速。几何平均从 419000 微秒压到 1805 微秒,183 人里排第 12。整个过程 14 天、1500 多次提交,而这些代码基本…
2026年8月15日
Google 开源 HEIR:让 AI 在看不见数据的情况下算完
Google 8 月 14 日放出 HEIR,一个开源编译器,把普通程序编译成能在加密数据上跑的程序。同态加密当了十五年密码学界最勾人的戏法:在密文上计算,拿回一个你能解密的结果,服务器从头到尾没见过任何一个输入。障碍一直是,要写一个 FHE 程序你得是个密码学家。HEIR 的意思是,这活该编译器干。
2023 年宣布意图,现在交货。四个编译好的应用作为演…
2026年8月15日
Intern-S2-Preview:3970 亿做科学,外挂一个 40 亿的记忆模块涨 3.4 分
上海 AI Lab 放出 Intern-S2-Preview,一个面向科学的 agent 型基础模型,论文署名 149 人。主干 3970 亿参数,专门配了时间序列模块做数值预测——把这个东西塞进语言模型里很少见,也直接说明了它给谁用。化学家、生物学家、物理学家。数据不是文字的那群人。
值得抄的设计是一个独立的 40 亿参数 Memory Decoder,…
2026年8月15日
AutoDesign:让元优化器改写 agent 的 harness,四十分钟,三美元不到
美团的 AutoDesign 是两天内第二篇 harness 进化的论文,走的是另一条路,落到同一个结论。一个元 harness 优化器指挥一个代码 agent,根据 rollout 反馈递归地改写自己的 harness。agent 跑一遍,优化器读发生了什么,agent 的脚手架被改一轮,循环。
他们测的是件很具体的事,不是 benchmark 的抽象:…
2026年8月15日
DarwinX 不进化模型,进化 harness,WebArena 从 43.5 干到 93
Salesforce AI Research 发了 DarwinX,把所有人都在绕的那个想法直接做成了种群。模型权重冻死。进化的是 harness:prompt、工具、skill、控制流。在脚手架上跑自然选择。
会被反复引用的结果是 WebArena-Infinity 从 43.5% 到 93.0%,且审计干净。Terminal-Bench 2.1 在同级…
2026年8月14日
强模型给弱模型搭个 harness,弱模型就变聪明了
这是一个说得很直白的好想法。能不能不动一个参数,把大模型的能力转移给小模型?能,在推理阶段做,让强模型去搭弱模型运行其中的那个 harness。论文叫 AI4AI at Test-Time,HuggingFace 92 赞,来自 UIUC 和 Salesforce Research。
做法是:一个 builder 模型用 5% 的验证数据,分几轮迭代打磨给…
2026年8月14日
OpenART:85% 攻击成功率,漏洞在 harness 不在模型
OpenART 是一个针对 agent 的红队框架,起点是大多数安全评测忽略的一个前提:agent 活在持久环境里,第三轮做的一次状态改动可以在第九十轮左右一个决策。一万多个带状态的场景,覆盖 50 个领域,今天在 HuggingFace 拿了 159 赞。
攻击方法叫演化式马尔可夫超图攻击,设计比一个提示注入语料库阴狠得多。EMHA 是一个黑盒策略,通过…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista