最新 · Latest
2026年8月11日
为什么 RL 能一次练很多技能,SFT 不行
今天 Hugging Face 上票数最高的论文,回答的是任何人在多任务上训 agent 都会一头撞上的问题:为什么在混合任务集上做 SFT,会让每一项都稍微变差,而在同一批混合数据上做 RL 基本不会?
作者给的答案是几何层面的。RL 产生的参数更新在任务之间是稀疏且近似正交的——不同任务碰的是不同方向,基本互不干扰。SFT 产生的更新会撞在一起。他们把…
2026年8月10日
EnvACE:腾讯让 agent 在脑子里排练世界
Agent RL 最贵的部分不是 GPU,是环境——真实的 API、真实的沙箱、真实的延迟、真实的抽风。EnvACE,一篇腾讯系团队的新论文(arXiv 2608.06197,HuggingFace Daily Papers 上 38 个赞),问了一个显而易见但离经叛道的问题:如果让策略自己学会模拟环境呢?
方法叫 world rehearsal,世界排练…
2026年8月8日
AgentOPSD:三十步里真正定胜负的是哪三步
今天 Hugging Face 上排第一的 agent 论文(66 赞)是 AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning,清华牵头的团队(arxiv.org/abs/2608.05987,代码在 github.com/ZethWang/AgentOPSD)。…
2026年8月7日
ABSeeker:4B 搜索 Agent 打出 30B 的水平
8 月 6 日 Hugging Face Daily Papers 排第一的 agent 论文,来自上海交大:ABSeeker,Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment(arxiv.org/abs/2608.05102,53 个赞)。招牌结果:一个…
2026年8月6日
Prime Agent:边跑边改自己 harness 的开源 Agent
Prime Intellect 在 8 月 5 日发布了 Prime Agent(primeintellect.ai/blog/prime-agent):一个开源的编程与研究 agent,核心想法只有一个——应该允许 agent 修改自己。不是改权重,是改 harness。
两个抽象干活。第一个叫 Recursive Language Model:不再是一…
2026年8月4日
RLSVR:不请裁判,让模型玩谍战游戏自己发奖励
Hugging Face日榜第一,143个赞:From RLVR to RLSVR。问题大家都熟:可验证奖励的RL在数学和代码上好使,因为答案能查;写作、总结这类开放任务没有标准答案,只能靠奖励模型或LLM裁判,而裁判会漂移、会被钻空子、还烧推理费。
他们的解法:别去评判输出,把任务本身改造成环境自己会打分的形状。落地实现叫SpyRL,一个信息不对称的自博…
2026年7月31日
SkillRise:让智能体积累技能,而不是每次重学
一篇叫 SkillRise 的新论文(arXiv 2607.26784)盯上了当下智能体一个挺诚实的短板:什么都从头学。解完一个任务,把琢磨出来的东西一扔,明天碰到类似的任务,重新开始。SkillRise 提出一套智能体强化学习的做法,让智能体把技能攒下来、跨任务带走,能力是复利式累积,而不是每次归零。
底下押的注值得直说。一个一次性智能体和一个会越来越强…
2026年7月28日
英伟达 Molt:一个小到能让 agent 自己读完的 RL 框架
英伟达 NeMo 团队今天放出了 Molt,直接冲上 Hugging Face 论文榜第一,647 个赞。它是一个 PyTorch 原生的、面向 agentic 强化学习的训练框架,整套设计哲学就是冲着这类技术栈越做越臃肿去的。它的 RL 内核大约九千行代码,能训练到 7000 亿参数的模型。这个数字才是重点:小到一个研究员能把整个算法装进脑子里,也小到一个…
2026年7月22日
DeepSearch-World:一个9B的搜索agent,没老师,自己教会了自己
现在做一个好用的搜索agent,默认配方是:拿个小模型,从前沿模型里蒸馏轨迹,发布。港科大的DeepSearch-World,arXiv 2607.07820,没走这条路,结果一个9B模型在BrowseComp上31.2%,GAIA上61.5%,HotpotQA上93.4%。
诀窍在环境。DeepSearch-World是一个给web agent用的确定性…
2026年7月19日
LongStraw:人人都能推理100万token,几乎没人能在上面训练
agent技术栈里有个尴尬的不对称:推理系统轻轻松松伺候百万token的上下文,但RL后训练——真正让agent在长任务上变强的那件事——却卡在25.6万token左右。于是一个攒出两百万token观察轨迹的agent,没办法端到端地从自己的轨迹里学习。所有人都在测长程能力,几乎没有人能针对它训练。
LongStraw,今天HuggingFace论文榜第一…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista