2026年8月18日ResearchBenchmarkAgents

MobileMem:用一整年的真实手机数据考验Agent记忆

Hugging Face今日榜20票:MobileMem(arXiv 2608.13606,17位作者,包括Ningyu Zhang),一个用一整年真实手机用户应用会话构建的基准,问的问题是:agent能不能理解、记住并持续学习一个人积累的经验。一条知识锚定的合成管线把会话变成连贯、时间一致的长周期轨迹,然后测试多跳推理、时序推理、知识更新、隐式偏好推断和端上记忆实现。项目主页:mobilemem.openkg.cn

它瞄准的缺口是真实的。现有的记忆基准,LoCoMo、LongMemEval,测的是对话回忆,答案就藏在整洁的对话记录里。一年的手机使用是完全另一种东西:异构、多模态、和个人强相关,而且自相矛盾,因为人会改主意、会搬家、会换工作。知识更新是最难也最重要的维度,不能修正自己认知的记忆不是记忆,是沉积物。隐式偏好推断是另一个低调但野心很大的部分:agent应该知道的关于你的事,大部分你从来没说出口过。

和今天另一条记忆新闻的配对才是真正的信号。工程侧,ai-memory正在GitHub trending上用"编译而非检索"的markdown wiki给coding agent做记忆;研究侧,MobileMem在定义生活尺度的记忆什么叫及格。工程派和评测派同一周在同一层会师,通常意味着这一层马上要快速变好,coding agent当年就是这么起来的。

arxiv.org/abs/2608.13606
← 上一篇
前沿Agent是优化器,不是研究员
下一篇 →
超级用户日报: 2026年8月18日
← 返回所有文章

评论

加载中...
>_