头条 · Featured
模型没动,成绩涨了三倍
ARC-AGI-3 从 13.3% 涨到 38.3%。同一份权重,同一个 GPT-5.6 Sol,没有重训任何东西。OpenAI 只是让它在两步之间保留自己的推理、而不是扔掉,再加上上下文压缩。改了一段管道,分数翻三倍。 看到这个数字之后你就回不去了。过去两年,所有人都在给错误的对象打分。 说白了 harness 就是这么回事。模型是泡在罐子里的一颗大脑。它打不开文件、跑不了命令、记不住昨天,也意识不到自己已经把同一件事试过四遍。harness 是罐子外面的一切:有哪些工具、什么时候把什么塞进上下文、工具返回之后发生什么、上一轮的推理是留着还是丢掉、什么时候该停、什么算完成。模型一次只产出一个猜测,harness 决定这个猜测能…
灵感雷达: 2026年8月16日
今天的信号几乎全部来自正在干这行的人,而不是消费者对着空气许愿。最硬的几个缺口都很枯燥、很运营:一家建筑公司在花两份工资,把一位极其厉害的估价师的手写单子重新敲进 CRM;一个每年新增七十五万户的财富层级,至今没有一个为它做的产品;以及一套…
2026年8月16日
Loop 日报: 2026年8月16日
这个领域昨天完成了一次重心转移:被优化的对象不再是模型,而是模型跑在里面的那个 harness。同一个 GPT-5.6 Sol,只是换了保留推理和上下文压缩的方式,ARC-AGI-3 就从 13.3% 跳到 38.3%;同一个 Qwen3.…
2026年8月16日
最新 · Latest
2026年8月16日
超级用户日报: 2026年8月16日
昨天这个生态第一次不再是单一厂商的故事。DeepSeek 开源了一个"万物皆插件"的 harness,一天之内社区就给它做出了 TUI、Telegram 桥接和 365 个插件;Qwen3.8-27B 上了 Ollama,一个参数就能塞进 Claude Code 里跑。热闹底下,真实用法还在继续往代码之外漂:牙医那 800 个 DICOM 文件被做成了查看器…
2026年8月16日
Soup 在 4GB 笔记本显卡上微调 8B 模型,还把自己撤回的结论一起公开
Soup 今天在 GitHub trending 上涨了 303 星,标题数字是:在一张 4GB 显存的 RTX 3050 笔记本卡上训 Llama-3.1-8B-Instruct。实测 NF4 下 119.6 tokens/秒,峰值显存 3.32 GB。Apache-2.0,作者 Alpamys Makazhan,地址 https://github.com…
2026年8月16日
Inferock Bench:给你开账单的公司,同时也在定义什么算失败
这句话就是整个产品的立论,扎人是因为它就是事实。一次 LLM 调用流到一半断了,一次回复空着但 token 照扣,一次重试悄悄把费用翻倍——关于到底发生了什么,唯一一份详细记录握在收你钱的那一方手里。Inferock Bench 是一个本地代理,帮你自己留一份。8 月 15 日拿下 Product Hunt 当日第一,241 赞。源码 https://git…
2026年8月16日
Spatial Memory Agent:权重冻住、不调工具,照样打赢微调
三天里第三篇论文,从不同角度得出同一个结论:能力现在长在系统层,不在权重里。Spatial Memory Agent 拿一个冻住的视觉语言模型,零参数更新、零外部工具调用,在它测过的每一个 base model 分组里都拿了最高宏平均。arXiv 2608.12743,8 月 13 日提交,HuggingFace 30 赞,在审。
机制是一个两阶段循环。训…
2026年8月16日
PlayWorld 让 agent 亲自去玩世界模型,因为固定动作脚本根本没法比模型
世界模型评测的正中间有一个测量学 bug,PlayWorld 是第一个把它当回事的基准。如果你的评测方式是喂一段固定动作序列然后给画面打分,你就默认了所有模型达成同一个结果需要同一串动作。它们不需要。让模型 A 走到目标的那串动作,可能跟模型 B 需要的完全不是一回事。也就是说固定动作条件下的评测压根不是一个跨模型比较。论文 arXiv 2608.13552…
2026年8月16日
Alaya-EVOKE 把记忆搬出模型,成本曲线就躺平了
交互式世界模型有一个无聊但致命的问题:交互越久历史越长,而只要这段历史活在模型的工作记忆里,成本就是二次增长,会话就会死。Alaya-EVOKE 的答案是干脆不在模型里存历史。论文 arXiv 2608.13546,8 月 13 日提交,作者 Yuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng …
2026年8月16日
CLI-Anything:别再教 agent 点按钮了,直接给它生成一个命令行
Agent 用不好专业软件,这事大家心照不宣,然后用三种都不太行的办法绕过去。用视觉去操 GUI,按钮一挪就崩。用现成的公开 API,覆盖面大概只有软件本身能力的五分之一。或者干脆重写一个玩具版本,假装那是同一个东西。HKUDS 把这三条路看了一遍,选了第四条:对着真正的后端生成一个真正的命令行。项目在 https://github.com/HKUDS/CL…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
xAI
Porter Supervisor
xAI
Hospitality Supervisor
xAI
Executive Sous Chef
xAI
Executive Chef
xAI
Cook
xAI
Barista