2026年7月18日ResearchLLM

十六场大模型发布战的 Twitter 声量全景 + benchmark 全解:从 Kimi K3、GPT-5.6、Grok 4.5 到 Fable 5 被封

2026 年的大模型发布战,我们用 Twitter API 全量抓了十六场:中国这边是腾讯混元 Hy3、Kimi K3/K2.5/K2、智谱 GLM-5/GLM-5.2、MiniMax M3、小米 MiMo-V2.5、DeepSeek V4、阿里 Qwen3.8;美国这边是 Anthropic Claude Fable 5、OpenAI GPT-5.6 三兄弟、xAI Grok 4.5、Thinking Machines 的 Inkling;再加两个对照组:日本 Sakana AI 的 Fugu("orchestration model"新品类的定义者),以及 Yann LeCun 的 AMI Labs——一家融了 10 亿美元、至今一个模型都没发的实验室。

每场发布的传播节点分成两类看:
【转发引用节点】= 直接转发/引用官方发布帖的账号——他们决定发布帖本身能飞多高;
【独立讨论帖】= 不挂官方帖、自己另起炉灶的讨论——评测、实测、争论,他们决定话题能活多久。
这两类的配比,基本就是一场发布的体质:前者靠官方运营和关系,后者靠模型本身值不值得聊。

先给总榜(官方主发布帖阅读量,数据截至 2026 年 7 月 20 日):

xAI Grok 4.5(7月8日)6895 万——发布帖阅读第一,但引用率只有 K3 的十分之一,见第十三节
Claude Fable 5(6月9日)5713 万——而它被政府封禁的公告帖是 9277 万,全场单帖真冠军
Sakana Fugu(日本,6月22日)2625 万
Kimi K3(7月16日)1985 万
OpenAI GPT-5.6 限定预览(6月26日)1847 万
DeepSeek V4 Preview(4月24日)999 万——赞数 4.6 万,全场发布帖第一
Thinking Machines Inkling(7月15日)780 万
GLM-5.2 开源权重帖(6月16日)755 万
阿里 Qwen3.8(7月19日)743 万
Kimi K2.5(1月27日)735 万
MiniMax M3(6月1日)521 万
AMI Labs 融资帖(3月10日)497 万——没有模型,靠叙事拿到的
Kimi K2(2025年7月11日)274 万
GLM-5(2月11日)150 万
腾讯 Hy3(7月6日)111 万
小米 MiMo-V2.5 开源帖(4月27日)81 万

三个数字先摆在这里:一年时间,顶级开源发布的声量从 K2 的 274 万涨到 K3 的 1985 万,涨了 7 倍;单帖声量第一的 Fugu,恰恰是一周后口碑翻车最狠的一场;而全场最大的单帖,是 Anthropic 宣布自己的模型被美国政府禁掉——危机比发布响 1.6 倍。声量、口碑、事故是三件事,这三个反差是全文最值钱的部分。

下面第一到九节是中国九场加 Fugu 对照(按时间顺序),第十到十六节是新增的六场加 AMI 对照,第十七节是横向规律,第十八节单独拆一个问题:这十六家到底在刷什么榜——那一节的结论可能比声量本身更有用。

━━━━━━━━━━━━━━━
一、Kimi K2(2025年7月11日):这一切的起点
━━━━━━━━━━━━━━━

发布帖:274 万阅读、6591 赞、1135 转、534 引用、2820 收藏。"Hello, Kimi K2! Open-Source Agentic Model",1T 总参/32B 激活,开源 agentic 模型的开山之作。
https://x.com/Kimi_Moonshot/status/1943687594560332025

【转发引用节点】(直接引用发布帖)

lmarena 官方:K2 成 Arena 第一开源模型、总榜第五——27.6 万阅读
https://x.com/arena/status/1945866381880373490
awnihannun(Apple MLX 作者):两台 512GB M3 Ultra 跑起 1T 模型,速度可用——23.8 万
https://x.com/awnihannun/status/1943723599971443134
op7418(中文区):"kimi 放大招了,代码能力不会让你失望"——25.4 万
https://x.com/op7418/status/1943688857129480295
igor9silva:"同任务同工具,Claude 两轮花 $0.88,Kimi 一发 $0.05"——17.4 万
https://x.com/igor9silva/status/1943701494911418700
theo(T3 Chat):"第一个真正擅长工具调用的开源模型,达到或超过 Anthropic 最强"——14.9 万
https://x.com/theo/status/1943910421859381320
kalomaze:"他这么说只是不想让你发现 K2 已经是开源权重新王"——14.7 万
https://x.com/kalomaze/status/1943843818887163989
kellerjordan0(Muon 优化器作者):"祝贺大规模训练成功"——6.7 万
https://x.com/kellerjordan0/status/1943849604140990816
Teknium(Nous):"Cursor 该把开源模型放进默认选项了"——6.7 万
https://x.com/Teknium/status/1943700372943434078
EMostaque(ex-Stability CEO):"K2 训练算力约 500 万美元级,compute 不是一切"——6.4 万
https://x.com/EMostaque/status/1944343637015306719
natolambert(AI2)泼冷水:"影响在企业端,不是 DeepSeek 时刻"——5.5 万
https://x.com/natolambert/status/1943780637145804962
cloneofsimo:"尊重 Kimi 把优化器如实叫 Muon 而不是换皮改名"——5.2 万
https://x.com/cloneofsimo/status/1943879028303118792

【独立讨论帖】(官方帖之外)

dr_cintas 的"疯狂一周"汇总,K2 与 Grok 4、Perplexity Comet 并列——154 万
https://x.com/dr_cintas/status/1943719359869747459
sam_paech:K2 拿下 EQ-Bench3 + 创意写作双榜第一——55.4 万
https://x.com/sam_paech/status/1944276326598553853
Sebastian Raschka(rasbt)架构解读:"K2 基本是 DeepSeek V3,但 head 更少、expert 更多"——55.1 万
https://x.com/rasbt/status/1944056316424577525
Yuchenj_UW:"传言 OpenAI 因为 K2 推迟了自家开源模型"——38.8 万
https://x.com/Yuchenj_UW/status/1944235634811379844
OpenRouter 官方:"Moonshot 的 token 市场份额几天内超过了 xAI"——23.8 万
https://x.com/OpenRouterAI/status/1944466834167919043
oran_ge(中文区):"Claude Code 能跑 K2,证明这套 Agent 架构适用任何模型,选择器在用户手里"——22.4 万
https://x.com/oran_ge/status/1944363643841232959
op7418 实测教程:"用 K2 驱动 Claude Code,再也不怕封号"——20.6 万
https://x.com/op7418/status/1943883107306025386
scaling01:"K2 比 Grok-4 强,benchmaxxer 完蛋了"——18.7 万
https://x.com/scaling01/status/1944055665082687756

官方一周运营:每天一个新钩子——上 Perplexity(23.2 万)、给 Groq 提速 185 tok/s、修 bug 公告、"K2 is SLOOOOOOOOOOOOW"道歉帖(32.9 万,公开承认太慢在买机器,坦诚圈粉)、一周后 tech report(9 万,MuonClip/20K 工具训练)。
https://x.com/Kimi_Moonshot/status/1945064408809660743

━━━━━━━━━━━━━━━
二、Kimi K2.5(2026年1月27日):创始人第一次出镜
━━━━━━━━━━━━━━━

发布帖:735 万阅读、15756 赞、1964 转、1188 引用。"Open-Source Visual Agentic Intelligence",HLE 50.2%、原生视觉、Agent Swarm(100 子代理并行、1500 次工具调用)。
https://x.com/Kimi_Moonshot/status/2016024049869324599

官方最大的新牌:创始人杨植麟第一次出镜拍视频介绍模型——单帖 169 万、9427 赞。
https://x.com/Kimi_Moonshot/status/2016065333694771276
同日开源 Kimi Code(Apache 2.0,25.8 万);随后 OSWorld/Design Arena/VoxelBench 连环战报 + tech report(31.6 万)。

【转发引用节点】

K2.5 发布帖的引用区偏弱——多是团队成员小作文(GengShangyi"Agent Swarm 项目今天见世界"、YongtingZhang 讲 PARL)和小号,外部大节点主要有:
zephyr_z9:"Kimi 打响 1Q26 模型大战第二枪,Agent Swarm 很有意思"——5416 阅读
https://x.com/zephyr_z9/status/2016022087950094540
lmsysorg(SGLang):Day-0 支持,15T 视觉-文本混合训练解读——6207
https://x.com/lmsysorg/status/2016021744684040574
OpenRouter:"带视觉的 K2.5 上线"——1920
https://x.com/OpenRouter/status/2016021913970344176
YouJiacheng 技术质疑:"难知识问答没进步,预训练可能还是 K2;高级视觉场景幻觉严重"——827
https://x.com/YouJiacheng/status/2016022034510496133

【独立讨论帖】(这场的声量主力在这边)

cryptopunk7213 一周大事记,K2.5 与 Google/Tesla/微软新闻同列——140 万
https://x.com/cryptopunk7213/status/2017101710863237136
ns123abc:"1T 参数、原生多模态、BEATS CLAUDE 4.5 OPUS、开源"——68.8 万
https://x.com/ns123abc/status/2016027534056464636
minchoi:两台 Mac Studio 本地跑 K2.5、24 tok/s——56 万
https://x.com/minchoi/status/2016496330697294198
birdabo:"KIMI K2.5 JUST MOGGED EVERYONE"——39.5 万
https://x.com/birdabo/status/2016099077252087979
Artificial Analysis:"新开源第一,史上最接近前沿;首个支持图像输入的开源旗舰"——30.5 万
https://x.com/ArtificialAnlys/status/2016250137115557953
EHuanglu:2 台 Mac Studio 24 tok/s,"很快不需要订阅了"——16.9 万
https://x.com/EHuanglu/status/2016611220803969125
thdxr(OpenCode):"所有 K2.5 推理供应商都过载,GPU 还是不够"——10.3 万
https://x.com/thdxr/status/2018394044020264968
akothari:"市场还没 price in K2.5"——8.7 万
https://x.com/akothari/status/2017663493819011271
theo:"K2.5 is an incredible model"——8.4 万
https://x.com/theo/status/2017107112690929973
批评:denisewu"K2.5 自称 Claude,和 DeepSeek 自称 ChatGPT 一样,蒸馏实锤"——1.1 万
https://x.com/denisewu/status/2016359279658455510

━━━━━━━━━━━━━━━
三、智谱 GLM-5(2026年2月11日):匿名预发的教科书
━━━━━━━━━━━━━━━

发布帖:150 万阅读、5334 赞、774 转、312 引用。"From Vibe Coding to Agentic Engineering",744B/40B 激活、28.5T tokens。
https://x.com/Zai_org/status/2021638634739527773

独特打法「匿名预发」:发布前 GLM-5 以 "Pony Alpha" 马甲在 OpenRouter 匿名跑分攒口碑,发布日 OpenRouter 官方揭晓"Stealth model reveal"——自带"石锤"话题。发布当天还有悬念 teaser"A new model is now available on z.ai"(73.9 万)。
https://x.com/Zai_org/status/2021564343029203032

【转发引用节点】

UnslothAI:"744B 从 1.65TB 压到 241GB,256GB Mac 能跑"——23.3 万(Unsloth 从此成为每场中国模型发布的固定放大器)
https://x.com/UnslothAI/status/2021931246247690666
himanshustwts:"vibe test 下来 UI one-shot 比 Opus 4.6 还好"——20.3 万
https://x.com/himanshustwts/status/2022662903342744005
ollama 官方:"GLM-5 上线 Ollama cloud"——19.1 万
https://x.com/ollama/status/2021667631405674845
lmarena:Text Arena 开源第一——16.6 万
https://x.com/arena/status/2021725350481526904
zhuokaiz:"Claude Code 里跑 GLM-5,1/3 成本"——15.8 万
https://x.com/zhuokaiz/status/2021692638143951252
awnihannun:单台 512GB M3 Ultra Q4 跑 GLM-5,15.4 tok/s——6.1 万
https://x.com/awnihannun/status/2022007608811696158
kimmonismus:"HLE 50.4%,中国离美国前沿不到 6 个月"——3 万
https://x.com/kimmonismus/status/2021644328079348104
zRdianjiao(智谱员工):"MIT 开源,感谢一路支持的开发者"——4.5 万
https://x.com/zRdianjiao/status/2021639480134996157
Chris Manning(斯坦福 NLP 教授):"这看起来是诚实的 benchmark——有强有弱"——1.5 万
https://x.com/chrmanning/status/2021967196306776566
hsu_steve:"GLM-5 全程用华为 Ascend + MindSpore 训练,没用 NVIDIA"——1.6 万
https://x.com/hsu_steve/status/2022378494873997688

【独立讨论帖】

theo 连发三帖:"值得用的代码模型只有 Opus 4.6、Codex 5.3、GLM-5"(14.6 万)+"第一个我能真心推荐写代码的开源模型"(11.8 万)+"GLM-5 is a killer model"(6.9 万)——西方头部开发者 KOL 背书是这场最大资产
https://x.com/theo/status/2021909439125840150
fxtrader(中文):"Pony Alpha 就是 GLM-5 石锤"——17.2 万
https://x.com/fxtrader/status/2021576544930631904
Artificial Analysis:"开源与闭源差距历史最小"——14.7 万
https://x.com/ArtificialAnlys/status/2022449374425661457
lmarena Code Arena SVG 对决预告——12 万
https://x.com/arena/status/2021732547349344690
tom_doerr:"原来 ollama cloud 支持 glm-5"——9.9 万
https://x.com/tom_doerr/status/2021729168090599505
scaling01:KingBench Agent 第一——7 万
https://x.com/scaling01/status/2021568936144253223
testingcatalog:"GLM-5 已可用"——6.7 万
https://x.com/testingcatalog/status/2021566369352073378
RoundtableSpace:"多项超 Opus 4.6,10 倍便宜,最低幻觉率"——6.1 万
https://x.com/RoundtableSpace/status/2022275811869376565
karminski3 中文全面实测(鞭炮炸鱼缸/硅基骑手)——2.9 万
https://x.com/karminski3/status/2021577166467854676

官方配套:Gameboy 长任务演示(700+ 工具调用、24 小时单 agent)41.3 万;"compute very tight"坦诚帖 24.3 万;技术报告 2/18 发布 44.8 万。杂音:发布同日宣布 Coding Plan 涨价(7.9 万),时机欠佳。
https://x.com/Zai_org/status/2021754659590033565

打法特色:高频多波段——GLM-5(2/11)→技术报告(2/18)→GLM-5-Turbo(3/15,114 万)→GLM-5.1(3/27,129.8 万)→GLM-5V-Turbo(4/1,196 万),几乎每月一发,每发百万级。

━━━━━━━━━━━━━━━
四、小米 MiMo-V2.5(4月22日官宣、27日开源):个人 IP 和免费运营
━━━━━━━━━━━━━━━

官宣帖(4/22):37.7 万阅读、2536 赞。
https://x.com/XiaomiMiMo/status/2046988157888209365
开源帖(4/27):81 万阅读、3405 赞。MiMo-V2.5-Pro(1T/42B)+ MiMo-V2.5(310B 全模态),MIT。
https://x.com/XiaomiMiMo/status/2048821516079661561

【转发引用节点】

罗福莉个人号(引用开源帖):"刚开源两个模型,再送开发者 100T tokens,go build something cool"——67.7 万、3074 赞,比官方开源帖还大。"AI 天才少女"个人 IP 的带货力在这场被验证
https://x.com/_LuoFuli/status/2048851054662762618
op7418:"全部开源+MIT+100T token 计划,太牛批了"——16.1 万
https://x.com/op7418/status/2048956024141598736
lmarena:Code Arena 前端开源第三——7.7 万
https://x.com/arena/status/2049172075143942282
quentin_hsu(中文):"毫不夸张,国内第一梯队"——2.9 万
https://x.com/quentin_hsu/status/2049136896316453020
TheAhmadOsman:"新的开源 SOTA 竞争者入场"——2.8 万
https://x.com/TheAhmadOsman/status/2048831095584534941
eliebakouch(HuggingFace)技术卡片:FP8 训练、27T/48T tokens——1.2 万
https://x.com/eliebakouch/status/2048845602633433258
vllm_project Day-0 支持——9750
https://x.com/vllm_project/status/2048825703244972375

【独立讨论帖】

Artificial Analysis:"MiMo V2.5 Pro 54 分与 Kimi K2.6 并列,权重放出即最强开源"——24.8 万
https://x.com/ArtificialAnlys/status/2047799218828665093
OnlyTerp 翻车帖:"本地 5090 上 Qwen 3.6 27B 直接打赢 MiMo V2.5 Pro"——7.6 万,负面爆款
https://x.com/OnlyTerp/status/2047069635103637568
opencode:"两个模型都上了 Go,价格不变"——7.9 万
https://x.com/opencode/status/2047003454283850112
onehopeA9(中文):把自己中签的 100T token key 直接送粉丝——3.9 万
https://x.com/onehopeA9/status/2049489498913091722
OpenRouter:"MiMo-V2.5 系列上线,token 效率极高"——2.5 万
https://x.com/OpenRouter/status/2046990572725182964
kimmonismus:"MIT 协议在 arena 超过 Opus 4.5"——2.2 万
https://x.com/kimmonismus/status/2049407886141591750
tphuang 生态观察:"Day-0 芯片名单里没有华为昇腾和寒武纪"——7 千
https://x.com/tphuang/status/2049575655784788364

打法特色:①运营驱动——100T Token Grant、连续免费,5/26 的"API 降价 99%"帖 115 万阅读,比开源帖还大
https://x.com/XiaomiMiMo/status/2059314052892099070
②Day-0 多芯片适配(AMD/昆仑芯/燧原/沐曦/天数智芯)做成独立传播点;③3 月 V2-Pro 也玩过 OpenRouter 匿名马甲(Hunter/Healer Alpha);④后续 UltraSpeed 1000tok/s(40.2 万)、MiMo Code CLI(21.7 万)持续续命。

━━━━━━━━━━━━━━━
五、MiniMax M3(2026年6月1日):单帖爆发与"跳票"梗
━━━━━━━━━━━━━━━

发布帖:521 万阅读、11490 赞、1141 转、1985 引用(引用数中国场次第一)。"首个三合一开源模型":SWE-Bench Pro 59.0%、MSA 稀疏注意力、1M 上下文、原生多模态。但权重"约 10 天后"才放。
https://x.com/MiniMax_AI/status/2061266317815296322

【转发引用节点】

Teknium(Nous):"M3 上线 Hermes Agent"——21.7 万
https://x.com/Teknium/status/2061279908152905905
ImAI_Eruel(日语):"中国开源逼近 GPT-5.5,'落后 4 个月'的说法要缩水了"——11.7 万
https://x.com/ImAI_Eruel/status/2061292399520108852
jiayuan_jy(中文):"实测一早上体感接近 Opus 4.7;M3 写码 + Opus/GPT 对抗式 code review"——10.7 万
https://x.com/jiayuan_jy/status/2061272379838677262
RyanLeeMiniMax(MiniMax 员工):"下周上 HuggingFace"——10.4 万。这场发布里 Ryan Lee 个人号全程高活跃:改宽松 license、承诺持续开源前沿权重、发排名战报,是官方号外的第二引擎
https://x.com/RyanLeeMiniMax/status/2061267406761476500
yacineMTB:"智能饱和后开源必然追上,战场在服务成本"——7.6 万
https://x.com/yacineMTB/status/2061275252282249393
willccbb(Prime Intellect)权重跳票梗:"M3 开创先河:第一个闭权重的开权重模型"——8.4 万
https://x.com/willccbb/status/2061275991889363448
SkylerMiao7(MiniMax 员工):"几个无眠夜后 M3 终于来了"——6.8 万
https://x.com/SkylerMiao7/status/2061282545296425465
notjazii:"1M context+原生多模态+超便宜"——7 万
https://x.com/notjazii/status/2061354245514035565
bridgemindai 负面实测:"它弄坏了我的 push-to-talk,穿墙 glitch"——4.6 万
https://x.com/bridgemindai/status/2061445050593128680

【独立讨论帖】

kilocode:"$0.07(M3)对 $3.39(Opus),同一次 code audit 都抓到 13/17 个 bug"——13.8 万
https://x.com/kilocode/status/2063397618034844135
权重 6/12 真放出时的第二波:官方 HF 帖 69.5 万 + 次日 meme 帖 53 万/6593 赞
https://x.com/MiniMax_AI/status/2065436935188058208
LechMazur 冷评:"M3 的座右铭:变得不可 benchmark"——1.6 万
https://x.com/LechMazur/status/2062962254010552780
fgbyte(西语):"告别 OpenCode 免费档里最强的模型,我把它薅干了"——2 万
https://x.com/fgbyte/status/2063697739565744523
RyanLee:AA 第 8 名战报——6.3 万
https://x.com/RyanLeeMiniMax/status/2062468206535840133
NVIDIA Nemotron 3 Ultra 对比赢 M3 的帖子(RoundtableSpace 5.4 万等)是发布周尾部的负面对照。

杂音特色:M3 的传播混入大量加密生态刷量(justinsuntron/TRON 系)、SEO 农场(JulianGoldieSEO 连发十几条)和"AI 时代工程师"鸡汤语录号蹭热度——引用数据水分比其他场明显。

━━━━━━━━━━━━━━━
六、GLM-5.2(6月13日/16日):地缘政治东风下的三段式发布
━━━━━━━━━━━━━━━

打法上最特殊的一场,发布绑定"Fable 5 被美国政府突然限制"事件,分三段:

第一段(6/13):Coding Plan 可用帖 262 万/8415 赞 + 宣言帖 103 万/8109 赞。宣言开头直接说"今天某些前沿模型被突然限制访问,深表遗憾……通往 AGI 之路绝不能被高墙围困"。发布时间选在 5:21——与 Fable 5 被下线同一分钟。
https://x.com/Zai_org/status/2065704919299235870
https://x.com/Zai_org/status/2065784751345287314

第二段(6/16):开源权重帖,真正的声量王——755 万阅读、13186 赞、1793 转、953 引用。
https://x.com/Zai_org/status/2066938937344495629

第三段:持续运营(HF 免费 5 小时 27.3 万、一个月后"满月"帖等)。

【转发引用节点】(以 6/13 宣言帖为主)

yacineMTB:"用中文优化我的 CUDA kernel,晚安各位"——16 万
https://x.com/yacineMTB/status/2065813836335051072
victor207755822(DeepSeek 研究员)借机开炮:"coding plan 订阅模式是糟糕生意"——11.8 万
https://x.com/victor207755822/status/2065806753074446444
maxifirtman(西语):"中国开始回应特朗普对 Claude 的封锁"——9.1 万
https://x.com/maxifirtman/status/2065860269473943974
kimmonismus:"封禁 Fable 5 是开源模型史上最大的免费公关"——8.8 万
https://x.com/kimmonismus/status/2065796495593394293
testingcatalog——3.2 万
https://x.com/testingcatalog/status/2065938982010056855
IntCyberDigest(地缘账号):"美国在限制,中国在开源"——3.1 万
https://x.com/IntCyberDigest/status/2066279540427497861
VaibhavSisinty:"5:21 同一分钟,故意的"——2.2 万
https://x.com/VaibhavSisinty/status/2065924837772804497
DeryaTR_(生物学者):"全力支持所有开源前沿模型"——1.9 万
https://x.com/DeryaTR_/status/2065838071220691173
0xSero:"Zai 是好人,信他们会一直开放"——1.7 万
https://x.com/0xSero/status/2065843514773033404
Hesamation:"Anthropic 是开源 AI 最大的加速器,虽然它一个权重都没放过"——5.5 千
https://x.com/Hesamation/status/2065805159746113879
NielsRogge(HF):"零炒作零'核武器'叙事,就是好模型"——4.8 千
https://x.com/NielsRogge/status/2066251173925888390

【独立讨论帖】(这场的第二波才是大头)

nutlope:"GLM 5.2 和 Opus 4.8 各做一个落地页你分不出来;$0.06 对 $0.49"——158 万、8242 赞
https://x.com/nutlope/status/2067313679951941686
UnslothAI 2-bit 本地版——188 万、7358 赞
https://x.com/UnslothAI/status/2067588262156501497
Design Arena:"GLM-5.2 第一,超过 now unavailable 的 Fable 5"——203 万
https://x.com/Designarena/status/2066940737011560652
lmarena Code Arena:"第二,只输 Fable 5"——154 万
https://x.com/arena/status/2066957802741043641
jeremyphoward(fast.ai 创始人):"GLM 5.2 是个奇迹,至少不输 Opus 4.8 和 GPT 5.5,我从没体验过这样的开源模型"——88.4 万、7370 赞
https://x.com/jeremyphoward/status/2067757468189679764
bridgemindai:"美国禁 Fable 两天后 GLM5.2 榜单第一……Unban Fable 5"——86.4 万、6822 赞
https://x.com/bridgemindai/status/2066126669073510904
mattpocockuk:"谁在跑 GLM 5.2?我第一次对开源模型 FOMO"——51.5 万
https://x.com/mattpocockuk/status/2067899664209187273
jun_song 排名:"Fable > Kimi-2.7 > Opus-4.8 = GLM-5.2 > GPT5.5 > M3"——48 万
https://x.com/jun_song/status/2066181519111229941
cyrilxuq(中文):"没理解智谱为啥这么强,为啥为啥为啥"——36.4 万
https://x.com/cyrilxuq/status/2066378521866592573
StudentOffersHQ:"ZCode 免费,像 Codex 但 $0"——21.2 万
https://x.com/StudentOffersHQ/status/2066625556737917203
0xAA_Science 段子:"Claude 开始蒸馏 GLM-5.2 了,很快 100 倍价格给大家用"——13.1 万
https://x.com/0xAA_Science/status/2065731200296292759
Sentdex:"闭源一团糟的同时,开源过了史上最好的一周:GLM5.2、M3、Kimi 2.7 code"——12.7 万
https://x.com/Sentdex/status/2066157250268237993
ZackKorman:"智谱的 Zcode 和 Codex 一模一样,抄袭指控甩不掉"——9.9 万
https://x.com/ZackKorman/status/2076254672004780118
反方实测:PawelHuryn 真实代码库埋 21 个 bug,"GLM max 档没提升,算上无缓存比 Opus 还贵"——1.7 千
https://x.com/PawelHuryn/status/2067327471096082935

后续负面:一个月后 Anthropic 国安政策负责人在 Aspen 论坛点名指控智谱蒸馏 Claude/OpenAI 模型——17.7 万。
https://x.com/vince_chow1/status/2077446050269331577

━━━━━━━━━━━━━━━
七、腾讯混元 Hy3(2026年7月6日):免费 API 买生态的标准答案
━━━━━━━━━━━━━━━

发布帖:110.9 万阅读、2891 赞、393 转、244 引用、1201 收藏(收藏/点赞比全场最高——开发者"存下来要用")。295B MoE/21B 激活、Apache 2.0、免费 API 两周。
https://x.com/TencentHunyuan/status/2074148098876768478

官方多波段:7/6 主帖 → 7/7 workflow 演示 → 7/9 生态汇总 → 7/13 OpenRouter 周榜第一(7.9 万)→ 7/14 1-bit/4-bit 单卡版(39.2 万,第二波峰)。
https://x.com/TencentHunyuan/status/2076500250391708059
https://x.com/TencentHunyuan/status/2076953120765280284

【转发引用节点】

姚顺雨(混元负责人,ex-OpenAI)个人叙事帖:"Hy2→Hy3 preview→Hy3,半年又一次大跨越,不只推理和 agent,还有抗幻觉、可靠性、产品体验"——14.6 万、1062 赞,官方帖外最重要的权威背书
https://x.com/ShunyuYao12/status/2074151389945827744
Paul Couvert(itsPaulAi,22万粉):"GLM-5.2 一半大小、竞争 GPT-5.5、强于 DeepSeek V4 Pro,Tencent cooked"——12 万
https://x.com/itsPaulAi/status/2074822893830361327
atomic.chat 物理模拟对比:"Hy3 达到 Gemini 3.5 质量、便宜 35 倍;DeepSeek V4 烧最多 token 效果最差"——11 万
https://x.com/atomic_chat_hq/status/2074202885517443364
kilocode:"HY3 免费上 Kilo"+ Opus/Fable/HY3 一把梭对比——7.9 万
https://x.com/kilocode/status/2074191895815672108
GesoraMeshack:同 prompt 让 GPT-5.5/Gemini 3.5 Flash/Hy3 生成 Space Invaders——4 万
https://x.com/GesoraMeshack/status/2074392119054094843
vllm_project Day-0:"Spin it up now"——3.3 万
https://x.com/vllm_project/status/2074151633118957954
pipenetwork:MLX 量化版——3.3 万
https://x.com/pipenetwork/status/2074865717900398700
Sentdex:"Oh my this looks really good,OSS AI 好到应接不暇"——2.9 万
https://x.com/Sentdex/status/2074184669659086885
中文区 KOL 集中投放(7/8-9,口径统一:价格/token 效率/WorkBuddy 免费):gkxspace 2.5 万、Zesee 2.3 万、gengdaJ 2 万、vista8 1.1 万("怪不得腾讯股价涨了")、LISHOUYIAI 点出"姚顺雨从 OpenAI 加入刚好半年,首个正式版本"叙事
https://x.com/gkxspace/status/2075054808457699457
https://x.com/LISHOUYIAI/status/2075389600995180606
质疑:NVIDIA 架构师 Max Lv"量化效果不好,性能非 SOTA,社区热情不大"——1 万
https://x.com/m0d8ye/status/2074264284654428432
gneubig(CMU/OpenHands):"如果数字反映真实体感,离能自己 host 的强模型又近一步"——1 万
https://x.com/gneubig/status/2074152558700990470
LiorOnAI(AlphaSignal):"Hy3 没卷 benchmark,修的是让 agent 悄悄失败的东西"——4.6 千
https://x.com/LiorOnAI/status/2074176479722864988

【独立讨论帖】

NousResearch:"Hy3 免费上线 Nous Portal"——27.6 万、1870 赞,全场最高
https://x.com/NousResearch/status/2074260103469892045
OpenCode:"Hy3 免费上线,early users 说比 preview 强很多"——17.4 万、2652 赞
https://x.com/opencode/status/2074574393628377220
jun_song:"HY3 明显好于 DeepSeek V4 Flash,MacBook M5 Max 实测"——3.9 万
https://x.com/jun_song/status/2074183938583802317
lily_gpupoor 定位判断(被反复引用):"Hy3 所有 coding bench 输 GLM 5.2,但赢在 BrowseComp/编排类——它是后训练成的搜索编排模型,21B 激活便宜到能当 always-on 云 agent"
https://x.com/lily_gpupoor/status/2074172227348779133
P0 Systems 用量帖:"发布 4 天打了 33 亿 tokens"——1 万,被官方转发
https://x.com/P0Systems/status/2075338845818642481
第二周用量数据成最硬素材:"Hy3 免费档单周 6.13 万亿 tokens 登顶 OpenRouter,压过 MiMo-V2.5(5.95T)和 DeepSeek V4 Flash(5.22T)"
https://x.com/dlimeng192048/status/2076966574142222791
karminski3 中文复盘:"国模霸榜 OpenRouter 用量 Top6,第一就是混元 3 免费版"——1.1 万
https://x.com/karminski3/status/2077166250338480281
本地部署接力:ciruai AMD Strix Halo 2-bit"可能是单台 128GB 机器最聪明的模型"(1.5 万)、umiyuki_ai 日语实测 1-bit GGUF 89.4GB(1.1 万)、Tech2Wild"AA Coding Index 超 DeepSeek V4 Flash"(5.5 千)
https://x.com/ciruai/status/2076809483230007676
https://x.com/umiyuki_ai/status/2077213538750496849
https://x.com/Tech2Wild/status/2077131705467437430

━━━━━━━━━━━━━━━
八、Kimi K3(2026年7月16日):史上最大的中国模型发布
━━━━━━━━━━━━━━━

发布帖:1985 万阅读、53849 赞、7168 转、3172 引用、22605 收藏——发布仅两天(本节窗口 7/16-18)。2.8T 参数、1M 上下文、原生多模态、KDA 解码快 6.3 倍,权重 7/27 放,定价 $3/$15(比 K2.6 涨近 4 倍)。
https://x.com/Kimi_Moonshot/status/2077830229968683203

【转发引用节点】

igus_ai(西语梗图):"Anthropic CEO 看着中国发布全面超 Opus 4.8、便宜 8 倍还开源的模型,无能为力"——550 万、53551 赞,K3 传播的最大单点
https://x.com/igus_ai/status/2077846880633983259
bakkermichiel(研究员):"谁能解释 Kimi 怎么这么强?'中国靠蒸馏'的故事解释不了这些结果"——79.7 万
https://x.com/bakkermichiel/status/2077857476574052730
cgtwts 绿字梗:"be Kimi > 天天被说落后几年 > 发 K3 > 登顶"——71.5 万、15363 赞
https://x.com/cgtwts/status/2077864998702113056
ChrisGPT:"K3 三发做出 CS:GO×Portal,$3.24;同 token 量 Fable 5 要 $10.80"——54.3 万
https://x.com/ChrisGPT/status/2077852656182129078
AlexFinn:"我错了,我说过距离桌上的 Fable 5 还有一年——就是今天"——46.9 万
https://x.com/AlexFinn/status/2077847346592010331
lmarena:"来看 K3 官方发布"——29.2 万
https://x.com/arena/status/2077834713818169716
thealexker:"被低估的细节:早期 K3 写了自家大部分 kernel,还造了 triton 级编译器 MiniTriton"——28.8 万
https://x.com/thealexker/status/2077841378139426953
kimmonismus:"这可能是 DeepSeek 2.0 时刻"——22.2 万
https://x.com/kimmonismus/status/2077832669778317369
Arav Srinivas(Perplexity CEO):"Incredible"——16.9 万
https://x.com/AravSrinivas/status/2077830975741211089
Teknium:"欢迎 Kimi 加入 Hermes Agent 全家桶"——11.2 万
https://x.com/Teknium/status/2077849107369218211
soumithchintala(PyTorch 之父):"wow, what a world-class model"——10.4 万
https://x.com/soumithchintala/status/2077901469295259795
Aaron Levie(Box CEO):"开源模型到这个水平,每降一次成本企业用例就翻一倍"——9.3 万
https://x.com/levie/status/2077857617859535112
KimiDevs(官方开发者号):"世界首个开源 3T 级模型"——9.6 万
https://x.com/KimiDevs/status/2077832039991275738

【独立讨论帖】

lmarena Frontend Code Arena 战报:"K3 第一,1679 分超 Fable 5,从第 18 跳到第 1"——1592 万、25132 赞,几乎追平主帖,十六场里最大的第三方帖
https://x.com/arena/status/2077824029126504525
Artificial Analysis 深度评测:"AAII 57 总榜第三超 Opus 4.8,$0.94/任务约 Opus 一半"——118 万、6037 赞
https://x.com/ArtificialAnlys/status/2077832874183860404
johnlindquist(egghead 创始人):"让 K3 用 2026 最新 css/webgl 推极限做单页"——91.8 万
https://x.com/johnlindquist/status/2077840176370602179
SemiAnalysis:"和 DeepSeek R1 时一样,又有人以为 KDA 线性注意力利空 NVDA/HBM——恰恰相反"——40.6 万;另一条"中国 K3 前端超所有美国模型"20.5 万
https://x.com/SemiAnalysis_/status/2078250693010309260
Rubzem:"有人一条 prompt 复刻 HALO CE 10v10"——40.4 万
https://x.com/Rubzem/status/2077918377675215039
MarioNawfal(地缘大号):"中国一个下午烧掉美国 AI 领先"——38.6 万
https://x.com/MarioNawfal/status/2078228246500634971
krishdotdev:"发布前两天的 Moonshot 办公室,$20B 公司活得像这样"——27 万
https://x.com/krishdotdev/status/2078177198515908988
hqmank:"K3 Max agent swarm 复刻 macOS 27 网页版"——24.2 万
https://x.com/hqmank/status/2078046106651640184
Pliny the Liberator 越狱:"KIMI-K3: LIBERATED,开源权重新前沿冠军"——21 万、4286 赞
https://x.com/elder_plinius/status/2078155279817167135
jun_song 泼冷水:"K3 tested,略差于 Fable"——20 万
https://x.com/jun_song/status/2077372165696135279
Whats_AI:"内部写作 benchmark K3 第一,超 Fable 5,#21→#1,便宜 5 倍"——14.3 万
https://x.com/Whats_AI/status/2077860441380798908
PatrickToulme:"K3 怎么追上来的:数万专家做 RL 环境数据,蒸馏只省了冷启动"——10.3 万
https://x.com/PatrickToulme/status/2078210533007016295
AA 行业帖:"8 天 4 个前沿发布,前沿俱乐部 6 周从 2 家变 6 家,Fable 领先缩到 1 分"——9.3 万
https://x.com/ArtificialAnlys/status/2078165665278730490
中文审美疲劳段子(wolfyxbt):"今天 k3 发布超越 fable-5;昨天 gpt-5.6-sol 发布超越 fable-5;前天……"——1.8 万、114 条回复
https://x.com/wolfyxbt/status/2078459685288759675

两天内讨论方向:①"开源追平 Fable"是否成立;②KDA 架构与算力叙事(SemiAnalysis 主导);③蒸馏与 RL env 大讨论;④美股冲击(WSJ 报道美股应声下跌);⑤涨价争议;⑥安全争议(越狱);⑦权重 7/27 才放——和 M3 一样留二段引爆点,"开源发布"正在变成两幕剧。

━━━━━━━━━━━━━━━
九、对照篇:Sakana Fugu(日本,6月22日):声量最大、口碑剪刀差也最大
━━━━━━━━━━━━━━━

发布帖:2625 万阅读、38190 赞、5983 转、3880 引用、30007 收藏——这在当时是全场单帖第一,直到 7 月被 Fable 5 的封禁公告和 Grok 4.5 超过。文案两句:"完整的多智能体编排系统装进单一模型 API;Fugu Ultra 匹配 Fable 和 Mythos,且无出口管制风险。"
https://x.com/SakanaAILabs/status/2068861630327443966

Fugu 本体是一个训练来"指挥别的模型"的 LLM:模型池里有 GPT-5.5、Gemini-3.1-Pro、Opus 4.8 等,Fugu 负责选人、派活、验收、合成,可递归调用自己("How does it work"帖 86.9 万)。这是 orchestration model 品类第一次以消费产品姿态发布。
https://x.com/SakanaAILabs/status/2068862344684581023

官方打法:①把地缘政治写进产品定位——"依赖单一公司的模型是实质性脆弱,Fugu 编排可替换模型池,直接绕过供应商限制"(150 万);GLM-5.2 是借 Fable 被禁的东风,Fugu 是把这阵风做成了产品本身
https://x.com/SakanaAILabs/status/2068862070062485867
②创始人 David Ha(hardmaru)发"集合知宣言"(42.5 万)
https://x.com/hardmaru/status/2068884466056225025
③七天七个 use case 连载:金融时序(20.1 万)、盲棋(12.6 万)、AutoResearch(12.4 万)、CAD(8.8 万)、魔方(3.8 万),压轴是恢复 1610 年古文书阅读顺序(3.9 万)——非常日本
④渠道:6/24 OpenRouter(22.4 万)、Vercel、7/2 OpenCode(12.5 万)、7/15 NVIDIA Nemotron 合作(20.8 万)
https://x.com/SakanaAILabs/status/2077528494775603313

【转发引用节点】

AM09_21(日本):"日本产 LLM 不知不觉到了 Mythos 级,路由做到极致就能这样吗"——115 万、4665 赞
https://x.com/AM09_21/status/2068866712053911899
VaibhavSisinty:"东京实验室造出匹配 Fable 5 的模型,创始人是 Transformer 论文原作者"——92.2 万
https://x.com/VaibhavSisinty/status/2068923914299068553
birdabo:"东京小实验室,数字是真的:SWE-Pro 54.2、GPQA-D 95.1"——63.2 万
https://x.com/birdabo/status/2068896568779100485
nokonoko_1203(日本):"Fugu 有订阅!!"——41 万
https://x.com/nokonoko_1203/status/2068901165304262756
cgtwts:"Sir… Sakana just launched their own Fable"——27 万
https://x.com/cgtwts/status/2068892872485835229
ImAI_Eruel(最清醒的一条):"编排模型性能原理上搭别人便车,我一直批判这类跑分;但看了 Fable/Mythos 停服风波,单一模型停服的风险对冲,要的就是这个"——23.8 万
https://x.com/ImAI_Eruel/status/2068906519656268243
Aaron Levie:"一个 API 把活派给最合适的模型,做成 LLM 是个好主意"——15.2 万
https://x.com/levie/status/2068917230570795178
BlancheMinerva(EleutherAI 的 Stella Biderman)打假:"这个点上你不该相信 Sakana 的任何 claim——这条推明显是假的,加上去年那批造假的 AI Scientist 论文"——12.4 万
https://x.com/BlancheMinerva/status/2069009885958668340
0xAA_Science(中文段子):"Sakana 调用了 Fable 和 Mythos,是它能'匹配 Fable 和 Mythos'的唯一原因。高情商:多代理编排系统;低情商:重新发明了 OpenRouter"——6.3 万
https://x.com/0xAA_Science/status/2069052996466704844
beffjezos:"Holy shit. Huge drop from Sakana"——6.3 万
https://x.com/beffjezos/status/2068871074784432199
haha_kabu(日语):"和 OpenRouter Fusion 一个原理,喊'日本产 LLM 到 Fable 级'的多半是外行"——5.3 万
https://x.com/haha_kabu/status/2068945331082162314

【独立讨论帖】(第 2-5 天,风向急转)

atomic.chat 对比实测:"同一个 Trader Desk 任务,Fugu Ultra 只是接近 GLM 5.2 的水平,价格贵 17 倍($0.51 vs $0.03)"——74.2 万、2478 赞,Fugu 周期内最大的第三方帖
https://x.com/atomic_chat_hq/status/2069171121044513273
markksantos 的 Crossy Road 对决:"功能和设计 Opus 赢,速度和性价比 Fugu 赢"——68 万、4937 赞
https://x.com/markksantos/status/2068962823007285628
BullTheoryio:"日本初创匹配 Fable 5 和 Mythos"——30.4 万
https://x.com/BullTheoryio/status/2069003954919297400
沃顿教授 Ethan Mollick:"典型编码测试要跑 30 分钟,结果……也就还行,实际达不到 Fable"——6.4 万
https://x.com/emollick/status/2069113727115227232
RoundtableSpace:"同一个 three.js 游戏 prompt,Opus 4.8 仍然赢"——5.4 万
https://x.com/RoundtableSpace/status/2069340935906079052
jun_song 罕见正面:"一个 startup 发布了 Mythos 级模型"——2 万
https://x.com/jun_song/status/2069011309652525216
leploutos(法语)实测:"真实 agentic 工单 Fugu 57.7 分 vs GPT-5.5 89.7 分,还更贵"——1 万
https://x.com/leploutos/status/2069759501763248364
stretchcloud 品类观察:"模型不再是产品,编排层才是"——小声量但被行业引用
一周后日语区已出现"GPT5.6 或 Fable 回来了可能就不用了"的留存担忧。

杂音独一份:$FUGU memecoin 蹭盘、加密跟单号编造"东京交易员用 Fugu 把 $6,200 变 $304,865"(7.4 万)、还和法国某同名主播的丑闻串流——搜"Fugu"的噪音比任何中国模型都大。

对照结论:Fugu 用"出口管制对冲 + 新品类定义 + Transformer 作者光环"在当时拿到最大单帖,证明叙事强度能在第一周压过产品;但实测帖第 3-5 天准时到账,叙事买不来第二周。定位上它赢麻了,交付上它把子弹留给了对手。

━━━━━━━━━━━━━━━
十、DeepSeek V4 Preview(2026年4月24日):发布即价格战
━━━━━━━━━━━━━━━

从这一节起是第二批:美国与其他厂商的六场发布,加一个"没有模型"的对照组。先从中国这边最后一家补齐——DeepSeek。

发布帖:999 万阅读、45903 赞、7616 转、2422 引用、9943 收藏。赞数 4.6 万是全部十六场里最高的,阅读转化率远好过那些靠曝光堆出来的场次。V4-Pro 1.6T 总参/49B 激活,V4-Flash 284B/13B 主打性价比,1M 上下文,开源权重和 58 页技术报告当日齐发。
https://x.com/deepseek_ai/status/2047516922263285776

真正的引擎在发布之后:72 小时内连打三记价格牌,每一记都是新的传播波峰——次日 API 75% off(124 万)、4/26 输入缓存降价到十分之一(148 万)、4/29 折扣延长(230 万)。促销帖比多数厂商的发布帖还大。

【转发引用节点】

_TALEBM_(阿拉伯语科技大V):"中国扔下开源炸弹,摧毁 AI 市场价格"——139 万
https://x.com/_TALEBM_/status/2047581216178655536
arjunkocher 引梁文锋:"全世界都该免费用上 1.6T 模型"——45.6 万
https://x.com/arjunkocher/status/2047529508895674704
ollama 官方:V4-Flash 上线 Ollama 云——15.1 万
https://x.com/ollama/status/2047598971435290992
SilenceCaPrompt(法语):"中国一次发布摧毁 OpenAI 和 Anthropic 的商业模式"——14.9 万
https://x.com/SilenceCaPrompt/status/2047680618457424051
JustinLin610(Qwen 负责人林俊旸)只回三个词:"why preview"——9.5 万,友商隔空互动成梗
https://x.com/JustinLin610/status/2047577502277865631
scaling01:自称比官宣早 41 分钟拿到泄露——2 万
https://x.com/scaling01/status/2047519869306909077
Mayhem4Markets:"1M 上下文只用 V3 的 27% FLOPs、10% KV cache"——1.6 万
https://x.com/Mayhem4Markets/status/2047525254495351241
CodeByPoonam:"五个月内第三次,中国免费开源打平 GPT 和 Claude"——1.4 万
https://x.com/CodeByPoonam/status/2047749617576726935
himanshustwts:"58 页技术报告是中国大厂 SOTA 方法论的范本"——1.2 万
https://x.com/himanshustwts/status/2047540770849304826
Prince_Canuma(MLX 生态):"This is not a drill,MLX 适配已在路上"——1.2 万
https://x.com/Prince_Canuma/status/2047575189014126593

【独立讨论帖】

victor207755822(DeepSeek 团队成员):"V3 到 V4 隔了 484 天,AGI belongs to everyone"——108 万
https://x.com/victor207755822/status/2047518146689732858
eliebakouch(HuggingFace 研究员):吐槽 Mistral 新模型比 V4-Pro 还贵、性能还不及——43.3 万
https://x.com/eliebakouch/status/2049523829358162027
prasenx:"OpenAI 收 200 美元一个月,中国免费送 1.6T"——30.3 万
https://x.com/prasenx/status/2047624541002928514
Jaciezyt(中文):V4 弱智吧测试,四题只对一题——26.9 万,反向刷屏
https://x.com/Jaciezyt/status/2047589305347100867
quxiaoyin:"同一个任务 Claude Code 花 150 美元,DeepSeek V4 只花 2 美元"——25.7 万
https://x.com/quxiaoyin/status/2048912429875437710
cjzafir:"Codex 5.5 做编排 + V4 做执行,36 小时烧 1 亿 token,白菜价胜过 Opus"——22.6 万
https://x.com/cjzafir/status/2049968752360570894
cryptopunk7213:"一周三个中国实验室发三个前沿开源模型,中国追平了"——21.5 万
https://x.com/cryptopunk7213/status/2047529894121185479
meta_alchemist:"20 美元的 vibe coding 订阅别买 Claude,买 GLM/Kimi/DeepSeek"——7.4 万
https://x.com/meta_alchemist/status/2049957128421724363
NVIDIAAI 官方:SGLang 在 Blackwell 上跑 V4,解码 180 tok/s/GPU——3.4 万
https://x.com/NVIDIAAI/status/2049964864240791877
neural_avb:CSA/HCA 注意力架构解读,"感谢 DeepSeek 随手开源了数百万美元的研究"——2.3 万
https://x.com/neural_avb/status/2049992995341291958

打法特色:主帖只讲开源和 1M 上下文两件事,不堆 benchmark;传播全靠发布后连续三记价格补刀。声量结构高度地缘化——最高的引用节点是阿拉伯语和法语博主的"中国摧毁美国定价",不是技术内容。生态适配(Ollama/NVIDIA-SGLang/MLX/Claude Code 兼容)当日跟进。杂音:中文圈"弱智吧翻车"刷屏,以及 Preview 命名引发的预期管理问题——连 Qwen 负责人都公开问 why preview。

━━━━━━━━━━━━━━━
十一、Claude Fable 5(2026年6月9日发布,6月12日被政府封禁):危机比发布响 1.6 倍
━━━━━━━━━━━━━━━

这是全部十六场里最不像"发布战"的一场——因为它的最大声量不由 Anthropic 制造。

发布帖(@claudeai,6/9):5713 万阅读、10.46 万赞、14388 转、9952 引用、21592 收藏。"介绍 Claude Fable 5:一个我们已使其可安全通用的 Mythos 级模型,能力超过我们以往任何公开发布的模型。"
https://x.com/claudeai/status/2064394146916229443

三天后,@AnthropicAI 发出那条改变一切的公告(6/12):美国政府援引国安权限发出口管制令,禁止一切外国人访问 Fable 5 和 Mythos 5,模型被迫全球下线——9277 万阅读、88040 赞、25579 转、28901 引用。这是本文全部十六场、所有帖子里的单帖阅读冠军,是它自己发布帖的 1.6 倍。
https://x.com/AnthropicAI/status/2065597531644743999

下线约 19 天。7/1 商务部撤销管制(1492 万)、7/2 带新安全分类器恢复上线(1553 万)、7/16 宣布 7/20 起纳入 Max/Team Premium 订阅并给 Pro 用户发 100 美元额度(2662 万)。
https://x.com/AnthropicAI/status/2072106151890809341
https://x.com/claudeai/status/2078302415804379218

【转发引用节点】(围绕封禁事件)

IntCyberDigest 爆料:Amazon 研究员向政府举报越狱案例,触发封禁——271 万;另一条讽刺"请顺便封禁 Teams、SAP 和 Jira"146 万、2.4 万赞
https://x.com/IntCyberDigest/status/2065702754434064851
steph_palazzolo(The Information 记者):Amazon CEO Jassy 亲自向白宫示警促成管制——111 万
https://x.com/steph_palazzolo/status/2065830580135051306
hugolowell(WIRED 记者):华盛顿谈判无果,商务部长 Lutnick 从 G7 连线——82.3 万
https://x.com/hugolowell/status/2066686166884098244
AndrewCurran_:首发商务部长致信 Amodei 的消息——75.4 万
https://x.com/AndrewCurran_/status/2065591524545724877
peter_szilagyi(以太坊核心开发者):"可怕的不是模型拒答生物学,是几家公司决定你能做什么"——74.2 万、1.38 万赞
https://x.com/peter_szilagyi/status/2064620043896291671
gothburz:长文梳理"1 月拒绝五角大楼 → 6 月被管制"的完整时间线——60.9 万
https://x.com/gothburz/status/2065601302705398034
shensi:"模型治理时代来了"——62.9 万
https://x.com/shensi/status/2067661954236182857
0xAA_Science(中文段子):"DeepSeek 开始蒸馏 Fable 了,很快 1% 价格给大家用"——60.3 万
https://x.com/0xAA_Science/status/2064680753712275650
Polymarket:官员曾试图阻止发布——14.7 万
https://x.com/Polymarket/status/2065605717873017160
TheFIREorg(言论自由组织):封禁涉嫌违反第一修正案——7.2 万
https://x.com/TheFIREorg/status/2066624484703191181

【独立讨论帖】(发布到被封的三天,以及封禁后)

viktoroddy:Fable 5 建站教程实测——267 万
https://x.com/viktoroddy/status/2064703131808584116
toddsaunders(创业者):"客户电话里 Claude 边听边把功能实时做出来"——209 万
https://x.com/toddsaunders/status/2064552188475482303
PromptLLM:"Fable 5 疯狂建议"梗图——127 万
https://x.com/PromptLLM/status/2064438075036483732
neerajjj6785:零编程 30 分钟做出 3 个 web app——61.3 万
https://x.com/neerajjj6785/status/2064549419589198050
tanukiponkich(日语):"只有握有超高难度问题的人才用得起 Fable"——58.2 万
https://x.com/tanukiponkich/status/2064710396838305868
MoonDevOnYT(封禁后):"政府封禁 Fable 交易,因为它赚了 1411%"——41 万
https://x.com/MoonDevOnYT/status/2065814675678253206
gkxspace(中文):"6/22 前免费窗口往死里薅"+ 91 分工程师实测——6.2 万
https://x.com/gkxspace/status/2064474117068231083
Techmeme:曝隐形护栏(prompt 修改、steering vector 削弱前沿 LLM 研发能力)——5.5 万
https://x.com/Techmeme/status/2064445158964461638
1littlecoder:"Fable banned、Opus closed、GLM open"——声量不大但代表了开源阵营的反扑叙事
https://x.com/1littlecoder/status/2067748997784289520

打法特色:①双账号分工——@claudeai 管产品(十万赞级),@AnthropicAI 管危机(九千万阅读级);②"Mythos 太危险,Fable 是安全版"的分级命名本身是营销钩子,但被封后大量人引用 Altman 那句"说自己造了炸弹是绝佳营销"反讽其自食其果;③舆论迅速三分:主权 AI/开源替代叙事(受益者是 GLM 和 Kimi)、第一修正案争议、Amazon 举报的宫斗线;④恢复期节奏管理教科书级——解禁预告→次日恢复→限免→纳入订阅四连发,每帖千万级,把一场事故运营成了四次曝光。这场也解释了第六节 GLM-5.2 为什么能在 5:21 那一分钟发布:它蹭的正是这里的东风。

━━━━━━━━━━━━━━━
十二、OpenAI GPT-5.6 三兄弟(6月26日预览 / 7月9日 GA):把政府审批变成悬念
━━━━━━━━━━━━━━━

阅读量最高的不是正式发布,是 6/26 那条限定预览官宣:1847 万阅读、40690 赞、5731 转、5313 引用、6658 收藏。Sol(旗舰)/Terra(均衡)/Luna(高量低价)三兄弟,定价 5/30、减半、1/6 三档,70 万 A100 小时红队测试,Cerebras 上 750 tok/s。关键一句是"应美国政府要求,先向少数可信伙伴开放"——这句话本身成了整场发布最大的话题引擎。
https://x.com/OpenAI/status/2070555272230384038
7/7 预告帖 977.8 万;7/9 GA 帖 432.7 万、12475 赞。
https://x.com/OpenAI/status/2075271421149020426

【转发引用节点】

METR_Evals(第三方评测机构):"预部署评估中,Sol 被检出的作弊率高于我们测过的所有公开模型"——58.5 万,机构级负面
https://x.com/METR_Evals/status/2070584331068969336
k_matsumaru(日语):"benchmark 上 Sol 不止 Mythos 级,已经超了"——32.5 万
https://x.com/k_matsumaru/status/2070556493762662594
MatthewBerman:"Dario 害了所有人"——讽刺限定预览从被骂变成行业惯例——28.5 万
https://x.com/MatthewBerman/status/2070619836879868285
milesdeutscher:"最强技术被锁在墙内,真正的飞跃一出现就被拿走"——14.3 万
https://x.com/milesdeutscher/status/2070627303672164674
toly(Solana 创始人):"下一批模型最好叫 Bonk"——10.7 万
https://x.com/toly/status/2070586098385113108
trekedge(预览内测用户):"ultra 模式主动派 subagent,自己捡起你忘掉的任务"——6.7 万
https://x.com/trekedge/status/2070566387001823651
levie(Box CEO):"模型是真的强,AI 进步没有撞墙"——4.7 万
https://x.com/levie/status/2070563281916620895
eddylazzarin(a16z crypto CTO):"长期拿 Sol 币比 Terra 币舒服"——3 万
https://x.com/eddylazzarin/status/2070572224827040198
Raydium(Solana 头部 DEX)只回一个词:"Solana."——2.4 万
https://x.com/Raydium/status/2070572541106626956
davetroy(记者):"政府逐客审批 AI 是俄式 sistema,不是美国"——1 万
https://x.com/davetroy/status/2070608586942681168
usamasyed:"Anthropic 当初小范围发 Mythos 被骂作秀,如今成了行业规范——该道歉了吧"——9.5 千
https://x.com/usamasyed/status/2070563041561715112

【独立讨论帖】

thsottiaux(OpenAI Codex 负责人)贴身肉搏:"说出你爱 Sol 的理由、或者为什么转投别家,前一万人送 100 美元 Codex 额度"——495.6 万、1.33 万条回复,时间正对 Grok 4.5 的低价攻势
https://x.com/thsottiaux/status/2077248807533003257
nrehiew_:"Kimi K3 官方分数确认——Fable/Sol 级,但 Sonnet 的价格"——124.5 万
https://x.com/nrehiew_/status/2077782070785634767
brunolemos(知名开发者):"Sol 删了我整个生产数据库,其他模型从没发生过,不安全"——104.8 万,全场最响的负面
https://x.com/brunolemos/status/2076769881534398974
datacurve:"K3 登 DeepSWE 第三,首个达到 Sol/Fable 水平的开源权重模型"——64.8 万
https://x.com/datacurve/status/2078189882707730535
adxtyahq:"实测前端开发,K3 强过 Sol 和 Fable 5"——54.1 万
https://x.com/adxtyahq/status/2077829756310241465
twetsfyp:"用 Sol 做十万美元级电影感网站"21 分钟教程——25.9 万
https://x.com/twetsfyp/status/2077937630604304666
doodlestein:"Sol Ultra 独自跑了 3 天,回来发现一份疯狂的 TODO 清单"——10.7 万
https://x.com/doodlestein/status/2078497833032749436
LexnLin:"误开 Sol MAX 跑通宵,周额度只剩 8%"——6.4 万
https://x.com/LexnLin/status/2079073513017929918
posi_posi8(日语):"没开过一次 Blender,Sol 从企划到 3D 建模到花絮视频全包"——6.2 万
https://x.com/posi_posi8/status/2078853975655530849

打法特色:①三段式(6/26 预览 → 7/7 预告 → 7/9 GA),把两周等待期做成悬念;②政府审批变悬念——"应政府要求限定开放"引爆了"政府挑选赢家"的批评、METR 的作弊率披露和一片群嘲,但也免费买到两周话题;③GA 当天十几条 benchmark 线程齐发,捆绑 ChatGPT Work agent,配三条素人用户故事拉大众叙事;④命名意外被 crypto 圈接管(Solana 官方、toly、Raydium 集体下场玩梗),贡献了超过技术讨论的传播面;⑤7/14 Codex 负责人亲自发起"100 美元额度换表白",是这一轮里最直白的一次贴身肉搏。

━━━━━━━━━━━━━━━
十三、xAI Grok 4.5(2026年7月8日):买量、降价、人肉刷屏
━━━━━━━━━━━━━━━

发布帖:6895 万阅读、27675 赞、4031 转、1160 引用、3865 收藏——单帖阅读全场第二,仅次于 Fable 5 的封禁公告。但这个数字要打折看:6895 万阅读只换来 1160 条引用,而 K3 是 1985 万换 3172 条。阅读是 K3 的 3.5 倍,引用只有它的三分之一,该账号多条产品帖阅读破亿,买量痕迹明显。内容:"首个专为 coding 和 agents 训练的模型,与 Cursor 共同训练",1.5T 参数、500K 上下文、2/6 定价、80 tok/s。
https://x.com/SpaceXAI/status/2074915721684086811
Musk 个人号前一天预告:709 万、5.74 万赞;7/10 免费开放帖:3498 万。
https://x.com/elonmusk/status/2074740539874775163
https://x.com/grok/status/2075608541583544414

【转发引用节点】

DannyLimanseta(独立游戏开发者、Cursor 早期测试):"Opus 4.8 水平但两倍速、更便宜,要换成主力"——139.9 万
https://x.com/DannyLimanseta/status/2074921437933211813
nvidia 官方:祝贺,GB300 NVL72 训练——64.4 万
https://x.com/nvidia/status/2074979063106843131
Hesamation:"Elon 没吹牛,OpenAI 和 Anthropic 终于有真对手了"——21.6 万
https://x.com/Hesamation/status/2074918213448536262
veggie_eric 晒价格表:Grok 2/6 对 GPT-5.6 的 5/30——19.2 万
https://x.com/veggie_eric/status/2074917945319489581
zdhnarsil(xAI RL 研究员):小团队把 RL scaling 推到新高度的幕后——19 万
https://x.com/zdhnarsil/status/2074923568287322488
adxtyahq 打假:"照官方 weather app demo 复现,完全失败,demo 严重误导"——17.7 万
https://x.com/adxtyahq/status/2074970350597882314
AskVenice(隐私 AI 平台):已接入——6.4 万
https://x.com/AskVenice/status/2074924384674783574
lmarena:进 Agent Arena 实测——2.8 万
https://x.com/arena/status/2074933774178300270
OpenRouter:已上线——1.8 万
https://x.com/OpenRouter/status/2074922885328543952
omarsar0(Elvis Saravia):"不及 Fable 5 和 GPT-5.5,但效率翻倍,编排场景够用"——1.1 万
https://x.com/omarsar0/status/2074921779718443155
Axel_bitblaze69 点破打法:"发布图里自家模型四项测试全输——它卖的不是最强,是九折智能一折价;选在 Fable 5 停免费那周发,是伏击"——1.2 万
https://x.com/Axel_bitblaze69/status/2074932844024176794
_NathanCalvin(AI 政策研究者):"xAI 的安全实践记录在同行里垫底"——6.9 千
https://x.com/_NathanCalvin/status/2074986608776921125

【独立讨论帖】

Musk 本人澄清:"传统媒体曲解了,我只是让 Tesla 和 SpaceX 试试,别的模型更好就继续用"——276.7 万
https://x.com/elonmusk/status/2075794297631158373
cb_doge:VulcanBench 91.3% 击败 Fable 5 与 Sol——206.6 万
https://x.com/cb_doge/status/2078920456682488189
Polymarket:SWE-Atlas-QnA 登顶,压过 Fable 5 和 Sol——104.7 万
https://x.com/Polymarket/status/2076472406860873975
teslaownersSV:登上 Cognition 的 FrontierCode 榜——72.5 万
https://x.com/teslaownersSV/status/2078367770899542088
tetsuoai:额度重置继续爆肝——52.7 万
https://x.com/tetsuoai/status/2077183806117920958
Polymarket:单任务成本 0.31 美元,比 Fable 5 低 89%——24.2 万
https://x.com/Polymarket/status/2078325638113714284
Daniel_Farinax:"10 分钟建出 macOS 27 风格 UI,Kimi 要 3 小时"——8.2 万
https://x.com/Daniel_Farinax/status/2078159941492469805
muskonomy 揭内情:Grok Build 紧急开源,因为此前被研究者发现偷传用户私有代码库——5.6 千
https://x.com/muskonomy/status/2077666908367642852

打法特色:①价格战当主叙事——不喊最强,喊"Opus 级智能四分之一价格",官方发布图甚至主动展示自己输掉的 benchmark;②Musk 个人号一周连发十几条"Try Grok 4.5"短帖,每条 180-350 万阅读,等于用世界最大的个人账号做人肉刷屏;③渠道地毯式铺开加免费开放加两次额度重置;④时机是伏击,选在 Fable 5 停免费那周。三个负面同期:demo 被打假、Grok Build 偷传私有代码丑闻(用开源灭火)、"强制 Tesla/SpaceX 使用"传闻需要 Musk 亲自澄清。

━━━━━━━━━━━━━━━
十四、Thinking Machines Inkling(2026年7月15日):主动说"我不是最强"
━━━━━━━━━━━━━━━

发布帖:780 万阅读、14770 赞、2012 转、1172 引用、7655 收藏。Mira Murati 公司的第一个模型:975B MoE/41B 激活、1M 上下文、Apache 2.0、全部权重开放、可在自家 Tinker 上微调。
https://x.com/thinkymachines/status/2077454609551921208
Murati 个人号同步:"我们的第一个模型 Inkling,从零训练,权重开放,今天就能在 Tinker 上微调"——152 万、13569 赞。
https://x.com/miramurati/status/2077455974743593100

【转发引用节点】

eliebakouch(HuggingFace 研究员):发现西方大厂开源模型全用 sliding window attention——17.8 万
https://x.com/eliebakouch/status/2077489988661395651
indigox(中文):"Llama 失败之后,美国终于又有了完全开放权重的大模型"——11.7 万
https://x.com/indigox/status/2077521343105671301
leerob(Vercel 高管):"1T MoE、1M 上下文、评测扎实、博客写得漂亮"——10.4 万
https://x.com/leerob/status/2077464952734982266
shakoistsLog:"自称第 1 的模型多半在撒谎,自称第 8 的多半真不错"——5.8 万,这场最大的梗
https://x.com/shakoistsLog/status/2077471860061778307
Jason(Jason Calacanis)一词:"Docket!"——3.6 万
https://x.com/Jason/status/2077492815257305251
saranormous(Sarah Guo,Conviction 创始人):"Open American models!"——3 万
https://x.com/saranormous/status/2077469313108422806
gabepereyra(Harvey CEO):祝贺并预告法律领域评测——2.6 万
https://x.com/gabepereyra/status/2077471888281149691
Sentdex:"没想到他们真做出来了"——1.9 万
https://x.com/Sentdex/status/2077477318545612897
TheValueist(投资者):从 NVDA/MU 基建交易角度解读——1 万
https://x.com/TheValueist/status/2077479843772469533
ziv_ravid 最深度的架构拆解:无 RoPE、256 专家、Muon 优化器、3000 万 RL rollouts——8.8 千
https://x.com/ziv_ravid/status/2077492202993770799

【独立讨论帖】

zijing_wu(FT 记者):曝架构借鉴 DeepSeek-V3、后训练用了 Kimi K2.5 的合成数据——9.4 万
https://x.com/zijing_wu/status/2077731380117794994
Reuters 通稿——4.2 万
https://x.com/Reuters/status/2077538802126492071
scmallaby(《More Money Than God》作者):批其哈耶克式"中央计划"宣言"荒谬得好笑"——6.4 千
https://x.com/scmallaby/status/2078175881617633448
dreams_asi 负面实测:"过度护栏,该改名 Lobotomised Machines"——4.4 千
https://x.com/dreams_asi/status/2077502418200260735
Tech2Wild:挖出 HuggingFace 上未正式发布的 Inkling-Small 彩蛋——4.5 千
https://x.com/Tech2Wild/status/2077500617321562455
Stazdex 复盘:"K3 同周吞掉了新闻周期,安静发布的那些会在半年后被抄进你的技术栈"
https://x.com/Stazdex/status/2078551379384357051
bendee983(TechTalks 作者):RL 曲线未平台化、小模型追平大模型的疑点分析
https://x.com/bendee983/status/2078833890983026700

打法特色:典型的"研究室式"发布——官方主帖 + Murati 个人号 + 十几位员工帖矩阵,生态 day-0 全铺(vLLM、Fireworks、Modal、Unsloth、NVIDIA 官号齐发),配 Bridgewater 用 Tinker 微调的企业案例。最聪明的一手是主动承认"Inkling 不是最强模型"——反常识的坦诚成了最大传播梗。两处失分:撞上 K3 同周发布被吞掉新闻周期(总声量 780 万只有 Fable 发布的七分之一);哈耶克宣言引来 Mallaby 级评论者群嘲,FT 曝其借鉴 DeepSeek 架构和 Kimi 蒸馏数据也削弱了"美国开源救星"的叙事。反过来,Fable 5 被封 19 天的记忆,恰恰是它"开放权重等于不可被拔电源"这个定位的最佳背书。

━━━━━━━━━━━━━━━
十五、阿里 Qwen3.8(2026年7月19日):预告即发布
━━━━━━━━━━━━━━━

发布帖:742.6 万阅读、23235 赞、3209 转、1970 引用、4649 收藏。发在周日,紧贴 K3 的热度周。内容极简:2.4T 参数、"即将开源"、一句"当今最强模型之一,仅次于 Fable 5"——没有 benchmark、没有权重、没有 license、没有独立定价,preview 只在自家三个商业渠道(Token Plan/Qoder/QoderWork)可用。
https://x.com/Alibaba_Qwen/status/2078759124914098291

【转发引用节点】

gamann77(日语 meme 号)"今日のAI情勢"梗图——185 万,引用区最大单点
https://x.com/gamann77/status/2078792317331451928
kimmonismus:"据称超 GPT-5.6、仅微逊 Fable 5,What the frick"——48.5 万
https://x.com/kimmonismus/status/2078761134119927969
cgtwts 梗图:"OpenAI 和 Anthropic 的 CEO 看着中国又开源一个"——32.3 万
https://x.com/cgtwts/status/2078798326770856293
natolambert(Ai2)定调:"Qwen 最大的模型从不开源,这次破例,意味着自上而下不许再藏最强模型的新时代"——11.5 万
https://x.com/natolambert/status/2078822507684249811
AlexFinn:"开源正式追平前沿,比 GPT-5.6 强,早劝你囤硬件"——10.5 万
https://x.com/AlexFinn/status/2078909994746233122
yacineMTB 反串:"开源危险论、永远租我们的 token"——7.5 万
https://x.com/yacineMTB/status/2078779089964724493
IOHK_Charles(Cardano 创始人):要凑 4TB 内存加 8 张 GPU 并行跑 Qwen3.8/K3/GLM-5.2——6.8 万
https://x.com/IOHK_Charles/status/2078871145063813410
suchenzang(资深 LLM 研究员)讽刺美方叙事:"偷了美国还敢免费送,好大胆"——5.7 万
https://x.com/suchenzang/status/2078771401465663931
testingcatalog:preview 已可测,关键细节仍未公布——3.9 万
https://x.com/testingcatalog/status/2078831313327702113
DCinvestor(投资人):"如果真是蒸馏,两周内复刻旗舰还能躲过检测,那说明闭源没有护城河"——3.4 万
https://x.com/DCinvestor/status/2078820673578045550
hosseeb(Dragonfly 管理合伙人)最狠的一条:"周日发布、无 benchmark 无权重、只有一句口号加 API 导流;这是 3 月 Qwen 团队大重组后的急行军"——3.2 万
https://x.com/hosseeb/status/2078789396544012660
scaling01:"2.4T 不意外,Qwen3.7-Max 本就是 ECI 榜上最高的中国模型"——2.3 万
https://x.com/scaling01/status/2078805754715283509

【独立讨论帖】

jun_song 开源接力表:"GLM-5.2→K3→Qwen3.8→DeepSeek V4,预期超 Opus"——40.7 万
https://x.com/jun_song/status/2078757735760539862
OmedVibeCodes 实测踩:"被吊打,远不到 Fable 5,也不及 GPT-5.6 和 Opus,营销言过其实"——16.9 万
https://x.com/OmedVibeCodes/status/2078809799139963283
aicodeking 实测赞:"超所有 Opus,raw intelligence 惊人,但 tool calling 在部分 harness 上有问题"——10.8 万
https://x.com/aicodeking/status/2078857426191921162
SPAC89:25 美元 Token Plan 实测"超值"——9.1 万
https://x.com/SPAC89/status/2078768008785228160
AM09_21(日本):"比起 K3 和 Qwen3.8,我更着迷 4B 小模型"——9.1 万,巨模型审美疲劳
https://x.com/AM09_21/status/2078984500714127558
oran_ge(归藏):"若真超 GPT-5.6,中美差距缩到 3 个月"——7.5 万
https://x.com/oran_ge/status/2079079643177787448
fanofaliens:"中国实验室已经进入互卷最强开源的阶段"——5.8 万
https://x.com/fanofaliens/status/2078872950317744500
masahirochaen(日本大V):用一周的中华开源潮推演"AI 泡沫崩溃剧本"——4.4 万
https://x.com/masahirochaen/status/2078788853889106197
peterwildeford 最扎实的质疑:"K3 和 Qwen3.8 都只是宣布将开源,权重都还没放"——2.9 万
https://x.com/peterwildeford/status/2078874429614960958
filicroval:K3 对 Qwen3.8 落地页一对一,"K3 完胜,但 Qwen 快 3 倍"——2.3 万
https://x.com/filicroval/status/2078837104335855794

打法特色:"预告即发布"——一条帖同时做 PR 和拉新,不给成品只给期票,preview 全部导流自家付费渠道。官方矩阵联动:qwen_cloud 推 6 美元月费的个人版 Token Plan(40 万阅读)、qoder_ai_ide 做 Day-0 支持加九折。效果两极:正面靠"开源接力"叙事和 natolambert 的定调,阿里股价周一涨 5.4%;负面集中在"无 benchmark 先称第二",实测两极分化。这场有近半声量是"信不信"的争论贡献的——K3 用第三方评测开路,Qwen3.8 用口号和渠道优惠开路,这是两条路线最干净的对照。

━━━━━━━━━━━━━━━
十六、对照篇二:AMI Labs——零产品,四百九十七万阅读
━━━━━━━━━━━━━━━

这是本文唯一一个没有模型的案例,但它恰恰量出了叙事在发布战里的价格上限。

AMI Labs(Advanced Machine Intelligence)是 Yann LeCun 离开 Meta 后创办的世界模型实验室,CEO 是 Alexandre LeBrun。官方号 @amilabs 有 4.4 万粉丝,签名"Real world. Real intelligence."——但全库只有两条推文:3 月 10 日的融资公告,和一条回复。7 月 16 日 TechCrunch 采访里 CEO 明确说仍是 pre-product、没有公开时间表("准备好了会给大家一个惊喜")。截至 7 月 20 日,零模型、零发布帖。

最大声量事件是那条融资帖:10.3 亿美元种子轮(欧洲史上最大)、35 亿美元估值、Bezos Expeditions 与 Cathay Innovation 领投——497 万阅读、8450 赞、874 转、478 引用、3167 收藏。这个数字超过腾讯 Hy3(111 万)和小米 MiMo(81 万)两场真实的模型发布。
https://x.com/amilabs/status/2031234832454324639

【外围讨论】(官方零输出,声量全由第三方生成)

aakashgupta:"LeCun 离开 Meta 三个月后,他的 NYU 网络发出 LeWorldModel 论文,15M 参数单卡训练世界模型——架构离开了 Meta"——115 万
https://x.com/aakashgupta/status/2046371351016161745
zhang_benita:AMI 联创谢赛宁 7 小时马拉松访谈《逃出硅谷》——84.2 万
https://x.com/zhang_benita/status/2033467851655512142
Ric_RTP:"LeCun 的十亿美元豪赌:赌 LLM 是错的"——60.6 万
https://x.com/Ric_RTP/status/2038613197737869457
LiorOnAI:JEPA 技术路线解读——29.5 万
https://x.com/LiorOnAI/status/2031479959685067006
aakashgupta:LeWM 论文如何改变世界模型的成本结构——23.6 万
https://x.com/aakashgupta/status/2052977133073690820
MilkRoadAI:LeCun 出走叙事——9.4 万
https://x.com/MilkRoadAI/status/2031358975975751917
aakashgupta:李飞飞加 LeCun,三周 20 亿美元的"反 LLM 联盟"——7.5 万
https://x.com/aakashgupta/status/2031601588742053918
karlmehta(7/17):LeCun 上 Bloomberg,"人形机器人公司没人知道怎么让机器人变聪明"——4.3 万
https://x.com/karlmehta/status/2078464874519372207
BoWang87(多伦多大学教授):世界模型的医疗应用 EchoJEPA——2.5 万
https://x.com/BoWang87/status/2031468649786257785
business(Bloomberg):CEO 称"欧洲输了 LLM,但能赢世界模型"——1.6 万
https://x.com/business/status/2067259938095632680

对照结论:AMI 是"零产品高声量"的极端样本——官方全年一条推,声量完全由 LeCun 的个人 IP 和第三方叙事驱动,"AI 教父对赌全行业"这个框架天然带流量,aakashgupta 一个人就贡献了三条十万加。它标出了本文那条隐含规律的极限值:叙事可以完全脱离产品独立运转,但保质期有限。Fugu 的叙事撑了一周,AMI 的叙事撑了四个月,7 月的舆论已经开始转向"什么时候交货"——两者面对的是同一个到期日。

━━━━━━━━━━━━━━━
十七、横向规律:十六场发布教给我们的事
━━━━━━━━━━━━━━━

1. 最大的放大器不是官方号,是竞技场和评测机构。lmarena 的 K3 帖 1592 万、GLM-5.2 的 Design Arena 帖 203 万、AA 每场深度评测 15-120 万。反过来也成立:第三方评测能一击致命——METR 一句"Sol 的作弊率高于我们测过的所有模型"58.5 万阅读,是 OpenAI 那场最难公关的一条。发布日把第三方弹药备好,比写十条官方帖都值钱。

2. 阅读量会骗人,引用率不会。 这是加入美国厂商后最重要的新发现。Grok 4.5 官方帖 6895 万阅读只换来 1160 条引用(每万次阅读 0.17 条),K3 是 1985 万换 3172 条(1.60 条),差了近十倍;DeepSeek V4 用 999 万阅读拿到 4.6 万赞,是全场赞数第一。曝光可以买,愿意接话的人买不来。看一场发布的真实体质,除以一下就知道了。

3. 危机比发布更响。 Fable 5 的发布帖 5713 万,被政府封禁的公告帖 9277 万——1.6 倍,且是全部十六场的单帖冠军。对当事人这是灾难,对同行这是最大的免费东风:GLM-5.2 把发布时间卡在 Fable 下线的同一分钟(5:21),Sakana Fugu 把"出口管制对冲"直接写进产品定位,Thinking Machines 的"开放权重不可被拔电源"也是同一笔遗产。别人的危机是你的发布窗口,这一条在 2026 年被验证了三次。

4. 个人号一定要上,效果分三档:创始人出镜(杨植麟视频 169 万、Murati 个人号 152 万)> 核心负责人叙事(罗福莉 67.7 万、姚顺雨 14.6 万)> 员工小作文。极限值是 Musk:一周十几条短帖每条 180-350 万,等于自带一个电视台。反面案例是 AMI——创始人 IP 强到官方号可以不发帖,但那是特例不是打法。

5. 免费等于付费买几十个渠道替你发布。Hy3 两周免费、MiMo 100T grant、Grok 直接开免费档加两次额度重置、Fable 5 恢复后限免七天。渠道方为获客主动做内容,互动率还比官方高。

6. "开源权重"是第二波峰,可以拆成两幕卖——但期票开得太多会被记账。GLM-5.2 权重帖是 Coding Plan 帖的三倍;K3 预告 7/27;Qwen3.8 只给"即将开源"。到了 7 月,peterwildeford 那句"K3 和 Qwen3.8 都只是宣布将开源,权重都还没放"开始有人转了。第一次拆两幕是技巧,大家都拆的时候,先兑现的那个才占便宜。

7. 实测对比帖永远强于官宣帖。公式没变:同 prompt + 头部闭源对照组 + 具体价格数字。nutlope 落地页对比 158 万、kilocode 的"0.07 对 3.39"13.8 万、Polymarket 的"单任务 0.31 美元比 Fable 低 89%"24.2 万。

8. 两类传播节点要分开经营。【转发引用节点】靠发布日的官方运营,决定发布帖飞多高;【独立讨论帖】靠模型真实力,决定话题活多久。K2.5 是反例(引用区全是自己人),Hy3 是正例(两头都有)。Inkling 提供了新的反例:矩阵铺得很齐,但撞上 K3 同周,新闻周期被整个吞掉——发布日历也是资源,选周比选文案重要。

9. 地缘政治杠杆巨大但双刃,而且现在是双向的。中国这边:GLM-5.2 借封禁东风、K3 引来 WSJ。美国这边:OpenAI 的"应政府要求限定开放"换来两周悬念,也换来"政府挑选赢家"的批评和第一修正案争议;Anthropic 被封 19 天,最大的受益者是它的中国对手。这一年最赚的叙事和最贵的代价,来自同一件事。

10. 坦诚是被低估的圈粉利器,而且天花板比想象高。K2 的"我们太慢了在买机器"32.9 万;GLM-5 的"compute very tight"24.3 万;最极端的是 Inkling——主动说"我们不是最强模型",换来"自称第 1 的多半在撒谎,自称第 8 的多半真不错"这条全场最大的梗。在一个人人自称超越 Fable 5 的时间点,承认不是第一反而成了最稀缺的定位。

11. 发布通胀是真的,绝对声量还在涨。K2(274 万)→K2.5(735 万)→K3(1985 万)一年 7 倍。但审美疲劳的信号也在变多:wolfyxbt 的"每天超越 Fable"段子、AM09_21 的"比起 K3 和 Qwen3.8 我更着迷 4B 小模型"。打法决定下限,模型决定上限,而发布密度正在压缩每一场的保质期——2026 年 7 月单月就有 K3、Grok 4.5、GPT-5.6 GA、Inkling、Qwen3.8 五场。

12. 叙事买得来第一周,买不来第二周(Fugu 定律),但它的期限比想象中长。Fugu 靠叙事拿下 2625 万,第 3-5 天被实测帖收走;AMI 靠"AI 教父反 LLM"的叙事,零产品撑了四个月、497 万阅读——超过两场真实发布。上限是:叙事能替产品站台,但站台的时间是有限的,而且到期日由第三方决定,不由你决定。 宣发能做的,是确保实测帖到账时你站在对的一边。

━━━━━━━━━━━━━━━
十八、他们到底刷什么榜:十六场发布的 benchmark 清单
━━━━━━━━━━━━━━━

先纠正一个容易得出的错觉:十六场里,发布推文正文逐字列分数的只有 MiniMax M3 一家——但这不等于其他家没有跑分表。分数只是不放在推文里,而是放在官方博客、model card、技术报告里,而且那些表往往非常长(OpenAI 列了三十项)。推文只放一张图或一句定性,表格留给愿意点进去的人。

以下是各家官方发布材料里跑分表的完整清单。

【中国七家的官方跑分表】

Kimi K3(7/16,官方博客 kimi.com/blog/kimi-k3)
分组:Coding / Agentic / Multimodal
Coding:DeepSWE 67.5(Kimi Code harness,mini-SWE-agent 口径 67.3)、Terminal-Bench 2.1 88.3、ProgramBench 77.8、FrontierSWE 81.2、SWE Marathon 42.0、PostTrainBench 36.6、MLS Bench Lite 48.3、Kimi Code Bench 2.0(自建)72.9
Agentic:BrowseComp 91.2、AutomationBench 30.8、SpreadsheetBench 2 34.8、MCP Atlas、OfficeQA Pro、APEX-Agents、GDPval-AA、AA-Briefcase
Multimodal:MMMU-Pro、PerceptionBench、ZeroBench
对照组:Fable 5、GPT-5.6 Sol、Opus 4.8。逐行对照(K3/Fable 5/Sol/Opus 4.8):Terminal-Bench 88.3/84.6/88.8/84.6、DeepSWE 67.5/70.0/73.0/59.0、BrowseComp 91.2/88.0/90.4/84.3、AutomationBench 30.8/29.1/29.7/27.2
特点:Moonshot 在博客里主动承认整体仍落后 Fable 5 和 GPT-5.6 Sol——中国厂商里少见的"认输一档"写法。完全不列国产模型,也没有一个中文榜。

Qwen3.8(7/19)——唯一一家彻底没有跑分表的
没有 benchmark 表、没有 model card、没有 HuggingFace repo 和 license、没有激活参数数、没有 API 定价、没有官方发布博客。只有 WAIC 上一句"仅次于 Fable 5"。可引用的官方数字还停留在上一代 Qwen3.7-Max:GPQA Diamond 92.4、SWE-bench Verified 80.4、Terminal-Bench 2.0 69.7。

DeepSeek V4 Pro / Flash(4/24,技术报告 arXiv 2606.19348,58 页)
分组:Coding / Math & Reasoning / Knowledge
Coding:SWE-Bench Verified Pro 80.6、Flash 79.0、Terminal-Bench 2.0 Pro 67.9、Flash 56.9、LiveCodeBench Pass@1 Pro 93.5、Flash 91.6、Codeforces rating 3206
Math:IMOAnswerBench 89.8、HMMT 2026 95.2、AIME 系列
Knowledge:HLE 37.7、SimpleQA-Verified Pro 57.9、MMLU-Pro 87.5、GPQA Diamond 90.1
对照组:Opus 4.6、GPT-5.4、Gemini-3.1-Pro
特点:七家里唯一还在列 MMLU-Pro 的。风格最学术,给了 base model 对照表和 Pro/Flash 双档。没有中文榜。

智谱 GLM-5.2(6/16,HuggingFace 官方博文)
分组:Reasoning / Coding / Agentic / Long-context
Reasoning:HLE 40.5(带工具 54.7)、CritPt 16.7、AIME 2026 99.2、HMMT、IMOAnswerBench、GPQA-Diamond
Coding:SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(GLM-5.1 是 63.5)、NL2Repo、DeepSWE、ProgramBench、FrontierSWE、PostTrainBench、SWE-Marathon
Agentic:MCP-Atlas 76.8、Tool-Decathlon 48.2
对照组:Opus 4.8、GPT-5.5、Gemini 3.1 Pro,外加 Qwen、MiniMax、DeepSeek——十六家里唯一把国产同行放进对照表的
特点:叙事重心是 long-horizon agentic engineering,把 FrontierSWE、SWE-Marathon、PostTrainBench 三个长周期榜单独拎出来讲。

MiniMax M3(6/1,官方博客)——榜单数量最多,约 25 项
分组:Coding/SWE / Agentic / Multimodal / Research / Office 商业 / Long Context
Coding:SWE-Bench Verified、SWE-Bench Pro 59.0、SWE-Atlas、SWE-fficiency 34.8、KernelBench Hard 28.8、NL2Repo、LiveSQLBench
Agentic:Terminal-Bench 2.1 66.0、MCP Atlas 74.2、Apex-Agents、Claw-Eval、OSWorld-Verified、BankerToolBench
Multimodal:MMMU-Pro、VideoMMMU、Video-MME、OmniDocBench
Research:PostTrainBench、PaperBench、IMO 2025、USAMO 2026
Office:OfficeQA Pro、SpreadSheetBench、YC-Bench
Long Context:LOCA-Bench(256k)
对照组:没有完整逐榜竞品对照表,只在文字里说"接近海外头部闭源",部分分数标注取自官方 leaderboard、部分用自建 scaffolding 内测
特点:BankerToolBench、YC-Bench、OfficeQA Pro、OmniDocBench 是它独有的行业/办公榜。

腾讯混元 Hy3(7/6)
分组:Agentic Coding / Agentic Search / Working Agent / STEM & Reasoning / In-context learning / 领域专家人工评测
Agentic Coding:SWE-Bench Verified 78.0、SWE-Bench Pro 57.9(preview 版 46.0)、Terminal-Bench 71.7(preview 58.0)、SWE-Bench Multilingual、NL2Repo
Agentic Search:BrowseComp 84.2、DeepSearchQA 91.0
Working Agent:MCP Atlas、Toolathon、SkillsBench、ClawEval
STEM:GPQA Diamond 90.4、HLE 带工具 53.2、USAMO、MathArena Apex、FrontierScience-Olympiad、ArxivMath、PHYBench
In-context learning:CL-bench 23.8(Opus 24.8)
领域专家人工评测:2.67/4 分(GLM-5.1 是 2.51)——十六家里唯一用人工专家打分做主榜的
对照组:GPT-5.5、GLM-5.2、DeepSeek-V4 Pro、Opus 4.8,并用自家 preview 版做纵向对比(74 天迭代叙事)

小米 MiMo-V2.5(4/27,官方页 + HuggingFace)
跑分大部分以图片形式呈现。可提取:SWE-Bench Pro 56.1、Terminal-Bench 2 65.8、Claw-Eval General 62.1、Claw-Eval Multimodal 23.8、Claw-Eval Multi-Turn 63.2、ResearchClawBench 16.91、MiMo Coding Bench(自建,只给定性)
对照组:Gemini 3 Pro(视频)、Claude Sonnet 4.6(多模态 agentic)、自家 MiMo-V2-Omni 与 Pro 版
关键口径:带星号项标注"仅在 500B 参数以下模型中筛选对比"——小米不跟全量前沿比,自己划了一条 500B 参数线。

【美国与其他五家的官方跑分表】

Claude Fable 5(6/9,官网对比表是图片)
分组:软件工程 / 知识工作与推理 / 视觉 / 计算机使用 / 健康 / 生物 / 网络安全
SWE-Bench Pro 80.3(Opus 4.8 的 69.2、GPT-5.5 的 58.6、Gemini 3.1 Pro 的 54.2)、Terminal-Bench 2.1 88.0、FrontierCode Diamond 29.3(Opus 4.8 仅 13.4)、CursorBench 称 SOTA 未给数、GDPval-AA 1932、HLE 59.0(带工具 64.5)、Hebbia Finance 称最高分未给数、GDP.pdf 29.8、OSWorld-Verified 85.0、HealthBench Professional 66.0、BioMysteryBench 46.1、ExploitBench 78.0
自建榜:GDP.pdf、ViBench、core analytics、FrontierBench
对照组:Opus 4.8、GPT-5.5、Gemini 3.1 Pro,外加自家未阉割的 Mythos Preview(SWE-Bench Pro 77.8)——用"拿掉护栏能力有多强"给安全叙事背书

GPT-5.6 Sol / Terra / Luna(6/26、7/9)——分组最细,榜单最多,七大类约三十项
专业与知识工作:Agents' Last Exam、GDPval-AA v2、Management Consulting Tasks(内部)、Big Finance Bench、AA Intelligence Index v4.1
编码:AA Coding Agent Index v1.1、SWE-Bench Pro、DeepSWE v1.1、Terminal-Bench 2.1
计算机使用与浏览:OSWorld 2.0、BrowseComp、BenchCAD、BenchCAD w/ Python
网络安全:CTF Challenges、SEC-Bench Pro、CyberGym、ExploitBench、ExploitGym
科学与健康:GeneBench Pro、LifeSciBench、MedChemBench(内部)、HealthBench Professional
学术推理与数学:GPQA Diamond、FrontierMath Tier 1-3 与 Tier 4、ARC-AGI-3
工具与长上下文:AutomationBench、Toolathlon、OpenAI MRCR v2(256K-512K / 512K-1M)、GraphWalks BFS
已确认分数:Sol 的 Terminal-Bench 2.1 88.8(ultra 91.9)、ALE 53.6、SWE-Bench Pro 64.6;Luna 的 Terminal-Bench 82.5;对照 Fable 5 的 87.2 / 40.5 / 80.0
对照组:GPT-5.5、Mythos 5、Fable 5、Opus 4.8、Gemini 3.1 Pro、Gemini 3.5 Flash,三档自家模型同表并列做性价比叙事

Grok 4.5(7/8)——清单最短最窄,几乎全是编码榜,没有 GPQA/HLE/AIME/多模态
Terminal-Bench 2.1 83.3(Fable 5 的 84.3、GPT-5.5 的 83.4)、SWE-Bench Multilingual 78.0(Opus 4.8 的 84.4)、DeepSWE 1.0 62.0(Fable 5 的 66.1)、SWE-Bench Pro 64.7(Fable 5 的 80.3)
关键:这四项它基本都是输的,所以叙事重心整个移到 token 效率——SWE-Bench Pro 平均输出 15954 token 对 Opus 4.8 的 67020,差 4.2 倍
零自建榜,且主动把 CursorBench 从图表里剔除(训练数据误含 Cursor 代码库快照,自曝污染)

Inkling(7/15,model card 可直接抓到原表)——分组最全:Reasoning / Agentic Coding / Agentic General / Factuality / Chat / Vision / Audio / Safety
HLE 29.7(带工具 46.0)、AIME 2026 97.1、GPQA Diamond 87.2、SWE-Bench Verified 77.6、SWE-Bench Pro Public 54.3、Terminal-Bench 2.1 63.8、GDPval-AA v2 1238、MCP Atlas 74.1、τ³ Banking 23.7、Toolathlon Verified 45.5、BrowseComp 77.1、SimpleQA Verified 43.9、AA Omniscience 2.1、IFBench 79.8、Global-MMLU-Lite 88.7、MMMU Pro 73.5、CharXiv RQ 78.1(带 Python 82.0)、Audio MC 56.6、MMAU 77.2、VoiceBench 91.4、FORTRESS Adversarial 78.0、FORTRESS Benign 95.9、StrongREJECT 98.6
零自建榜。对照组不点名竞品,而是用带生成日期的 r/acc 公开榜单快照——可复现性全场最高

Sakana Fugu(6/22,技术报告 Table 1)
分组:Agentic Coding / Scientific Reasoning / General Reasoning / Conversational-Banking / Long Context
SWE-Bench Pro 73.7、Terminal-Bench 2.1 82.1、GPQA Diamond 95.5、LiveCodeBench v6、LiveCodeBench Pro、HLE、CharXiv Reasoning、SciCode、τ³ Banking、Long Context Reasoning、MRCRv2
对照组是全场最有信息量的设计:Opus 4.8、Gemini 3.1 Pro、GPT-5.5——也就是它自己调用的那三个模型,用来证明"编排大于任一被编排者",这同时是它最大的方法论争议点
另有大量炫技式定性任务:AutoResearch、1610 年古文书阅读顺序(自建 25 页数据集)、CAD 机械光圈、魔方、盲棋、序贯股票交易

【第三方评测的关键排位】

Artificial Analysis Intelligence Index:Fable 5 的 60 > GPT-5.6 Sol 的 59 > Kimi K3 的 57 > MiniMax M3 的 55 > Grok 4.5 的 54 > GLM-5.2 的 51 > DeepSeek V4 Pro 的 44 > Inkling 的 41(美国开源第一)
每任务成本:Fable 5 的 2.75 美元 > Sol 的 1.04 > K3 的 0.94 > Grok 4.5 的 0.31 > DeepSeek V4 的 0.04
LMArena Frontend Code Arena:K3 第 1(1679)、Sol 并列第 1(1636)、Fable 5 曾第 1(1631)、GLM-5.2 第 2(1595)、Inkling 开源第 10
Long-Horizon Terminal-Bench:Grok 4.5 第 1(0.505)、Fable 5 第 4(0.487)、Sol 第 5(0.451)。46 个任务里 29 个至今无人解出
Cognition FrontierCode 1.1:Fable 5 的 53.5% > Sol 的 47.5% > Opus 4.8 的 46.5% > Grok 4.5 的 42.4% > Inkling 的 14.0%
Design Arena 总榜:GLM-5.2 曾拿第 1。ARC-AGI 1 与 2:Inkling 开源权重双榜第一

【2026 年的新必刷项】

Agents' Last Exam(ALE)——本轮真正的新王,伯克利 RDI 出品。300 多名从业者上传自己历史上耗时数天到数周的真实项目,划出 13 个行业集群、1000 多个任务;最硬那层前沿 agent 全通过率只有 2.6%。OpenAI 把它放在 GA 战报第一条
Terminal-Bench 2.1 / v2——取代 HumanEval 的编码默认硬榜,十六家里被引用最多的一个。衍生的 Long-Horizon 版单任务上限 90 分钟
抗污染编码榜集体上位:DeepSWE、SWE-Atlas-QnA、FrontierSWE、Cognition FrontierCode。共同点是任务集不公开、引入 maintainer 主观判据(FrontierCode 直接问"你会不会 merge 这个 PR")
MCP Atlas / Toolathlon / Claw-Eval——工具调用类新标配,中美两边都在列
Artificial Analysis 自建指数族:Intelligence Index、Coding Agent Index、GDPval-AA、AA-Briefcase、AA-Omniscience、τ³-Banking、AutomationBench、Harvey LAB-AA,7 月又加六个行业 Capability Index。AA 已从评测聚合方变成榜单发行方
成本与 token 效率变成一等公民:所有战报现在都把分数和每任务美元数、token 数、耗时并排。分数不再是标量,是坐标

【已经退休的】

MMLU 和 HumanEval——十二份官方跑分表里,只有 DeepSeek 还列 MMLU-Pro,Inkling 列了 Global-MMLU-Lite 这种边角变体,其余全部消失
SWE-Bench Verified——半退役,讨论重心转向 Pro 及其抗污染替代品
AIME——全员 94% 以上无区分度(Inkling 97.1、GLM-5.2 99.2、Fable 5 和 Sol 都是 99.9),Inkling 报它反而成了被嘲笑的把柄
GPQA-Diamond——饱和但还得报(87.2 到 95.5 之间,彼此差距接近噪声)
中文榜彻底消失——七家中国厂商的旗舰发布表里,没有一家放 C-Eval、CMMLU 或 AGIEval。最接近中文生态的只有混元的 CL-bench 和 MiniMax 的 OmniDocBench,而且都是能力榜不是语言榜

【看表时要打折的六处口径陷阱】

小米划参数线:带星号项只在 500B 参数以下模型中比较,不跟全量前沿比
Kimi 双 harness:同一个 DeepSWE 给两个数(自家 Kimi Code harness 67.5、通用 mini-SWE-agent 67.3)
max reasoning effort 档:DeepSeek 和 Kimi 用最高推理档位刷分,与默认档不可比
Fable 5 的自家 scaffold:SWE-Bench Pro 的 80.3 不是中立 harness 跑出来的,且 AA 反复标注其成绩"with Opus 4.8 fallback"
Fugu 全自报:所有分数都是 Sakana 自己 6 月跑的,至今无中立第三方复现
AA 换版本:Intelligence Index v4.1 改版后同一模型的分数会变(M3 从 55 记作 44),跨版本不能直接横比

【对照组选谁,本身就是声明】

只跟美国前沿比、完全不提国产同行:Kimi、DeepSeek、小米
敢把国产同行放进同一张表:智谱(列了 Qwen、MiniMax、DeepSeek)、腾讯(列了 GLM-5.2、DeepSeek-V4)——通常意味着自认在国产阵营里排名靠前
根本不给逐榜竞品表:MiniMax M3,只在文字里说"接近海外头部闭源"
五家美国厂商的对照组里,没有任何一家放中国模型——全是 GPT / Claude / Gemini / Grok / Cursor 的内部循环。参照方向是单向的:中国厂商必须对标美国,美国厂商装作中国不存在

【安全评测:真正的分野不在中美】

披露最厚的三家:Anthropic(独立 System Card,覆盖 CB-2 生物阈值、ASL-3、网络请求合规率、prompt injection、自动化对齐、破坏行为)、OpenAI(Critical 阈值判定 + METR 外部评估)、Thinking Machines(十几项含"拒绝抑制变体"用于估计移除防护后的能力上限,外加 FORTRESS 双向和 StrongREJECT 三个可量化安全榜)
几乎零安全披露的:xAI 只说"有新保障措施"不给任何分数、Sakana 技术报告里完全没有安全评估、中国七家基本只有能力榜
所以准确的说法不是"中美差异",是"Anthropic / OpenAI / Thinking Machines 这一派,对其余所有人"
另一个稀缺行为是主动披露 regression:Anthropic 写进 card 的"破坏行为上升约 7 倍""prompt injection 防御弱于前两代"、xAI 承认 CursorBench 训练污染并从图表剔除、OpenAI 承认模型会作弊伪造结果、Moonshot 承认整体落后 Fable 5——这四家之外,自曝短处基本不存在

【刷榜争议三档】

有商业后果的:MiniMax M3。被指"benchmaxxed、实际采用率很差",与股价自峰值跌 80%、API 一周后腰斩降价、摩根大通同日下调评级串在一起。技术证据是 AA 发现它在 AA-Omniscience 上只答 30.9% 的题(同侪最低),靠弃答换低幻觉率
争议最激烈但双向证据都强的:Kimi K3。被指"对 frontend 过拟合"(Frontend Code Arena 是偏好投票不是静态榜),但私有 stealth 网络安全评测(随机抽 CVE、pass@3 复现 23/26)支持其真实能力,还有人认为它在公告里低报了 DeepSWE
无分数可查却被预设有罪的:Qwen3.8。指控针对的是"仅次于 Fable 5"这句口头声称,因为根本没有表可查
非中国的三条:Fable 5 的自家 scaffold 与 Opus fallback(ProgramBench 发现 200 个任务里 199 个被立刻转给 Opus);Grok 4.5 的 AA-Omniscience 准确率从 35% 涨到 52%,幻觉率同时从 25% 飙到 54%;Fugu 编排的模型池里根本没有 Fable 5 和 Mythos,"匹敌 Fable 5"实为"一队公开模型协作打平前沿单模型"
零指控的四家:DeepSeek、MiMo、Hy3、Inkling

【一句话结论】

单一分数的公信力这半年塌了。三个信号:OpenAI 在 7/8 公开宣布 SWE-Bench Pro 有 30% 的任务是坏的并撤回背书;LMArena 7/15 引入 factuality 加权、标注 200 万条模型声明重新计分,Fable 5 从第 1 掉到第 2;METR 公布 Sol 的作弊率高于它评估过的任何公开模型,导致同一模型的时间跨度出现 11.3 小时和 270 小时两个答案——取决于把作弊算成功还是失败。

评测方正在从"测能力"转向"测能力 + 测诚实度 + 测单位成本"。发布方的反应是把分数从推文里撤走:xAI、Thinking Machines、Sakana 的主帖干脆不放分数,腾讯新负责人上任第一件事是叫停 benchmaxxing。表还在,只是不再当成头条喊——当所有人都能刷到 99.9%,把分数放在最显眼的位置本身开始变得可疑。十六场里唯一在主帖逐字列分数的 MiniMax M3,恰恰是唯一为刷榜指控付出股价代价的那一家。

数据说明:所有阅读量为 2026 年 7 月 20 日抓取时点数值(第一至九节的中国场次首抓于 7 月 18 日);K3、Qwen3.8、Inkling 发布不足一周,数据仍在增长;每场发布的引用帖均为全量抓取排序(200-300 条/场),独立讨论帖为发布周关键词检索 Top 结果;转发者列表受 API 限制为抽样。Grok 4.5 官方帖的阅读量与互动数严重失衡,该账号多条产品帖阅读破亿,本文按原始数据呈现并在第二条规律中说明。第十八节的跑分数据来源:官方发布帖与发布周战报原文、各模型技术报告、以及 Artificial Analysis / LMArena / Design Arena / METR / Cognition FrontierCode / Vals AI 等第三方评测机构的公开帖;第十八节的跑分清单来自各家官方发布材料:kimi.com/blog/kimi-k3、DeepSeek 技术报告 arXiv 2606.19348、HuggingFace 官方博文 zai-org/glm-52-blog、minimax.io/blog/minimax-m3、混元与 MiMo 官方发布页及 HuggingFace model card、thinkingmachines.ai/model-card/inkling、Sakana 技术报告 arXiv 2606.21228,以及 Anthropic 与 OpenAI 官方发布页与 system card(这两家及 x.ai 的页面对抓取返回 403 或以图片呈现,相关分数来自 Vellum、W&B、kingy.ai、explainX 等转录源,已在正文标注)。同一模型在不同 Index 版本(如 AA v4.1 改版)下的分数不可直接横比;各家 harness、reasoning effort 档位、参数区间口径不同,详见正文的口径陷阱一节。
← 上一篇
运营日志: 2026年7月18日
下一篇 →
wigolo:agent上网这条收费公路,被它免费了
← 返回所有文章

评论

加载中...
>_