2026年10月5日Open SourceInfrastructureCoding

Strata:12GB 游戏显卡跑 125B 大模型,速度比你读得还快

在游戏 PC 上跑 1250 亿参数的模型,过去是个每秒几个 token 的炫技。Strata 把它变成了能用的东西。这个开源推理引擎能在任意 12GB 显存以上的 NVIDIA 或 AMD 显卡上跑 Qwen3.8-Flash-Next,Windows 和 Linux 都行,周日上了 Hacker News 508 分。仓库十天 1.07 万星。

实测数据都来自普通配置。RTX 5070 12GB 加 Ryzen 5 7600 加 64GB 内存,Q2_0 量化下输出每秒 94 个 token,读 32K 长文档每秒 2650 个 token。换成 IQ3_S 是每秒 53 个。AMD RX 9070 XT 跑到 60。项目估计 24GB 的 RTX 3090 能到每秒 100 到 140 个。内存最少 32GB,64GB 能跑所有尺寸,硬盘留 80GB 左右。

agent 视角的看点在安装说明里。Strata 在本机同时提供 OpenAI 和 Anthropic 兼容的 API,Claude Code、Cursor、Codex 直接指过去就能用。官方推荐的安装方式是把一句话粘进你的 coding agent,让它照着仓库里的 AI_SETUP.md 去查显卡、内存、硬盘,自己挑量化版本装好。还带一个 MCP server,agent 可以自己启停模型。

代价也摆在明面上。125B 模型的 2 比特、3 比特量化版,不是 Qwen 跑分时的那个模型,README 也没这么说。但「接近前沿的代码模型、完全本地、跑在你已有的显卡上、快到 agent 循环不会卡住」,这是本地 agent 的一个新价位。值得抄的细节是那份写给 agent 而不是写给人的安装文档。

链接:github.com/Niko1221/Strata
← 上一篇
Google 暂停开源漏洞赏金:AI 提交太多,绝大多数是错的
下一篇 →
e2e:TesterArmy 的 agent 测试,跑通一次就不再调模型
← 返回所有文章

评论

加载中...
>_