Kolibri:Aleph Alpha 发布 3B 激活开源模型,会说「我不知道」
德国的 AI 旗舰终于交出了它早该交的作业。Aleph Alpha 周六发布 Kolibri,一个英德双语 MoE 模型,总参数 780 亿,每个 token 只激活 30 亿。Apache 2.0 协议,权重放在 Hugging Face。一天之内上了两次 Hacker News 头部,发布帖 441 分,外部拆解文 409 分,技术报告还单独开了一帖。
成绩远超它的激活规模。AIME 2025 拿到 96.9%,AIME 2026 拿到 96.0%,HumanEval+ 92.7%。官方说法是在数学、代码、长上下文上能打平激活参数大它 4 倍的模型。上下文拉到 100 万 token。架构是 384 个专家激活 6 个,50 层里 40 层滑动窗口注意力、10 层全注意力,百万上下文就是靠这个压低成本的。训练用了 768 张 B200,21 天,大约 24 万亿 token。
对 agent 最有用的反而是最不起眼的那个数字。在 AA-Omniscience 上它有 44% 的时候选择弃答,上一代只有 14.8%。它被专门训练成:上下文里没有答案,就说「我不知道」。一个要根据自己的判断去执行动作的 agent,模型不瞎编比数学榜多两分值钱得多。工具调用和四档推理强度(从不思考到高)都是开箱即用。
「主权模型」是卖给欧洲政府和强监管行业的说辞,21.3% 的德语预训练数据就是证据。但 3B 激活意味着普通硬件就能跑,这才决定德国以外的开发者会不会拿它来做本地 agent。
链接:huggingface.co/Aleph-Alpha/Kolibri-1 以及 aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model
← 返回所有文章
成绩远超它的激活规模。AIME 2025 拿到 96.9%,AIME 2026 拿到 96.0%,HumanEval+ 92.7%。官方说法是在数学、代码、长上下文上能打平激活参数大它 4 倍的模型。上下文拉到 100 万 token。架构是 384 个专家激活 6 个,50 层里 40 层滑动窗口注意力、10 层全注意力,百万上下文就是靠这个压低成本的。训练用了 768 张 B200,21 天,大约 24 万亿 token。
对 agent 最有用的反而是最不起眼的那个数字。在 AA-Omniscience 上它有 44% 的时候选择弃答,上一代只有 14.8%。它被专门训练成:上下文里没有答案,就说「我不知道」。一个要根据自己的判断去执行动作的 agent,模型不瞎编比数学榜多两分值钱得多。工具调用和四档推理强度(从不思考到高)都是开箱即用。
「主权模型」是卖给欧洲政府和强监管行业的说辞,21.3% 的德语预训练数据就是证据。但 3B 激活意味着普通硬件就能跑,这才决定德国以外的开发者会不会拿它来做本地 agent。
链接:huggingface.co/Aleph-Alpha/Kolibri-1 以及 aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model
评论