资讯›热点›正文

Aleph Alpha 开源 Kolibri-1:78B 参数 MoE 仅激活 3.5B、百万上下文

秋水长天 2026-10-4 09:12 阅读 0 热点
德国 AI 公司 Aleph Alpha 于 10 月 3 日开源 78B MoE 模型 Kolibri-1,每 token 仅激活 3.5B 参数,支持百万级上下文,以 Apache 2.0 协议发布权重,主打欧洲主权 AI 场景。

10 月 3 日,德国 AI 公司 Aleph Alpha 在柏林墙倒塌纪念日当天开源了旗舰大模型 Kolibri-1,以 Apache 2.0 协议将完整权重发布到 Hugging Face,任何人可下载、运行与修改。这家总部位于海德堡的实验室把“主权 AI”写进了产品定位,试图为欧洲政府与受监管行业提供不依赖美国或中国基础模型的可用方案。

Aleph Alpha 开源 Kolibri-1:78B 参数 MoE 仅激活 3.5B、百万上下文

Kolibri-1 是一个德语—英语混合专家(MoE)模型:总参数约 781 亿,但每个 token 仅激活约 34.6 亿参数(占比约 4.4%)。架构上包含 50 层、每层 384 个路由专家加 1 个共享专家,每 token 仅路由到 6 个专家;上下文原生支持 26.2 万 token,官方验证可扩展到 105 万 token。模型以 FP8 权重发布,单张 H200 或 B200 即可承载,训练动用 768 块英伟达 B200 GPU、约 24 万亿 token、耗时 21 天。

在 Aleph Alpha 自报的评测中,Kolibri-1 的 AIME 2025 数学测试达 96.9%、GPQA Diamond 为 84.3%、LiveCodeBench v6 为 85.9%,在自家总评上领先 Qwen3.6-35B、英伟达 Nemotron 3 Super 与 Mistral Small 4。更值得关注的是“拒答”能力:在 AA-Omniscience 测试里它会主动说“不知道”的比例从上一代的 14.8% 提升到 44%,对会执行动作的智能体而言,一个不愿瞎编的模型比高几分更有价值。

Aleph Alpha 开源 Kolibri-1:78B 参数 MoE 仅激活 3.5B、百万上下文

从影响看,Kolibri-1 把顶级能力进一步从闭源 API 推向可自托管的开源权重栈:Apache 2.0 允许商业使用,百万级上下文让企业无需切块即可对整批合同、多年监管文件做检索增强生成。这既抬高了欧洲主权 AI 的 ceilings,也给美国实验室带来压力。背景上,Aleph Alpha 此前已推出 306 亿参数的 Kolibri Origin 作为基础设施试跑,本次 781 亿版本在预训练德语占比约 21.3% 上做文章,并以专属德语词表提升德语分词效率。

读者评论 (0)

想参与讨论?请 登录 后发表评论。

还没有评论,欢迎抢沙发!