Aleph Alpha开源Kolibri,781亿参数只激活34.6亿
德国AI公司Aleph Alpha开源了新模型Kolibri,权重放在Hugging Face上,许可为Apache2.0,可商用、可再分发。选在德国统一日发布,指向很清楚:这是一次面向欧洲市场的表态。模型总参数78.1B,但每个token只激活约3.46B,走的是混合专家架构里偏轻的那条路。
架构上的取舍集中在效率。Kolibri共50层,全部是混合专家层,配384个专家,每个token激活其中6个,另有1个共享专家。注意力采用滑动窗口加全注意力的组合:40层只看512个token的窗口,每第5层做一次全上下文注意力。这样处理的好处是解码时显存与算力不随上下文线性增长,团队称这对推理服务和强化学习训练两端都有收益。
上下文长度支持到100万token,训练时最长用到256k。训练砸的算力不小,用了768张B200,合计约24T token,分三段:先在16k长度上跑20T,再在64k长度上跑3.44T,最后用200B token把长度适配到256k。数据配比里德语超过21%,英语约62%,代码约14%。优化器用的是Muon,路由算法是自研的精确分位平衡。
一个值得留意的决定是为什么停在78B。团队的说明是服务成本:做到123B参数量时性能还在涨,但在两张H100上只能同时处理3个256k长上下文请求;换回78B,同样的硬件能跑18个并发请求,解码速度快28%。这个取舍把参数规模从能多大就多大,拉回到单卡能服务多少路。
基准成绩上,AIME2025得96.9,GPQA拿到84.3,LiveCodeBench v6为85.9,τ²-bench telecom一项是94.7,对照对象是激活参数最多四倍于它的模型。抗幻觉是这次重点宣传的能力,训练里引入了三角博弈式的负样本生成办法,让模型学会在上下文不支持时拒答,官方给出的拒答率是44%,上一代只有15%。
德语语料是Kolibri真正想讲的故事。它的分词器在德语上平均每个token承载4.90字节,高于GPT-5的4.35和Qwen3-Next的3.59,复合词切分更贴近词法结构。团队把德语数据的来源说得很细:从Common Crawl策展1.3T,改写约1T,翻译只占很小一部分。对想在欧洲本地部署、又不愿把内部数据送出机房的机构来说,这份清单比榜单名次更有说服力。