德国 AI 公司 Aleph Alpha 于 2026 年 10 月 3 日在官方博客发布 Kolibri:一个英语—德语混合专家(MoE)模型,总参数 780 亿、每 token 激活约 30 亿,支持最长 100 万 token 上下文,完整权重在 Hugging Face 以 Apache 2.0 发布。官方把它定位为面向公共管理、工业与航空航天等受监管领域的主权模型,并强调拒答训练与自有基础设施部署。
Aleph Alpha Kolibri 发布:78B 开源权重模型,可私有化部署
这次发布的是什么
德国 AI 公司 Aleph Alpha 于 2026 年 10 月 3 日(德国统一日)在官方博客发布 Kolibri,一个新的开源权重语言模型。按官方说法,Kolibri 是英语—德语混合专家(MoE)Transformer,总参数 780 亿、每 token 激活约 30 亿,支持最长 100 万 token 的上下文,完整权重在 Hugging Face 上以 Apache 2.0 许可发布。
它是同一条训练流水线上的第二个模型。此前的 Kolibri Origin 为 300 亿总参数、30 亿激活、6.5 万 token 上下文,官方称先用它验证了从数据摄入、消融实验、预训练、后训练到最终评测的整条链路。
产品定位上,官方把 Kolibri 描述为面向受监管领域「主权、关键任务」工作的专用模型,点名的场景包括公共管理、工业与航空航天。影响谁:需要把模型跑在自有机房、内部数据不出网的欧洲政企客户;业务以德语为主的团队;以及在检索问答里需要模型明确拒答、便于事后审计的工程团队。
可用性与限制
- 许可范围:官方写明权重与配置文件以 Apache 2.0 发布,并说明训练代码与方法不随权重开放。
- 获取渠道:权重托管在 Hugging Face 的 Aleph-Alpha/Kolibri-1;国内访问速度与是否需要镜像,以官方说明为准。
- 部署形态:官方强调可在本地或自有基础设施部署;是否提供托管 API、企业版如何采购,以官网为准。
- 运行依赖:官方说明 Kolibri 需要 aleph-alpha-inference 这个包来提供 Kolibri 的 vLLM 插件,可以用官方容器镜像,也可以自行安装该包。
- 硬件门槛:MoE 的激活参数小,但全部参数都需要常驻显存或内存,实际所需资源以官方模型卡为准。
- 语言范围:官方定位为英语 + 德语双语模型,发布材料没有把其他语言列为主要目标。
- 评测口径:官方公布的基准分数由厂商自己的评测流程跑出,发布材料中没有给出第三方复核结果。
- 合规表述:官方称按欧盟 AI 法案、通用 AI 行为准则与 GDPR 设计,具体合规结论仍需客户自己的法务判断。
主要功能
- 处理英语与德语双语任务
- 支持最长 100 万 token 上下文
- 提供推理能力与工具调用
- 上下文中没有答案时明确拒答
- 支持本地或私有环境部署
- 覆盖数学、代码与长文本任务
技术原理
Kolibri 用的是混合专家架构:总参数 780 亿,但每个 token 只激活约 30 亿,用稀疏激活换取能力与推理成本之间的取舍。官方的表述是,在其对比的范围内,Kolibri 处在质量对推理成本的帕累托前沿上——也就是没有对比模型能在同样的推理成本下给出更高质量,或在同样质量下成本更低。这是厂商自测的结论。
德语能力方面,官方称自己训练了德英双语分词器(词表规模 26 万多),德语原文数据在预训练语料中占有相当比例,而对翻译文本用得很少,理由是翻译文本会带来源语言的文化印记。分词器这一层的设计目标是让德语复合词不被切碎。
拒答机制是官方重点讲的一块。官方称在训练中加入了拒答数据与自家的 Merlin-Arthur 协议,让模型在上下文中找不到答案时明确表示不知道,而不是编一段出来;官方称会持续跟踪拒答准确率。官方也公开了一个聚焦幻觉的评测集(AA-Omniscience,公开子集托管在 Hugging Face)。
训练流程上,官方称后训练分两步:先做监督微调教会模型基础推理与对话交互,再做大规模强化学习,让它在一批长周期任务上学会推理。更完整的细节官方指向配套的技术报告。
实际体验
下面是一套读者可以自己复现的验证路径,不是本站的实测结论:
- 先核对许可与规格:打开 Hugging Face 上的 Aleph-Alpha/Kolibri-1,确认许可证字段是 Apache 2.0,并核对模型卡里的上下文长度与激活参数说明,再和你准备投入的硬件对照。
- 起一次本地服务:按官方说明二选一——使用官方容器镜像 ghcr.io/aleph-alpha/aleph-alpha-inference,或安装 aleph-alpha-inference 包(官方给的安装写法是 pip install 「aleph-alpha-inference>=1.0」,它会自动装上配套版本的 vLLM)。启动命令与参数以官方仓库当前说明为准。
- 验证德语处理:准备一段含长复合词的德语业务材料,比较同一份材料用德语提问和用英语提问时,回答的要点是否一致、专业名词有没有被切碎。
- 验证拒答:故意问一个上下文里根本没有答案的问题,观察模型是否明确说不知道,而不是补一段看起来合理的内容。这一步建议做成固定用例,方便以后换版本时重跑。
- 验证长上下文:逐步加长输入,记录从哪个长度开始出现前后不一致。官方标注的原生窗口是 262,144 token,超过它需要显式放开到 1,048,576,具体参数以官方说明为准。
- 估算成本:记录显存占用与解码速度,与你正在用的同规模模型横向对比,再决定值不值得替换。
项目地址与获取方式
- 官方发布博客:https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/
- 模型权重:https://huggingface.co/Aleph-Alpha/Kolibri-1
- 推理代码:https://github.com/Aleph-Alpha/aleph-alpha-inference
- 官方容器镜像:ghcr.io/aleph-alpha/aleph-alpha-inference
- 官方另在 GitHub 上提供了评测框架仓库 Aleph-Alpha-Research/eval-framework
请通过官方渠道获取,避免安装被篡改的版本。企业采购与托管形态以官网为准。
适合谁用
- 需要把模型跑在自有机房或私有云、数据不出内网的欧洲政企团队
- 以德语业务为主的客服、文档处理与知识问答场景
- 需要模型明确拒答、便于事后审计的检索问答系统
- 研究稀疏激活 MoE 与双语分词器的工程团队
- 不必用:只需要中英文通用对话、且不关心私有化部署的个人用户,这类需求用成熟的通用对话工具省事得多,可以先看站内 /category/chat 下的工具
常见问题
Kolibri 是完全开源的模型吗?
官方写明权重与配置文件以 Apache 2.0 许可发布,可以下载、微调和部署,不需要单独的商业许可。但官方同时说明,训练代码与训练方法不在开放范围内。如果你需要的是完整可复现的训练栈,这一点要先确认清楚。
780 亿参数的模型需要什么硬件才能跑?
官方没有在发布博客里给出具体的硬件清单。要注意 MoE 的特点是激活参数小、但全部参数都要常驻显存或内存,所以显存与内存容量是主要门槛,而不只是算力。实际所需资源以官方模型卡为准。
它支持中文吗?
官方定位是英语—德语双语模型,发布材料没有把中文列为主要目标语言。中文场景下是否够用,建议按上面「实际体验」里的步骤自己跑一遍,不要直接按英文或德语的表现推断。
官方公布的基准分数能直接拿来和其他模型对比吗?
这些分数是厂商用自己的评测流程跑出来的,官方也说明了对比对象与设置,但发布材料中没有第三方复核结果。做选型时建议把它当作参考区间,并用自己的业务用例复跑一遍。
和上一代 Kolibri Origin 相比改了什么?
官方的说法是两者走同一条训练流水线,Kolibri Origin 用来验证这条流水线。参数规模从 300 亿总参数提升到 780 亿,上下文从 6.5 万 token 提升到最长 100 万 token,官方称在数学、代码、事实依据与长上下文等任务上有明显提升。具体分数以官方技术报告为准。
相关工具与内容
- 想对比同类对话与模型工具:/category/chat
- 可自部署的开源对话模型:/tool/qwen、/tool/deepseek
- 相关的开源模型快讯:/article/olmo-core-3-release-2026-10
- 开源训练与 RL 代码:/article/openpangu-2-0-training-rl-open-source-2026-09
- 推理算子的开源进展:/article/deepseek-ascend-kernels-open-source-2026-09
相关内容
Ai2 开源 AstaBrief:8B 模型一次成稿带引用的科研报告
Ai2(Allen Institute for AI)于 2026 年 10 月 2 日在官方博客宣布开源 AstaBrief 8B:一个把研究问题与检索到的文献片段直接转成带引用报告的小模型,基于 Qwen3-8B 做后训练,路线是监督微调加 DPO 而非强化学习。它同时以 Fast 模式上线 Ai2 的科研平台 Asta,与原有的 Thinking 模式并列,官方称成稿时间大幅缩短。
NVIDIA DGX Spark 64GB 发布:本地跑千亿参数,两台可组集群
NVIDIA 于 2026 年 10 月 2 日在官方博客宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP、MSI 开售,官方称可在本机运行最高约 1000 亿参数模型。同篇还介绍了 NVIDIA Sync Cluster Assistant:两台机器用 QSFP 线缆直连后内存池化到 128GB,官方称可支持模型规模提升到约 2000 亿参数。
OLMo-core 3 发布:主攻混合专家训练与导出校验
Ai2 于 2026 年 10 月 1 日为 OLMo-core 打出 v3.0.0 版本标签,重心偏向混合专家(MoE)训练与导出:新增元数据来源的文档边界开关、可选 SwiGLU 反向优化、每头 Q/K 归一化增益与 EMO 路由,并给混合 MoE 的 Hugging Face 导出加上精确张量往返校验与一批拒绝规则。同时移除了 model_ladder API 及十一个相关训练脚本。
继续阅读:Ai2 开源 AstaBrief:8B 模型一次成稿带引用的科研报告 · NVIDIA DGX Spark 64GB 发布:本地跑千亿参数,两台可组集群