Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0(非预发布)。本版新增四个模型支持:NVIDIA 的 Nemotron 3 Diarization 说话人日志模型与 NemotronH Omni 多模态推理模型、NAVER 的 HyperCLOVAX Vision V2 视觉语言模型,以及 GTE 文本表示模型;同时包含数项破坏性变更。
Transformers v5.18.0 发布:新增说话人日志与多模态推理模型,附数项破坏性变更
这次发布的是什么
Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0。GitHub Release 记录的发布时间为 2026-09-30T16:46:27Z,且未标记为预发布,是常规的稳定版本通道。
这一版的新增模型有四个。Nemotron 3 Diarization 是 NVIDIA 的开源权重流式说话人日志模型,用来判断一段音频里「谁在什么时候说话」。NemotronH Omni 是 NVIDIA 的多模态推理模型,把 NemotronH 的混合 Mamba-Transformer 语言模型与 RADIO 视觉编码器、可选的 Parakeet 声音编码器组合在一起。HyperCLOVAX Vision V2 是 NAVER 的多模态视觉语言模型。GTE 是一个 BERT 式的双向文本表示编码器。
影响谁:用 Transformers 加载开源模型的开发者。新增模型意味着这几类任务现在可以直接用库内的标准接口跑,不必等社区自己补实现。
可用性与限制
- 版本通道:v5.18.0 未标记为预发布,属稳定版本通道;前一个小版本为 2026 年 9 月 9 日的 v5.17.0。
- 破坏性变更:官方 Release 说明在 Breaking changes 一节列出了数项,包括 ROCm 上 gpt-oss 把 FA3 路由改为 aiter 的 flash attention 并生成 ROCm fixtures、加快 DETR 图像处理、重映射 indexers 的 layer_type、修正 vLLM 后端对视频输入的 token 计数、对 DETR 系列模型的现代化改造,以及 Kernels 版本升级。升级前建议先看这一节。
- 依赖环境:具体 Python、PyTorch 与加速库的版本要求以官方 Release 说明与安装文档为准。
- 模型权重:本版提供的是模型支持,权重需自行从 Hugging Face Hub 获取,各模型有自己的许可条款。
- 硬件与精度:说话人日志与多模态模型对显存的要求各不相同,官方 Release 未统一给出数值,请以各模型的模型卡为准。
主要功能
- 加载 Nemotron 3 Diarization 做流式与离线的说话人日志
- 用 NemotronH Omni 做文本、图像、视频与声音的联合推理
- 用 HyperCLOVAX Vision V2 处理文本、图像与视频输入
- 用 GTE 生成文本表示与重排序用的向量
- 跟随官方对 DETR 系列与视频输入的修复
- 沿用统一接口接入新模型,不必自建实现
技术原理
据官方 Release 说明,Nemotron 3 Diarization 使用了 Streaming Sortformer 引入的 Arrival-Order Speaker Cache(AOSC)与 FIFO 队列,支持最多八位说话人,并按每位说话人在音频中首次出现的顺序排列输出。单个 checkpoint 支持可配置的延迟档位,从 80 毫秒输入缓冲到 30.4 秒的离线式缓冲;输出帧分辨率以 10 毫秒为倍数可配;配合分块推理,音频总时长不受限制。
NemotronH Omni 的做法是把不同模态投影到同一个自回归模型的输入空间:图像与视频的 patch 经过 RADIO tower 与 pixel-shuffle MLP,投到语言模型嵌入空间中对应图像与视频标记的位置;音频片段以同样方式投到音频标记的位置。结果是单一自回归模型可以对文本、图像、视频和声音做联合推理。
HyperCLOVAX Vision V2 由 HyperClovaX 语言主干加 Qwen2.5-VL 视觉编码器组成,官方说明提到它内置了思考标记,可以做思维链推理。GTE 则是 BERT 式双向编码器,用旋转位置编码 RoPE 取代了原本的位置嵌入,使用 gated MLP,并在每个残差连接后接层归一化;官方说明提到阿里巴巴的 gte 系列与 Snowflake 的 arctic-embed 检查点也基于同一架构。
实际体验
想在自己的环境里确认这些模型是否可用,可以按官方 Release 说明给出的链接逐项验证,步骤是可复现的:
第一步,先在隔离环境里升级到 v5.18.0,跑一遍你现有的加载与推理脚本。因为本版有破坏性变更,这一步是必要的,不要在主力环境里直接升。
第二步,按官方给出的模型文档链接,逐个确认目标模型的类名与调用方式。官方 Release 对每个新增模型都附了文档页地址,按文档写最小加载脚本即可。
第三步,针对说话人日志模型,用一段多人对话音频分别跑流式与离线两种配置,对比延迟与输出的说话人顺序是否符合预期;这一步能验证 AOSC 的排序行为在你的音频上表现如何。
第四步,针对多模态模型,准备同一段内容的不同模态版本(比如一段带画面的视频与其音频轨),观察联合推理与单模态推理的结果差异。
权重下载与显存占用以各模型卡为准。
项目地址与获取方式
库本身在 GitHub 的 huggingface/transformers 仓库,Release 说明页见 v5.18.0 标签;安装与版本说明以官方安装文档为准,模型权重从 Hugging Face Hub 获取。请通过官方仓库与官方 Hub 获取,避免安装被篡改的版本。
适合谁用
- 需要做会议录音、通话或多说话人音频切分的开发者,可看说话人日志模型
- 做多模态理解、需要文本图像音视频联合推理的研究与工程团队
- 用 GTE 系列做文本表示与重排序、希望走标准接口的检索系统
- 维护内部模型加载层、需要跟进破坏性变更的平台工程师
不必用的情况:只调用云端 API、不本地加载开源权重的开发者,本次新增与你的工作流无关;生产环境对稳定性要求高的话,建议等破坏性变更在社区跑一段时间再升。
常见问题
v5.18.0 是稳定版吗?
GitHub Release 上该版本未标记为预发布,属稳定版本通道。但同一份说明里有 Breaking changes 一节,稳定版不等于可以直接升级,升级前仍建议先看这一节并在隔离环境验证。
升级会不会让现有脚本报错?
有可能。官方列出的破坏性变更涉及 DETR 图像处理、indexers 的 layer_type 重映射、vLLM 后端视频 token 计数以及 ROCm 上 gpt-oss 的注意力实现路由。如果你的代码依赖其中任何一项,需要先改再升。
新增的模型权重在哪里下载?
本版本提供的是模型支持,权重需从 Hugging Face Hub 获取。各模型有自己的许可与使用条款,商用前请以对应模型卡为准。
说话人日志最多能处理几个人?
官方 Release 说明写明支持最多八位说话人,并按每位说话人首次出现的顺序输出。输入缓冲可配置,范围从 80 毫秒到 30.4 秒,配合分块推理时音频总时长不受限制。
没有 GPU 能跑吗?
官方 Release 未统一给出硬件与显存要求,各模型的模型卡会写。多模态与流式模型通常对资源要求较高,建议先查目标模型的模型卡再决定部署方式。
相关工具与内容
- /category/code — AI 编程与开发工具分类,本地加载开源模型属于这一类
- /category/audio — AI 音频分类,说话人日志与语音处理的相邻工具
- /category/chat — AI 对话分类,多模态推理模型的常见落地方向
- /tool/deepseek — DeepSeek 官方产品入口,可对照看模型侧能力
- /tool/qwen — 通义千问,多模态方向的对照工具
- /article/gpt-6-family-guide-2026-09 — 若你在比较云端模型挡位,可参考这篇
相关内容
Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选
Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。
DeepSeek 把内核栈开源到昇腾:DeepGEMM-Ascend 首发,FlashMLA 新增 Ascend 950 支持
2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开 deepseek-ai/DeepGEMM-Ascend 仓库,README 的 News 段标注 2026.09.30 首发、支持 Ascend 950 设备;同日 FlashMLA 合并了标题为 Ascend 950 开源版本的 PR,新增昇腾 NPU 的稀疏注意力 prefill 与解码内核,支持范围收窄到 DeepSeek-V4.1。
Manus Flex 上线:自带推理服务商的 API 密钥,模型你自己选,智能体它来跑
Manus 于 2026 年 9 月 29 日发布官方博客,推出 Manus Flex 模块:用户可在 Manus 工作区接入受支持推理服务商的自有 API 密钥,模型推理由该服务商直接计费,Manus 继续负责规划、工具与执行环境。首批推理合作伙伴为 OpenRouter、Fireworks 与 Modal。