Transformers v5.18.0 发布:新增说话人日志与多模态推理模型,附数项破坏性变更

Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0(非预发布)。本版新增四个模型支持:NVIDIA 的 Nemotron 3 Diarization 说话人日志模型与 NemotronH Omni 多模态推理模型、NAVER 的 HyperCLOVAX Vision V2 视觉语言模型,以及 GTE 文本表示模型;同时包含数项破坏性变更。

这次发布的是什么

Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0。GitHub Release 记录的发布时间为 2026-09-30T16:46:27Z,且未标记为预发布,是常规的稳定版本通道。

这一版的新增模型有四个。Nemotron 3 Diarization 是 NVIDIA 的开源权重流式说话人日志模型,用来判断一段音频里「谁在什么时候说话」。NemotronH Omni 是 NVIDIA 的多模态推理模型,把 NemotronH 的混合 Mamba-Transformer 语言模型与 RADIO 视觉编码器、可选的 Parakeet 声音编码器组合在一起。HyperCLOVAX Vision V2 是 NAVER 的多模态视觉语言模型。GTE 是一个 BERT 式的双向文本表示编码器。

影响谁:用 Transformers 加载开源模型的开发者。新增模型意味着这几类任务现在可以直接用库内的标准接口跑,不必等社区自己补实现。

可用性与限制

  • 版本通道:v5.18.0 未标记为预发布,属稳定版本通道;前一个小版本为 2026 年 9 月 9 日的 v5.17.0。
  • 破坏性变更:官方 Release 说明在 Breaking changes 一节列出了数项,包括 ROCm 上 gpt-oss 把 FA3 路由改为 aiter 的 flash attention 并生成 ROCm fixtures、加快 DETR 图像处理、重映射 indexers 的 layer_type、修正 vLLM 后端对视频输入的 token 计数、对 DETR 系列模型的现代化改造,以及 Kernels 版本升级。升级前建议先看这一节。
  • 依赖环境:具体 Python、PyTorch 与加速库的版本要求以官方 Release 说明与安装文档为准。
  • 模型权重:本版提供的是模型支持,权重需自行从 Hugging Face Hub 获取,各模型有自己的许可条款。
  • 硬件与精度:说话人日志与多模态模型对显存的要求各不相同,官方 Release 未统一给出数值,请以各模型的模型卡为准。

主要功能

  • 加载 Nemotron 3 Diarization 做流式与离线的说话人日志
  • 用 NemotronH Omni 做文本、图像、视频与声音的联合推理
  • 用 HyperCLOVAX Vision V2 处理文本、图像与视频输入
  • 用 GTE 生成文本表示与重排序用的向量
  • 跟随官方对 DETR 系列与视频输入的修复
  • 沿用统一接口接入新模型,不必自建实现

技术原理

据官方 Release 说明,Nemotron 3 Diarization 使用了 Streaming Sortformer 引入的 Arrival-Order Speaker Cache(AOSC)与 FIFO 队列,支持最多八位说话人,并按每位说话人在音频中首次出现的顺序排列输出。单个 checkpoint 支持可配置的延迟档位,从 80 毫秒输入缓冲到 30.4 秒的离线式缓冲;输出帧分辨率以 10 毫秒为倍数可配;配合分块推理,音频总时长不受限制。

NemotronH Omni 的做法是把不同模态投影到同一个自回归模型的输入空间:图像与视频的 patch 经过 RADIO tower 与 pixel-shuffle MLP,投到语言模型嵌入空间中对应图像与视频标记的位置;音频片段以同样方式投到音频标记的位置。结果是单一自回归模型可以对文本、图像、视频和声音做联合推理。

HyperCLOVAX Vision V2 由 HyperClovaX 语言主干加 Qwen2.5-VL 视觉编码器组成,官方说明提到它内置了思考标记,可以做思维链推理。GTE 则是 BERT 式双向编码器,用旋转位置编码 RoPE 取代了原本的位置嵌入,使用 gated MLP,并在每个残差连接后接层归一化;官方说明提到阿里巴巴的 gte 系列与 Snowflake 的 arctic-embed 检查点也基于同一架构。

实际体验

想在自己的环境里确认这些模型是否可用,可以按官方 Release 说明给出的链接逐项验证,步骤是可复现的:

第一步,先在隔离环境里升级到 v5.18.0,跑一遍你现有的加载与推理脚本。因为本版有破坏性变更,这一步是必要的,不要在主力环境里直接升。

第二步,按官方给出的模型文档链接,逐个确认目标模型的类名与调用方式。官方 Release 对每个新增模型都附了文档页地址,按文档写最小加载脚本即可。

第三步,针对说话人日志模型,用一段多人对话音频分别跑流式与离线两种配置,对比延迟与输出的说话人顺序是否符合预期;这一步能验证 AOSC 的排序行为在你的音频上表现如何。

第四步,针对多模态模型,准备同一段内容的不同模态版本(比如一段带画面的视频与其音频轨),观察联合推理与单模态推理的结果差异。

权重下载与显存占用以各模型卡为准。

项目地址与获取方式

库本身在 GitHub 的 huggingface/transformers 仓库,Release 说明页见 v5.18.0 标签;安装与版本说明以官方安装文档为准,模型权重从 Hugging Face Hub 获取。请通过官方仓库与官方 Hub 获取,避免安装被篡改的版本。

适合谁用

  • 需要做会议录音、通话或多说话人音频切分的开发者,可看说话人日志模型
  • 做多模态理解、需要文本图像音视频联合推理的研究与工程团队
  • 用 GTE 系列做文本表示与重排序、希望走标准接口的检索系统
  • 维护内部模型加载层、需要跟进破坏性变更的平台工程师

不必用的情况:只调用云端 API、不本地加载开源权重的开发者,本次新增与你的工作流无关;生产环境对稳定性要求高的话,建议等破坏性变更在社区跑一段时间再升。

常见问题

v5.18.0 是稳定版吗?

GitHub Release 上该版本未标记为预发布,属稳定版本通道。但同一份说明里有 Breaking changes 一节,稳定版不等于可以直接升级,升级前仍建议先看这一节并在隔离环境验证。

升级会不会让现有脚本报错?

有可能。官方列出的破坏性变更涉及 DETR 图像处理、indexers 的 layer_type 重映射、vLLM 后端视频 token 计数以及 ROCm 上 gpt-oss 的注意力实现路由。如果你的代码依赖其中任何一项,需要先改再升。

新增的模型权重在哪里下载?

本版本提供的是模型支持,权重需从 Hugging Face Hub 获取。各模型有自己的许可与使用条款,商用前请以对应模型卡为准。

说话人日志最多能处理几个人?

官方 Release 说明写明支持最多八位说话人,并按每位说话人首次出现的顺序输出。输入缓冲可配置,范围从 80 毫秒到 30.4 秒,配合分块推理时音频总时长不受限制。

没有 GPU 能跑吗?

官方 Release 未统一给出硬件与显存要求,各模型的模型卡会写。多模态与流式模型通常对资源要求较高,建议先查目标模型的模型卡再决定部署方式。

相关工具与内容

  • /category/code — AI 编程与开发工具分类,本地加载开源模型属于这一类
  • /category/audio — AI 音频分类,说话人日志与语音处理的相邻工具
  • /category/chat — AI 对话分类,多模态推理模型的常见落地方向
  • /tool/deepseek — DeepSeek 官方产品入口,可对照看模型侧能力
  • /tool/qwen — 通义千问,多模态方向的对照工具
  • /article/gpt-6-family-guide-2026-09 — 若你在比较云端模型挡位,可参考这篇
Related
快讯 2 小时前

Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选

Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。

前沿快讯 0 阅读
链接已复制