">

Diffusers v0.41.0 发布:接入 Qwen-Image 2.1,并改用围绕新模型的发版节奏

Hugging Face 的扩散模型库 Diffusers 于 2026 年 10 月 6 日发布 v0.41.0,主线是把 Qwen-Image 2.1 接入 Diffusers,支持文生图、图像编辑、原生透明通道与 LoRA 训练。官方同时宣布改用与 Transformers 一致的发版策略:次版本围绕新模型集成组织,补丁版本只做修复。

这次发布的是什么

Hugging Face 的扩散模型库 Diffusers 于 2026 年 10 月 6 日在官方 GitHub 仓库发布 v0.41.0。据官方 release 说明,这一版的核心是接入 Qwen-Image 2.1 —— 一个把图像生成与图像编辑合并在同一模型里的模型,其视觉生成部分为 70 亿参数,支持多张参考图与原生 RGBA 输出(即直接产出带透明通道的图像),并支持 LoRA 训练。除新模型外,这一版还包括张量并行下的分片权重加载、LTX-2.5 的 DFR 流水线、Cosmos 3 的缓存与 FP8 去噪、模块化 Diffusers 的若干改进,以及 ONNX 支持的废弃。官方同时宣布从这一版起调整发版策略。

可用性与限制

  • 安装渠道:通过 PyPI 与官方 GitHub 仓库发布,请通过官方渠道获取,避免安装被篡改的版本。
  • 破坏性变更:官方标注 ONNX 支持已废弃,建议改用 Optimum;此前已废弃的若干流水线别名被移除,老代码升级前需核对。
  • 模型权重:Qwen-Image 2.1 的权重需单独获取,具体许可与下载方式以模型仓库说明为准。
  • 硬件前提:涉及 FP8、张量并行与显存优化的部分依赖具体 GPU 与依赖版本,收益以你的环境实测为准。
  • 升级建议:作为 minor 版本,建议在虚拟环境里先跑一轮回归,再更新生产依赖。

主要功能

  • 接入 Qwen-Image 2.1:文生图、图像编辑、多参考图输入、原生 RGBA 透明输出与 LoRA 训练。
  • 张量并行下的检查点加载:每个 rank 直接读取自己那一份分片权重,降低加载期显存占用。
  • LTX-2.5 DFR 流水线:支持关键帧槽位,以及可组合的空间与时间精修。
  • Cosmos 3:支持 SeaCache,并为 ModelOpt FP8 检查点提供混合精度的去噪路径。
  • 单文件加载器扩展到 Krea 2 与 MiniMax-H3。
  • 模块化 Diffusers:Wan 2.2 VACE 获得模块化块结构,从本地路径加载时避免重复下载权重。

技术原理

据官方说明,从 v0.41.0 起 Diffusers 采用与 Transformers 相同的发版哲学:次版本(minor)围绕新模型集成来组织,同时带上自上一版以来合入的其他改动;补丁版本(patch)只聚焦修复。这一版的主线模型 Qwen-Image 2.1 把生成与编辑合为一体,意味着同一套权重既能从文字出图,也能在给定参考图的基础上做改动;原生 RGBA 输出则把透明通道直接做进生成结果,省掉额外的抠图步骤。工程侧,张量并行加载让每个 rank 各自读取分片权重,避免加载阶段在单卡上聚合完整权重造成的显存峰值;Cosmos 3 的 SeaCache 与混合精度去噪面向的是视频生成里的重复计算与量化推理。具体收益与限制以官方 release 说明与文档为准。

实际体验

可复现的验证步骤:在独立虚拟环境中把 Diffusers 升级到 v0.41.0,先跑一遍既有流水线确认无回归;再按官方 Qwen-Image 2.1 文档拉起一条文生图流水线,观察出图与显存占用,然后叠加一张参考图试图像编辑,并检查输出是否带可用的透明通道。若你原本依赖 ONNX 路径,先在测试环境验证 Optimum 的替代方案再切生产。涉及 FP8 与张量并行的部分建议在多卡环境单独压测。

项目地址与获取方式

开源仓库与发布说明均在 GitHub 的 huggingface/diffusers:https://github.com/huggingface/diffusers/releases/tag/v0.41.0 。安装包通过 PyPI 发布,Qwen-Image 2.1 的权重按其模型仓库说明获取。请通过官方渠道获取,避免安装被篡改的版本。

适合谁用

  • 用 Python 自建图像生成与编辑流水线的开发者,尤其是需要透明通道输出的场景。
  • 想在自有数据上做 LoRA 微调、又希望沿用官方流水线接口的团队。
  • 做视频扩散模型推理优化、关注显存占用与量化的工程团队。
  • 什么人不必用:只用现成生图应用、不写代码的创作者,这一版与你的日常使用基本无关。

常见问题

v0.41.0 一定要升级吗?

取决于你是否用得到 Qwen-Image 2.1 或其中的推理优化。若现有流水线稳定且不涉及 ONNX 路径,可以择机升级;但官方已废弃 ONNX 支持并移除了部分旧别名,依赖这些路径的项目应尽早安排迁移。

ONNX 被废弃后该用什么?

官方在 release 说明中建议改用 Optimum 走 ONNX Runtime 工作流。迁移成本取决于你当前用到的算子与导出方式,建议先在测试环境验证。

Qwen-Image 2.1 能做什么别的模型做不了的事?

官方说明强调了两点:把图像生成与图像编辑合并在同一个模型里,以及原生 RGBA 输出(直接产出带透明通道的图像)。此外它支持多张参考图输入与 LoRA 训练。

这一版有没有性能上的改进?

官方提到了张量并行下分片权重的直接加载以降低加载期显存、Cosmos 3 的 SeaCache 与 FP8 混合精度去噪、以及模块化加载时避免重复下载权重等。实际收益以你的硬件与模型为准。

相关工具与内容

  • AI 绘画分类:本站图像生成方向的入口。
  • ComfyUI:把扩散模型流水线可视化编排的本地工具。
  • 通义万相:阿里的图像与视频生成工具。
  • LiblibAI:偏模型与工作流分享的创作社区。
  • AI 编程分类:面向开发者的 AI 工具入口。
Related
快讯 1 小时前

EmbeddingGemma 2 发布:7.4 亿参数的端侧多模态嵌入模型,文本、图像、音频、视频共用一个向量空间

Google DeepMind 于 2026 年 10 月 6 日在官方博客发布 EmbeddingGemma 2,把上一代的纯文本嵌入扩展到代码、图像、视频与音频,统一映射到同一个嵌入空间。模型基于 Gemma 4 架构、7.4 亿参数、Apache 2.0 许可,面向手机与浏览器等端侧场景,官方称其支持可裁剪的模块化编码器与 Matryoshka 向量降维。

前沿快讯 1 阅读
快讯 1 小时前

Anthropic 扩展 Cyber Verification Program:把高级网络能力按三档开放给经审核的安全团队

Anthropic 于 2026 年 10 月 6 日宣布扩展其 Cyber Verification Program(CVP),把过去分别运行的 Project Glasswing 与 CVP 合并为一个三档访问的计划:Defense Access、Red Team Access 与 Specialized Access。通过审核的安全团队可获得拦截更少、网络能力更强的 Claude 模型访问权限,官方同时公布了分层拦截效果的评估结论。

前沿快讯 1 阅读

继续阅读:通义听悟 4.3 分:转写之外,纪要能直接发 · 讯飞听见 4.3 分:形态最全,套餐要先想清楚

关于本文:本站文章由编辑部独立撰写,评测口径与免责说明见关于我们。想继续找工具,可从分类导航按场景浏览,或回首页搜索。

链接已复制