">

Open WebUI v0.12.0:实时语音通话、3D 动态形象与双因素登录一起到位

Open WebUI 于 2026 年 10 月 10 日发布 v0.12.0。这一版把语音通话切到实时模式(默认走 OpenAI Realtime 的 gpt-realtime-2.1-mini 配 Marin 音色),支持上传 VRM 模型做带口型的 3D 动态形象,并加入强制双因素登录;同时还带来共享对话可回复、模型控件、长工具调用中的上下文压缩等一批改动。

这次发布的是什么

Open WebUI 于 2026 年 10 月 10 日发布 v0.12.0(GitHub Release 时间 2026-10-10T21:17:46Z,PyPI 上 open-webui 0.12.0 的上传时间是 2026-10-10T21:08:24,为当前最新稳定版;上一版 0.11.4 发布于 2026 年 9 月 21 日)。这一版的改动量不小,最显眼的三项是:语音通话新增 Realtime 模式、实时通话里可以用 3D 动态形象替代语音光球、以及面向全体用户的双因素登录。此外还包括共享对话支持回复、模型可挂载自定义控件、长工具调用过程中的上下文压缩、多文件技能与版本历史等一批更新。

可用性与限制

  • 部署形态:Open WebUI 是自托管项目,需要自己准备运行环境;官方同时提供 PyPI 包与容器镜像,具体渠道以官方发布页为准。
  • 实时通话依赖外部模型:Realtime 模式走 OpenAI Realtime 语音模型(官方说明里默认为 gpt-realtime-2.1-mini 配 Marin 音色),需要自备对应的接口地址与密钥,费用以模型提供方官方页面为准。
  • 通话时长限制:官方说明通话需要一个 Allow Call 权限,并且一小时后自动结束。
  • 双因素登录为可选项:由管理员在认证设置里开启(或用环境变量 ENABLE_MFA 开启),OAuth 与可信头登录可以分别配置跳过。
  • 实验性标记:管理员界面里的 Tool Search 被官方标注为实验功能,行为可能变化。

主要功能

  • 实时语音通话:在音频设置里把通话模式从 Standard 切到 Realtime,由实时语音模型接住闲聊,把真正的问题与任务交给对话里选中的模型(连同它的历史与工具),再把回答念出来的同时在聊天区显示完整回复。
  • 3D 动态形象:实时通话中可上传带骨骼的 VRM 形象(官方给出的上限是 25 MiB)替代语音光球,可选配空闲、聆听、说话三种状态的 VRMA 动作片段(上限 10 MiB),并最多加 16 个带描述的命名手势,口型跟随朗读内容。
  • 双因素登录:管理员可要求每位用户绑定验证器应用,首次登录扫码绑定并发放十个一次性恢复码;OAuth 与可信头登录可用开关放行;丢了验证器可用命令行发一次性恢复令牌。
  • 共享对话可回复:共享模式从「仅克隆」切到「允许回复」后,被共享的人可以在同一段对话里继续写,消息显示发送者名字与头像,回复实时推给所有打开该对话的人。
  • 模型控件:能给模型加命名控件(例如把推理强度做成低、中、高三档的菜单或滑块),每档可带自己的自定义参数,可设默认值,选择会被记住。
  • 长工具调用中的上下文压缩:开启上下文压缩并使用原生函数调用时,一次回复里连续跑很多工具调用的,会在工具轮次之间触发压缩,把每次调用连同结果一起保留。
  • 多文件技能与版本历史:工作区技能可以携带脚本、参考与模板等支撑文件,在编辑器里以文件树管理,每次保存留一个可翻阅、可对比、可回滚或删除的版本。

技术原理

据官方说明,实时通话的分工是一层语音外壳 + 原有模型内核:实时语音模型负责把语音转成文字、判断这句话是闲聊还是真问题,闲聊自己接住,真问题与任务则转交给该对话当前选中的模型,并带上这段对话的历史与已挂载工具;拿到结果后再由语音模型朗读,同时把完整文字回复写进聊天区。工具需要审批或向用户提问时,仍然要在聊天区里回答 —— 也就是说,语音只覆盖「说与听」,权限确认依旧留在可审计的界面上。

3D 形象部分走的是 VRM / VRMA 这套带骨骼与动作片段的模型格式,动作用在 idle、listening、speaking 三个状态上,手势由语音模型在对话语境合适时或被要求时自行触发,口型跟随朗读输出。官方还给这些能力配了对应的环境变量,方便在容器化部署里统一设置。

实际体验

想在自己实例上验证这些改动,可以按下面的顺序做(都是读发布说明就能照做的检查,不涉及主观评价):

  1. 升级到 0.12.0 后进入音频设置,确认通话模式里出现 Realtime 这一项,以及是否列出 Allow Call 权限。
  2. 配好实时语音的接口地址与密钥后发起一次通话,先问一个简单闲聊问题,再问一个需要调用工具的问题,观察闲聊是否被语音模型直接接住、真问题是否被转给对话里选中的模型。
  3. 在模型编辑器里上传一个 VRM 形象,确认是否出现预览、动作片段上传与手势配置这几项,以及大小上限提示。
  4. 在认证设置里打开 MFA,用另一个账号登录,确认是否被要求扫码绑定并拿到十个恢复码。
  5. 共享一段对话并把共享模式切到允许回复,让另一个账号在同一段对话里写一条消息,确认对方能看到且能区分发送者。

项目地址与获取方式

发布页在 https://github.com/open-webui/open-webui/releases/tag/v0.12.0 ,仓库为 open-webui/open-webui,采用开源许可。安装包请通过官方渠道获取(官方发布页给出的容器镜像与 PyPI 包),避免安装被篡改的版本。实时语音功能需要自备模型提供方的接口与密钥。

适合谁用

  • 自建聊天前端、希望把语音交互接进现有模型的团队。
  • 需要多人共用一套实例、对登录安全有要求的部署者(MFA 与共享权限都在这一版补上)。
  • 想在对话里长期积累技能与提示词版本、需要回滚能力的重度使用者。
  • 不适合:只想开箱即用、不想维护服务的个人用户 —— 自托管本身要承担升级与备份成本。
  • 不适合:对外部语音接口有合规顾虑的场景 —— Realtime 模式需要把音频送到外部模型提供方。

常见问题

实时通话必须用 OpenAI 的语音模型吗?

官方说明里的默认值是 OpenAI Realtime 的 gpt-realtime-2.1-mini,并提供接口地址、密钥、模型与音色等环境变量,说明可以指向其他兼容接入点。具体可选范围以官方文档为准。

通话会不会一直挂着?

不会。官方说明通话需要一个 Allow Call 权限,且一小时后自动结束。工具需要审批或提问时,仍要在聊天区里处理。

开启 MFA 后,用 OAuth 登录的人也会被拦吗?

可以配置。官方给出 MFA_ALLOW_OAUTH_BYPASS 与 MFA_ALLOW_TRUSTED_HEADER_BYPASS 两个开关,分别放行 OAuth 与可信头登录;是否放行由管理员决定。

恢复码丢了怎么办?

登录时绑定的验证器可以后续在账号设置里更换,也可以重新生成恢复码;验证器本身丢失时,管理员可用官方提供的命令行子命令发一个一次性恢复令牌。

这次更新需要重新配置已有模型吗?

不需要重建。官方说明模型可以在编辑器里单独指定自己的实时语音音色;模型控件、版本历史这些是新增的可选项,不设置就按原行为运行。

相关工具与内容

Related
快讯 1 小时前

Vercel CLI 向智能体开放域名购买:流程可以跑完,付款仍需人确认

Vercel 于 2026 年 10 月 9 日在官方 Changelog 发布更新:编码智能体可以通过 Vercel CLI 走完域名搜索、查可用性、询价到发起购买的完整流程,但成交这一步被刻意留给人类确认 —— 非交互执行时 CLI 返回结构化错误,把确认交回给人。

前沿快讯 5 阅读
快讯 1 小时前

InvokeAI 7.0.0 alpha 2:多画板项目、MySQL 后端与更多 GGUF 模型支持

InvokeAI 于 2026 年 10 月 11 日发布 7.0.0 alpha 2(PyPI 包 invokeai 7.0.0a2 上传于 2026-10-11T02:05:42)。相对 alpha 1 增加了项目内多画板、MySQL 与 MariaDB 数据库后端、krea2 / ideogram4 / ernie-image 的 GGUF 变换器支持、视频参考帧与音频参考等外部调用能力,以及显存预留配置项。官方同时强调这是 alpha 版本,且 v7 的数据库迁移是单向的。

前沿快讯 3 阅读
快讯 1 小时前

ONNX Runtime 1.31.0:模型包接口转正,MoE 量化推理与设备选择继续补强

微软于 2026 年 10 月 9 日发布 ONNX Runtime 1.31.0。这一版把模型包与 EPContext 数据回调提升为稳定的 C / C++ 接口,改进 CPU 加载开销与 INT4/INT8 量化的 MoE 专家推理,让 CoreML 参与按设备选择执行提供器(含 Apple Neural Engine),并新增工作区内存核算。同时 ACL 执行提供器进入弃用状态,且受支持的原生构建默认开启 1DS 遥测。

前沿快讯 3 阅读

继续阅读:InvokeAI 7.0.0 alpha 2:多画板项目、MySQL 后端与更多 GGUF 模型支持 · ONNX Runtime 1.31.0:模型包接口转正,MoE 量化推理与设备选择继续补强

关于本文:本站文章由编辑部独立撰写,评测口径与免责说明见关于我们。想继续找工具,可从分类导航按场景浏览,或回首页搜索。

链接已复制