微软于 2026 年 10 月 1 日在 Microsoft Foundry 上线三个 MAI 语音模型:流式转录的 MAI-Transcribe-2-Streaming 覆盖 60 种语言并自动检测语种,边收音频边产出文本;合成侧推出 MAI-Voice-2.1 与其高速档 MAI-Voice-2.1-Flash,覆盖 23 种语言且跨语言保持同一音色。三个模型同时上线 OpenRouter、Vercel 与 LiveKit。
微软 MAI 语音三件套:流式转录 60 种语言,合成 23 种
这次发布的是什么
微软于 2026 年 10 月 1 日在 Azure AI Foundry 官方技术社区博客宣布,Microsoft Foundry 中新增三个 Microsoft AI(MAI)语音模型:MAI-Transcribe-2-Streaming、MAI-Voice-2.1 与 MAI-Voice-2.1-Flash。官方博客的页面时间戳为 2026-10-01。
三个模型的分工很清楚。MAI-Transcribe-2-Streaming 是流式语音转文本模型,官方称它不再等说话人说完再返回文本,而是连续转写,覆盖 60 种语言并自动检测语种,先产出称为 partials 的初步假设,再随上下文不断修订,直到一句话结束才提交稳定结果。MAI-Voice-2.1 是文本转语音模型,官方称支持 23 种语言,并在不同语言之间保持一致的语音身份,发音与表达方式会随目标语言自适应。MAI-Voice-2.1-Flash 支持相同的语言与跨语言音色,但针对响应速度与高吞吐场景优化。
影响谁:做客服语音机器人、实时字幕与多语言语音助手的开发者。流式转录改变的是时点——应用可以在对方还没说完时就开始理解和准备动作,而不必等一句话结束。
可用性与限制
- 调用渠道:官方称三个模型都在 Microsoft Foundry 提供,既有 Foundry 内的 Azure Speech,也有 Foundry 的直接 API;此外还上线了 OpenRouter、Vercel 与 LiveKit。
- 演示入口:官方提到在 MAI Playground 里做了一个名为 Chatter 的演示,用于展示三个模型串起来的实时语音代理。
- 能力取舍:官方建议,如果需要说话人分离与词级时间戳,应选用此前的非流式模型 MAI-Transcribe-2,而不是 Streaming 版本。
- 结果稳定性:partials 是初步假设,会随后续上下文被修订,只有话语结束后才提交终稿。依赖中间结果的逻辑需要能容忍这种修订。
- 语言覆盖:转录 60 种语言,合成 23 种语言;超出这些范围的语言官方未作声明。
- 语音克隆与授权机制:本次官方公告未提及,相关能力与限制以官方文档为准。
- 境内可用性:Microsoft Foundry 与 Azure 服务在境内的可用性与合规要求,请以微软官方说明为准。
- 价格:以微软官网定价页为准。
主要功能
- 边听边转:音频到达即开始产出文本,不等说话人说完。
- 自动检测语种:60 种语言连续转写,无需预先指定。
- 分批输出:先给初步假设,随上下文修订,句末提交稳定字幕。
- 跨语言同音色:23 种语言保持一致的语音身份,按语言自适应发音。
- 高速档合成:Flash 版本面向响应敏感、调用量大的语音应用。
- 组合成回路:转录与合成可以搭配,构建完整的语音代理。
- 多平台接入:Foundry、Azure Speech、OpenRouter、Vercel 与 LiveKit 都可调用。
技术原理
据官方说明,流式转录改变的是输出时机。传统转录要等一句话说完才返回完整文本,而 MAI-Transcribe-2-Streaming 在音频到达时就持续产出文本:官方称在收到音频后的低数百毫秒内产出首批假设,随后随更多上下文到达不断精炼,直到话语结束才提交稳定的转写结果。这个区别在应用需要边听边行动时才有意义——客服机器人可以在句子还没说完时就开始识别来电意图,语音助手可以更早开始推理或准备工具调用。
合成侧的做法是让同一个语音身份跨语言保持一致。官方举的例子是,一个教学应用可以从英文讲解切到中文练习,而不会听起来像换了一位老师。官方称模型会根据具体语言调整发音与表达方式,而不是在所有语言的回复里都带同一种口音。
关于模型架构、参数量与训练细节,本次官方公告未予说明,这部分以官方模型卡与文档为准。
实际体验
语音模型值不值得换,跑一个最小回路就能判断。下面是可复现的验证步骤:
- 先看官方演示:在 MAI Playground 里试 Chatter,确认三个模型串起来之后的实时效果,也对延迟有一个直观感受。
- 搭最小回路:用 Foundry 的直接 API 或 Azure Speech 建一个语音回路,把麦克风音频流式送进 MAI-Transcribe-2-Streaming,观察首批文本到达的时间点。
- 打印每一版 partial:确认初步结果确实会被后续上下文修订,据此判断你的业务逻辑能不能直接用中间结果,还是必须等终稿。
- 对比两个合成档位:同一句话分别用 MAI-Voice-2.1 与 MAI-Voice-2.1-Flash 合成,比较自然度与响应速度的差异。
- 做跨语言测试:让同一个音色在中英文之间切换,确认听感上是否保持同一个人,这一步决定了它能不能用在多语言产品里。
项目地址与获取方式
- 官方公告:Azure AI Foundry 技术社区博客的 Build expressive voice experiences with new MAI models in Microsoft Foundry 一文,页面时间戳 2026-10-01。
- 调用入口:Microsoft Foundry(直接 API 与 Azure Speech),以及 OpenRouter、Vercel、LiveKit;演示在 MAI Playground。
- 请通过微软官方渠道获取密钥与接入方式,避免第三方中转带来的数据风险。
- 模型卡、可用区域与具体定价以微软官网为准。
适合谁用
- 做客服语音机器人的团队:需要在对方还没说完时就开始理解并准备工具调用。
- 做实时字幕与语音驱动界面的产品:文字几乎同速上屏。
- 做多语言语音助手的开发者:23 种语言共用同一音色,切换语言不换人。
- 调用量大的语音应用:Flash 档位面向响应速度与吞吐优化。
- 不必用的人:只需要离线批量转写、且需要说话人分离与词级时间戳的场景,官方建议用非流式的 MAI-Transcribe-2 更合适。
- 暂不建议押注的场景:依赖语音克隆的业务,官方公告未说明相关能力与授权机制。
常见问题
三个模型分别该怎么选?
要边听边出文本选 MAI-Transcribe-2-Streaming;要高质量离线转写并需要说话人分离与词级时间戳,官方建议选此前的非流式模型 MAI-Transcribe-2。合成侧,语音质量与表现力优先时选 MAI-Voice-2.1,响应速度与大规模调用优先时选 MAI-Voice-2.1-Flash。两者语言覆盖与跨语言音色一致,差别在取舍方向上。
流式转录和此前的 MAI-Transcribe-2 有什么不同?
核心差别在输出时机。非流式模型等一段话说完再返回完整文本,适合需要说话人分离、词级时间戳等后处理能力的场景;流式模型在音频到达时就持续产出文本,先给初步假设再随上下文修订,句末提交终稿,适合需要在说话过程中就采取行动的应用。官方把两者定位为按体验需求选择,而不是新旧替代。
支持哪些语言?
官方称 MAI-Transcribe-2-Streaming 覆盖 60 种语言并支持自动语言检测;MAI-Voice-2.1 与 MAI-Voice-2.1-Flash 覆盖 23 种语言,且在这 23 种语言之间保持一致的语音身份。具体语言清单与地区变体以官方模型卡为准。
可以从哪些平台调用?
官方称三个模型都在 Microsoft Foundry 提供,既有 Foundry 内的 Azure Speech,也有 Foundry 的直接 API 访问;此外还通过 OpenRouter、Vercel 与 LiveKit 提供。想先看效果可以去 MAI Playground,官方在那里放了一个名为 Chatter 的演示。Azure Voice Live 也在官方给出的入口列表中。
计费方式是怎样的?
本次文章内容不写具体价格数字,计费口径与档位请以微软官网定价页为准。需要注意的是官方公告提到过部分模型有介绍期价格,介绍期结束后的价格会变化,因此接入前应先查当前定价,不要依据二手转述的数字做成本测算。
相关工具与内容
- /category/audio — AI 音频分类,语音识别与合成的同类工具都在这里
- /tool/elevenlabs — ElevenLabs,语音合成方向的对照工具
- /tool/moyin — 魔音工坊,中文配音场景的常见选择
- /tool/xunfei-tingjian — 讯飞听见,转写与字幕方向的对照工具
- /tool/tingwu — 通义听悟,会议记录与音频理解方向
- /article/suno-review-2026 — Suno 评测,音频类 AI 的选型参考
相关内容
Claude Code Mods:插件能改写提示、拦截工具调用
Claude Code 于 2026 年 10 月 1 日发布 v2.1.287,新增 Claude Code Mods:由 JavaScript 或 TypeScript 事件处理函数组成的插件,运行在 Claude Code 内部,可改写提示词、拦截或接管工具调用、重画界面并注册自定义命令。同版本还带来内置的 You should know 旁路提醒 mod。Mods 不被沙箱隔离,官方要求只从信任的来源安装。
Cloudflare 开源 Clef:只输出结构化判断与概率
Cloudflare 于 2026 年 10 月 1 日发布两个自研决策模型 Clef 与 Clef-flash,托管在 Workers AI,同时以 Apache 2.0 协议在 Hugging Face 开放权重。模型只输出类型化判断与概率而非自由文本,带视觉编码器与 64K 上下文,接口与 Jev 兼容。同日还预告了基于强化学习的微调服务。
Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选
Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。
继续阅读:稿定设计值不值得用:电商物料一条龙,物料杂了就露短 · 创客贴的 4.1 分怎么来的:发丝能抠干净,版式跳不出模板