不等说完就出字:流式转录改的其实是交互结构

美西时间 10 月 1 日,微软人工智能部门发布三款音频模型:流式转录模型 MAI-Transcribe-2-Streaming,以及两款文本转语音模型 MAI-Voice-2.1 与 MAI-Voice-2.1-Flash,三款均可通过 Microsoft Foundry 获取,环球网科技、腾讯新闻等中文媒体在 10 月 2 日转引了官方消息。官方将 MAI-Transcribe-2-Streaming 称为微软在流式转录方向推出的新款模型——此前的 MAI-Transcribe-2 只能处理完整录音,等说话者讲完再整段返回文本。

流式是另一类问题:模型要在人还在说话的时候就开始出字,再随着上下文悄悄修正。按官方口径,音频流入后约 100 毫秒出头即产生初步转写假设,说话结束后 0.13 秒给出稳定终稿;最终词错率 2.5%,初步转写错误率 2.8%,支持 60 种语言并自动连续检测语言,无需预先告知语种。微软还给出了一组内部评估:实时语音识别与字幕生成的出字速度约为最接近竞品的两倍。这些数字均为厂商自述口径,第三方基准数据尚未同步验证,下文单列一节讨论。

流式转录三指标对照(微软发布口径 vs 第三方媒体整理)MAI-Transcribe-2-Streaming最终词错率 2.5% · 终稿 0.13 秒 · 60 种语言自动检测$0.54/小时(年底前)Grok Voice Transcribe 2.0(对照)词错率 2.73% · 终稿 0.49 秒(第三方媒体整理口径)公示榜在列Muse Voice Transcribe(对照)终稿 0.16 秒(第三方媒体整理口径)公示榜在列MAI-Voice-2.1 / 2.1-Flash23 种语言 26 地区 · 同一嗓音跨语言 · 克隆带同意校验$22 / $15 每百万字符口径标注榜单居中说法出自微软发布口径;第三方称公示页当时未挂出该模型 · 无开源权重
微软 MAI 音频三款新模型与竞品对照(厂商发布口径)

榜单口径:官方称居首,公示页当时未挂出

微软引用的是独立评测平台 Artificial Analysis 的流式语音榜单,称该模型在最终转写与部分转写两项准确率排名中均居榜首,并处于准确率与延迟权衡的帕累托前沿。但科技媒体 DataNorth 在报道中提示了一个值得注意的细节:发稿时该模型尚未出现在 Artificial Analysis 的公示流式榜单上,彼时排在榜单前面的是 Grok Voice Transcribe 2.0;按该媒体整理的对照,Grok 的词错率为 2.73%、终稿耗时 0.49 秒,另一竞品 Muse Voice Transcribe 终稿耗时 0.16 秒——单看准确率差距其实只有零点二三个百分点,折算下来每千词多对两三个字,真正拉开差距的是延迟项。

把两类口径并列写出来并非抬杠:厂商引用榜单日期为 9 月 28 日的数据快照,公示页更新存在时差是常见现象,但在独立页面可查证之前,居中的说法应按厂商自述对待。这也是本轮发布里最值得选型团队留意的部分——数字本身差异不大,决策权重应放在延迟与自己业务录音的实测上。

两款语音模型:同一副嗓音,二十三种语言

语音合成侧,MAI-Voice-2.1 覆盖 23 种语言、26 个地区口音,核心卖点是跨语言保持同一说话人身份——多语言助手在对话中切换语种时不必换「人」,官方示例里家教应用可以在一节课中途中切换语言而不换老师。官方还演示了按角色与情绪出声的能力,如客服、旁白或喜悦、失望等语气。MAI-Voice-2.1-Flash 面向高并发、低延迟场景:150 毫秒端到端即可开始输出长达 45 秒的音频,推理速度较标准版快 55%,官方称较同类方案便宜约六成。两款模型都支持用几秒钟参考音频克隆嗓音,并内置同意校验机制以防滥用。

定价方面,MAI-Voice-2.1 为每百万字符 22 美元,Flash 版 15 美元;转录流式版以每小时音频 0.54 美元的优惠价发售至今年年底,约为自家批处理版(每小时 0.10 美元)的 5.4 倍。第三方媒体整理的对照显示,ElevenLabs 与 Deepgram Flux 的流式转录约合每千分钟 6.5 美元,微软为 9 美元——价格不是这轮发布的卖点,速度才是。

生态位:自研模型栈补上语音这一块

分发渠道同样值得注意:三款模型除 Microsoft Foundry、MAI Playground 与 Azure Voice Live 外,还上架了 OpenRouter 与 Vercel AI Gateway,LiveKit 支持列为即将推出。这是微软人工智能部门在 Mustafa Suleyman 带领下持续扩充自研模型栈的又一环——语音恰恰是延迟、价格与语言覆盖共同决定合同归属的品类,且便于与 Azure 既有的客服系统、Teams 生态捆绑。官方将转录与 Flash 语音模型的组合框定为「在语音交互回路两端买回时间」:听得快、答得快,人才会觉得对话是自然的。

冷静看:三个没说清的缺口

这批发布也有几处留白。其一,流式转录模型未提及说话人区分(谁在说话)能力,会议纪要类场景尚不能仅靠它完成;其二,官方只给了总词错率,没有按语言拆分,干净英语音频上的 2.5% 说明不了嘈杂环境或小语种的表现,而呼叫中心与会议记录恰恰活在噪音里;其三,三款模型均为托管服务、无开源权重,数据须过微软的管道。选型建议是把自有业务录音丢进 MAI Playground 先测再算账。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。