一批五款模型,一次降价三档

云栖大会期间,阿里通义千问团队发布 Qwen-Audio 3.1 系列语音模型:ASR(语音识别)、TTS(语音合成)、Realtime(实时交互)三条现有产品线升级,新增 ASR-Next(音频理解)与 TTS-Next(音频创作)两款新模型,合起来覆盖「理解—生成—交互—创作」四个环节。价格同步下调:语音识别最高降 95%,实时语音约降 85%,语音合成约降 70%。需要指出的是,阿里只公布了百分比,没有给出各档绝对单价,也没有说明折扣对应哪种调用方式,具体价格以官方报价页为准(厂商口径);各媒体报道的发布日期口径略有出入,集中在 9 月 22 至 25 日之间,降价自 9 月 22 日北京时间起生效的说法来自外媒汇总。

三条老产品线各自补了什么

识别侧的升级最实在。Qwen-Audio 3.1 的 ASR 支持 30 种语言与 16 种中文方言,首字延迟约 160 毫秒,公开方言数据集上平均字错率 4.55%,方言转普通话语义句准确率 82.10%(均为官方测试口径)。新特点是「原生转录润色」:自动去掉口头禅与重复、重组语句,直接输出成稿而非原始转录;支持按说话人分离角色、识别行业热词,打断与重叠语音也能处理。合成侧的 TTS 覆盖 16 种语言与 20 个中文方言区,内置 86 个内联标签标注笑声、呼吸、咳嗽等非语言事件,还支持跨语言音色克隆——同一个品牌音色在普通话、粤语、英语、日语之间保持一致。交互侧的 Realtime Plus 是全双工实时对话,上下文窗口 262,144 个 token,模型说话中途可以插话而不丢上下文,并能依据检测到的情绪状态调整语速语调。

两款新品把「听」和「说」拆成两个工种

结构上更值得注意的是 ASR-Next 与 TTS-Next 的分工。ASR-Next 不再只做音频转文字,而是回答关于音频的问题:识别情绪、区分环境声与机械噪音、描述声音事件并定位发生时间,相当于把「先转写、再接一个文本模型理解」的两段式流程收进一个模型。TTS-Next 则把语音合成扩展为音频生成——语音、音效、环境声在一次调用里产出,不需要多工具串联。媒体测算口径称其 TTS 定价较 ElevenLabs(每百万字符约 100 美元)低约 70%;跨语言品牌音色的一致性,则是海外供应商短期内难以对齐的能力。

三档降价:识别砍得最深,合成降幅最浅(官方口径)ASR 语音识别最高降 95%30 语言 + 16 中文方言 · 首字约 160msRealtime 实时约降 85%262K 上下文 · 全双工可插话TTS 语音合成约降 70%16 语言 + 20 方言区 · 86 内联标签升级三线 + 新增两款:ASR / TTS / Realtime + ASR-Next / TTS-NextASR-Next 管音频理解(情绪 / 环境声 / 问答),TTS-Next 管音频创作(语音 + 音效一次生成)阿里仅公布百分比、未公布分项绝对单价(厂商口径)· 各源发布日期口径在 9 月 22 至 25 日之间
Qwen-Audio 3.1 三档降价幅度与五款模型分工(官方口径)

与 DeepSeek 的同一周,两个相反方向

这一周中国模型市场出现了少见的对照。DeepSeek 在 8 月把 API 提价 2.3 至 4.5 倍之后,收入跑速翻倍至约 10 亿美元(本站此前已报道);阿里则把语音 API 价格砍到最高一折。两家动作方向相反,逻辑却同构——都是在自家占优的品类里调价:DeepSeek 靠开源模型积累了难以替代的调用量,提价是在兑现既有位置;阿里语音的份额尚未固化,降价是买位置的支出。对开发者的启示很朴素:转写这类输出容易比对的场景,值得重新报一遍价;生产级的英文语音合成,则要先测质量再谈省钱,ElevenLabs 在英文上的质量口碑仍是换供应商的隐性成本。

降价之外的确定性收益

把云栖大会这条线摆进阿里本季的动作里看,从训推一体芯片真武 V900(本站此前已报道)到语音全线降价,主线是把「全栈自研 + 全线降价」打包成一套面向开发者的成本叙事。语音是其中弹性最大的品类:客服外呼、语言陪练、无障碍读屏这些此前算不过账的场景,95% 的降幅足以改变立项与否。至于降价是否伴随质量与稳定性的取舍、折扣档位的真实门槛、定价何时覆盖更多区域,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。