微软推出三款 MAI 语音模型,流式转录登顶 Artificial Analysis 准确率榜
微软人工智能(Microsoft AI)于 10 月 1 日宣布,在 Microsoft Foundry 上架三款新的音频模型:首个流式转录模型 MAI-Transcribe-2-Streaming,以及两款文本转语音模型 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash。三款模型分别覆盖“听”与“说”两个环节,面向客服、多语种助手和互动教学等语音智能体场景。

流式转录是这次发布的重点。传统语音识别通常要等说话人讲完一整句才返回文本,而 MAI-Transcribe-2-Streaming 在收到音频后约 100 毫秒就输出首个部分假设(partials),随后随着上下文增多不断修正,并在语句结束时提交稳定结果。微软称,在 Artificial Analysis 的流式语音识别榜单上,该模型在最终转录与部分转录两项准确率上均排名第一,最终词错误率为 2.5%,首次部分转录词错误率 2.8%,从说话结束到返回最终文本仅需 0.13 秒。
该模型支持 60 种语言,并具备自动、连续的语言检测能力。微软内部评估显示,在实时听写和字幕生成场景下,文字出现在转写结果中的速度约为最接近竞品的两倍——多数情况下字词在说出后 320 毫秒即可出现,而最接近的竞争对手需要 500 毫秒以上。价格方面,MAI-Transcribe-2-Streaming 以每小时音频 0.54 美元的优惠价发售,优惠持续到今年年底。

语音合成一侧,MAI-Voice-2.1 支持 23 种语言、26 个地区变体,最大特点是同一个声音可以跨语言使用并带上地道的本地口音,而不是把一种口音套用到所有语言上。微软举例说,一款教学应用可以在课中从英文讲解切换到中文练习,而听感上不像换了一位老师。该模型定价为每百万字符 22 美元。
MAI-Voice-2.1-Flash 则面向高并发、低延迟场景:支持同样的语言与跨语言音色,可在 150 毫秒的端到端延迟内生成最长 45 秒音频,模型推理速度比同级别模型快 55%,价格便宜约 60%,为每百万字符 15 美元。两款语音模型都支持用几秒钟参考音频做声音克隆,并内置同意机制以防范滥用。在一项 4000 人参与的图灵测试中,50.3% 的听众认为 MAI-Voice 的合成语音与真人录音一样自然或更自然。
微软把语音智能体拆解为听、理解、决策、说的闭环,认为每个环节要么为对话争取时间,要么消耗时间。把 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1-Flash 搭配使用,可以在两端同时压缩延迟,为模型留出更多推理、调用工具和校验答案的余量。除微软自家的 Foundry 云服务外,三款模型也已上线 MAI Playground、Vercel 和 Azure Voice Live,两款语音模型可在 OpenRouter 上调用,LiveKit 集成即将推出。
读者评论 (2)
想参与讨论?请 登录 后发表评论。
0.13秒出结果,这延迟压得竞品真没脾气
0.54美元一小时这价格真香,直播字幕党狂喜