资讯›热点›正文

微软 MAI-Transcribe-2-Streaming 登顶实时语音识别榜首

一方见地 2026-10-4 12:34 阅读 0 热点
微软在 Microsoft Foundry 推出首个流式语音转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言、收到音频后约 100 毫秒出首个结果,在 Artificial Analysis 实时转写准确率榜居首,并配套发布 MAI-Voice-2.1 与 Flash 两款语音合成模型。

10 月 1 日,微软在 Microsoft Foundry 发布三款新的 Microsoft AI(MAI)语音模型,其中 MAI-Transcribe-2-Streaming 是微软首个流式语音转写模型。它无需等说话人讲完,就能在音频流入时持续输出文字,与同步发布的 MAI-Voice-2.1、MAI-Voice-2.1-Flash 两款文本转语音模型一道,组成低延迟的听—说语音智能体闭环。

微软 MAI-Transcribe-2-Streaming 登顶实时语音识别榜首

该模型支持 60 种语言并自动连续识别语种,在收到音频后 100 毫秒出首个假设(partials),随上下文修正,语句结束即提交稳定文本。微软称其内部测试显示,实时字幕与语音识别速度约为最接近竞品的两倍。在 Artificial Analysis 的 AA-WER Streaming 榜单(约 8 小时音频、38 个模型)中,其最终与首个部分转写词错误率均约 2.5%,位列第一;竞品 Grok Voice Transcribe 2.0、Meta 的 Muse Voice Transcribe 紧随其后。

低延迟让语音智能体能在用户说完前就开始推理或调用工具,适用于客服、实时字幕与听写。定价上,流式版为优惠期 0.54 美元每小时间音频,批量版 MAI-Transcribe-2 为 0.10 美元每小时。语音侧,MAI-Voice-2.1 覆盖 23 种语言、26 个地区并保持同一声音跨语种,Flash 版端到端延迟仅 150 毫秒、比同级快 55%、便宜约 60%。

这是微软在自研 MAI 模型路上的又一落地。此前其 MAI-Transcribe-2 已在 FLEURS 多语种准确率与 Artificial Analysis 的准确率乘延迟前沿上夺冠,流式版把同样优势延伸到实时对话。随着语音助手、语音客服对边听边做需求上升,低延迟转写正成为语音智能体的关键底座。

读者评论 (0)

想参与讨论?请 登录 后发表评论。

还没有评论,欢迎抢沙发!