微軟發表首款串流轉錄與語音合成模型,主打低延遲即時對話與聲音複製

TechNews 編輯台約 3 分鐘閱讀

站內可閱讀至 (台北時間)

微軟發表首款串流轉錄與語音合成模型,主打低延遲即時對話與聲音複製(新聞配圖)
配圖來源:科技新報原站文章
本站保存版本
字級

微軟人工智慧部門 Microsoft AI 1 日發表三款新模型,包括首個串流轉錄模型 MAI-Transcribe-2-Streaming,以及兩款文字轉語音模型 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,Microsoft Foundry 提供公開預覽。這組模型鎖定可即時對話的語音代理應用,讓開發者能在使用者尚未說完話時就開始處理語音內容,縮短互動等待時間。

MAI-Transcribe-2-Streaming 支援 60 種語言,能自動連續語言偵測,接收音訊後約 100 毫秒內先產生初步辨識結果,並以更多上下文逐步修正,待發話結束後再輸出穩定版。微軟表示,這款模型 Artificial Analysis 最終與部分轉錄準確率評比名列第一,且兼顧準確度與延遲率。定價方面,年底前有每小時音訊 0.54 美元導入價。

Introducing 3 new models: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 and MAI-Voice-2.1-Flash.

Accurate streaming transcription. Natural speech and less waiting between turns.

Build voice agents that keep the conversation moving! pic.twitter.com/QB6Yr9UiyK

— Microsoft AI (@MicrosoftAI) October 1, 2026

語音合成部分,MAI-Voice-2.1 主打更自然、具表現力的多語言輸出,支援 23 種語言,並可在切換語言時維持相同聲線與近母語口音。高速版 MAI-Voice-2.1-Flash 則專為高頻、低延遲場景設計,約 150 毫秒點到點延遲產生最多 45 秒音訊,價格也較低。微軟兩款 Voice 模型都支援聲音複製功能,但需經審核授權,且僅能使用已取得本人同意的聲音。

除了 Microsoft Foundry,也可經 MAI Playground、Azure Voice Live、Vercel 與 OpenRouter 等平台使用,微軟並在 MAI Playground 展示結合三款模型的語音代理示範 Chatter。微軟表示,這次更新擴充 MAI 音訊產品線,目標是提供開發者更快更自然的即時語音互動工具。

(首圖來源:Microsoft)

您的咖啡贊助將是讓我們持續走下去的動力

從這裡可透過《Google 新聞》追蹤 TechNews