微軟推出3款AI語音模型 MAI-Transcribe即時轉錄準確度稱冠

黎怡涵約 2 分鐘閱讀

站內可閱讀至 (台北時間)

微軟推出3款AI語音模型 MAI-Transcribe即時轉錄準確度稱冠(新聞配圖)
配圖來源:TVBS新聞網原站文章
本站保存版本
字級

微軟(Microsoft)宣布推出3款人工智慧(AI)語音模型,包括即時語音轉文字模型MAI-Transcribe-2-Streaming,以及文字轉語音模型MAI-Voice-2.1與MAI-Voice-2.1-Flash,主打低延遲、多語言及高效率,協助開發者打造更自然的AI語音代理人。微軟表示,MAI-Transcribe-2-Streaming在Artificial Analysis的轉錄準確度測試中,完整及部分轉錄結果的準確度均排名第1。

MAI-Transcribe-2-Streaming支援60種語言,並可持續自動偵測使用者使用的語言。不同於必須等待使用者說完才輸出文字的傳統語音轉錄方式,模型在接收到語音後100多毫秒便可產生初步轉錄內容,之後隨著更多上下文資訊加入持續修正,並快速形成穩定文字。

微軟表示,這讓AI語音代理人能在使用者尚未說完話時便開始推理或呼叫工具;在即時聽打及字幕等應用中,內部測試顯示文字出現速度約為最接近競品的2倍。該模型年底前的優惠價格為每小時音訊0.54美元。

MAI-Voice-2.1則聚焦於多語言文字轉語音,支援23種語言及26個語言地區,且同一個聲音可跨不同語言維持一致的聲音特徵,同時依照當地語言調整口音及發音。

MAI-Voice-2.1-Flash則針對高流量及低延遲應用設計,支援與MAI-Voice-2.1相同的語言範圍,可在約150毫秒的端到端延遲下生成45秒音訊。微軟表示,模型推理速度提升55%,價格則比同類模型低約60%,每100萬字元15美元。兩款模型也支援以數秒參考音訊進行跨語言聲音複製,並內建同意與安全防護機制,降低聲音複製遭濫用的風險。

微軟表示,將MAI-Transcribe-2-Streaming搭配MAI-Voice-2.1-Flash,可縮短AI語音代理人「聽取、理解、決策及回答」各環節的等待時間,讓代理人能在對話進行期間處理資訊及使用工具。目前3款模型均可透過Microsoft Foundry使用,另可在MAI Playground等平台取得。