微軟推出首款自研即時串流語音轉錄模型,並更新MAI語音模型

陳曉莉約 2 分鐘閱讀

站內可閱讀至 (台北時間)

微軟推出首款自研即時串流語音轉錄模型,並更新MAI語音模型(新聞配圖)
配圖來源:iThome原站文章
本站保存版本
字級

微軟

微軟AI部門Microsoft AI(MAI)周四(10/1)推出首款自研即時串流語音轉錄模型MAI-Transcribe-2-Streaming,支援60種語言及持續自動語言偵測,收到音訊後約100毫秒即可開始輸出初步轉錄內容。同一天微軟也更新文字轉語音模型MAI-Voice系列,推出MAI-Voice-2.1及低延遲版本MAI-Voice-2.1-Flash。

即時串流語音辨識目前已廣泛用於語音代理人、即時字幕及語音輸入等應用,OpenAI、Google、Deepgram及ElevenLabs等業者皆提供相關模型。這類技術會在音訊持續傳入時同步產生可修正的部分轉錄內容,再逐步確認最終文字,因此各家主要競爭重點在於轉錄準確度及延遲表現。

微軟先前已推出MAI-Transcribe-2語音轉錄模型,此次再推出MAI-Transcribe-2-Streaming,將自研語音辨識能力延伸至即時串流場景。MAI-Transcribe-2-Streaming會隨後續語音內容持續修正轉錄結果,讓語音代理人能在使用者尚未說完時開始推理或呼叫工具。

根據Artificial Analysis的即時串流語音辨識評測,MAI-Transcribe-2-Streaming在最終轉錄與部分轉錄結果的準確度均排名第一。在準確度與延遲的綜合評估中,該模型也位居前段,顯示其能兼顧高準確度與低延遲。

同步更新的MAI-Voice-2.1與MAI-Voice-2.1-Flash皆支援23種語言與26個地區,可讓同一組合成聲線跨語言輸出,並在不同語言間維持一致的說話者特徵。此外,兩款模型也支援以數秒參考音訊複製特定聲音。

兩者主要差異在定位。MAI-Voice-2.1著重語音品質與自然度,適合內容製作、配音及長篇語音生成;MAI-Voice-2.1-Flash則針對語音助理、客服等大量且要求低延遲的即時應用最佳化,相較標準版速度更快、價格也較低。

價格方面,MAI-Transcribe-2-Streaming今年底前優惠價為每小時音訊0.54美元;MAI-Voice-2.1與Flash則依輸入文字量計費,每100萬個字元分別為22美元與15美元。