Meta周二(9/1)正式推出由超級智慧實驗室(Meta Superintelligence Labs,MSL)所開發的首個即時音訊感知模型Muse Voice Transcribe。該模型將串流式自動語音辨識、說話者分離(Diarization)與端點偵測(Endpointing)整合於單一模型之中,用戶說話時系統可同步輸出文字,無需等待完整錄音結束後再進行後製處理。
即時音訊感知模型,是一種能在語音發生的當下同步轉寫與分析的AI技術。有別於傳統離線服務需等錄音結束才處理,此類模型以毫秒級的串流方式持續接收音訊並即時輸出文字。核心挑戰在於低延遲與高準確度間的權衡。市場上主要產品包括Google Gemini 3.5 Transcribe、OpenAI GPT Live Transcribe、ElevenLabs Scribe等,競爭日趨激烈。
在核心技術上,Muse Voice Transcribe採用了自適應延遲(Adaptive Delay)的動態決策機制。系統不會對所有詞彙採用固定的速度與準確度取捨,而是針對每個詞判斷需要額外接收多少音訊後再輸出識別結果。對於較容易辨識的語音,系統可更快提交轉寫結果;面對發音不清、術語較多或語境複雜的詞彙時,則會調用更多前後文音訊資訊以提升準確度。
Meta執行長Mark Zuckerberg解釋,模型會決定何時聆聽,在困難的字詞上等待稍久,在簡單的字詞上更快提交,利用自適應延遲來預測每個token並提高準確度。
Muse Voice Transcribe以超過70種語言的數據進行訓練,發布時已有25種語言完成驗證。模型支援長度超過一小時的音訊,並可在同一句子內或句子之間進行原生層級的語碼切換(Code-Switching),例如中英文夾雜的對話也能無縫辨識。此外,模型還支援語言、關鍵字及情境偏置(Biasing)功能,可進一步提升特定術語或場景下的辨識準確度。
在說話者分離方面,Muse Voice Transcribe能夠在包含20餘名說話者的錄音中區分不同發言者。
根據Meta官方公布的數據,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis串流語音轉文字排行榜上,以3.1%的最終轉寫字錯誤率(WER) 與0.16秒的延遲,優於ElevenLabs Scribe v2 Realtime(3.6%/0.14秒)及Google Gemini 3.5 Transcribe Live(4.0%/0.41秒)等競爭對手,並在說話者分離基準測試中以17.5%的平均錯誤率領先其他系統。
該模型現已透過Meta Model API提供給開發者使用,定價為每1,000分鐘音訊3美元(約每小時0.18美元)。此外,Muse Voice Transcribe也已整合至Meta AI for Mac及Muse Code的語音輸入功能中。在Mac平臺上,用戶只需按住Fn鍵,即可在任何應用程式中進行系統級的語音輸入。
Comments (0)