新聞

Google推出語音轉文字模型Gemini 3.5 Transcribe,目前在Gemini API與Gemini Enterprise Agent Platform以公開預覽形式提供,可把錄音或即時語音轉成文字,並自動移除「嗯」、「啊」等口語贅詞、處理說話者中途更正,整理標點符號、數字和段落格式。模型也支援自動語言辨識、自訂專有詞彙,以及錄音檔的說話者區分和字詞級時間戳記,可用於即時字幕、語音代理、會議紀錄及通話分析。

Gemini 3.5 Transcribe分成即時與錄音檔兩種版本,即時版本gemini-3.5-transcribe-live透過Live API處理持續傳入的語音,Google表示延遲低於1秒,而錄音檔版本gemini-3.5-transcribe則可處理會議、訪談與通話錄音,並提供較完整的說話者辨識與時間標記功能。

其中的智慧轉錄功能會先理解說話內容,再整理成較容易閱讀的文字,例如說話者說「星期二,不對,星期三」,模型可依後面的更正留下星期三,也能刪除重複語句及口吃內容,並自動整理日期、金額與清單格式。如果需要完整保留原本說法,則可改用逐字轉錄模式,智慧轉錄無法與區分說話者功能或字詞級時間戳記同時使用。

錄音檔版本最多可區分8名說話者,將不同人的發言分開標示,不過Google表示,3名以上說話者的發言歸屬判定仍屬實驗功能。模型可自動辨識85種以上語言,並接受最多1,000個自訂詞彙,協助辨識產品名稱、縮寫或專業術語,Google表示,通常在100個以內效果較佳。

Google引用Artificial Analysis測試指出,Gemini 3.5 Transcribe的平均字詞錯誤率,在即時轉錄為4.0%,錄音檔轉錄為2.6%,數值越低代表辨識錯誤越少。Google也表示,相較前一代Chirp 3,產生最終轉錄結果所需時間縮短70%。

錄音檔版本單次最多可處理1小時音訊,啟用說話者區分或字詞級時間戳記後降為30分鐘,而即時版本每次最長10分鐘。目前Google公布的語言清單列有簡體中文(cmn-Hans-CN)與繁體粵語(yue-Hant-HK),尚未列出臺灣華語對應項目。