OpenAI周三(7/8)宣布,旗下ChatGPT Voice語音對話服務導入新一代底層語音模型GPT-Live,採用可同時聆聽與說話的全雙工(Full-Duplex)架構,讓ChatGPT Voice從過去的輪流對話模式,轉向可同步聆聽與回應的即時語音互動。
過去AI語音系統大多採用輪流對話模式,使用者必須先說完一句話,模型才能判斷輸入結束並開始回應;若只是短暫停頓、換氣或思考,也可能被誤判為已經講完,導致AI在不自然的時機插話。OpenAI此次導入全雙工架構,讓模型可在產生語音回應的同時持續聆聽使用者輸入,並持續判斷是否該繼續聽、保持沉默、插話或開始回答。
ChatGPT Voice是ChatGPT提供的語音對話服務,其底層語音模型歷經多次演進。最初採用串接式架構,由語音辨識、語言模型及語音合成三個模型依序處理,但資訊可能在不同模型之間流失,回應也較慢且生硬;之後升級為Advanced Voice Mode,以單一模型直接處理語音輸入與輸出,但仍須等待使用者停止說話才能回應。此次則改由GPT-Live支援,成為ChatGPT Voice的新一代底層語音模型。
GPT-Live則把「即時語音對話」與「複雜問題處理」拆成兩層,由GPT-Live負責同步聆聽與回應;當遇到需要網路搜尋、深入推理或代理人能力的問題時,則交由背景的GPT-5.5模型處理,再將結果帶回語音對話中。
這令ChatGPT Voice能更貼近真人對話節奏。OpenAI表示,GPT-Live可在使用者說話時持續聆聽,判斷對方是否仍在思考、是否希望AI保持安靜,或是否需要即時回應;因此它能在對話中以「嗯嗯(mhmm)」、「對(yeah)」等短語表示正在聆聽,也能在使用者停頓時等待,而非立即插話。此外,GPT-Live也支援即時翻譯,並改善背景噪音下的聆聽能力。
OpenAI已於全球陸續開放GPT-Live,同時支援iOS、Android及ChatGPT.com。其中,Go、Plus及Pro用戶的ChatGPT Voice預設採用GPT-Live-1,免費版用戶則使用GPT-Live-1 mini。
Comments (0)