微軟上周公布自有開發的模型,包括圖片生成的MAI-Image-2.5-Pro及MAI-Voice-2-Flash,意在取代OpenAI GPT模型。
MAI-Image-2.5-Pro是最新高品質圖像生成模型,為需要視覺準確度、一致性和創意控制的使用情境而設計。MAI-Voice-2 Flash則是為毫秒必爭的低延遲度語音應用而設計。
微軟希望透過自主研發模型逐步取代OpenAI技術。在MAI-Image-2.5上線後,現在Bing Image Creator已100%使用微軟自行開發的模型。微軟毫不避諱地表示MAI模型比OpenAI模型使用成本來得低。例如在PowerPoint中MAI-Image-2.5的GPU成本比OpenAI GPT-Image-2低了84%。微軟並號稱,最新的MAI-Voice-2比GPT模型的GPU成本低了89%。
MAI-Image-2.5-Pro在Azure Foundry上線
MAI-Image-2.5-Pro適用於圖像設計專業團隊。其視覺一致性適合產品文宣、品牌元件、數位廣告、看板設計的多格說故事(multi-frame storytelling)文本;或是在多角度、不同色彩變化及多變情境設定中,維持零售業產品和電玩遊戲人物或物件精確性不變;更強大的視覺推論可以更精確詮釋鏡頭方向、光線和指令推進。而在醫療、金融服務、製造和其他高度受法令控管的產業,則能設計需要高準確度內容。
微軟說明,MAI-Image-2.5-Pro比前版MAI-Image-2.5更適合需要頂級圖像忠實性和品質、需要連續性物件一致性、工作流需要視覺推論、世界知識和確實遵循設計指令,而且是設計專業行銷文案、廣告、產品設計或企業設計資產。
MAI-Voice-2 Flash上線並整合進Dynamics 365
MAI-Voice-2 Flash是以文字生成語音的模型,強調比MAI-Voice-2回應速度更快,成本更低,且支援超過15種語言。它適合用於生成客服中心代理人、口語化語音助理、互動語音回應(IVR)系統。
MAI-Image-2.5-Pro現在於Microsoft Foundry上線,以價格而言,文字輸入/圖像輸出分別為百萬token 5美元/106美元。MAI-Image-2.5文字及圖像輸入各為5、8美元。圖像輸出為百萬token 47美元。
MAI-Voice-2 Flash則在語音代理人開發平臺Azure Speech上線,並且整合到Azure Voice Live API,價格為百萬字元(character)15美元。MAI-Voice-2價格則為22美元。此外,它也成為微軟Dynamics 365 Contact Center雲端客服中心代理人的基礎模型。
至於先前推出的MAI-Image-2.5,微軟宣布它現在成為PowerPoint及OneDrive主要影像編輯場景的預設模型。
Comments (0)