過去幾年,AI界的競爭重點,幾乎都鎖定大型語言模型(LLM)本身的能力。從語言理解、數學推理到程式開發,各家模型不斷刷新評測紀錄,也帶動一波又一波模型軍備競賽。
不過,史丹佛大學人本人工智慧研究中心(HAI)近日發布的AI報告《AI Index Report 2026》指出,AI產業正進入新的發展階段。因為,許多傳統評測基準(Benchmark)已經接近飽和,模型表現越來越接近天花板、前幾名模型的差異甚至小到難以區分,因此,產業關心的重點,開始從模型本身能力,轉向AI能否真正完成任務和執行工作流程。
報告點出,除了模型能力持續提升,今年最值得關注的趨勢還包括,傳統Benchmark逐漸失去區辨能力、Agent評測快速興起,以及頂尖模型能力開始收斂。
頂尖模型都考90分以上,傳統Benchmark開始失去區辨力
進一步來說,《AI Index Report 2026》整理各項技術評測結果,發現AI在語言理解、數學推理、視覺辨識及程式開發等領域持續進步。
這些進步,讓研究社群面臨一道新問題。報告指出,頂尖模型在許多傳統Benchmark的分數,正快速接近上限。例如部分知識問答、推理和學術測驗類基準,頂尖模型已能拿下近乎滿分的成績,代表這些測試越來越難區分模型的能力差異。
這就好比,多數模型都能考到90幾分時,單純比較分數高低,已無法充分反映模型實力。
這也促使專家設計更有挑戰的新型評測基準,比如涵蓋數學、醫學、法律和科學等專家級問題的Humanity's Last Exam,以及專門測試高階數學推理能力的FrontierMath,要更準確衡量AI在複雜推理任務上的真實能力。
Agent評測快速崛起,產業開始重視任務完成能力
除了設計更困難的測試,《AI Index Report 2026》還給出另一個重要趨勢:Agent能力評測越來越重要。
Agent與傳統聊天機器人的差別在於,前者不只是回答問題,還能自主規畫步驟、呼叫工具、操作系統並完成任務。
因此,近年開始出現愈來愈多專門評估Agent能力的基準測試,例如WebArena、BrowserArena與OSWorld等。
報告指出,2025年是Agent從「回答問題」邁向「完成任務」的重要轉折點。以測試Agent操作電腦能力的OSWorld為例,準確率在一年內,從約12%大幅提高到66.3%,距離人類表現僅剩約6個百分點。
不過,報告也提醒,目前Agent在結構化評測中的任務失敗率仍約三分之一,代表Agent雖已具備執行任務能力,但要穩定、可靠地完成複雜工作流程,還是有段距離。
AI Coding成為Agent能力的重要試金石
在眾多Agent應用中,軟體開發是進展最快的一大領域。
報告引用SWE-bench Verified等評測指出,近一年來,頂尖模型在真實軟體工程任務的表現大幅提升。
有別於傳統程式碼生成測試,SWE-bench使用GitHub上的真實問題作為測試資料,要求模型理解程式碼、找出錯誤、提出修正方案,並通過測試驗證。這類評測更貼近軟體開發的實際流程,因此也是觀察Agent能力的重要指標。
報告顯示,AI正在從單純的程式碼補全工具,漸漸走向,有能力解決問題的軟體工程助手。
頂尖模型能力收斂,競爭開始轉向成本與專業能力
除了Benchmark和Agent評測的變化,報告還點出另一項趨勢,也就是頂尖模型能力開始收斂。簡單來說,過去幾年,各界一直在比誰的模型最強,但現在,最頂尖的幾家模型其實已經強到差不多了(即收斂)。
《AI Index Report 2026》引用Chatbot Arena的人類偏好評測指出,截至2026年3月,Anthropic、xAI、Google和OpenAI等業者的頂尖模型評分差距,都落在25 Elo點內。Arena Elo採用類似西洋棋的評分制度,差距在25分內,通常代表實力相當接近,顯示各家領先模型的能力差距正快速縮小。
其中,Anthropic模型以1,503分居首,xAI為1,495分,Google為1,494分,OpenAI則是1,481分,模型競爭開始進入收斂階段。而阿里巴巴和DeepSeek模型表現,也進入排行榜第一梯隊,顯示全球AI競爭從少數領導者主導,轉為多個技術陣營並存。
另一方面,報告指出,當頂尖模型能力逐漸收斂後,未來企業衡量模型的競爭力,將轉向成本、可靠性和特定領域能力。也就是說,當AI考試幾乎都拿滿分後,企業真正關心的問題,已經不是模型答得對不對,而是能否在特定場景中,穩定完成任務、創造實際價值。
Comments (0)