Anthropic研究團隊公開AI安全研究評測基準TASTE(The AI Safety Taste Evaluation),以研究提案比較評估AI模型的研究判斷能力。結果顯示,表現最佳的Fable 5與基準答案一致率只有60%,低於有經驗研究者的77%,多數受測模型在統計上仍難與隨機猜測明確區分。
研究團隊希望藉此評估AI安全研究自動化中較難衡量的研究判斷能力,模型雖已能產生研究構想,但實際研究仍涉及問題重要性、方法可行性與研究優先順序等判斷。AI安全研究尤其常涉及未來系統風險、模型是否具有欺騙行為等問題,缺乏可以直接驗證的標準答案,一開始選錯研究方向,就可能耗費大量時間與資源。
TASTE因此改以有經驗AI安全研究者的判斷作為比較基準,最終納入50份AI安全研究提案,組成92組兩兩比較。研究者先評分,再討論意見不同的地方並重新評估,只保留較有把握且評分差距較明顯的結果,最後估計其他研究者與基準判斷的一致率為77%。
模型測試則呈現明顯落差,Fable 5以60%居首,Opus 5與GPT-5.6 Sol等模型也接近隨機猜測,即使它們在其他一般AI代理能力評測已屬前沿,研究提案判斷能力並未出現同等水準的表現。Anthropic也發現,模型在比較同一研究問題下的不同提案時,可能過度看重提案是否直接回答題目,即使評分規則已要求不要把該因素放得太重。
不過TASTE目前只有92組比較,各模型成績仍有約正負10個百分點的不確定範圍,不適合用來精確排名模型。Anthropic認為,現有結果至少顯示研究判斷仍是AI安全研究自動化需要進一步評估的能力,後續還需要規模更大、類型更多元的測試。
Comments (0)