新聞

OpenAI推出研究級基準測試GeneBench-Pro,用來衡量AI模型在計算生物學任務中處理雜亂資料、判斷分析方向,以及評估研究結果能否支持後續決策的能力。相較於測驗模型是否記得知識或能否依照固定流程完成任務,GeneBench-Pro更接近專業研究工作中常見的判斷情境,評估模型在模糊條件下選擇方法、修正假設與完成分析的能力。

GeneBench-Pro是在GeneBench基礎上推出的新基準測試,任務涵蓋基因體學、定量生物學與轉譯醫學等範圍。OpenAI說明,GeneBench-Pro共有129個問題,分布在10個領域與21個子領域,包括統計遺傳學、族群遺傳學、功能基因體學、蛋白質體學、臨床與藥物基因體學、癌症基因體學與微生物基因體學等。

每一道GeneBench-Pro題目都會提供模型一組接近真實研究情境的資料集、簡短實驗背景,以及和後續決策相關的估算目標。模型必須先探索資料,再選擇適合的分析方法,經過反覆實驗與修正後提出最終答案。OpenAI將這類能力稱為研究判斷力(research taste),指的是研究者在分析過程中判斷資料能支持什麼問題、初步診斷如何影響模型設定,以及何時需要調整原本計畫的能力。

GeneBench-Pro試圖避開傳統長流程基準測試常見的問題,OpenAI指出,若題目使用歷史資料,可能會出現多種合理分析路徑,導致評分反映的是出題者偏好,而非模型能力,而若題目對數值結果不敏感,模型即使採用錯誤分析方法也可能通過。因此GeneBench-Pro以合成資料建構題目,由OpenAI掌握完整因果結構並直接模擬資料生成流程,並透過消融測試與解題軌跡分析,檢查題目是否存在捷徑或資訊洩漏。

OpenAI也將其中82題交由外部領域專家審查,審查者包括研究生、博士後研究員、產業科學家與教授,檢視題目貼近真實研究情境的程度、目標答案的可判定性,以及方法與估算方式的合理性。OpenAI目前已在Hugging Face開源10道代表性GeneBench-Pro題目,並提供互動式介面供外部查看,並表示,後續將提供50題子集給Artificial Analysis進行第三方獨立評測。