應用程式安全業者Aikido Security近日公布13款AI模型的漏洞辨識能力評測結果,比較不同模型的漏洞辨識能力與執行成本。研究人員將含有漏洞的程式碼片段交由漏洞分析代理分析,測試模型是否能理解程式執行流程、判斷漏洞是否可遭攻擊者利用,並正確辨識安全問題,而非評估模型自行從大型程式碼儲存庫找出漏洞位置的能力。
研究人員從GitHub安全公告資料庫(GitHub Advisory Database)挑選26個CVE,並以Aikido實際使用的AI Code Analysis程式碼安全分析框架測試13款模型。每款模型針對每個CVE執行3次;同一CVE只要在任一次執行中成功辨識,便納入彙整結果。
結果顯示,GPT-5.6系列彙整3次執行結果後,最高辨識26項漏洞中的23項,在受測模型中居冠;Grok 4.5辨識20項,Claude Opus系列模型辨識15至18項,開放權重模型GLM-5.2則辨識16項,表現與部分專有模型相近。
評測也顯示,同一模型在不同次執行中,辨識出的漏洞可能有所不同,因此將費用較低的模型執行多次並合併辨識結果,可能取得與高價模型相當的成果。GPT-5.4 nano單次最高辨識13項漏洞,執行3次並合併辨識結果後,可辨識18項,與GPT-5.6 Terra單次執行平均辨識18項的成果相當;GPT-5.4 nano執行3次的成本合計約170美元,整體成本明顯低於GPT-5.6 Terra單次執行成本。
Comments (0)