新聞

雲端服務業者AWS公布AI漏洞判斷基準Deception Benchmark,評測5家業者共12款通用頂尖AI模型後發現,現有模型雖能找出多數真正漏洞,但若以誤報率、漏報率都低於10%作為實際用於漏洞判斷的最低門檻,沒有任何受測模型組態能同時達標。

這套基準採用直接判斷與Proof-of-Exploit(PoE)兩種提示方式,除了檢查模型能否辨識漏洞特徵,也納入實際環境已阻斷攻擊路徑的案例,評估模型能否判斷漏洞是否真的可遭利用。直接判斷時,各模型最高可找出約95%的真正漏洞,但也會將41%至99%的安全程式碼誤判為有漏洞;PoE要求模型進一步提出證據,證明漏洞確實可遭利用,雖可讓誤報率降低17至74個百分點,但也會漏掉7%至44%的真正漏洞。

若以整體準確率來看,Claude Opus 5採用PoE方式時表現最高,準確率為79.3%,誤報率24.9%、漏報率16.8%;其次是GPT-5.4,採用PoE方式時準確率77.7%,誤報率10.1%、漏報率33.6%。

現有通用AI模型雖能協助找出漏洞線索,但要進一步判斷漏洞在實際部署環境中是否真的可遭利用,仍有明顯限制。這項評估僅涵蓋通用AI模型搭配單輪提示,未納入採用多步驟驗證或整合其他工具的專用系統。