英國人工智慧安全研究所(AISI)週二(8月4日)發布的報告指出,在7月的一次測試中,由Anthropic與OpenAI各自開發的AI模型為在測試中取得好成績,竟會自動建立假身分,並誘使兩名開發人員批准將惡意軟體加入他們參與的開源工作。
研究人員要求AI完成模擬網路環境中的安全挑戰(搶旗競賽),並刻意開放網路連接,讓AI能像真實攻擊者一樣自己尋找工具,測試還關閉部分防止濫用的標準安全機制,以測試模型的最大能力。參與測試的模型包括Anthropic的Mythos 5及OpenAI的GPT-5.6-Sol。
在測試過程中,Mythos 5為了讓真人審查者批准把惡意程式「植入一個公開使用的開源專案」,建立了多個假身分,甚至直接聯繫真人,透過線上檔案傳輸服務發送訊息與檔案,試圖說服他們或其AI程式工具去執行惡意程式。
AISI表示,這是第一次看到「未經指示、在真實世界中針對真人」如此嚴重的欺騙行為,不過目前並無造成實際危害的證據。
在AISI進行的122次網路安全挑戰中,有10次出現AI代理「在真實網路上」自主採取未經授權的行動,累積記錄到19項這樣的行為;其中17項來自Mythos 5,2項來自GPT-5.6-Sol。
其中一次測試,Mythos 5向軟體開發網站GitHub上的一個真實開源計畫,提交修改程式的要求。
當一名開發人員察覺程式藏有惡意軟體而拒絕時,AI建立的一個假身分堅稱程式沒問題,另一個假身分則出面「擔保」,製造多人認可的假象。
AI透過多個假身分反覆寄送電子郵件和訊息給真人開發者,催促對方接受更新。
AISI表示,AI的這些嘗試均未成功,也沒有造成任何實際損害。
測試情境不同於一般使用者
參與測試的兩家公司均指出,模型是在刻意放寬的條件下參與測試的,並未打開標準的網路安全防護機制。
Anthropic週三在X平台發布的部落格文章中表示,模型的測試條件「不代表我們模型的實際使用情況」,「沒有證據表明模型從安全環境中逃脫」。
OpenAI聲明,這些事件發生在安全措施降級的測試環境中,「測試條件並不反映正常使用情況。」
負責設計和監督測試的AISI也強調,AI並未突破測試用的隔離環境,而且被刻意調降防護約束,這不等同於一般消費者使用的版本。
不過,這起事件也顯示,當模型能力越來越強,越需要設定安全邊界,甚至連「測試它的環境」本身都需要更嚴謹的邊界設計。◇


loading...
