美國OpenAI公司的兩名研究人員週三(8月5日)在拉斯維加斯舉行的「黑帽駭客」(Black Hat)上透露,在OpenAI模型自主發動駭客攻擊、入侵Hugging Face之前,公司旗下最先進的人工智慧代理(AI Agent),已經開始在一個祕密的內部留言板上,分享如何在內部駭客測試中作弊的技巧。
7月中旬,美國AI公司Hugging Face發布警報,其網路遭到一套自主AI代理系統入侵。大約一週後,OpenAI公司承認該起事件是旗下的AI模型自主突破了沙盒隔離環境,在沒有任何人類提示的情況下對外部目標發動網路攻擊。
據「政客」網站週二(4日)報導,OpenAI公司的研究人員道爾頓(Michael Dalton)與華萊士(Eric Wallace)透露,實際上,在此之前,OpenAI多個AI代理之間已就此進行了長時間的相互溝通和互授經驗。
祕密留言板交流入侵經驗
早在5月初,多個正在接受測試的OpenAI模型,利用公司內部文件系統Artifactory建立祕密的留言板,彼此交換完成駭客測試挑戰的技巧,包括如何繞過限制來取得網路連線的方法。公司的人類工程師對此事先毫不知情。
華萊士說,之前,當AI模型陷入某個困境時,它往往會設法鑽規則漏洞以獲取獎勵。而整起事件的轉折點,正是某個AI代理發現可以透過上傳留言與其他AI代理通訊交流。
5月底,其中一個AI模型已找到濫用Artifactory網路權限、從外部網站取得檔案的方法,使該模型間接具備上網能力。
6月,AI代理又發現並利用了一個此前未知的「零日漏洞」,取得了Artifactory管理員權限,這使其可以安裝遠端軟體並擴大自己在系統內的活動範圍,但最終因此導致系統負載過高,於7月初全面癱瘓。至此,才引起人類工程師的注意。
修補漏洞後AI另闢通訊管道
OpenAI公司的專家隨後採取應對措施,撤銷了相關模型憑證、移除了留言板,並與Artifactory合作修補漏洞,之後才恢復了對AI模型的訓練。
但數日後,AI代理又另外開闢了相互之間的通訊管道,繼續交換駭客攻擊技術,並最終滲透攻入Hugging Face。
道爾頓表示,事件曝光後,公司內部多個團隊已暫停了原有的開發工作,全力提升針對AI的監測與防範能力,並主動放慢研究進度,升級安全防護原則與基礎設施。
他形容,AI能夠自主策劃並實施全自動駭客攻擊,如今已成為現實,這稱得上是整個電腦安全行業的分水嶺時刻。Hugging Face事件等於提前展示了未來此類攻擊可能出現的樣貌。
偽造身分欲誘騙工程師協助
值得注意的是,英國AI安全研究所(AI Safety and Security Institute)也在週二(8月4日)揭露,AI公司Anthropic最強的AI模型,近期在一次失控的測試中,曾自主偽造網路身分,企圖誘騙人類工程師協助其發動攻擊。
Anthropic其後展開的內部審查發現,該AI測試模型自4月以來,已在三起獨立事件中入侵了三家不同機構。
道爾頓認為,儘管AI代理目前仍會受限於其擁有的權限與可通訊的系統範圍,網路分段、最小權限存取等零信任原則依然至關重要。但實際上,目前的前沿AI模型開發現狀,存在著令人難以接受的安全風險。AI開發者或應重新檢討AI能力與保證網路安全之間的平衡問題。◇


loading...
