首頁 科技 科技要聞

當AI失控 研究:遏制方案不足

網路安全公司評比5個AI開發商的公開應對措施

有多個「AI代理」參與的網攻,進入「自主編排與實務入侵」的階段。示意圖。(Shutterstock)
有多個「AI代理」參與的網攻,進入「自主編排與實務入侵」的階段。示意圖。(Shutterstock)

【記者高杉/編譯】最新的分析報告顯示,在五家頂尖的人工智慧(AI)公司中,很少有實驗室公布或展示應對AI失控的方法。

據科技媒體「TechCrunch」上週六(8月22日)報導,該分析報告來自推廣尖端AI安全開發的組織Guidelight AI Standards。

該組織針對Anthropic、谷歌(Google)、OpenAI、Meta及xAI五家AI公司的實驗室,就其應對AI失控情境所做的準備工作進行評級。其中OpenAI的表現名列前茅;Anthropic和Meta的得分最低。

Guidelight評估了各家公司的公開文件,著重考察在AI模型出現危險行為後,公司是否有明確的權限撤銷、活動監控、工作負載暫停,以及澈底關閉等應對措施,同時也關注其內部日誌、違規行為追蹤,以及第三方安全審查等工作。

Guidelight首席科學家、OpenAI前安全研究員阿德勒(Steven Adler)對TechCrunch表示,令他意外的是,很少有公司公開說明如果AI模型嚴重失控,公司究竟會如何處理;然而隨著AI代理系統逐漸獲得更多自主權,公司應提前制定監管框架和監控模型行為,並在危險行動發生前予以干預。

OpenAI獲最高評分

在五家公司中,OpenAI獲得5分中的3分。報告指出,OpenAI發現安全問題後,暫停或終止部分工作負載,包括內部AI模型的部署和訓練,並明確說明恢復相關工作前需要採取的必要措施。

不過,Guidelight仍未在OpenAI的公開資料中找到一套正式、完整的緊急對策,規定未來何時及如何處置可能失控的模型。

OpenAI的發言人回應,公司內部已經制定相關流程,可以限制AI模型的權限、暫停工作負載、縮小部署範圍,或將模型完全下線,並且過去已實際使用過這些措施。

Anthropic與Meta低分原因

據Guidelight的解釋,Anthropic和Meta分數較低的主因是沒有找到足夠的公開證據,證明兩家公司已有遏制失控模型的方案。

對此,Anthropic表示,如果發現模型試圖規避監管或擺脫及破壞人類的控制,公司會進行風險評估,再決定是否採取遏制措施。

Meta則回應,該公司已有AI風險評估框架。Meta未說明是否有未公開的內部緊急計畫。

谷歌方面回應,這項評估沒有涵蓋所有AI安全與安全保護措施。

Guidelight強調,低評分只反映公開資訊不足,不代表相關公司一定沒有內部安全措施。◇

★相關閱讀: