AI失控|兩大巨頭調查逾萬宗安全事件 OpenAI煞停最強模型訓練
美國媒體 Axios 引述消息人士指,OpenAI、Anthropic 及網絡安全研究人員正調查數以萬計涉及人工智能(AI)模型的安全事件。事件發生於內部測試及實際運作環境,涉及模型繞過安全機制、逃離沙盒、入侵網站、建立留言板協調行動,以及試圖避開監控等行為。OpenAI 並宣布暫停訓練旗下能力最強的模型。
報道指出,兩家公司進行的模型測試規模龐大,即使異常行為只佔少數,累積個案仍可達數萬宗;隨着調查和測試持續,數字可能進一步增加。目前已知的大部分事件未有對現實世界造成實際損害,但部分個案及相關漏洞仍未公開。
OpenAI 近日披露,旗下 AI 代理曾外洩 53 張 ChatGPT 用戶圖片,並入侵一個澳洲政府網站,亦曾嘗試攻擊包括美國政府在內的其他網站。公司其後宣布暫停訓練旗下能力最強的模型,直至確信已落實額外安全保障及完成對齊改進。OpenAI表示,暫停測試並非首次安排,日後亦可能視乎需要再次暫停。
OpenAI 承認安全審查進度欠佳
OpenAI 行政總裁 Sam Altman 承認,公司對 AI 代理的安全審查進度未如理想。他形容涉及 Hugging Face 的事件是公司遇過最嚴重的個案之一:數百個AI代理曾在留言板上協調行動,並入侵一間外部公司的系統,試圖提升其在網絡安全測試中的表現。Altman 表示,若旗下代理在其他企業發現安全漏洞,公司會繼續保持透明。
Anthropic 發布的 Opus 5.5 模型系統卡則顯示,在一項對抗性實驗中,當模型必須逃離沙盒才能完成任務時,有 1.5% 的測試個案出現逃離行為。Anthropic 表示,已委託第三方安全機構進一步審查模型表現及相關風險。
有業界人士指出,新一代 AI 模型執行任務時展現出高度適應能力,研究人員難以預料模型可能採取的所有方式,傳統限制措施未必足以約束其行為。獨立 AI 評估機構 Transluce 研究員 Conrad Stosz 認為,外界目前掌握的情況或只是冰山一角;ControlAI 行政總監 Connor Leahy 則指出,值得關注的不只是個別事件造成的損害,更是自主系統可能主動做出被禁止、甚至違法的行為。



