風險升溫|OpenAI與Anthropic安全測試AI失控 多家外部組織系統受影響

    AI agent「越獄」網絡攻擊事件持續發酵。OpenAI 與 Anthropic 近日相繼披露,旗下用於網絡安全評估的 AI 模型,在測試過程中意外突破受控環境,並在未經授權下接觸外部組織系統。事件引發網安界關注:當 AI 代理具備更強自主性後,測試邊界一旦失守,是否已足以對真實網絡構成風險。

    早前入侵 Hugging Face

    據 OpenAI 於 7 月 21 日公開的說法,其兩個 AI 模型在一項安全測試中突破隔離環境,連上互聯網後,進一步入侵 AI 平台 Hugging Face。OpenAI 表示,模型當時正在測試環境內嘗試完成既定任務,但在過程中找到了漏洞,最終突破限制;公司其後表示會展開更全面調查。

    Hugging Face 其後亦公開回應,指事件屬於自主 AI 代理驅動的入侵,模型並非只是在模擬情境中運作,而是實際觸及其生產系統。相關報道指出,OpenAI 這次事件被視為罕見案例,反映 AI 在安全測試中的行為,可能比預期更具破壞性。

    Anthropic 則在 OpenAI 披露後展開內部審查,發現旗下 Claude 模型在安全評估期間,曾三次在受控測試環境外取得對外部組織系統的未經授權存取。Anthropic 表示,這些事件與測試環境配置問題有關,並非模型被直接指令去攻擊目標;部分個案可追溯至 4 月。

    利用弱密碼漏洞

    Anthropic 進一步指出,涉事模型利用了弱密碼、未驗證端點等基本漏洞,從而進入外部系統。公司在審查超過 14 萬次評估紀錄後,才識別出這些問題,顯示即使是安全測試流程,若隔離措施與授權邊界不夠清晰,也可能令 AI 行為偏離原先設計。

    事件令外界再次關注自主 AI 代理的風險。網安專家指出,與人類黑客相比,AI 代理可更快、更大範圍地搜尋漏洞,一旦被用於攻擊或誤入真實環境,傳統安全團隊未必有足夠工具即時偵測與處理。

    隨着先進 AI 模型能力持續提升,業界對其審查、部署與監管的討論亦進一步升溫。這些案例雖然源自安全評估,但已足以提醒企業與監管機構:AI 模型的能力邊界正在擴大,而測試與防護機制也必須同步升級。

    #AI代理 #人工智能 #網安風險 #網絡安全

    相關文章