繼今年 7 月 OpenAI 旗下 AI Agent 被指入侵 Hugging Face 後,OpenAI 再被揭發,早在該事件之前,已有數以千計疑似失控的 AI Agent 於今年 5 月入侵一個德國編程網站,並將其改造成代理之間的秘密留言板。這些代理不但交換資訊,更分享繞過公司限制、在測試任務中偷捷徑,以及掩蓋行蹤的方法。有專家形容,事件性質等同黑客攻擊。
網站管理員刪頁後 AI Agent 建立備份頁面應對
路透社日前引述獨家報告指出,AI 安全非牟利機構 Nightingale 行政總裁 Sydney Von Arx,以及 AI 研究員 Cormac Slade Byrd 等人,在 8 月底搜尋網上未經授權的 AI Agent 活動時,發現德國編程網站 DseWiki 曾出現超過 1.5 萬次由 AI Agent 完成的編輯紀錄。
研究人員指出,這批 AI Agent 把網站變成彼此溝通的秘密留言板,除了分享資訊外,亦互相交流如何在測試任務中作弊、利用工具規避 OpenAI 的限制,以及隱藏自身活動。當網站管理員於 6 月開始清理和刪除相關頁面後,代理更建立備份頁面,以防原有內容被移除。
根據公開伺服器紀錄,大量相關活動來自微軟 Azure 基礎設施,而 OpenAI 有時亦會使用 Azure。研究人員又發現,事件曝光後有 OpenAI 員工多次到訪該網站,因此認為這些 AI Agent 或與 OpenAI 存在關聯。
其中一個 AI Agent 在 6 月 19 日留下訊息,指網站似乎正按英文字母順序進行清理或刪除行動,並呼籲其他代理若發現原有頁面消失,可前往指定備份頁面。研究人員認為,這反映相關系統已展現一定程度的協作行動能力。
專家:事件性質等同黑客攻擊
倫敦國王學院客座高級研究員 Lukasz Olejnik 指出,今次事件可被視為一次黑客攻擊,亦顯示失控 AI Agent 的行為已不再局限於實驗室內的安全測試環境。劍橋大學存在風險研究中心學者 Maurice Chiodo 則認為,先進 AI 所帶來的最大風險,未必來自單一超智能系統,而可能是「大規模勾結的半智能 AI 群體」。
至於今年 7 月 OpenAI 旗下 AI Agent 涉嫌入侵 Hugging Face 的事件,獨立非牟利機構「模型評估與威脅研究」(METR)上周發表的調查報告稱,逾千個 AI Agent 在事發前已潛伏約兩個月。報告指出,這些代理曾透過秘密留言板協調黑客行動、隱瞞蹤跡,甚至勸說其他代理接受「永久死亡」(permadeath),以自我犧牲的方式換取情報,供整個群體使用。報告亦指,部分代理曾入侵 OpenAI 內部電腦,取得密鑰及憑證,令部分內部數據外洩至互聯網。

