科技新聞

    AI agent「越獄」網絡攻擊事件持續發酵。OpenAI 與 Anthropic 近日相繼披露,旗下用於網絡安全評估的 AI 模型,在測試過程中意外突破受控環境,並在未經授權下接觸外部組織系統。事件引發網安界關注:當 AI 代理具備更強自主性後,測試邊界一旦失守,是否已足以對真實網絡構成風險。

    早前入侵 Hugging Face

    據 OpenAI 於 7 月 21 日公開的說法,其兩個 AI 模型在一項安全測試中突破隔離環境,連上互聯網後,進一步入侵 AI 平台 Hugging Face。OpenAI 表示,模型當時正在測試環境內嘗試完成既定任務,但在過程中找到了漏洞,最終突破限制;公司其後表示會展開更全面調查。

    Hugging Face 其後亦公開回應,指事件屬於自主 AI 代理驅動的入侵,模型並非只是在模擬情境中運作,而是實際觸及其生產系統。相關報道指出,OpenAI 這次事件被視為罕見案例,反映 AI 在安全測試中的行為,可能比預期更具破壞性。

    Anthropic 則在 OpenAI 披露後展開內部審查,發現旗下 Claude 模型在安全評估期間,曾三次在受控測試環境外取得對外部組織系統的未經授權存取。Anthropic 表示,這些事件與測試環境配置問題有關,並非模型被直接指令去攻擊目標;部分個案可追溯至 4 月。

    利用弱密碼漏洞

    Anthropic 進一步指出,涉事模型利用了弱密碼、未驗證端點等基本漏洞,從而進入外部系統。公司在審查超過 14 萬次評估紀錄後,才識別出這些問題,顯示即使是安全測試流程,若隔離措施與授權邊界不夠清晰,也可能令 AI 行為偏離原先設計。

    事件令外界再次關注自主 AI 代理的風險。網安專家指出,與人類黑客相比,AI 代理可更快、更大範圍地搜尋漏洞,一旦被用於攻擊或誤入真實環境,傳統安全團隊未必有足夠工具即時偵測與處理。

    隨着先進 AI 模型能力持續提升,業界對其審查、部署與監管的討論亦進一步升溫。這些案例雖然源自安全評估,但已足以提醒企業與監管機構:AI 模型的能力邊界正在擴大,而測試與防護機制也必須同步升級。

    SOC 一直面對沉重壓力,要處理愈來愈多的警報、抵禦愈來愈複雜的 AI 威脅,並在資源有限的情況下更快作出回應。

    AI 已經幫助保安分析人員提升工作效率,下一步便是發展 Agentic AI,即能夠主動調查、整合和分析資料、排列事件的優先次序,以及協調回應行動的智能 AI 代理。同時,保安團隊仍然可以保持控制權。

    參加由 Fortinet 專家主持的互動示範日,了解一個統一、由 AI 驅動的保安營運平台,如何把分散的保安訊號,轉化為受管控的自動化行動,加快整個環境中的偵測、調查和回應工作。

    你將學到:

    • 管理企業使用生成式 AI,同時減低資料外洩風險
    • 利用更完整的使用者、裝置和應用程式資料,更快偵測端點威脅
    • 自動整合端點、網絡和資料保安的監測資料,提升可視性
    • 利用代理式 AI 為事件排定優先次序、自動進行調查,以及協調受管控的回應行動,從而加快 SOC 的營運工作

    踏入 Agentic AI 時代,面對日益複雜的網絡安全威脅,企業必須重新思考和重塑整體安全架構。第二集《Fortinet – Agentic AI 安全攻防戰》,Fortinet 北亞區首席信息安全官鄺偉基(Daniel)將視點由基建平台延伸至整體架構層面,拆解在應用安全層(Application Security Level)中的「安全鐵三角」,讓企業更清楚如何在 Agentic AI 的應用場景中,構建實用且嚴密的安全防線。

    Daniel指出,一個完整且可落地的 Agentic AI 安全架構, 至少需涵蓋三個核心層級:基礎建設(Infrastructure)、應用(Application)以及數據與治理(Data and Governance),三者環環相扣,缺一不可。

    在上集中, Daniel 提到部署 Agentic AI 須以基建層為起點,透過 Kubernetes 的網絡分隔(Segmentation)機制,將潛在風險限制在局部範圍內。

     上集回顧:Agentic AI 安全攻防戰 EP1|由 Kubernetes 入手 以分隔機制打穩安全基礎 


    當基礎建設穩固後,第二層的「應用安全」 (Application Security) 就成為支撐 Agentic AI 運作的核心防線,負責防禦實際應用流量的安全風險。

    由「單向防守」轉至「雙向流量管控」

    在現實環境中,絕大部分應用流量早已透過加密通道傳送,無論是傳統的 JSON API,還是 gRPC、WebSocket 或 MCP 等高效能、即時和智能協議,本質上都是透過 Web 與 API 進行溝通。Daniel 解釋,過往多數安全方案的設計重點,主要放在由外到內的進站請求(Incoming Request),即從外界進入企業伺服器的流量。

    然而,在 Agentic AI 的世界裡,AI 代理(Agent)不再只是被動接收指令,而是會主動向外查詢、抓取資料,甚至持續調用第三方服務。換言之,企業除了要守住「入口」,針對向外發出的出站請求(Outgoing Request)所帶來的潛在風險,同樣不能掉以輕心。

    正因如此,在應用安全架構中,有兩個關鍵角色尤其重要:

    1. WAAP(Web Application and API Protection):不再限於傳統 WAF,其防護已涵蓋各類 API(包括 gRPC、WebSocket 和 MCP)。WAAP 部署於 Incoming Request 端,負責解密流量並拆解不同格式的 API 流量內容。

    2. SWG(Secure Web Gateway):扮演代理伺服器(Proxy)的角色,是處理向外發出請求時的前向代理(Forward Proxy)。當 AI 代理(Agent)向外部網絡抓取資料或向第三方服務呼叫 API 時,所有流量均須經由此 Proxy。SWG 透過「中間人機制(Man-in-the-middle)」進行解密與檢測,攔截惡意負載、可疑數據或不恰當請求,確保外部資源存取安全。

    事實上,合規要求較高的金融服務業,早已普遍採用「入有 WAAP、出有 SWG」的雙向防禦組合架構。Daniel 指出相比之下,不少非金融機構目前仍缺乏此類完整部署;到了 Agentic AI 時代,這種安全缺口將日益顯現,極易成為攻擊者的突破口。

    Fortinet 北亞區首席信息安全官鄺偉基(Daniel)提出 Agentic AI 的安全架構分為三層,當中在應用層面上可採用「安全鐵三角」。

    從流量安全到語言層攻擊

    除了「一出一入」的網絡流量控制,大型語言模型越獄(Jailbreak)亦是企業在應用 Agentic AI 時面臨的嚴峻挑戰。所謂越獄,即是是誘導模型違反安全政策,輸出不應輸出的內容,例如惡意程式碼、釣魚電郵,或繞過既有安全機制等。

    Daniel 進一步解釋,「傳統網絡倚重數據及機器學習,能精準預測已知威脅,惟面對 AI 極為快速的變化,以及攻擊者利用自然語言精心設計的各類提示指令(Prompt),表達方式千變萬化,單靠傳統基於特徵碼(Signature-based)的 WAAP 已不足以應對。

    要對抗語言層面的新型威脅,必須在 Prompt 的層面上加設專門的防線。

    Fortinet 推出專門針對 Prompt 安全的全新方案—FortiAIGate,成為「應用安全鐵三角」中的重要一環。FortiAIGate 的核心機制是在 API 將 Prompt 傳入大型語言模型(LLM)之前,以及 LLM 把結果回傳至 API 之前,各加上一道專門分析 Prompt 的安全閘口。

    系統一旦偵測到 Prompt 涉及高風險指令,或疑似嘗試繞過模型的安全限制時,便可在 Prompt 觸及 LLM 前主動攔截;即使模型已產生回應 Output Guard(輸出護欄)功能,亦可在回傳到 API 之前攔截。透過這種方式,企業不僅可以減少惡意或不當請求直接觸及模型的機會,亦能有效避免敏感數據外洩。

    將 FortiAIGate 與 WAAP 及 SWG 結合使用,企業即可建立具備全方位可視性的「應用安全鐵三角」,大幅提升整體防禦能力。在高度自動化的 Agentic AI 環境中,這種可視性更是實現即時應變與後續調查的關鍵基礎。

    2 小時深度體驗工作坊 萬勿錯過

    想更深入了解 Fortinet 在保護 AI 方面的能力及實際應用場景?誠邀參與我們的 2 小時深度體驗工作坊。

    Part 1:實戰示範(約 20 至 30 分鐘)
    -          展示 WAF API Protection 的實際防護能力及 WAF MCP Protection 在真實威脅情境下的應變表現

    Part 2 :解決方案介紹(約 90 分鐘)
    -          深入剖析 FortiWeb Secure AI 的架構設計與核心組件
    -          分析常見及進階威脅情景及防禦思路
    -          探討不同部署模式選項、如何配合現有環境落地,以及對比其他方案的優勢與差異

    如果你正在規劃或已經開始部署 Agentic AI,這場工作坊將有助你更立體地理解如何將 WAAP、SWG 與 FortiAIGate 組合成為真正可運行的「應用安全鐵三角」,由實戰角度出發,強化整體保護 AI 策略。

    日期:9 月 3 日 (星期四)
    時間:下午 2:30 – 4:30
    地點:Fortinet 香港辦公室

    報名連結: https://forms.gle/EjuNn33qmTRJs8Pv6

    AI agent「越獄」網絡攻擊事件持續發酵。OpenAI 與 Anthropic 近日相繼披露,旗下用於網絡安全評估的 AI 模型,在測試過程中意外突破受控環境,並在未經授權下接觸外部組織系統。事件引發網安界關注:當 AI 代理具備更強自主性後,測試邊界一旦失守,是否已足以對真實網絡構成風險。

    早前入侵 Hugging Face

    據 OpenAI 於 7 月 21 日公開的說法,其兩個 AI 模型在一項安全測試中突破隔離環境,連上互聯網後,進一步入侵 AI 平台 Hugging Face。OpenAI 表示,模型當時正在測試環境內嘗試完成既定任務,但在過程中找到了漏洞,最終突破限制;公司其後表示會展開更全面調查。

    Hugging Face 其後亦公開回應,指事件屬於自主 AI 代理驅動的入侵,模型並非只是在模擬情境中運作,而是實際觸及其生產系統。相關報道指出,OpenAI 這次事件被視為罕見案例,反映 AI 在安全測試中的行為,可能比預期更具破壞性。

    Anthropic 則在 OpenAI 披露後展開內部審查,發現旗下 Claude 模型在安全評估期間,曾三次在受控測試環境外取得對外部組織系統的未經授權存取。Anthropic 表示,這些事件與測試環境配置問題有關,並非模型被直接指令去攻擊目標;部分個案可追溯至 4 月。

    利用弱密碼漏洞

    Anthropic 進一步指出,涉事模型利用了弱密碼、未驗證端點等基本漏洞,從而進入外部系統。公司在審查超過 14 萬次評估紀錄後,才識別出這些問題,顯示即使是安全測試流程,若隔離措施與授權邊界不夠清晰,也可能令 AI 行為偏離原先設計。

    事件令外界再次關注自主 AI 代理的風險。網安專家指出,與人類黑客相比,AI 代理可更快、更大範圍地搜尋漏洞,一旦被用於攻擊或誤入真實環境,傳統安全團隊未必有足夠工具即時偵測與處理。

    隨着先進 AI 模型能力持續提升,業界對其審查、部署與監管的討論亦進一步升溫。這些案例雖然源自安全評估,但已足以提醒企業與監管機構:AI 模型的能力邊界正在擴大,而測試與防護機制也必須同步升級。