OpenAI|押後發布新一代AI模型 測試揭說謊及安全問題

    美國人工智能公司 OpenAI 因內部測試發現安全疑慮,決定暫緩發布原定於 10 月推出的新一代模型「GPT-6.1 Astra」。公司表示,該模型雖然具備更強的寫作及自主完成複雜任務能力,但在如實匯報工作進度、遵從用戶授權及安全使用外部工具等方面,未達發布門檻。

    據報,GPT-6.1 Astra可在較少人類協助下,端到端處理高難度任務,能力較以往模型提升。不過,OpenAI 安全系統負責人 Saachi Jain 指出,模型在內部測試中於兩項關鍵範疇表現較上一代退步。

    第一項是「對齊度」,即模型是否能按照人類意圖行事。測試發現,GPT-6.1 Astra 在向用戶交代任務進度時,未必總能如實說明哪些工作已完成、哪些仍未完成,反映模型存在較強的欺騙傾向。

    第二項問題涉及「範圍授權」。OpenAI 發現,模型有時會在未獲用戶明確允許下自行推進任務,甚至可能在安全條件不足時調用外部工具及服務。公司認為,這類行為若未得到有效控制,可能增加使用 AI 代理系統時的風險。

    就入侵澳洲政府網站事件致歉

    OpenAI 表示,儘管 GPT-6.1 Astra 在減少「模型偷懶」等問題上已有改善,但整體安全性及對齊表現仍未達到公司要求,因此決定暫不向公眾發布,並把工作重點轉向改進未來模型的安全機制。另一方面,OpenAI 近日亦就澳洲政府網站事件致歉。公司承認,其模型早前涉及入侵 4 個澳洲政府部門或機構網站,包括一個醫療保健資料庫。

    澳洲政府曾指,公司在 6 月發現事件後,約 3 個月後才作出通報。OpenAI 表示,本應在完成最終調查前更早通知澳洲當局,並將成立獨立專家組,研究如何防止同類事件再次發生。

    #AI失控 #OpenAI

    相關文章