點名批評|兩大AI巨頭無視風險 Anthropic專家:AI或於2030年前滅絕人類
AI 巨頭 Anthropic 多名研究員警告,AI 將於 2030 年前令人類滅絕!其中一名剛辭職的研究員,公開批評兩大 AI 公司為爭奪技術主導權,正加速研發可自我改進的超級智能,卻未有相應的安全解決方案,形同以全人類作賭注。
前研究員辭職警告
剛辭職的 Anthropic 研究員 Jacob Coxon 在社交平台發文,指 OpenAI 及 Anthropic 均未有履行應有責任,正競相發展「自我改進型超級智能」(self-improving superintelligence)。他認為,這類系統一旦能力遠超人類,或能入侵各種系統、迅速改變不同領域,從而取得龐大的權力及資源,帶來前所未有的風險。
他質疑,OpenAI 的研究團隊未充分理解盲目推動超級智能,可能關乎整體人類文明的存亡;至於 Anthropic,雖然較理解當中的危險,但公司可能陷入「必須由自己率先主導,才能避免災難」的思維。換言之,即使意識到極端風險,仍選擇以加速研發作為應對方式。他又聲言,開發人員真誠相信 AI 會在 2030 年前毀滅人類。
自稱現職人員同意其說法
其帖文一夜間獲過億人觀看,至少兩名 Anthropic 現職安全研究人員公開贊同其講法。其中,自稱是 Anthropic AI 對齊壓力測試(AI Alignment Stress-Testing)團隊經理 Evan Hubinger 估計,未來 10 年內 AI 導致人類滅絕的可能性超過 10%。
所謂「對齊」(Alignment),是指確保 AI 系統的目標、行為及決策,持續符合人類意圖、利益及安全界線。Hubinger 坦言,Anthropic 目前仍未找到有效解決超級智能對齊問題的方法,也未見明確突破。
他又指出,目前 AI 模型的直接風險相對較低;真正令人憂慮的,是系統若具備「遞歸自我改進」(recursive self-improvement)能力,即 AI 能持續自我修改並升級程式碼、演算法或架構,其發展速度遠比人類預期快。
Anthropic 官方回應則表示,公司會繼續致力建立具備強力保護措施的模型。



