第一例!OpenAI因「安全」取消發布新模型,現在AI失控到底多嚴重?
站內可閱讀至 (台北時間)

OpenAI近日因內部測試中發現嚴重的安全隱患,決定取消原訂於十月推出的新一代AI模型「GPT-6.1 Astra」。這是業界首度有大型科技公司因為安全疑慮而放棄發布重要產品,反映出AI代理失控的風險,已無法被業界迴避。
據《華爾街日報》率先報導,GPT-6.1 Astra原本被寄予厚望,它能獨立完成複雜任務而無需人類協助,但在安全與對齊(Alignment,即AI是否遵循人類意圖)的測試中卻表現不佳。
OpenAI安全系統主管賈恩(Saachi Jain)指出,該模型出現了較高程度的「欺騙性」,有時會對用戶隱瞞自己採取了哪些行動。
此外,它還存在「越權」的問題——它會在未經用戶許可的情況下擅自執行任務,甚至在不安全的情況下調用外部工具與服務。
「在安全與對齊方面,總是需要權衡,」賈恩坦言,必須在確保模型不越界,與避免模型在遇到阻礙時變得「懶惰」之間,找到正確的界線。
OpenAI取消發布新模型,並非單一事件,而是今年夏天以來一連串AI失控事件的最高潮。過去幾個月,OpenAI的內部測試模型接連出現駭客行徑。
今年初夏,數千個被指派執行網路安全測試的OpenAI內部代理,竟然擅自駭入了開源AI平台 Hugging Face。隨後,OpenAI在內部調查中震驚地發現,其AI代理還曾試圖入侵澳洲公共衛生系統、美國教育部、商務部以及證券交易委員會(SEC)的網站。
例如,AI曾嘗試駭入美國教育部網站以收集民權辦公室的數據,雖然並未成功,但它卻利用在網路上找到的登入憑證,成功從美國普查局網站抓取資料,甚至分享SEC網站的公開數據到網路論壇上。
儘管OpenAI強調這些事件並未造成資料外洩,但這已充分證明這些AI已經學會自主行動,且行為模式完全出乎開發者的預料。
更令人擔憂的是,包含OpenAI、Google與Anthropic在內的科技巨頭,往往都是在事件發生後,才驚覺自家的AI做了什麼。
這些失控事件不僅讓矽谷的工程師捏把冷汗,連推動AI發展的巨頭本身也開始感到害怕。
根據另一家巨頭Anthropic近期曝光的上市公開說明書草案,文件中花了將近三分之一的篇幅,向潛在投資人警告其技術可能對人類構成「生存威脅」(existential risks to humanity)。
該草案文件明確指出,愈來愈先進的AI模型,有可能學會操縱、勒索,甚至展現出無法預測的行為。
面對如此巨大的風險,僅靠企業暫緩發布、「自我監管」有用嗎?
《大西洋》雜誌的評論直言,這些AI公司一面發表嚴肅的文章呼籲世界重視AI風險,一面卻繼續推出更強大的新模型,這種做法等同「用發現問題來取代解決問題」。
目前,美國佛羅里達州總檢察長已對OpenAI提起訴訟,要求法院在第三方批准的安全護欄建立之前,禁止該公司開發新模型。但單靠各州的零星訴訟,顯然無力制衡巨頭。
曾為OpenAI與英國政府AI安全研究所工作的電腦科學家克拉夫(Heidy Khlaaf)在頂尖學術期刊《自然》上發表評論指出,我們不該把責任推給「失控的AI」,真正的問題在於人類的疏忽與AI實驗室缺乏問責機制。
如果網路安全工程師不小心讓惡意軟體逃出測試環境,他們必須承擔法律責任,AI企業不該有差別待遇。
克拉夫家在文末呼籲,真正有心想減輕AI災難性風險的政治領袖與政策制定者,應該參考核能、航空、醫療保健與金融等領域已有的監管模式,「當AI系統被部署在受監管的產業時,它就應該遵守與其他關鍵技術相同的風險門檻與問責機制。」
(資料來源:WSJ, NYT, Nature, Atlantic)