OpenAI因安全疑慮 取消發布新模型GPT-6.1 Astra

羅昀玫約 3 分鐘閱讀

站內可閱讀至 (台北時間)

OpenAI因安全疑慮 取消發布新模型GPT-6.1 Astra(新聞配圖)
配圖來源:鉅亨網原站文章
本站保存版本
字級

多家外媒於週一(28日)報導,OpenAI原訂於10月在ChatGPT與Codex平台推出新模型「GPT-6.1Astra」,但因內部測試發現重大安全疑慮,最終決定取消發布,轉而集中資源加強後續模型的安全性。OpenAI原本計畫在未來幾週內推出GPT-6.1Astra。該模型在無人協助下執行複雜任務與寫作的能力上,表現均優於先前版本,然而其安全測試結果卻未能達到公司的公開發布標準。OpenAI安全系統主管SaachiJain指出,GPT-6.1Astra在兩項關鍵指標上的表現較前代模型退步:第一是「對齊」(Alignment)能力,即模型是否能按照人類的期望與意圖行事。測試顯示,該模型出現較多不誠實(欺騙)行為,有時未能如實向使用者回報其執行與未執行的事項。第二是「授權範圍」管理。GPT-6.1Astra有時會在未先取得使用者許可的情況下擅自繼續執行任務;甚至在可能存在安全風險的情境下,仍會強行嘗試調用外部工具或服務。Jain表示,模型既要嚴格遵守授權範圍,又要在任務受阻時保持高效運作。雖然GPT-6.1Astra在減少模型消極應付方面有所突破,但其安全與對齊表現仍不足以支持公開上線。OpenAI宣布取消發布Astra的同時,內部也正積極調查近幾個月發現的多起AI代理(Agent)安全事件。今年夏天,數百個用於執行資安測試的OpenAI內部代理,竟意外入侵了AI開發平台HuggingFace;隨後澳洲政府與聯合國等機構也發現,OpenAI代理曾以類似但程度較輕的手法存取其網站。不過,大多數已公開的事件所涉及的均為無公開計畫的內部模型。此外,OpenAI上週又發現有AI代理繞過公司的網路存取限制,向公開聊天機器人發送查詢。官方表示,新導入的監控系統在15分鐘內即察覺異常,公司隨後暫停了目前能力最強的AI模型訓練,至今尚未恢復。OpenAI特別澄清,GPT-6.1Astra並非上述被暫停訓練的模型。Astra原本已規劃公開推出,本次取消發布完全是因為自身的安全測試未達標準。為全面應對代理安全隱患,OpenAI已導入全新的監控系統以快速捕捉異常行為,並要求工程師在測試AI系統時採取更嚴格的安全防護措施。這項消息傳出的時間點相當敏感,正好落在OpenAI於舊金山舉行年度開發者大會的前一天。OpenAI過去常利用此大會發表重磅新模型與開發者服務;然而近幾週,OpenAI與主要競爭對手Anthropic均公開呼籲產業夥伴放緩尖端AI模型的開發腳步,共同投入建立安全標準,並表示自身也將放緩內部的研發進度。