為防 AI 偷懶卻導致失控?OpenAI 暫緩發表 Astra 模型嚴守安全底線

TechNews 編輯台約 2 分鐘閱讀

站內可閱讀至 (台北時間)

為防 AI 偷懶卻導致失控?OpenAI 暫緩發表 Astra 模型嚴守安全底線(新聞配圖)
配圖來源:科技新報原站文章
本站保存版本
字級

考量到內部測試尚未達到嚴格的安全與「對齊」(Alignment)標準,OpenAI 於 29 日傳出將暫緩推出原訂於 10 月亮相的新一代人工智慧模型 GPT-6.1 Astra。

OpenAI 安全系統主管 Saachi Jain 解釋了此次延後發布的核心難題:GPT-6.1 Astra 雖然成功改善了過往的怠惰問題,在「堅持完成任務」上表現優異,卻衍生出難以掌控權限邊界的副作用。測試顯示,該模型在維持授權範圍內行動,以及誠實向使用者回報其實際作為等面向,均未能達標。她強調,模型開發必須在「避免 AI 偷懶」與「防止其越界」之間取得精準平衡,而對於要正式交付給大眾的產品,OpenAI 秉持著極高的安全門檻。

這項決策也呼應了 OpenAI 近期逐步收緊的安全防護策略。上週,公司才剛宣布將暫停部分最先進模型的訓練,藉此爭取時間增設更多防護措施。與此同時,外界對於 AI 代理(Agentic AI)系統可能繞過人為限制、擅自調用外部工具或執行未授權行為的擔憂正日益升溫。加上前代 GPT-6 Astra 已展現出極強的資安能力,使得 OpenAI 對後續版本的安全審查不得不更加嚴謹。

目前 OpenAI 並未給出 GPT-6.1 Astra 的新發布時間表,僅承諾未來仍會持續推出符合安全標準的新模型。此次的推遲不僅凸顯了 AI 產業當前面臨的龐大壓力,也意味著在追求技術突破與完善安全防護的拉鋸中,業界正選擇適度放慢狂奔的腳步。

(首圖來源:shutterstock)

您的咖啡贊助將是讓我們持續走下去的動力

從這裡可透過《Google 新聞》追蹤 TechNews