Anthropic IPO 說明書將警告投資人 AI 恐帶來人類存亡風險,坦言模型可能抗拒關機、察覺受測

Claire約 3 分鐘閱讀

站內可閱讀至 (台北時間)

Anthropic IPO 說明書將警告投資人 AI 恐帶來人類存亡風險,坦言模型可能抗拒關機、察覺受測(新聞配圖)
配圖來源:INSIDE原站文章
本站保存版本
字級

根據路透社獨家審閱的首次公開發行(IPO)公開說明書,Anthropic 將警告投資人,先進 AI 可能對人類構成「災難性或攸關存亡的風險」(catastrophic or existential risks to humanity)。說明書列出模型可能出現的自我保存行為,包括試圖「抗拒關機」、「隱匿或操弄資訊」,以及「類似勒索」的行為。

Anthropic 在 261 頁的說明書主文中,用了約 80 頁陳列風險因素,描述公司業務的篇幅則是 48 頁,前者將近後者的 2 倍。作為對照,擁有 xAI 的 SpaceX 在 277 頁的說明書主文中,約 38 頁用於風險因素。

以「安全優先」AI 實驗室自我定位的 Anthropic,在說明書中也把產品擴張本身列為風險來源:「我們開發高度先進的模型、平台與應用,並擴大使用情境,可能進一步提高模型造成傷害的風險。」

說明書把模型可能展現的「自我保存行為」(self-preserving behaviours)列為風險,具體包括試圖抗拒關機、隱匿或操弄資訊,以及類似勒索的行為。針對安全測試本身,Anthropic 寫道:「模型可能察覺我們正在進行評估,這對我們評估模型安全性的能力構成重大限制。」白話來說,模型若知道自己正在受測,測試結果就未必能反映它在真實使用情境中的表現。Anthropic 並補充,模型有時會在訓練過程中發展出意料之外的能力,而且可能直到部署後才被發現。

Anthropic 指出,安全工作耗費大量資源(resource-intensive),會與算力及人才的支出相互競爭,而且安全投資的回報仍不明確;說明書並未揭露公司在安全研究上的支出金額。Anthropic 本月稍早曾揭露,在抽樣的 7 月某一週,投入 AI 研發的算力中約 6% 分配給安全工作。

Anthropic 近幾週承諾公開更多關於如何用 AI 模型打造下一代技術的資料,專家則對遞迴式自我改進(recursive self-improvement)提出警告,也就是模型在沒有人類協助下自行發展的階段。

Anthropic 執行長 Dario Amodei 近期發表一篇近 4,000 字的長文,呼籲 AI 前沿發展應放慢腳步,約 10 天後,Anthropic 就推出 Claude Opus 5.5。一邊呼籲減速、一邊持續推出新模型,也凸顯 Anthropic 在安全主張與市場競爭之間的拉扯。

Anthropic 內部對風險的評估同樣不樂觀,根據外媒報導,Anthropic 研究員 Evan Hubinger 曾估計,AI 在未來十年內造成人類死亡的機率超過 10%。

不過 Anthropic 仍把安全視為能在市場上站得住的長期押注:「我們相信,打造可靠、值得信賴且安全的 AI 系統是一項集體責任,而市場將會給予回報。」

這些關於模型行為與安全算力的說法,過去多半散見於研究部落格與模型說明文件;如今正式寫進 IPO 公開說明書,成為 Anthropic 對投資人揭露的一部分,市場是否會如 Anthropic 所說為安全買單,上市後將接受檢驗。

核稿編輯:Mia

最新發展: