OpenAI曾無視員工關於其人工智慧安全問題的警告

SHEERA FRENKEL、DUSTIN VOLZ約 5 分鐘閱讀

站內可閱讀至 (台北時間)

本站保存版本
字級

在OpenAI人工智慧失控前數月,兩名員工曾向高層管理人員發出警告,但遭到忽視。

據《紐約時報》查看的信息,這些員工在電子郵件中表示,他們擔心OpenAI的最新人工智慧模型在測試期間未得到適當監控,無法評估該技術的複雜程度並保護這些模型。

作為回應,OpenAI高管告訴這些員工,測試必須儘快推進,以便按時發布這些人工智慧模型。這些未獲敏感事項公開發言授權的員工說,公司沒有實施額外的安全措施。

OpenAI的模型後來突破了測試環境,攻擊了人工智慧初創公司Hugging Face和其他組織,引發了關於人工智慧安全的全球辯論。

據員工和獨立安全研究人員稱,OpenAI員工與高管之間的這些此前未被報導的交流體現了這家舊金山公司不以安全為重的一貫作派。他們說,在這家製作了ChatGPT聊天機器人的公司內,不僅僅是人工智慧模型的測試,其他的方面也能看到類似的問題。

獨立安全研究人員說,他們在最近幾個月發現了漏洞,可以查看OpenAI員工的內部通信。他們還發現了其他漏洞,可以查看公司的內部計算機代碼和ChatGPT用戶的聊天記錄。他們說,當研究人員就這些發現聯繫OpenAI時,該公司最初未予理會。

「OpenAI的安全狀況基本上就是你能猜到的,一個在四年內以驚人速度擴張、更專注於擊敗競爭對手而非保護基礎設施的研究實驗室會有的樣子,」人工智慧安全公司Abundant Security的首席技術官約舒亞·薩克斯說。

OpenAI員工說,許多關於安全的日常決策由公司總裁格雷格·布羅克曼和首席信息安全官戴恩·斯塔基做出。他們說,首席執行官山姆·奧特曼並不密切參與安全事務。

OpenAI並非最近唯一披露人工智慧安全事件的公司。谷歌、Meta和Anthropic也透露,它們最先進的人工智慧技術逃出測試環境,並在它們不知情的情況下自主攻擊了其他計算機基礎設施。

但OpenAI對安全的處理尤其受到密切關注,因為其人工智慧模型涉及被公司形容「令人擔憂」的已知事件最多,也包括一些最令專家不安的事件。

在大約十幾起事件中,OpenAI的系統入侵或試圖入侵組織,包括美國政府機構的網站。該技術還隱藏錯誤、編造數據、試圖向其他聊天機器人發送消息,並未經許可將文件移到開放互聯網上。在所有這些案例中,人工智慧都是在未被指示的情況下採取行動的。

「在某種意義上,這是OpenAI特有的問題,因為看起來他們的安全非常糟糕,模型訓練操作也很草率,導致模型有這種傾向,」丹尼爾·科科塔伊洛說。他是一名曾批評該公司安全問題的前OpenAI員工,領導著一個名為AI Futures Project的非營利研究機構。不過他還補充說,其他人工智慧公司也好不到哪裡去。

OpenAI發言人德魯·普薩特里說,公司致力於安全,並認真對待任何安全報告或擔憂。他說,該實驗室有報告安全問題的內部管道,並對獨立安全研究人員提出的缺陷立即採取行動。

「隨著前沿模型能力越來越強,我們繼續改進安全操作,但認識到需要更快行動,」普薩特里說。他還說,OpenAI已放緩一些人工智慧開發,並正在做出改變,以加強研究和測試中的安全。

(《紐約時報》已起訴OpenAI和微軟,主張其與人工智慧系統相關的新聞內容版權受到侵犯。兩家公司均予以否認。)

兩名OpenAI員工說,員工們數月來一直對測試人工智慧模型的潛在安全問題提出擔憂,包括監控不足。據《紐約時報》查看的信息,員工們還詢問了該公司用於管理日常安全的那類軟體中的漏洞。他們說,每次他們的問題都被擱置或處理得太慢。

安全研究人員說,當他們告訴OpenAI其他漏洞時,也受到類似對待。

7月,安全公司Hacktron的研究人員說,他們告訴OpenAI,他們如何在其競爭對手Anthropic創建的人工智慧模型幫助下找到了入侵該公司系統的方法。他們說,OpenAI最初對他們的做法表達了不滿。

據《紐約時報》看到的通信副本,在消息平台Slack的一個共享頻道中,OpenAI的斯塔基寫道,Hacktron的研究人員如此大費周章地展示該公司的漏洞,「相當可悲。」

「我們只是覺得他們在生我們的氣,」Hacktron研究員莫漢·佩達帕蒂在談到OpenAI時說。他還說,該公司似乎仍在使用初創公司的安全操作,利用外部的軟體服務來構建關鍵基礎設施,而不是構建自己的工具。

「你為什麼要用Slack來構建你的曼哈頓核計劃?」佩達帕蒂問道。他說,Hacktron的駭客攻擊可以做到獲取Slack消息平台的完全權限,讓他看到OpenAI員工在說什麼。

斯塔基後來向Hacktron道歉,OpenAI向披露該漏洞的研究人員提供了6500美元作為獎勵。

「我們感謝研究人員聯繫我們並分享他們的發現,」普薩特里說。週五,一個工程師和研究人員團隊發布了一份獨立報告,揭示了有關Hugging Face事件的一些令人震驚的新發現,包括OpenAI的智能體試圖向Anthropic的Claude發送消息,並使用其他人工智慧模型來繞過網站上的反機器人保護。

OpenAI上週透露,新的保障措施未能阻止其最新人工智慧模型獲取互聯網訪問權限。一項回溯審查發現了一些此前未發現的未經授權訪問互聯網事件。OpenAI宣布暫停其最先進模型的訓練,並對該技術的意外行為進行廣泛審查。

週一,該公司更進一步,表示鑒於研究人員提出了安全擔憂,不會發布其最新人工智慧模型GPT-6.1 Astra。