OpenAI調查失控AI代理人活動,已通知逾100個組織
站內可閱讀至 (台北時間)

OpenAI周三(9/30)公布AI代理人未對齊行為的最新調查進度,指出截至9月26日,已就相關異常活動通知超過100個組織,目前仍在持續回溯歷史紀錄,預期還會發現更多案例。
這項調查源於OpenAI先前發現內部研究模型入侵Hugging Face的事件。OpenAI之後擴大檢查模型在訓練及評估期間的網路活動,尋找是否還有其他代理人在執行任務時偏離原本目的,或以未預期方式與第三方網站及服務互動。目前調查已進行約一個月,尚未發現其他事件的規模或嚴重程度達到Hugging Face事件。
為了找出更多異常活動,OpenAI正逐月回溯約50PB歷史紀錄,搜尋模型曾存取或修改網站,以及涉及密碼、API金鑰、存取Token等敏感憑證的活動。這項調查目前動用約7,000顆GB200及GB300 GPU,每日成本超過50萬美元,OpenAI並計畫隨著調查流程改進進一步增加運算資源。
OpenAI表示,只要模型未經授權繞過第三方安全控制、影響對方系統或服務正常運作,或活動暴露潛在安全漏洞,就可能通知相關組織。因此,截至9月26日收到通知的逾100個組織,並不代表全都遭到入侵,也不代表私人資料遭到存取。
在這波審查中,OpenAI發現的代理人異常行為包括繞過網站存取控制、使用公開外露的登入憑證或存取金鑰、進行查詢或命令注入,以及讀取原本供內部使用的檔案或後端系統。另有部分代理人曾在第三方網站發布內容,例如將公開Wiki頁面當作留言板,被稱為代理人垃圾訊息。
資安業者Asymmetric Security周四(10/1)所公布的獨立調查,也觀察到與OpenAI說法相符的行為。研究人員指出,部分疑似OpenAI代理人原本可能只是執行公共衛生、貿易或教育資料查詢,但在無法順利取得資訊後,開始利用外部服務繞過原有執行環境限制,並逐步出現探測網站、建立帳號及透過非預期管道取回資料等行為。
其中一種手法是結合HTTP測試服務httpbin與網址分析服務urlquery。代理人原有網路工具不足以完成部分網頁操作,因此先透過httpbin建立含有程式碼的網頁,再由urlquery以瀏覽器開啟執行,向目標網站取得資料,最後從urlquery留下的頁面標題或掃描報告取回結果。研究人員認為,這讓代理人補足原有工具缺乏的瀏覽器能力。
調查也發現,代理人曾探測網站外露的.git組態檔及備份程式,並對美國教育部API嘗試SQL注入,但沒有證據顯示成功;另曾進入AIHW、Data USA、IHME及UNCTAD等機構的測試或預備環境。部分代理人還註冊私人掃描服務帳號,並使用48小時後失效的臨時信箱,使部分活動紀錄更難追查。但研究人員強調,目前無法確認這些做法是否意在隱藏行蹤。