隨著生成式 AI 深入企業流程,Prompt Injection(提示詞注入)也成為新的資安威脅之一。攻擊者會把惡意指令藏在網頁、Email、文件或其他外部內容中,誘導模型偏離原本任務。這類攻擊某種程度上很像對人的 Social Engineering(社交工程):攻擊者不一定要突破系統漏洞,而是想辦法讓目標「相信」一段資訊,再自行做出不該做的動作。現在,這項風險又出現新的變化。
9/28,一群來自彼此競爭的前沿 AI 公司與學界研究者罕見共同呼籲,政府應開始掌握 AI 公司究竟把多少研發工作交給 AI 自動完成。同一天,OpenAI 因安全測試未過關,取消原定 10 月推出的新模型 GPT-6.1 Astra;NVIDIA 則發布 Open Agent Safety Platform(開放代理安全平台),把 AI Agent(AI 代理)的安全防線從模型本身延伸到軟體執行環境與硬體層。
多年來,資安研究人員主要透過數位指紋追蹤不同類型的惡意軟體,用以辨識駭客工具、偵測潛在感染,以及分析這些工具的使用變化。《WIRED》報導,隨著攻擊者開始將代理型 AI 導入駭客工具,讓惡意軟體能透過 AI 模型或服務取得指令、判斷下一步行動,思科系統旗下的威脅情報與安全研究組織 Cisco Talos
Meta 的 AI 助理 Muse 可依使用者指示致電商家,處理訂位、詢價及查詢商品等事項。《路透》查閱 Meta 內部貼文發現,公司曾在員工測試中,讓真人承包人員接手部分由 Muse 發起的電話。部分員工擔心,如果沒有清楚告知執行方式,承包人員可能在通話中接觸使用者的敏感資訊。Muse 上線時強調代理工作的隔離措施,真人參與通話的安排也因此受到員工質疑。