拼圖式隱私侵擾:大型語言模型如何透過生活細節肉搜出「你是誰」?

蕭國振約 5 分鐘閱讀

站內可閱讀至 (台北時間)

拼圖式隱私侵擾:大型語言模型如何透過生活細節肉搜出「你是誰」?(新聞配圖)
配圖來源:關鍵評論網原站文章
本站保存版本
字級

文:李逸元(國立台灣大學電機工程博士,現任台大資訊工程學研究所元一網宇永續研究中心主任研究員,並於國立陽明交通大學、國立中央大學兼任授課)蕭國振(出身刑事司法實務體系,現為法律系博士生、大專院校兼任講師,具法學與工學雙碩士背景)十九世紀末,攝影與報刊讓私人生活更容易被記錄、複製與傳播。1890年,美國法律學者薩繆爾‧華倫(Samuel D. Warren)與路易斯‧布蘭岱斯(Louis D. Brandeis)發表〈隱私權〉(The Right to Privacy),主張法律應保護私人生活免於不當公開。當時令人擔憂的,是私人影像與消息突然進入大眾視野。今天,人們主動在網路留下文字,卻未必預見這些文字日後會被拼湊成自己的身分。有人使用假名在論壇談工作,提及任職產業與參與過的專案;隔了幾個月,又寫下搬家、求職或就醫的經歷。各篇貼文都沒有署名,分開閱讀難以確認作者。將文字彙整,再與公開履歷比對,原本分散的生活片段極可能指向本人。資料未必是祕密,串接後卻揭露了發文者原先沒有打算公開的身分關係。在2026年第35屆USENIX安全研討會(USENIX Security Symposium)上,賽蒙‧勒門(Simon Lermen)、弗洛里安‧特拉梅爾(Florian Tramèr)等人撰寫的論文〈Large-scale online deanonymization with LLMs〉被正式發表並收錄。研究團隊選取338名曾在Hacker News帳號與LinkedIn串接的使用者進行測試。他們將這些人的發文整理成摘要,並隱去姓名、帳號等直接線索,讓AI代理程式上網尋人。結果成功辨識出226人。這些受測者原本公開過跨平台連結,不能據此推論其他匿名帳號也同樣容易被辨識。不過,實驗指出,即使移除姓名等直接識別資訊,發文中的個人經歷與生活細節,仍能成為AI追查真實身分的線索。為研究大規模資料庫配對,團隊另設計「先搜尋、後推理」的分階段流程。系統先從貼文整理生活經歷與職涯輪廓,透過語意向量搜尋縮小候選範圍,再由大型語言模型推理,比對專案經歷、活動時序與其他細節。冷門研究題目、任職產業或搬遷年份,分開看未必足以辨識本人,合起來能大幅提高辨識成功率。搜尋負責找出「誰最像」,推理則檢驗「是不是他」,證據不足便放棄判斷。研究還將多名Reddit使用者各自不同時期的發言切成兩份,測試重新配對能力。這項實驗顯示過去仰賴人工閱讀與比對的工作,如今已有自動化處理的可能。在開放網路代理程式實驗中,研究團隊估計每份檔案的辨識成本約為1至4美元。追查成本降低,原本仰賴資料分散與調查耗時所維持的網路隱匿性,也面臨新的考驗。零散資料經串接後足以描繪個人,臺灣的憲法解釋早已注意到這項風險。司法院釋字第603號審查國家強制蒐錄指紋時,確認資訊隱私權受憲法第22條保障,人民有權決定資料如何揭露、知悉與控制其使用,並更正錯誤記載。理由書也提醒,即使資料並非私密敏感,與其他資訊結合成詳細個人檔案後,仍須評估其侵害程度。釋字第689號則從公共場域的跟追與新聞採訪出發,指出人在公共場所,仍得在符合社會通念且期待已表現於外的範圍內,要求私人活動不受持續侵擾。兩案雖未直接處理網路帳號配對,卻提供了共同的提醒,資料曾經公開,仍須檢視累積、串接與使用後對個人造成的影響。實體跟追與網路資料串接雖然方式不同,都涉及個人的生活被他人長期掌握。片段資訊曾經公開,不代表當事人同意他人將其彙整成完整的人物檔案。隱私權所保障的,除了祕密不被揭露,還包括個人對資料如何被串接與使用的知悉及控制。這種對資料串接與使用的保障,在《個人資料保護法》中也有依據。第2條第1款涵蓋直接或間接可識別自然人的資料,同條第4款將為建立或利用個資檔案所為的「連結」列為處理。匿名貼文與公開履歷經比對後,若能指向特定人,便須檢視個資法的適用。非公務機關蒐集或處理時,仍須有特定目的。主張資料屬當事人自行公開或其他已合法公開者,須符合第19條第1項第3款;主張取自一般可得來源者,須符合第7款及其重大利益但書。兩者均受第5條的誠信、必要範圍及與蒐集目的正當合理關聯的要求拘束。從蒐集貼文、跨平台比對,到建立身分對照表、公開配對結果或轉交他人,各環節可能分別構成蒐集、處理或利用,須依行為主體、追查目的、資料性質與使用方式判斷合法性。非公務機關利用第6條第1項所列類型以外的個資,超出蒐集之特定目的必要範圍時,須符合第20條第1項但書事由;貼文內容若構成病歷、醫療等第6條列舉資料,須檢驗該條的原則與例外。貼文公開可讀,不代表可以任意串接、找出本人,再將真實身分攤在大眾眼前。跨平台比對找出的身分,若被公開或轉交他人,隱私侵擾便從匿名發言延伸到現實生活。配對錯誤,無關者可能遭到指認;配對正確,也可能打破當事人刻意維持的網路活動與現實身分之間的隔離。模型的猜測不能當成身分證明,正確辨識也不等於可以任意揭露。追查目的、比對依據及結果如何使用,都須接受檢驗。從攝影與報刊揭露私人生活,到AI串接匿名發言、找出真實身分,科技改變了隱私遭受侵擾的方式。當零散貼文足以指向本人,隱私保障便不能只停在姓名是否公開,還須關注資料如何被聚合,以及身分如何被揭露。使用者公開發言,不代表放棄對現實身分與私人生活的保護。延伸閱讀AI審查不能只剩「按確認鍵」:財政部內控要點登場後的責任治理考驗數位身分時代資安危機:比個資外洩更可怕的是,當駭客掌握「成為你」的材料當AI不再是黑箱:CID模型如何重塑人工智慧治理的法律邊界?【加入關鍵評論網會員】每天精彩好文直送你的信箱,每週獨享編輯精選、時事精選、藝文週報等特製電子報。還可留言與作者、記者、編輯討論文章內容。立刻點擊免費加入會員!責任編輯:翁世航核稿編輯:羅元祺