案件太多、敏感卷證又不能上商用AI,法務部啟動三年主權AI計畫
站內可閱讀至 (台北時間)

攝影/王若樸
「案件這麼多,又不讓我用AI,要我怎麼辦?」時任法務部綜合規劃司副司長古慧珍在8月底數位政府高峰會上,用這句第一線同仁可能的抱怨,點出法務部推動AI的兩難:檢察官、觀護人需要工具幫忙整理資料和文書,但卷宗內有個資、案情和偵查脈絡,不能直接上傳到商用AI。
法務部的解法是,要用三年時間建立自己的三層式主權AI平臺:底層共用算力與資料湖,中層提供法務專屬大型語言模型推論系統,上層則是自主開發的AI助理應用。今年,這項計畫先選定代表性場域、展開試驗,明年則進入推廣期,要逐步擴增本土司法語料庫和實務案例,2028年預計擴大規模、形成持續演進的法務AI生態系。
古慧珍指出,法務部及所屬共有127個機關。光是2025年,刑事案件就有265萬件、行政執行案件1,358萬件,觀護受理案件也破12.5萬件,加起來超過1,600萬件。每一份案件,都需要人工閱讀卷證、查找前科到登打系統欄位,這種重複性工作往往占用第一線人員3成以上的工作時間。
雖然ChatGPT、Gemini等現成商用AI,看似能解決上述重複性工作,法務部卻有2大顧慮。首先是資料安全,偵查與觀護資料包含個資,也記載案件如何調查、如何處理;即使去掉姓名等識別資訊,剩下的內容仍可能透露案情或偵查方法。
再來,這類商用AI模型真能讀懂臺灣法律與法務工作嗎?古慧珍點出,這些商用模型未必理解臺灣法律用語、檢察書類或是實務脈絡。因此,法務部希望自己掌握資料、模型選擇與部署方式,在符合《人工智慧基本法》的原則下,來建立一套部署於可控、隔離環境,且能滿足業務需求的AI推論系統,打造專屬的法務主權AI服務。
古慧珍也強調,法務部建立專用AI,只是用來輔助檢察官整理資訊及製作文書,不能替檢察官認定事實、適用法律或作成案件處分。
法務部這項計畫名為法務專屬大型語言模型計畫,共分三層架構。第一層是建立共用算力池與資料湖,第二層建立法務專屬模型推論系統,第三層則是各類應用服務,比如檢察官及觀護的專用AI助理、行政執行AI工具、AI文件審閱等應用。
法務部的概念是「底層資源共享、應用服務分流」,共用昂貴的算力資源和資料基礎,各單位再根據自己的工作痛點去發展AI應用。
其中,第一層包含算力池和資料湖。以算力池來說,法務部的目標是要支援1200億(120B)以上參數的大型語言模型(LLM),有能力支援150人同步上線的推論需求。資料湖則用來集中管理結構化與非結構化資料,維持資料治理的一致性,讓資料的來源、流向及使用情形可以管理、追溯,供第二層模型及第三層應用調用。
不過,主權AI所需算力,要全部自建嗎?古慧珍坦言,GPU伺服器、散熱及後續擴充都要成本。因此,法務部考慮較有彈性的部署方式,一部分核心算力自建,另一部分則在符合資安條件下,向國網中心租用隔離的運算資源,作為法務部算力池的延伸。
另一個更現實的問題是,各地檢署的網路,到底跟不跟得上。法務部所屬機關的網路頻寬約分為30Mbps、50Mbps及100Mbps等級,若將所有卷證、錄音與提示詞都要上傳到法務部處理,可能造成網路傳輸大塞車。
因此,法務部預留AI PC的發展空間,並考慮將OCR、語音轉文字等較小型的AI工作,直接在各地檢署中執行,不必把所有資料都送回法務部。
有了算力和資料,第二層才是整套系統的核心大腦,也就是法務專屬語言模型推論系統。法務部希望採用的模型,不只懂繁體中文和臺灣法律,還要理解檢察機關如何處理案件。
要讓模型學會這些知識,法務部得準備自己的語料。除了辦案工具與法律書籍,團隊也希望蒐集檢察官製作的偵查書類。這些起訴書、不起訴處分書,記錄了檢察官如何整理事實、作成處分及說明理由,背後正是第一線長期累積的實務經驗。
「模型至少要懂檢察官在想什麼。」古慧珍表示,法務部打算建立封閉語料庫,並依資料敏感程度、使用者角色分層授權;例如,系統要根據檢察官、觀護人等角色,設計不同資料的存取限制,不能因為共用同一套AI底層,就看見彼此的資料。
即使模型與資料都留在內部,原始案件資料不能未經處理,就直接用於訓練模型。法務部得先找出具代表性的高品質案例,進行去識別化,避免模型記住個人資料,日後遭有心人透過提示詞問出特定人士的前科或案件資訊。「要人工智慧前,一定要有工人智慧。」古慧珍說,如何找到高品質資料、安全用於模型訓練,是這項計畫最費工的環節之一。
為了找出合適的技術架構,法務部打算在計畫第一年,先進行多路線實驗。一種做法是測試多款開源模型,比如Gemma 4、總參數達675B的Mistral Large 3,搭配檢索增強生成(RAG)、Agent skills及工作流程,模型可以從法務知識庫取得資料來完成指定任務;另一種是用法務語料微調模型,來讓模型學習專業知識。同時,團隊也會嘗試多個模型協作推論,來比較不同做法的效果與運算成本。
為了不被單一模型綁住,法務部還要建立自己的評測資料集和評測方法。未來出現新模型時,就可以用同一套法務題目測試,再決定是否替換,保留模型快速更新的彈性。
最上層則是各種第一線會使用的AI工具。法務部第一波先聚焦2項代表性應用,分別是檢察官AI助理和觀護AI助理。
以檢察業務來說,公訴卷宗長達數百、數千頁,檢察官與同仁不只要逐頁閱讀,還得人工查找裁判書及前科,再把所需資訊登錄案管系統。法務部規畫,先用OCR讀取卷證,再以AI加上標籤、製作摘要,並從裁判書擷取前科等欄位,自動帶入系統或整理成清單,降低人工查找與登打錯誤。
對於高度類型化的案件,AI可以協助撰寫書類初稿。檢察官可先提供慣用範本和制式理由段落,在認定事實、決定起訴或不起訴後,再透過AI協助,把決定寫成文字。
「它是文字的表述,它不是幫你做決定。」古慧珍強調,AI不能替檢察官認定事實或適用法律,產出的初稿須經過檢察官審核。即使文件由AI生成,最後的判斷與責任仍在檢察官身上。
另一款觀護AI助理,則從訪談與紀錄工作切入。2025年觀護受理案件超過12.5萬件,平均一名觀護人一年要辦理超過500件。觀護人除了和個案面談,還要整理錄音、撰寫觀護紀錄,並查看其他相關資料。
法務部規畫以語音辨識將訪談錄音轉成文字,再結合刑案紀錄、系統資料與動態因子,輔助製作觀護紀錄和風險評估報告。古慧珍期待,觀護人減少資料整理負擔後,可以進行更深入的面談,也能更快掌握高風險案件。不過,這些結果只供決策輔助,最後仍由觀護人員判斷。
除了這2款助理,法務部也會開發行政執行AI知識庫、AI文件審閱員、國會資訊AI分析等應用。這些工具將由各業務單位結合RAG、Agent skills與工作流程開發,處理各自的第一線需求。
除了三層架構,法務部將計畫分成三年推進。2026年是試驗期,先選定代表性場域,比較不同模型、技術與應用方式;2027年進入推廣期,待可行性與安全性獲得驗證後,再逐步擴增本土司法語料和實務案例;2028年則進入優化期,擴大部署規模,形成持續演進的法務AI生態系。
這項計畫橫跨法律業務、AI技術、資料治理及多個所屬機關,所以,法務部會引入第三方專案管理團隊,協助法律與AI技術諮詢、管控里程碑和進度、制定驗收標準,並導入獨立驗測機制。
法務部目前先採取諮詢會形式運作,後續希望建立AI資料治理相關機制,將《人工智慧基本法》的原則及資料治理要求,帶進整個計畫。
法務部預期,這些AI應用能將文書處理時間減少30%,並降低重複性工作及人工登打錯誤,讓檢察官、觀護人和行政執行人員,把時間用在更需要專業判斷的工作。
不過,主權AI要落地,還得克服新的治理問題。法務部希望,在治理上要做到資料不外流、操作可稽核、責任可追溯;但使用者從登入系統、輸入提示詞、上傳卷證,到取得AI產出的文件,究竟哪些紀錄要保存,又該保存多久,目前還沒有完整的答案。
「全部都要保留六個月嗎?硬體空間夠不夠?成本要多少?」古慧珍指出,AI紀錄如何留存,不只牽涉資安,也與儲存成本、資料治理有關,仍有待進一步的規範。
法務部的主權AI計畫要解決的不只是模型效用。從整理安全可用的法務語料、讓各地機關順利連上服務,到釐清AI使用紀錄的管理規則,都是法務部接下來要面對的落地課題。