黑熊學院》台灣該做的是:確保下一代AI試著理解中文世界時,不是只讀到中國立場

自由時報約 3 分鐘閱讀

站內可閱讀至 (台北時間)

黑熊學院》台灣該做的是:確保下一代AI試著理解中文世界時,不是只讀到中國立場(新聞配圖)
配圖來源:自由時報原站文章
本站保存版本
字級

◎ 黑熊學院 紐時標題:「中國輸出AI數據,北京論述影響全球知識體系」引起擔憂,也有不少台灣人認為「AI等於資訊戰」。 目前我們並不知道各家商業大型語言模型究竟使用了哪些中文網站、各自占多少比例,因為OpenAI、Anthropic、Google等公司並未公開完整的訓練資料清單。 可以確定的是「公開網路是重要來源之一」,但中文網路本身具有一個與英語網路很不一樣的政治結構。 全球絕大多數中文使用人口居住於中國,中國政府又長期對新聞、出版、搜尋引擎與網路平台進行高度控制。 於是問題自然就浮現了:如果大型語言模型大量閱讀人類留下的文字,而且有某一種語言的資訊環境本身受到國家力量系統性介入,這些介入留下的痕跡,會不會也被模型一起學進去? 2026年5月刊登於《自然》(Nature)雜誌的一份研究,正是在回答這個問題。 研究團隊首先比較不同國家的媒體自由程度與大型語言模型使用當地語言回答政治問題時的傾向,發現:「媒體受到國家控制程度愈高,模型以當地語言回答時,對該國政治領導人與制度的評價也往往更加正面。」 這項研究真正重要的發現完全不是「美國AI已經被中國政府控制」,而是證明了一個更基本、近乎常識的機制,亦即「國家對資訊環境的控制,可以透過訓練資料進一步影響大型語言模型的輸出」。 #台灣能做什麼 在台灣社群媒體上,時不時可以看到有人提醒網友,不要回答疑似中國公關公司或資訊操作帳號提出的問題。 但大型語言模型不需要派出假帳號,一題一題詢問台灣人「你們早餐吃什麼」、「台灣人怎麼稱呼某樣東西」,才能學會台灣人的語言與文化。 因為台灣網路上數十年累積的論壇、部落格、公開社群貼文等,本身就是規模極大的語言材料。模型可以從大量文字的統計關係裡學習台灣人使用哪些詞彙、如何造句。 相較之下,派人經營大量假帳號、等待真人逐一回答,再拿這些零碎回答訓練一個大型基礎模型,是極度沒效率的資料蒐集方法。 當然我們還是要有所警覺。如果對方想蒐集的是「特定年齡、政治立場或社會群體」面對「特定問題」時的「真實反應」,設計問題誘導真人回答,仍然可能形成有價值的標註資料,可以用於輿情研究、人物模擬、模型微調或資訊操作。 但這與「中國缺乏台灣語料,所以必須假裝外國人來問台灣人,才能訓練大型語言模型」是兩件不同的事情。 事實上,如果我們真正擔心全球大型語言模型的中文知識受到中國資訊環境過度影響,台灣最「不」應該採取的策略,就是把自己的資料藏起來。 對台灣而言,比起消極的擔心中國官方立場污染民主世界的語言模型,不如積極思考: 「如何讓全球人工智慧系統更容易取得大量、高品質而且具有可信來源的台灣中文資料」? 例如政府公開資料、法院判決、國會紀錄、新聞資料、歷史文化典藏、研究成果,以及台灣社會自然產生的大量文字,都可能構成與中國資訊環境不同的中文世界。 若中國政府已經意識到,未來人工智慧所閱讀的資料本身就是一種基礎建設,因此開始積極向全球提供資料與AI模型。 那麼台灣真正需要面對的,就不該是如何阻止自己的語言被人工智慧讀到,應是如何確保當下一代人工智慧寒窗苦讀試著理解中文世界時,讀到的不是只有中國立場。 ** 大型語言模型如何訓練?用中文提問與跟英文提問,會得到不同的結果?

█本文為專欄合作,完整文章請見

█作者:張茵惠/台灣思想文化協會理事長,現為作家、編輯,企業AI素養講師

本文經授權轉載自黑熊學院臉書