AI 造成人類滅絕的機率

賴志文約 10 分鐘閱讀

站內可閱讀至 (台北時間)

AI 造成人類滅絕的機率(新聞配圖)
配圖來源:上報原站文章
本站保存版本
字級

眼前國際主流媒體關注的公共議題之一是,AI 是否已經具有足以破壞人類控制的能力?(法新社)

2026 年 9 月,AI 可能導致人類滅絕,突然變成國際主流媒體集中報導的公共議題。事實上,這是一個重新燃起的長期爭論。AI 可能失去人類控制、甚至威脅人類存續,已經爭論多年。

2026 年 9 月 17 日,英國國王查爾斯三世在蘇格蘭鄧弗里斯莊園召集一場人工智慧會議。NVIDIA 執行長黃仁勳,以及 Google DeepMind、OpenAI、Anthropic 等人工智慧公司的高層都在現場。查爾斯警告,如果人工智慧落入錯誤的人手中,可能帶來「生存性危險」(existential dangers),必須在太遲以前建立足夠的防護措施。

如果要防止人工智慧造成巨大災難,必須先知道風險有多大。但是,AI 滅絕人類的機率,究竟要怎麼算?

要理解這種機率為什麼難算,可以先看一個機率很好算的例子。1935 年,英國統計學家 Ronald Fisher 在《實驗設計》(The Design of Experiments)提出後來著名的「女士品茶」實驗。一位女士聲稱,只要喝一口奶茶,她就能分辨究竟是先倒茶,還是先倒牛奶。Fisher 設計八杯茶,其中四杯先倒茶,四杯先倒牛奶,再讓女士判斷。如果她根本沒有辨別能力,只靠猜測,卻剛好把八杯全部分對,機率是多少?八杯之中選出四杯先倒牛奶,一共有 70 種可能組合。只有其中一種能全部答對,因此機率是 1/70。

這個 1/70 不是「女士具有辨別能力的機率」,而是在她沒有辨別能力的假設下,仍然全部答對的機率。Fisher 能夠算出 1/70,是因為八杯茶如何配置、可能出現多少種組合都由實驗事先確定。

AI 的未來沒有這八杯茶。可是,AI 研究者已經提出具體的百分比。2026 年 9 月,Anthropic 的對齊科學(Alignment Science)主管 Evan Hubinger 公開表示,他確實認為 AI 可能「殺死所有人類」,而他個人估計這件事在未來十年內發生的機率「超過 10%」。他隨後補充,目前的模型造成這種結果的可能性仍低,他擔心的是人工智慧透過遞迴式自我改進形成超級智能。

同樣是一個百分比,Hubinger 的 >10% 顯然不是用 Fisher 的方法算出來的。目前國際間討論 AI 滅絕人類風險時出現的機率數字,依其形成方式,至少可以辨認出三種:專家判斷、群體調查,以及不同條件機率組合後的推算。

重大災難往往缺乏足夠的歷史資料,也無法反覆實驗。如何在這種情況下估計風險,科學界發展出「結構化專家意見徵詢」(structured expert elicitation)。

2020 年底,加勒比海聖文森島的蘇弗里耶爾火山重新活動,就曾實際使用這套方法。當時沒有人知道火山是否會從持續的熔岩活動轉為爆炸式噴發。研究團隊定期集合不同專家的判斷,再隨監測資料更新估計。

2021 年 1 月到 3 月初,專家估計未來幾週轉為爆炸式活動的中位機率大約是 10%。3 月 23 至 24 日出現火山構造型地震群後,估計提高到約 20%。4 月 8 日出現帶狀火山震顫後,估計再提高到約 60%。

這些估計不只為了出研究報告。研究團隊把專家徵詢的結果納入提供給決策者的建議。4 月 8 日,當局獲知火山活動升高,同日把警戒提升到紅色,約 1.6 萬名居民撤離紅色與橙色警戒區。隔天中午,蘇弗里耶爾火山開始爆炸式噴發,沒有傳出嚴重傷亡或死亡。

蘇弗里耶爾火山顯示,專家判斷可以被結構化,並隨新的監測證據持續修正。Hubinger 提出的 >10% 同樣來自專業知識與現有資訊的判斷。這個數字若要進一步評估,就要知道它根據哪些證據形成,以及什麼新證據會讓它上升或下降。

黃仁勳提醒:沒有準備好的產品就不要推出。(資料照片/王侑聖攝)

除了由特定專家估計風險,也可以透過大規模調查,了解一個專業群體如何判斷同一項風險。2023 年,一項大型調查詢問 2,778 名曾在頂尖人工智慧學術會議或期刊發表論文的研究者,如何預測人工智慧未來的能力與影響。這項研究後來於 2025 年正式刊登於《人工智慧研究期刊》。

研究團隊以幾道不同問題,詢問 AI 滅絕人類或同等嚴重結果的可能性。調查結果顯示,各題回答「至少有 10% 機率」的受訪者比例不同,約在 38% 至 51% 之間。

2,778 人的調查,比一個人的判斷更能描述 AI 研究者群體如何看待風險。但是,受訪者即使增加到過萬人,增加的仍是我們對 AI 研究者如何判斷風險的了解,而不是對 AI 未來發展的直接觀察。

2009 年,法國航空 AF447 失事後的搜索,可以說明兩者的差別。6 月 1 日,AF447 從里約熱內盧飛往巴黎途中墜入大西洋。海面搜索找到部分殘骸,但主要機身與黑盒子沉在海底,此後多次水下搜索都沒有找到。

兩年搜尋無果後,法國航空事故調查局委託美國 Metron 團隊重新分析搜索範圍。研究人員使用貝葉斯統計,把先前掌握的資訊與歷次搜索結果納入分析,重新建立殘骸位置的機率分布。前幾輪沒有找到飛機,本身也是新的證據。某片海域經過充分搜索仍沒有發現殘骸,飛機位於該處的估計機率就會降低。

2011 年,新一輪搜索依照更新後的機率圖展開。幾天之內,搜索團隊找到主要殘骸,之後也尋獲飛行資料記錄器與座艙語音記錄器。

法航 AF447 的搜索之所以出現轉機,是因為新的證據改變了對飛機位置的機率估計。AI 的風險估計也是如此:群體調查可以告訴我們研究者如何判斷風險;新的能力測試、安全實驗與實際部署結果,才能增加關於 AI 本身的證據。

如果測試發現 AI 模型比原先預期更容易規避監督,原來的風險估計就有了向上修正的依據;如果足以偵測某項危險能力的測試反覆沒有發現這項能力,也有了向下修正的依據。

還有另一種截然不同的做法:不直接估計「AI 滅絕人類的機率」,而是分析其可能發生的原因並分別估計可能性,再推算整體機率。

2026 年,《經濟模型》(Economic Modelling)期刊刊登了〈滅絕機率(p(doom))的經濟學:變革性人工智慧時代的生存風險與經濟成長情境〉一文,研究者把可能導致人工智慧災難的過程拆成四項:p1 是變革性人工智慧出現的機率;p2 是它出現後奪取主導權的機率;p3 是取得主導權後,人工智慧的目標與原先設定不一致的機率;p4 則是原本目標一致,但後來情況改變時,人工智慧無法自行修正的機率。

四項機率最後組成:

p(doom) = p1p2p3 + p1p2(1 – p3)p4

公式列出兩條導致 p(doom) 的路徑:第一項代表人工智慧出現、奪取主導權,而且目標不一致;第二項代表人工智慧出現、奪取主導權,原先目標一致,後來卻因無法修正而走向災難。兩條路徑相加,就是整體的 p(doom)。

可是,把問題拆開並不能直接估計出 p1、p2、p3、p4。

論文作者明確指出,就他們所知,模型需要的 p1 至 p4 還沒有經過正式的專家估計,因此只能提出與既有專家敘述及整體 p(doom) 大致相容的粗略數值。作者也特別提醒,表中的分解只是示範性情境,不是對這些條件機率的實證校準。

工程界處理重大事故時,也碰過這個問題。1975 年,美國公布 WASH-1400《反應爐安全研究》報告。核反應爐核心熔毀不是可以反覆觀察的事件,當時也缺乏足以直接計算重大事故頻率的資料。研究團隊因此利用故障樹等方法,把重大事故拆成設備故障、系統失效與不同事故序列,再估計它們對核心熔毀風險的影響。研究結果顯示,風險並不只來自大型管線破裂等重大事故,小型冷卻水流失事故與人員操作失誤也可能成為核心熔毀的重要風險來源。這項研究後來成為機率風險評估(PRA)的重要里程碑。

WASH-1400 並沒有因為把事故拆開,就消除機率估計本身的不確定性。相反地,事故被拆成不同故障與事件後,哪些數值有運轉資料支持、哪些依賴工程判斷、哪些仍有很大的不確定性,也變得更清楚。

四年後,三哩島核事故發生。事故中出現的,正包括小型冷卻水流失與操作人員失誤。WASH-1400 並沒有預測三哩島事故,但它已經把後來實際出現的重要風險因素,從一個總體的核災機率中辨認出來。三哩島事故後,風險評估重新受到重視。到 1982 年,美國核能管制委員會主席已指出,PRA 對執照審查、監管要求、新反應爐設計,以及研究與檢查優先順序都具有重要作用。

WASH-1400 的價值,在於事故被拆成不同原因後,研究者可以逐項尋找設備故障率、系統可靠度與人員操作等資料,也能看出哪些估計仍然依賴工程判斷、哪些不確定性最大。

《Economic Modelling》對 p(doom) 的條件推算也有同樣的作用。它的價值不只在最後得到一個滅絕機率,也在於把這個機率拆開後,辨認風險主要來自哪裡,以及哪些部分最需要新的證據。

三個歷史案例共同顯示,面對無法反覆實驗的重大風險,機率估計並不止於得到一個百分比。新的證據可以改變原有估計;把風險拆開,可以找出風險主要來自哪裡;即使仍有不確定性,機率估計也可以隨著證據增加而修正,並用來支持後續決策。

AI 安全研究也正在累積這些證據。2026 年《國際人工智慧安全報告》沒有提出「AI 滅絕人類」的官方百分比。報告把失去控制拆成幾項更具體的條件:AI 是否已經具有足以破壞人類控制的能力?即使具有能力,它是否會以有害方式使用這些能力?人類又是否把它部署在提供足夠權限與機會的環境裡?

目前的 AI 還沒有足以造成失去控制的整體能力;但與風險相關的能力正在進步。模型愈來愈能辨認自己正在接受測試、尋找評測漏洞,在實驗中也出現規避監督、獎勵黑客(reward hacking)等行為。

這些實驗不能直接算出「AI 滅絕人類的機率」,卻能逐步增加與失控風險有關的證據。

9 月 17 日,黃仁勳回應英國國王查爾斯,談的是科技業熟悉的產品安全:沒有準備好的產品就不要推出。人工智慧可以快速發展,但產品上市以前必須經過充分測試。

問題在於沒有可直接驗證 AI 滅絕人類機率的測試。Fisher 有八杯茶。蘇弗里耶爾的火山學家有地震、氣體與地表變形;AF447 的搜索團隊有最後位置、聲納與搜索紀錄;核能工程師有設備故障、運轉資料與真正發生的異常事件。AI 安全研究者能測量模型的能力與行為,卻沒有四杯「人類存續」和四杯「人類滅絕」。

因此,p(doom) 不會像「女士品茶」一樣,從一個事先確定的實驗直接算出來。它可能來自專家判斷、群體調查或條件推算,而這些估計是否需要改變,仍要看新的能力測試、安全實驗與實際部署的結果。

能辨識一個機率怎麼來,才能知道它還缺什麼證據;知道它還缺什麼證據,才知道下一步該測量什麼,以及這個數字現在足以支持什麼行動。

※作者從事半導體業二十餘年,現為自由撰稿人。

AI

黃仁勳

人類滅絕

查爾斯