Gemini 重返榮耀?Google 推出 Gemini 4 Argon 旗艦模型,單次輸出上限暴增至 100 萬 Token,19 項跑分 13 項第一

Rocky約 8 分鐘閱讀

站內可閱讀至 (台北時間)

Gemini 重返榮耀?Google 推出 Gemini 4 Argon 旗艦模型,單次輸出上限暴增至 100 萬 Token,19 項跑分 13 項第一(新聞配圖)
配圖來源:電腦王阿達原站文章
本站保存版本
字級

Gemini 已經有好一陣子沒有推出讓人眼睛一亮的旗艦模型了。上一次 Google 拿出最高等級的模型,是今年 2 月的 Gemini 3.1 Pro Preview,5 月的 Google I/O 上,官方雖然曾預告 Gemini 3.5 Pro 會在下個月登場,結果最後沒有推出,反而是 Flash 系列輕量模型從 3.5、3.6、3.7 一路更新到 3.8。這也讓很多人想問,Gemini 是不是快不行了?

而就在稍早,Google 終於端出全新世代 Gemini 4,並率先發表旗艦模型 Gemini 4 Argon。從官方公布的測試結果來看,Argon 在 19 項跑分中拿下 13 項第一,單次輸出上限更從原本的 6.4 萬 Token,一口氣暴增到 100 萬 Token。雖然首波還沒有直接開放給一般用戶使用,但至少從 Gemini 4 Argon 的登場可以看出,沉寂一段時間的 Gemini 旗艦模型,終於開始動起來了。

Google 發表 Gemini 4 Argon:單次輸出上限 100 萬 Token,主攻寫程式、法律財務與資安防禦

稍早 Google 於官方部落格宣佈推出 Gemini 4 Argon 新一代前沿模型,也就是所有模型中最頂尖的等級。Gemini 4 Argon 主攻三個領域:真實世界的軟體工程、法律與財務這類企業知識工作,以及資安防禦。

特色大致可以分成 4 個:

單次輸出上限拉到 100 萬 Token

寫程式與企業知識工作的能力

看圖表、看長影片這類視覺理解

找出並修補資安漏洞的能力

首先是超長的輸出上限。Gemini 4 Argon 單次能輸出的內容上限,從前一代的 6.4 萬 Token 提升到 100 萬 Token,可說是目前業界最高。作為對比,目前競爭對手的輸出上限大多在 12.8 萬 Token。

Google 表示,當模型有足夠的空間深入思考、在一次執行裡產生幾十萬個 Token,就比較有機會一口氣把困難的問題解完,而不是想到一半就被截斷。

寫程式與企業知識工作部分,Google 說內部工程師已經把 Argon 用在日常工作上,從一般除錯、大型程式碼搬遷到演算法設計都有。除此之外,還特別強調 Argon 在財務、法律、稅務這類白領工作的表現,像是做多步驟的財務研究、撰寫法律文件,或是在 Zapier 這類自動化平台上把一整套業務流程從頭跑到尾。

Argon 在需要「視覺理解」的知識工作上也特別強,例如分析專業圖表、從很長的影片裡找出特定細節,或是讀完一系列文件後直接採取行動。

資安防禦是 Google 這次著墨最多的部分。

Google 提到他們刻意把 Gemini 4 Argon 訓練成擅長資安防禦的模型,能自己找出軟體漏洞、驗證漏洞是否真的存在,再自動寫出修補。早期測試中,Argon 在全球醫院使用的醫療軟體裡,找到一個會外洩敏感個資的嚴重漏洞,這是先前其他前沿模型都沒有發現的。

官方這次也公布一張 19 項測試的對照表,比較對象是 OpenAI 的 GPT-6 Astra,以及 Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5,Argon 在其中 13 項拿下第一、1 項並列第一、5 項落後。完整成績表格如下:

類別

測試項目

Gemini 4 Argon

GPT-6 Astra

Claude Fable 5.1

Claude Opus 5.5

知識工作

Vals Index

68.9%

63.1%

65.8%

67.0%

AutomationBench

51.3%

41.4%

31.4%

42.5%

Vals Finance Agent v2

65.4%

53.5%

58.9%

58.6%

Harvey 法律代理測試

19.6%

5.4%

6.7%

3.8%

代理式寫程式

DeepSWE v1.1

77.9%

74.1%

67.4%

74.2%

FrontierSWE v2

55.0%

65.5%

56.3%

62.3%

Vibe Code Bench

91.9%

89.6%

90.3%

90.3%

Terminal-bench 4.0

57.4%

58.2%

57.9%

66.4%

機器學習工程

PostTrainBench

45.3%

44.3%

40.2%

49.3%

科學與數學

Terminal-Bench Science 0.1

57.6%

68.1%

52.6%

63.3%

LABBench 2

88.8%

85.4%

68.6%

73.1%

RiemannBench

76.0%

72.0%

65.6%

69.6%

長上下文

GraphWalks(12.8 萬 Token 以內)

99.7%

98.7%

91.4%

90.6%

GraphWalks(25.6 萬至 100 萬 Token)

84.2%

71.8%

65.0%

66.8%

電腦操作

Agent's Last Exam

39.5%

34.2%

—

38.2%

OSWorld-2.0

69.2%

72.6%

—

—

多模態理解

Chartography

71.6%

71.0%

46.2%

66.3%

LVBench

91.7%

87.5%

79.7%

83.7%

資安

CWE-bench v1

68.0%

68.0%

58.0%

67.0%

先看 Argon 領先的部分,差距最大的集中在企業知識工作。

衡量 AI 在財務、程式、法律、稅務工作上經濟價值的 Vals Index,Argon 拿到 68.9%,Claude Opus 5.5 是 67.0%、Claude Fable 5.1 是 65.8%、GPT-6 Astra 是 63.1%,領先幅度不算大:

差距較大的是 Zapier 推出的 AutomationBench,這項測試看的是模型能不能把業務流程從頭到尾自動跑完,Argon 拿到 51.3%,第二名 Claude Opus 5.5 是 42.5%、GPT-6 Astra 是 41.4%,領先將近 9%:

最誇張的是法律 AI 公司 Harvey 的法律代理測試,這項測試難度很高,四個模型的分數都很低,但 Argon 拿到 19.6%,GPT-6 Astra 只有 5.4%、Claude Opus 5.5 更只有 3.8%,Argon 的分數是對手的三倍以上:

很多人關心的寫程式方面,在 DeepSWE v1.1 測適中,Argon 拿到 77.9%,Claude Opus 5.5 是 74.2%、GPT-6 Astra 是 74.1%,Google 稱這是目前的最高紀錄。Vibe Code Bench 也以 91.9% 小勝兩款 Claude 的 90.3%:

科學與視覺理解也有不錯的表現,像是測試長影片理解的 LVBench,Argon 拿到 91.7%,GPT-6 Astra 是 87.5%、Claude Opus 5.5 是 83.7%。不過電腦操作的 Agent's Last Exam,Argon 39.5% 只比 Claude Opus 5.5 的 38.2% 高一點。

資安則是 Argon 跟 GPT-6 Astra、Grok 4.7 在 CWE-bench v1 並列第一,兩者都是 68%,Claude Opus 5.5 以 67% 緊追在後:

當然,Argon 也不是每一項都贏,有 5 項測試落後,其中 2 項 Argon 甚至是四個模型中的最後一名。

難度更高的軟體工程測試 FrontierSWE v2,Argon 只拿到 55.0%,GPT-6 Astra 是 65.5%、Claude Opus 5.5 是 62.3%。Terminal-bench 4.0 測試 Argon 拿到 57.4%,Claude Opus 5.5 以 66.4% 大幅領先,GPT-6 Astra 也有 58.2%。

比較可惜是,Google 這次沒有放 Gemini 3.1 Pro 或 Gemini 3.8 Flash 的成績,因此沒辦法直接看出 Gemini 4 Argon 在各項測試比前代進步多少。

Gemini 4 Argon 現階段只透過 Google DeepMind 的 Fairwind 計畫開放,尚未開放給一般用戶。不過 Google 有提到,會一邊蒐集早期測試者的回饋、一邊調整防護措施,然後盡快開放給開發者、企業和一般消費者,第一批會是付費 API 客戶和 Google AI Ultra 訂閱者。

API 定價目前已經公佈,分成引入價和正式價兩階段,不過沒說引入期會維持多久:

模型(每百萬 Token)

輸入

快取輸入

輸出

Gemini 4 Argon(引入價)

2 美元

0.10 美元

10 美元

Gemini 4 Argon(正式價)

4 美元

0.20 美元

20 美元

Claude Opus 5.5

4 美元

0.20 美元

20 美元

GPT-6 Astra

10 美元

1 美元

50 美元