Gemini 重返榮耀?Google 推出 Gemini 4 Argon 旗艦模型,單次輸出上限暴增至 100 萬 Token,19 項跑分 13 項第一
站內可閱讀至 (台北時間)

Gemini 已經有好一陣子沒有推出讓人眼睛一亮的旗艦模型了。上一次 Google 拿出最高等級的模型,是今年 2 月的 Gemini 3.1 Pro Preview,5 月的 Google I/O 上,官方雖然曾預告 Gemini 3.5 Pro 會在下個月登場,結果最後沒有推出,反而是 Flash 系列輕量模型從 3.5、3.6、3.7 一路更新到 3.8。這也讓很多人想問,Gemini 是不是快不行了?
而就在稍早,Google 終於端出全新世代 Gemini 4,並率先發表旗艦模型 Gemini 4 Argon。從官方公布的測試結果來看,Argon 在 19 項跑分中拿下 13 項第一,單次輸出上限更從原本的 6.4 萬 Token,一口氣暴增到 100 萬 Token。雖然首波還沒有直接開放給一般用戶使用,但至少從 Gemini 4 Argon 的登場可以看出,沉寂一段時間的 Gemini 旗艦模型,終於開始動起來了。
Google 發表 Gemini 4 Argon:單次輸出上限 100 萬 Token,主攻寫程式、法律財務與資安防禦
稍早 Google 於官方部落格宣佈推出 Gemini 4 Argon 新一代前沿模型,也就是所有模型中最頂尖的等級。Gemini 4 Argon 主攻三個領域:真實世界的軟體工程、法律與財務這類企業知識工作,以及資安防禦。
特色大致可以分成 4 個:
單次輸出上限拉到 100 萬 Token
寫程式與企業知識工作的能力
看圖表、看長影片這類視覺理解
找出並修補資安漏洞的能力
首先是超長的輸出上限。Gemini 4 Argon 單次能輸出的內容上限,從前一代的 6.4 萬 Token 提升到 100 萬 Token,可說是目前業界最高。作為對比,目前競爭對手的輸出上限大多在 12.8 萬 Token。
Google 表示,當模型有足夠的空間深入思考、在一次執行裡產生幾十萬個 Token,就比較有機會一口氣把困難的問題解完,而不是想到一半就被截斷。
寫程式與企業知識工作部分,Google 說內部工程師已經把 Argon 用在日常工作上,從一般除錯、大型程式碼搬遷到演算法設計都有。除此之外,還特別強調 Argon 在財務、法律、稅務這類白領工作的表現,像是做多步驟的財務研究、撰寫法律文件,或是在 Zapier 這類自動化平台上把一整套業務流程從頭跑到尾。
Argon 在需要「視覺理解」的知識工作上也特別強,例如分析專業圖表、從很長的影片裡找出特定細節,或是讀完一系列文件後直接採取行動。
資安防禦是 Google 這次著墨最多的部分。
Google 提到他們刻意把 Gemini 4 Argon 訓練成擅長資安防禦的模型,能自己找出軟體漏洞、驗證漏洞是否真的存在,再自動寫出修補。早期測試中,Argon 在全球醫院使用的醫療軟體裡,找到一個會外洩敏感個資的嚴重漏洞,這是先前其他前沿模型都沒有發現的。
官方這次也公布一張 19 項測試的對照表,比較對象是 OpenAI 的 GPT-6 Astra,以及 Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5,Argon 在其中 13 項拿下第一、1 項並列第一、5 項落後。完整成績表格如下:
類別
測試項目
Gemini 4 Argon
GPT-6 Astra
Claude Fable 5.1
Claude Opus 5.5
知識工作
Vals Index
68.9%
63.1%
65.8%
67.0%
AutomationBench
51.3%
41.4%
31.4%
42.5%
Vals Finance Agent v2
65.4%
53.5%
58.9%
58.6%
Harvey 法律代理測試
19.6%
5.4%
6.7%
3.8%
代理式寫程式
DeepSWE v1.1
77.9%
74.1%
67.4%
74.2%
FrontierSWE v2
55.0%
65.5%
56.3%
62.3%
Vibe Code Bench
91.9%
89.6%
90.3%
90.3%
Terminal-bench 4.0
57.4%
58.2%
57.9%
66.4%
機器學習工程
PostTrainBench
45.3%
44.3%
40.2%
49.3%
科學與數學
Terminal-Bench Science 0.1
57.6%
68.1%
52.6%
63.3%
LABBench 2
88.8%
85.4%
68.6%
73.1%
RiemannBench
76.0%
72.0%
65.6%
69.6%
長上下文
GraphWalks(12.8 萬 Token 以內)
99.7%
98.7%
91.4%
90.6%
GraphWalks(25.6 萬至 100 萬 Token)
84.2%
71.8%
65.0%
66.8%
電腦操作
Agent's Last Exam
39.5%
34.2%
—
38.2%
OSWorld-2.0
69.2%
72.6%
—
—
多模態理解
Chartography
71.6%
71.0%
46.2%
66.3%
LVBench
91.7%
87.5%
79.7%
83.7%
資安
CWE-bench v1
68.0%
68.0%
58.0%
67.0%
先看 Argon 領先的部分,差距最大的集中在企業知識工作。
衡量 AI 在財務、程式、法律、稅務工作上經濟價值的 Vals Index,Argon 拿到 68.9%,Claude Opus 5.5 是 67.0%、Claude Fable 5.1 是 65.8%、GPT-6 Astra 是 63.1%,領先幅度不算大:
差距較大的是 Zapier 推出的 AutomationBench,這項測試看的是模型能不能把業務流程從頭到尾自動跑完,Argon 拿到 51.3%,第二名 Claude Opus 5.5 是 42.5%、GPT-6 Astra 是 41.4%,領先將近 9%:
最誇張的是法律 AI 公司 Harvey 的法律代理測試,這項測試難度很高,四個模型的分數都很低,但 Argon 拿到 19.6%,GPT-6 Astra 只有 5.4%、Claude Opus 5.5 更只有 3.8%,Argon 的分數是對手的三倍以上:
很多人關心的寫程式方面,在 DeepSWE v1.1 測適中,Argon 拿到 77.9%,Claude Opus 5.5 是 74.2%、GPT-6 Astra 是 74.1%,Google 稱這是目前的最高紀錄。Vibe Code Bench 也以 91.9% 小勝兩款 Claude 的 90.3%:
科學與視覺理解也有不錯的表現,像是測試長影片理解的 LVBench,Argon 拿到 91.7%,GPT-6 Astra 是 87.5%、Claude Opus 5.5 是 83.7%。不過電腦操作的 Agent's Last Exam,Argon 39.5% 只比 Claude Opus 5.5 的 38.2% 高一點。
資安則是 Argon 跟 GPT-6 Astra、Grok 4.7 在 CWE-bench v1 並列第一,兩者都是 68%,Claude Opus 5.5 以 67% 緊追在後:
當然,Argon 也不是每一項都贏,有 5 項測試落後,其中 2 項 Argon 甚至是四個模型中的最後一名。
難度更高的軟體工程測試 FrontierSWE v2,Argon 只拿到 55.0%,GPT-6 Astra 是 65.5%、Claude Opus 5.5 是 62.3%。Terminal-bench 4.0 測試 Argon 拿到 57.4%,Claude Opus 5.5 以 66.4% 大幅領先,GPT-6 Astra 也有 58.2%。
比較可惜是,Google 這次沒有放 Gemini 3.1 Pro 或 Gemini 3.8 Flash 的成績,因此沒辦法直接看出 Gemini 4 Argon 在各項測試比前代進步多少。
Gemini 4 Argon 現階段只透過 Google DeepMind 的 Fairwind 計畫開放,尚未開放給一般用戶。不過 Google 有提到,會一邊蒐集早期測試者的回饋、一邊調整防護措施,然後盡快開放給開發者、企業和一般消費者,第一批會是付費 API 客戶和 Google AI Ultra 訂閱者。
API 定價目前已經公佈,分成引入價和正式價兩階段,不過沒說引入期會維持多久:
模型(每百萬 Token)
輸入
快取輸入
輸出
Gemini 4 Argon(引入價)
2 美元
0.10 美元
10 美元
Gemini 4 Argon(正式價)
4 美元
0.20 美元
20 美元
Claude Opus 5.5
4 美元
0.20 美元
20 美元
GPT-6 Astra
10 美元
1 美元
50 美元