Google 強勢反攻!Gemini 4 Argon 模型登場,100 萬詞元輸出、基準測試挑戰 GPT-6、Fable 5.1

Ted約 7 分鐘閱讀

站內可閱讀至 (台北時間)

Google 強勢反攻!Gemini 4 Argon 模型登場,100 萬詞元輸出、基準測試挑戰 GPT-6、Fable 5.1(新聞配圖)
配圖來源:蘋果仁原站文章
本站保存版本
字級

別再笑 Gemini 三頭龍,這次 Google 準備要強勢反攻啦!今日(10/1)Google 正式發表全新前沿 AI 模型 Gemini 4 Argon,主打更強的程式開發、深度研究、企業工作與網路安全能力,其中輸出上限更從原本的 6.4 萬Token 一口氣暴增到 100 萬 Token。

而在基準測試中,Gemini 4 Argon 也交出相當亮眼的成績,多個項目皆領先 GPT-6、Fable 5.1、Opus 5.5;只不過目前尚未公開上線,想用還得再等等。

Google Gemini 4 Argon 四大升級重點整理

輸出上限提高到 100 萬 Token

Gemini 4 Argon 最直接的規格升級,就是輸出 Token 上限從原本的 6.4 萬提高到 100 萬;作為對比,目前 GPT-6 與 Claude Fable 5.1 的單次最大輸出都是 12.8 萬 Token。而輸出上限提高後,Gemini 4 就能在單次任務中持續產生更多內容,更適合處理需要長時間推理、分析與執行的複雜工作。

Google 也將 Gemini 4 定位成能穩定執行耗時、多步驟工作的模型,目前已有數千名 Google 員工將它應用在程式開發、深度研究與寫作等工作中。

寫程式能力更強,已能處理數十萬行大型專案

「程式開發」是 Gemini 4 Argon 的強項之一;Google 已經實際用 Gemini 4 協助處理內部大型程式專案,包括把原本以 C、C++ 撰寫的程式轉換成 Rust,甚至能處理超過 80 萬行程式碼的大型專案。

除此之外,Gemini 4 也被用來改善 Google 資料中心的記憶體使用效率,目前已經釋放超過 300 TiB 的記憶體空間;在量子運算研究中,Gemini 4 更只花了幾分鐘,就找到比現有公開研究成果改善約 40% 的最佳化方案。

不只寫程式,金融、法律、影片理解也更強

Gemini 4 Argon 並不只針對工程師設計。Google 也特別強調它處理知識型工作的能力,包括金融研究、法律研究、文件草擬與深度研究等領域;碰到需要搜尋大量資料、交叉分析資訊,再整理成完整結果的工作時,Gemini 4 會持續完成多個步驟,而不只是針對單一問題提供答案。

Gemini 4 的多模態理解能力同樣出色,可以分析專業圖表、從長影片中找出指定資訊,也能閱讀一系列文件後進一步執行任務。換句話說,Google 想讓 Gemini 從原本「回答問題、整理資料」的 AI 工具,逐漸變成可以參與完整工作流程的 AI。

強化網路安全,可主動尋找與修補漏洞

網路安全是 Gemini 4 Argon 的另一項重要能力。Google 表示 Gemini 4 可以自主尋找、驗證並協助修補軟體漏洞,資安公司 Wiz 已經透過「Scan for Good」計畫實際使用 Gemini 尋找高風險漏洞。

在一次測試中,Gemini 4 有找到一項可能造成全球醫院使用的醫療軟體洩露敏感個人資訊的重大漏洞,而且這項問題先前並未被其他受測的 AI 模型發現。不過由於這類能力同樣可能遭到濫用,因此 Google 目前沒有直接把完整的網路安全能力提供給所有用戶,而是先開放給受信任的防禦專家與內部團隊。

Gemini 4 Argon 多項測試領先 GPT-6、Fable 5.1、Opus 5.5

從 Google 公布的基準測試來看,Gemini 4 Argon 在知識工作、程式開發、長內容理解、影片理解與網路安全等多個項目都有不錯的表現。在涵蓋 19 個比較項目的測試表中,Gemini 4 有 13 項拿下最高分或並列最高分,但並非所有項目都領先。

例如在測試真實世界長時間程式開發能力的 DeepSWE v1.1 中,Gemini 4 拿下 77.9%,高於 GPT-6 Astra 的 74.1%;長影片理解 LVBench 則達到 91.7%,GPT-6 為 87.5%。

而在 GraphWalks 的 25.6 萬至 100 萬詞元測試中,Gemini 4 得到 84.2%,明顯高於 GPT-6 Astra 的 71.8% 以及 Fable 5.1 的 65.0% 與 Opus 5.5 的 66.8%,也呼應這次 Google 大幅強化長時間、複雜任務處理能力的升級方向。

當然 Gemini 4 並不是每個項目都第一,例如部分程式開發、科學與電腦操作測試仍由 GPT-6 Astra 或 Claude Opus 5.5 領先。

測試類別

基準測試

Gemini 4

GPT-6

Fable 5.1

Opus 5.5

知識工作

Vals Index

68.9%

63.1%

65.8%

67.0%

AutomationBench

51.3%

41.4%

31.4%

42.5%

Vals Finance Agent v2

65.4%

53.5%

58.9%

58.6%

Harvey's Legal Agent Benchmark

19.6%

5.4%

6.7%

3.8%

程式開發

DeepSWE v1.1

77.9%

74.1%

67.4%

74.2%

FrontierSWE v2

55.0%

65.5%

56.3%

62.3%

Vibe Code Bench

91.9%

89.6%

90.3%

90.3%

Terminal-bench 4.0

57.4%

58.2%

57.9%

66.4%

機器學習工程

PostTrainBench

45.3%

44.3%

40.2%

49.3%

科學與數學

Terminal-Bench Science 0.1

57.6%

68.1%

52.6%

63.3%

LABBench 2

88.8%

85.4%

68.6%

73.1%

RiemannBench

76.0%

72.0%

65.6%

69.6%

長內容理解

GraphWalks(最高 128K)

99.7%

98.7%

91.4%

90.6%

GraphWalks(256K~1M)

84.2%

71.8%

65.0%

66.8%

電腦操作

Agent's Last Exam

39.5%

34.2%

—

38.2%

OSWorld-2.0

69.2%

72.6%

—

—

多模態理解

Chartography

71.6%

71.0%

46.2%

66.3%

LVBench

91.7%

87.5%

79.7%

83.7%

網路安全

CWE-bench v1

68.0%

68.0%

58.0%

67.0%

Gemini 4 Argon 尚未公開上線,想用還得再等等

API 價格方面,Gemini 4 Argon 每百萬輸入 Token 為 2 美元、每百萬輸出 Token 為 10 美元,快取輸入 Token 則比一般輸入價格低 95%。

但目前尚未開放給所有 Gemini 用戶,Google 是先透過 Fairwind 計畫,讓部分受信任的網路安全防禦專家使用 Gemini 4,同時在正式大規模發布前進行安全評估,並根據早期使用者的回饋持續調整模型與安全機制。

接下來 Gemini 4 會率先提供給付費 API 客戶以及 Google AI Ultra 訂閱者使用,之後再逐步擴大使用範圍,但 Google 並未明確公布時間排程。

Google 這次對 Gemini 4 的定位已經明顯從「更會回答問題的 AI」,往「可以長時間執行複雜工作」發展;等到後續正式擴大開放,這些能力才會真正進入一般用戶的日常使用情境,是否能擺脫「呆頭龍」稱號,就看接下來的市場考驗了。