Google公布Gemini 4 Argon前沿模型,自知識工作至網路安全全面進化
站內可閱讀至 (台北時間)

現在生成式AI的更迭速度相當快,同時也有越來越多針對特定領域的延伸版本,Google繼Gemini 3系列推出多個延伸版本後,正式推出全新前沿模型Gemini 4 Argon,在複雜、長期的工作流程中維持深度的推理,在多項複雜工作流程具備出色的表現,並涵蓋真實世界的軟體工程、法律與金融知識工作,同時有著出色的網路安全防禦能力,同時也在Google內部獲得實證。優先開放受信任網路安全防禦專家的先進模型Gemini 4 Argon屬於高度先進的前沿模型,在擴大使用範圍前配合美國政府志願性計畫,先開放全縣給相關單位評估,同時蒐集早期測試者回饋不斷迭代。同時Google將自防禦濫用行為、防禦提示注入攻擊、監控未對齊行為、系統強化等四大領域持續增強。Argon優先透過Fairwind計畫開放給獲信任的網路安全專家,後續Gemini 4 Argon將率先開放給付費API客戶與Google AI Ultra訂閱者使用;Argon將提供優惠價,每百萬輸入Token為2美元,每百萬輸出Token為10美元,快速輸入Token價格比一般輸入Token計價便宜95%。已改變Google內部工作與開發方式Gemini 4 Argon已在Google內部工作流程導入,數千名員工表示受惠Argon在專業程式編寫任務、執行深度研究與寫作品質具有優勢,並在3大重大工程領域帶來突破。數分鐘將量子演算法提升40%:在複雜的量子運算,某些特定程序會導致拖慢整體執行速度,而Argon協助相關團隊突破效能瓶頸,大幅提升運算所需的量子位元x邏輯閘的時空資源,在一個實際案例,Argon僅花數分鐘時間,就比現有公開文獻提升40%表現。改善記憶體效率:透過Argon分析Google資料中心整體系統資源的效能分析數據,自主辨識與套用記憶體最佳化方案後,透過全面布署,已經釋放超過300TiB記憶體,預估整體可節省約500TiB至1PiB記憶體容量。大規模程式碼庫遷移與最佳化:Argon代理程式已將Google內部的C/C++程式碼轉移至Rust,規模自re2、libgav1 等核心函式庫的數萬行,涵蓋至Fuchsia Zircon核心的80多萬行。顧及許多系統的關鍵性,這類大規模重寫在投入生產環境前,都會經過嚴格的自動與手動稽核、模擬測試及審查。Argon代理程式改善libgav1解碼性能Google舉出具體的案例,利用Argon代理程式接手Google影片解碼開源軟體libgav1的Ryst移植版本,並成功替換高達3.2萬行SIMD程式碼,Argon在過程中反覆進行效能測試、分析編譯器輸出結果,最後完成安全的Rust程式碼,使編譯器可自動完成向量化處理,不僅維持與原本相同的影片表現,更使執行速度較原本Rust版本提高2.7倍,直逼高度最佳化的C++版本,並兼具記憶體安全。為解決複雜難題而生▲Argon在多個領域皆有出色的領先表現Gemini 4 Argon旨在解決更長、更複雜的使用情境,模型輸出詞元上限自先前6.4萬個Token大幅提升至100萬個Token,使模型能有充裕的深度思索能力,並可在單次推演產生數十萬個Token,具備全新層次的申對推論能力。於跨領域程式編寫與企業工作流程獲得運用▲Argon在用於評估真實世界長期軟體工程任務的DeepSWE v1.1創下77.9%表現Gemini 4 Argon除了已經在Google內部獲得許多實證,在程式編寫,邏輯推論,多模態具備穩定執行耗時且多步驟任務的能力,Google在內部將Argon應用在一般除錯、大規模程式碼庫遷移,以及演算法設計。在專門評估「真實世界長期軟體工程任務」的DeepSWE v1.1基準測試中,Argon以77.9%的優異得分,創下了業界最先進的新紀錄。▲Argon在Vals指數表現出色同時於處理專業知識領域,諸如在衡量金融、程式開發、法律與稅務等工作經濟影響力的Vals指數中,Argon穩居榜首。像是多步驟金融研究(Vals Finance Agent v2)以及法律研究與草擬(Harvey’s Legal Agent Benchmark)。此外,Argon在Zapier測試企業核心業務「全端執行能力」的AutomationBench基準測試中,Argon也以51.3%的高分位居第一;Argon執行專業的圖表分析、辨識長影片中的關鍵細節,並根據一連串的文件內容採取行動也同樣出色,在專門測試長影片理解能力的LVBench評測中,Argon以91.7%的高分,展現了業界最頂尖的水準。訓練之初即考量防衛性網路安全此外,為了使網路防禦專家可更好應對新一代網路攻擊,Argon在訓練之初就設定以及高網路防禦能力為目標,Argon可自主尋找、驗證與修補關鍵軟體漏洞,同時針對受信任的防禦專家及Google內部團隊,Google將提供未設網路安全防護限制的Argon特別版本。Wiz已藉由「Scan for Good」計畫將Argon用於網路安全防禦,將免費保護關鍵公共基礎設施,且在早期影響力示範發現一個關鍵漏洞,恐洩露全球醫院使用的醫療保健軟體的敏感個人資訊,並成功辨識出其它先進模型未能發現的嚴重風險。▲Argon在漏洞識別的表現與Grok 4.7並列▲對比專攻資安的3.8 Flash Cyber,Argon在漏洞辨識能力更出色在作為評估模型修補安全漏洞能力的CWE-bench v1測試中,Argon延續3.8 Flash Cyber優異表現,獲得68%與Grok 4.7並列最高分。然而在漏洞識別能力,對比專為資安的3.8 Flash Cyber更出色,於Google內部全方位漏洞基準測試,成功揭露涵蓋20種程式語言、複雜程式碼酷的廣泛安全風險,於Wiz用於評估模型在無原始碼狀況下分析即時網路系統能力的基準內部黑箱滲透測試,Argon在攻擊面探測、漏洞識別以及產生驗證用的概念驗證(PoC)方面,表現均優於3.8 Flash Cyber。