Gemini 4 Agron 基準測試亮眼,但遭 Google 自家員工質疑實際寫程式表現不如預期

TechNews 編輯台約 3 分鐘閱讀

站內可閱讀至 (台北時間)

Gemini 4 Agron 基準測試亮眼,但遭 Google 自家員工質疑實際寫程式表現不如預期(新聞配圖)
配圖來源:科技新報原站文章
本站保存版本
字級

Google 今日推出最新旗艦 AI 模型 Gemini 4 Argon,但彭博(Bloomberg)報導,員工對實際表現出現質疑聲浪。消息傳出後,Alphabet 股價漲幅從逾 2% 收斂至約 0.5%。

彭博引述直接參與開發的知情人士指出,Gemini 4 以業界常用基準測試結果成績優異,但員工實際用於工作時表現卻打折扣,部分程式設計力有未逮,尤其不擅長前端設計,也就是決定 App 與網站外觀及操作體驗。

部分員工認為,Anthropic Fable 與 OpenAI Astra 進步速度比 Gemini 更快,即使 Gemini 4 發揮最佳水準,某些領域仍較落後;但也有員工認為新模型已追上業界頂尖水準。

Google 否認此說法,稱 Gemini 4 程式設計等領域表現不佳並不正確。熟悉模型開發的 Google 員工也向彭博表示,公司有「高度共識」認為 Gemini 4 位居尖端,且經過嚴格測試。Google 並引用 DeepMind 負責人 Koray Kavukcuoglu 日前發言,他完全信任團隊,認為 Google 必定會一直站在前線。

業界稱之為「刷榜」(benchmaxxing,中國用語),即優先追求標準化測試高分,而非打造真正實用的產品。兩名熟悉 Gemini 4 的人士認為新模型似乎受此影響。AI 新創 Surge AI 創辦人 Edwin Chen 比喻,孩子 SAT 考高分,不代表出社會後表現也很好。

不過,Gemini 4 並非沒有亮點。知情人士表示,多模態應用如從影片擷取中繼資料表現出色,資安領域也具競爭力,Google 稱某資安基準測試勝過 Astra,也率先開放特定資安合作夥伴。但 Gemini 4 屬大型模型,推論成本較高,恐對利潤率造成壓力。

Gemini 4 推出歷經波折。Google 原計畫年 6 月推出 Gemini 3.5 Pro,最終未達目標而放棄。彭博行業研究分析師 Mandeep Singh 估計,頂尖模型單次訓練成本最高可達 4 億美元。

Gemini 是 Google 搜尋、地圖、Gmail 與 Chrome 等產品的技術核心,這些產品各擁有超過 10 億名使用者。OpenAI 與 Anthropic 積極推動 AI 程式設計代理等產品之際,Gemini 4 能否實用方面贏得信任,將左右 Google 的競爭地位。

(首圖來源:Google)

您的咖啡贊助將是讓我們持續走下去的動力

從這裡可透過《Google 新聞》追蹤 TechNews