告別GPU獨大時代:代理式AI為何讓CPU與記憶體成為資料中心新主角?
站內可閱讀至 (台北時間)

2026年9月2日至4日,SEMICON Taiwan在台北南港展覽館登場。會場談得最多的幾項技術,包括高頻寬記憶體、3D封裝、矽光子、晶片測試,看起來分屬不同產業,它們處理的其實是同一個問題:AI伺服器的運算速度上升得太快,資料已經來不及在晶片、記憶體與機櫃之間移動。AMD在開幕演講把話說得很白:AI硬體的創新中心已經從單一晶粒移到完整系統,範圍涵蓋運算、記憶體、互連、封裝、主機板與機櫃。SEMICON的Memory Executive Summit則把「記憶體」稱為AI系統的策略核心。前一段時期,市場的焦點還在GPU數量。代理式AI(Agentic AI)進入企業流程之後,資料中心要處理的是更零碎、更持續、而且帶有狀態的工作,CPU因此重新回到採購清單的前排。但新增的CPU能不能變成可用的服務,還要看記憶體供應、封裝良率和網路頻寬跟不跟得上。換句話說,瓶頸正在換位置。1. Agent把一次提問拆成更多CPU工作假如你對AI助理下達指令:「把下週去東京的出差改到週四,預算不能超過兩萬元,找到班機後,送主管核准。」一般聊天機器人讀完問題,產生文字回答,工作就接近結束。能執行任務的Agent不一樣。它要讀行事曆,登入差旅系統,查公司規定和航班價格。票價超出預算就得重新搜尋。確認選項之後,還要建立簽核紀錄,然後等主管授權。你只下了一次指令,後台卻要多次呼叫模型,可能還得打開瀏覽器、查資料庫、執行程式。每一步用到的運算方式不同。GPU擅長同時處理大量相似的數學運算,適合訓練模型和產生答案。CPU負責的是作業系統、程式執行、權限檢查、網路連線和任務排程。網站還沒回覆時,CPU必須保存工作進度。主管幾分鐘後批准,系統還得知道任務停在哪裡。Google在2026年4月說明Agent基礎設施時,把這類負載稱為「branchy logic」:流程不斷分岔,一次人機互動可能啟動數百個並行任務。Google表示,旗下雲端容器服務GKE的Agent Sandbox每個叢集每秒可啟動300個隔離環境,採用自家Axion CPU的版本,價格效能比其他大型雲端平台高出30%。這個30%或許只能放在Google自己的測試條件下理解,但我覺得可以放重點的地方是在:沙盒啟動速度(每秒能開幾個)、每顆CPU能扛幾個Agent,因為這些項目兩年前不會出現在雲端服務的比較表上的。2. 瓶頸會在模型、工具與沙盒之間移動2026年8月,香港科技大學聯合Alibaba與ByteDance團隊,於arXiv平台上發布了一篇針對AI Agent系統運作瓶頸的實測研究。團隊開發了評測工具AgentSysBench,針對10種Agent應用、4,641筆基準請求,以及三個實際應用在單日留下的17.9萬個工作階段進行系統級追蹤,逐一記錄模型推論、工具呼叫(Tool Calls)與系統元件的延遲與資源消耗。這項研究提供了幾個顛覆傳統思維的數據:延遲瓶頸轉移:10種應用中,有5種的主要延遲並非來自模型推論本身,而是來自外部工具呼叫與環境互動(如程式沙盒編譯、資料庫檢索等)。資源需求高度異質化:模型推論吃重GPU,文件搜尋依賴記憶體(RAM),而程式沙盒則大量消耗CPU(單一Session記憶體峰值高達28GB)。各環節延遲差距最高達32倍。架構調度即效能:團隊透過任務類型的異質排程與元件部署位置優化(如減少跨節點通訊),成功將整體延遲降低29%至40%,特定情境下回應速度更提升了4.5倍。雖然該論文仍處於預印本階段,且部分產出的環境數據難以在外部完整重現,不宜直接作為市場規模推估的基準;但它預告的基礎設施轉型很明確:Agent時代的成本與效能估算,已經不能只看「每秒Token產生量(Tokens/sec)」或單純的GPU算力,而是必須以「端到端完成單一任務(E2E Task)所消耗的時間、記憶體占用與整體TCO」作為全新衡量口徑。模型呼叫量也正在快速增加。OpenRouter是第三方模型串接平台,開發者透過單一API即可呼叫超過400種AI模型,並按用量付費,其公開的數據也因此成為業界觀察模型使用趨勢的重要指標。2026年5月,OpenRouter表示,每週處理的token量在半年內由5兆增至25兆(token為模型處理文字的基本單位);到了8月19日線上支付巨頭Stripe同意收購OpenRouter時,平台公布的每日處理量已經超過10兆token。這個增幅滿驚人,但我更在意的是收購背後的組合:AI算力調度的路由介面,開始和金融支付基礎設施接在一起。OpenRouter處理的是一項AI任務該交給哪個模型,以及如何在價格、速度與穩定性之間選擇;Stripe掌握的則是計費、支付與風險管理。兩者結合之後,token原本是衡量模型運算量的技術單位,現在也逐漸成為可以直接定價與結算的商業單位,並為Agent時代的自動計費、按次收費,甚至更小額的自動支付留下空間。這也透露出AI商業化正在換一個階段。市場在追問模型有多聰明的同時,也開始在意每次推論花多少錢、成本如何控制,以及企業能不能從龐大的使用量中留下利潤。雖然單一平台的數據無法代表全球AI總流量,但這反映出AI應用形態的轉變:現代Agent任務往往需要多次模型呼叫、工具回傳與連續推理。隨著token消耗量激增,不僅帶動了GPU/NPU算力與顯存的需求,連帶也大幅加重了伺服器CPU、記憶體檢索與網路頻寬的負載。3. 需求確實回升,但59%的營收增幅主要來自價格Intel的「資料中心與AI部門」(DCAI)2026年第二季營收63億美元,年增59%。這個部門的營收主要來自Xeon伺服器CPU,也包括替客戶設計的客製化晶片。59%很容易被讀成CPU市場的成長強勁,但它其實混合了銷量、平均售價(ASP)和產品組合。根據Intel季報(10-Q)對伺服器CPU的細部說明:出貨量年增9%,ASP年增48%。Intel表示,售價上升大多來自高階產品(如 Xeon 6 平台)占比提高,依需求調整價格的貢獻較小,其中一部分是為了抵銷上漲的原料成本。也就是說,客戶的總購買量雖有成長,但營收增幅的絕大部分來自「產品單價變貴」。若2027年供應恢復,價格支撐可能減弱。要判斷這一波需求能不能延續,得將出貨量和平均售價分開追蹤。Intel管理層還提出一項配置假設。公司在第一季法說會表示,訓練大型模型時,一顆CPU通常搭配七至八顆GPU。進入推論之後,比例縮到一比三或一比四。多Agent同時運作時,CPU與GPU可能接近一比一,甚至由CPU居多。這是Intel依客戶需求所作的描述,不是全產業統計。競爭對手給出相近方向。AMD企業副總裁Raja Swaminathan在SEMICON Taiwan表示,聊天機器人時代常見的CPU與GPU配置約為一比四至一比八,代理式AI則正把比例推向一比一,部分工作甚至需要更多CPUF。NVIDIA執行長黃仁勳在8月法說會估計,依問題類型不同,Agent完成推理、規劃與多輪工具操作所需的運算量,可能是人類直接使用模型的15至100倍。同時,NVIDIA在2026年中正式推出了專為Agent打造的Vera CPU,用以處理程式執行、工具調用與任務協調。不過,我們先別急著把這些說法當成產業共識。各家大廠紛紛推出自家CPU方案,彼此的行銷說法不能互相充當獨立佐證。「一比一」也缺少統一定義:早期的八卡伺服器本來就只配一到兩顆CPU,比例自然是一比八或一比四,而當機櫃級設計(如GB200 NVL72配置36顆Grace CPU與72顆Blackwell GPU,比例為一比二)普及後,分母和分子都隨之改變。這種架構演進更多是系統設計思維的轉變。接下來要看的不是單純的口號,而是伺服器實際落地的CPU插槽數、機櫃級互連架構(如NVLink-C2C),以及CPU占整體資料中心資本支出的真正比重。4. 市場擴大,增量未必由Intel與AMD包辦CPU需求增加,並不保證Intel與AMD能取得全部增量。AWS有Graviton,Google有Axion,Microsoft則推出Cobalt。三家都以Arm架構為基礎,把處理器和自家的作業系統、網路及雲端計價方式一起設計。2026年4月,AWS宣布Meta將部署數千萬顆Graviton5核心,用於即時推論、程式生成、搜尋與多步驟任務;Google把Axion N4A放進Agent Sandbox以優化Agent運行環境;Microsoft在6月推出Cobalt 200預覽版,宣稱效能比前一代提高至多50%。這些部署把競爭邏輯攤開了。新增的CPU需求正在向雲端平台自研的Arm晶片分流,Intel與AMD很難包辦市場增量。雲端平台掌握實際工作負載,能依軟體需求調整硬體設計,也能壓低外購成本、控制供應和耗電。x86生態系仍是Intel與AMD的防線:大量企業軟體原本就跑在x86上,客戶換架構要付出移轉成本。AMD在3月的技術說明裡,就把x86軟體相容性列為主要防線。企業的資料庫和應用程式多半建立在x86環境,改用Arm可能要重新編譯程式,或者同時維護兩個版本。雲端原生服務換起來比較容易,保險、銀行和製造業的舊系統則可能繼續留在x86。市場不會整齊地轉向單一架構。5. 平台廠開始跨界,CPU成為控制整套系統的入口Arm原本的生意是授權。它設計CPU架構和核心,客戶取得授權後自行做成晶片。2026年3月,Arm推出自有的AGI CPU,第一次直接賣晶片成品。7月底的財報說,AGI CPU在2027與2028會計年度的客戶需求已超過20億美元,是3月發表時所估10億美元的兩倍。Arm的授權業務同樣在加速。Neoverse是Arm專為資料中心設計的CPU核心,AWS的Graviton、Google的Axion、Microsoft的Cobalt和NVIDIA的Grace都以它為基礎。這些客戶的晶片累計出貨已超過15億個Neoverse核心:前10億個花了六年的時間去打底、教育市場、慢慢累積生態系,最近5億個只用九個月。這裡算的是核心數,不是晶片數,而且幾乎全部來自授權客戶的產品,說明資料中心採用Arm架構的速度正在加快。Arm因此同時握有兩種收入來源。授權模式服務AWS、Google這類自研晶片的客戶,直接賣CPU能提高每套系統的收入,代價是可能和部分授權客戶競爭。Meta的做法說明大型買家的算盤:一面在AWS上大量採用Graviton5,一面擔任Arm AGI CPU的主要合作夥伴與共同開發者。多方採購本來就是壓低成本、分散供應風險的老辦法。NVIDIA的動作更快。公司表示Grace CPU過去12個月營收已超過50億美元。2026年量產的Vera CPU可以搭配Rubin GPU,也能單獨部署,採用88顆自研Olympus核心,記憶體頻寬最高1.2TB/s。產品說明直接列出Python執行、沙盒、資料處理和任務協調等用途。CPU在這裡已經是可以單獨賣的東西,不是GPU的配件。供應鏈的分工也隨之改變。過去CPU、GPU與伺服器大致由不同公司供應,現在每家都想多控制幾個環節。控制得愈多,愈容易優化耗電與資料傳輸,客戶要換平台也愈貴。6. Agent留下大量狀態,記憶體會比算力更早耗盡Agent執行時要保存的東西不少:對話紀錄、文件、工具回傳的資料、工作進度,還有KV cache。KV cache是模型生成文字時暫存前文計算結果的記憶體,用來避免每產生一個token就重算一次。對話愈長,同時運作的Agent愈多,它就愈膨脹。記憶體的壓力已經反映在伺服器成本上。Google Cloud供應鏈基礎架構資深總監Nikhil Cherian在SEMICON Taiwan表示,高效能記憶體占AI伺服器硬體物料清單的成本已超過75%。這個比例固然是Google主管在會場提供的觀察,我們從外部看不到樣本和計算方式,且僅限於單台伺服器硬體的BOM,不含土地、機房、電力與網路,但已明確點出記憶體成本佔比頗高的訊號。SK海力士資深副總裁Hoshik Kim在同一場活動算了一個高負載情境:如果1,000個Agent各自維持32K上下文(Context Window),光是KV cache需求就高達約10.5TB,這幾乎吃掉一套NVIDIA NVL72機架一半的HBM容量。雖然一般企業未必會遇到這種極端模式,但卻也暴露了系統瓶頸所在。更常見的浪費是「閒置」。AgentSysBench的產出環境紀錄發現,Agent等待工具回傳或人類確認時,可能閒置數分鐘甚至數小時,卻仍保留著工作資料。記憶體若一直被等待中的Agent占住,新任務就算拿到CPU核心也未必跑得動。SEMICON的記憶體論壇因此討論CXL記憶體池、狀態卸載(State Offloading)與分層儲存。CXL是一種高速互連標準,可讓CPU存取外部記憶體,也能讓多台伺服器共享容量。狀態卸載則是把暫時不用的工作資料移到成本較低的記憶體或儲存裝置,等任務恢復再載回。這些技術要處理的目標只有一個:別讓等待中的Agent長時間占著最貴的高速記憶體。狀態卸載若要真正省錢,次級儲存裝置的速度也得夠快。SK海力士與SanDisk在2026年8月的FMS(Flash Memory Summit)公布第一版HBF(High Bandwidth Flash)開放規格。HBF想補的是HBM與SSD之間的空檔,用NAND換容量,單模組最高512GB,頻寬依等級落在每秒0.4至3.0TB,透過UCIe連接CPU或GPU。最即時的資料繼續留在HBM;那些不必常駐HBM、卻又無法承受SSD存取延遲的模型權重、KV cache與Agent狀態,才卸載移到HBF。規格目前已交由OCP公開,希望全業界的廠商一起來採用,把HBF做成全產業通用的標準硬體,但控制器、封裝、軟體支援與客戶驗證都還沒走完。三星選了另一條路,把記憶體搬到處理器上方。公司在FMS展示的zHBM概念模型,將HBM垂直堆疊在AI加速器上,官方目標是相較HBM5把效能提高至多八倍、能源效率提高至多三倍,熱阻降低一半以上。這些都還是設計目標,不是量產晶片的第三方測試結果。HBF是加容量,zHBM是縮距離。這場記憶體競爭,已經越過單顆晶片的規格,延伸到分層配置與3D封裝。GPU端早就示範過記憶體有多要緊。H200和H100採用同一代Hopper架構,運算單元相同,主要差別在記憶體:H200容量提高到141GB,頻寬每秒4.8TB,約為H100的1.4倍。NVIDIA公布的部分大型語言模型測試中,H200效能比H100高出1.6至1.9倍。然而,測試同時調高了吞吐量的批次大小(Batch Size),因此,這段1.6至1.9倍效能不能全算在記憶體頭上,因為運算單元沒變,這有點落入了「雞生蛋、蛋生雞」的邏輯問題:更大的記憶體帶來的資料供應速度,本來就允許系統採用更大的批次,也確實足以改變推論表現。Batch Size每翻倍,同時運算產生的中間資料,包含KV Cache、暫存結果等就會成倍膨脹;記憶體不夠大、頻寬不夠快,Batch Size根本也調不上去。CPU端是同一個問題。NVIDIA給Vera配到1.2TB/s的「記憶體頻寬」,正好呼應了AgentSysBench量到單一沙盒占用高達28GB工作記憶體的「容量壓力」,怕的就是因記憶體吞吐跟不上而陷入空等狀態。7. 封裝與光互連接著吃緊,量產時點仍待驗證壓力接著傳到封裝與網路。CPU、GPU、ASIC與HBM必須縮短彼此距離,2.5D及3D封裝因此進入高階AI系統。SEMI統計,全球半導體封裝與組裝設備銷售額在2025年增加19.6%,達到60億美元,2026年預估再成長9.2%。這項支出主要呼應當前的CoWoS與HBM堆疊,比展場上的概念展示更接近實際訂單。機櫃數量擴大後,銅線會撞上傳輸距離、訊號衰減與耗電的限制,台積電等大廠指出,導入共同封裝光學(CPO,把光學收發元件和交換器晶片封裝在一起),相較銅線可帶來10倍的節能優勢,因而受到關注。但量產進度則要保守看。SEMICON的CPO議程提到,光學晶片的晶圓級測試尚未成熟,後段製程與光纖連接也缺乏統一流程。雖然早期產品已陸續量產,但真正走向大規模普及,仍要看後段測試與封裝標準能否完成驗證。8. 系統愈客製,能共同設計的台灣廠商愈有議價權近期訂單會先落在已經量產的環節:HBM相關封裝、高階載板、PCB、電源散熱、系統級測試。CPU與加速器的組合愈多,ODM要驗證的主機板、韌體和散熱方案也愈多。訂單增加的同時,工程人力、認證成本與庫存管理都會上升。2027至2028年再看CXL記憶體池、3D堆疊和CPO測試設備能不能完成客戶驗證。面板級扇出型封裝(FOPLP)有大尺寸和材料利用率的優勢,高階產品仍要克服翹曲、精密對位與散熱。這類技術可以列進產業地圖,現階段不宜直接換算成營收。對台灣廠商來說,出貨量只回答了一半問題。按客戶規格組裝,競爭還是集中在成本與交期。能參與主機板、電源、散熱、韌體和整機驗證的公司,才比較有機會提高議價能力。測試設備商也一樣:單一量測工具的價值有限,能處理光電共同測試、溫控與系統級驗證,收入才會跟著封裝複雜度走。日月光在2026年8月的OCP亞太高峰會提出次世代AI封裝三部曲:先進封裝、光學互連、垂直供電。三項都需要和客戶一起定義規格,已經超出收到圖面再代工的範圍。執行長吳田玉也曾表示,矽光子與CPO不屬於短線題材,CPO量產「應該在今年會開始發生」,至於全球採用率和商業效益,仍要由市場決定。機會和風險是綁在一起的。愈早參與共同設計,議價能力愈強;CPO什麼時候跨過量產門檻,現在沒有人能給確定答案。9. 軟體每省下一份資源,都可能抵銷部分硬體訂單接下來最值得追蹤的是實際採購。CPU與GPU的配置比例,可以檢查Agent有沒有真的改變伺服器設計。Intel的出貨量和平均售價,能區分需求擴張與缺貨漲價。Graviton、Axion與Cobalt的採用情況,會告訴我們新增市場有多少留給傳統CPU廠。目前企業端與市場上,仍然缺乏「完成單一任務的實際單位成本」這個關鍵數據。Agent若反覆呼叫昂貴模型,又長時間占用CPU與記憶體,demo畫面再流暢也未必有商業價值。而且,軟體如果做得好,會反過來壓低硬體需求。AgentSysBench在Agent等待模型回覆時卸載沙盒狀態,平均記憶體由35.3GB降到7.7GB,改善4.6倍,尖峰用量改善2.1倍,額外延遲低於0.5%。重複呼叫造成的資源浪費相當驚人:在環境紀錄中,不到三分之一(27%)的熱門搜尋問題,竟然占掉了三分之二以上(67.3%)的搜尋流量。研究團隊只做了一件簡單的事:把搜尋結果暫存10分鐘,當其他Agent問到相同問題時,直接拿存好的答案給它。光是這個小動作,就一口氣砍掉了35.2%的重複呼叫,還幫整個系統省下近兩成的等待時間(19.3%)。網址抓取採用同樣的方法,也輕鬆減少了一成以上的無用之功(重複呼叫減少11.65%、累計延遲減少16.5%)。演算法也可以省下硬體的需求。Google推出名為TurboQuant的壓縮演算法,在官方測試中把AI保存對話紀錄(KV Cache)壓到3位元,記憶體用量一口氣縮小了六倍,且不影響回答準確度。簡單來說,同一張記憶體現在能塞進六倍以上的對話紀錄,同一批記憶體可以容納更多上下文,未來即使Agent使用量暴增,硬體成長需求也不一定會1:1線性成長。CPU重新受到重視,但產業沒有回到Intel與AMD主導的舊秩序。代理式AI把競爭單位從單顆處理器推到整套系統:模型在GPU上推論,工具與沙盒吃CPU,長對話占記憶體,機櫃之間還得處理傳輸與散熱。我認為這波CPU行情,可以一路追蹤到2027年。到時候,伺服器CPU插槽數若沒有增加,今天關於CPU與GPU配置走向一比一的說法,可能只是新一輪產品週期的宣傳;若插槽數持續上升,還要進一步觀察Intel供應恢復後,平均售價是否回落。不過,CPU多賣了多少顆,終究只回答一部分問題。真正決定下一輪市場格局的,仍是誰能把CPU、GPU、記憶體與網路整合成一套穩定、低耗電,而且能夠大規模量產的系統。資料來源SEMICON Taiwan:Scaling the 代理式AI Era with Advanced Packaging, Heterogeneous Integration, and Optical InterconnectsSEMICON Taiwan 2026 Memory Executive SummitSEMICON Taiwan:How AI Is Redefining the Role of MemorySEMICON Taiwan 2026 Highlights AI-Driven Manufacturing TransformationSEMICON Taiwan:Productizing TeraPHY Optical EnginesGoogle Cloud:Scaling for the agentic era, 2026-04-23Google Cloud:What’s new in GKE at Next ‘26, 2026-04-23AgentSysBench:From LLM Inference to Agentic Workloads, 2026-08-15OpenRouter, OpenRouter Raises $113M Series B, 2026-05-28OpenRouter, OpenRouter is Joining Stripe, 2026-08-19Intel:2026年第二季10-QIntel:1Q26 Earnings CallAWS, Meta signs agreement with AWS to power 代理式AI on Amazon's Graviton chips, 2026-04-24Microsoft, New Azure Cobalt 200 VMs deliver 50% performance improvement, fully optimized for modern 代理式AI workloads, 2026-06-02AMD, 代理式AI Brings New Attention to CPUs in the AI Data Center, 2026-3-13ARM, Building the future of computing, on Arm. Together. For Everyone. 2026-06-30NVIDIA, NVIDIA Unveils Vera, the CPU for Agents, 2026-05-31NVIDIA, Q227 Earnings CallNVIDIA, NVIDIA H200 GPU工商時報,代理式AI重寫資料中心 AMD:CPU/GPU配置走向1比1,2026-09-01。工商時報,AI顛覆記憶體定位 海力士高層:從成本轉為戰略投資,2026-09-01中時新聞網,AI伺服器記憶體成本破75% Google祭出2大策略突破,2026-09-01工商時報,SEMICON Taiwan》Google破解AI「記憶體牆」記憶體占伺服器成本逾75%、軟硬體雙管齊下,2026-09-02。經濟日報,Google 供應鏈基礎架構資深總監透露 DRAM 供應相當緊張,2026-09-03。經濟日報,突破AI資料中心瓶頸 三星打造3D記憶體與儲存解決方案,2026-09-01。中時新聞網,記憶體三巨頭 搶AI新戰局:三星押3D、SK海力士攻架構、美光拚系統整合,2026-09-02。財訊,AI晶片競賽變了!imec新執行長:台灣50公里半徑串起全球最強生態系,2026-08-31。新電子,SK海力士/Sandisk攜手於FMS 2026公布第一版HBF標準,2026-08-05。理財周刊,SanDisk受惠AI儲存需求飆升 能否追趕美光、希捷?2026-09-16延伸閱讀GTC大會:輝達攜手台廠推出代理型AI專用Vera CPU,Groq 3推論晶片三星代工下半年出貨輝達將投資50億美元入股英特爾,合作開發晶片,美媒:客製CPU由台積電晶圓代工、英特爾封裝CPU「通才型」處理器難敵大量瑣碎工作,GPU成AI晶片代名詞【加入關鍵評論網會員】每天精彩好文直送你的信箱,每週獨享編輯精選、時事精選、藝文週報等特製電子報。還可留言與作者、記者、編輯討論文章內容。立刻點擊免費加入會員!責任編輯:翁世航核稿編輯:羅元祺