告別傳統資料中心!Meta 攜手 AMD 打造超大規模一體化 AI 系統

隨著 Meta 在模型訓練、推論、推薦與排序系統,以及面向數十億用戶的全新代理型 AI 應用需求急遽擴張,傳統單純擴增 GPU 或伺服器數量的做法,已無法滿足龐大的運算規模;在 Advancing AI 2026 大會上,AMD 董事長暨執行長蘇姿丰博士與 Meta 基礎設施負責人 Santosh Janardhan 共同探討了雙方的合作策略,當前的 AI 平台效能,高度仰賴運算、網路、記憶體、電力、散熱與軟體間的無縫協同運作,這意味著在 Gigawatt 等級的規模下,基礎設施必須被視為單一且高度整合的系統來進行工程設計,這促使 Meta 與 AMD 捨棄在開發末期才導入現成元件的模式,轉向從晶片到軟體的超前聯合開發。

 

 

AMD EPYC 處理器於開放式異質架構之演進

 

為了維持龐大伺服器機隊的高使用率並妥善應對不同工作負載,Meta 採用了開放式異質架構,並與 AMD 在多個世代的 EPYC 處理器上展開深度合作;從早期的 Milan、Bergamo、Turin,直到最新的 Venice 架構,Meta 已經在其基礎設施中部署了數百萬顆 EPYC CPU。

 

作為 Venice 架構的主要客戶,Meta 正在實驗室進行嚴格的平台驗證,以期在未來獲得更多核心數、更優異的能源效率以及專屬的客製化能力,為規模化部署做好準備。

 

此外,隨著 AI 系統逐漸朝向代理化(Agentic)發展,CPU 在協調代理程式、執行工具、管理資料以及統籌 AI 模型周邊系統中的重要性日益提升。

 

為了完美平衡 CPU 與 GPU 的效能,Meta 也已著手與 AMD 規劃未來的 Verano 架構以及更長遠的 EPYC 產品藍圖。

 

基於 Open Rack Wide 規範的 AMD Helios 機櫃級平台

 

在 GPU 與機櫃級系統的硬體層面,雙方的技術整合同樣從產品採購深化為端到端的共同設計;Meta 在 2026 年稍早透過開放運算計畫(OCP)發布了專為大規模 AI 基礎設施訂定的 Open Rack Wide(ORW)規範,AMD 隨即以該標準為基礎,推出了 AMD Helios 機櫃級解決方案,此平台整合了 AMD Instinct GPU、EPYC 處理器、AMD Pensando 網路技術以及 ROCm 軟體,並針對 Gigawatt 規模的電力、散熱與能源效率進行了深度最佳化,將雙方對開放性架構的承諾從單一晶片延伸至超大規模叢集與系統層級。

 

從 MI300X 到 MI450 的 Instinct GPU 定製化部署

 

基於共同的架構願景,Meta 與 AMD 針對每個世代的 Instinct 加速器進行了極為深入的技術最佳化,雙方的合作始於 MI300X,透過 AMD ROCm 軟體在超大規模環境下成功調校生產工作負載,累積了豐富的實戰經驗;隨後,MI350 系列進一步將應用範疇擴展至 AI 訓練領域,支援了 Meta 平台核心的推薦與排序模型。

 

目前,Meta 計畫部署基於 Instinct MI450 架構的客製化 GPU,Meta 工程團隊已提前取得 Helios 平台的使用權限,正與 AMD 針對硬體、軟體與系統整合進行全面測試,標誌著雙方合作已邁入深度的端到端平台共同設計階段。

 

前瞻下一代 6 Gigawatts AI 基礎設施藍圖

 

這項緊密的技術結盟將直接支援 Meta 未來高達 6 Gigawatts 規模的 AMD GPU 基礎設施部署計畫,面對如此龐大的資料中心量體,電力、散熱、網路、記憶體與軟體架構的決策必須在開發初期就進行跨領域的考量,無法等到最終驗證階段才著手解決。

 

下一代 AI 基礎設施的設計流程已將資料中心視為一個完整的巨型系統;Meta 營運全球數十億用戶平台的龐大經驗,也正深刻影響著 AMD 未來的產品走向,包含即將推出的 AMD Instinct MI500 加速器與下一代機櫃級系統;透過早期的工作負載校準,雙方期望能以更快的速度與更高的效率,部署具備未來運算彈性的 AI 基礎設施。