AI算力不只看GPU AMD Helios、ROCm全方位布局 破解NVIDIA生態鎖定 智慧應用 影音
DIGITIMES Logo
231
DIGITIMES Logo
DIGITIMESForumA

AI算力不只看GPU AMD Helios、ROCm全方位布局 破解NVIDIA生態鎖定

  • 孫昌華/台北

企業AI進入規模部署階段後,基礎設施的競爭重點正由單一晶片效能轉向整體系統配置。Agentic AI讓工作流程同時牽涉任務規劃、工具呼叫、資料查詢、權限確認、記憶存取與模型推論,使CPU、GPU、網路與軟體之間的分工也更細。

這項趨勢讓企業在規劃AI基礎設施時,不能只看單一加速器的峰值效能,還要同時考量工作負載、資源配置與實際部署條件。而當AI應用從技術驗證走向長時間、大規模運行,企業的算力規劃也會延伸到訓練、推論、網路與軟體協同。整體平台能否穩定支撐不同工作負載,並兼顧效能與資源利用率,也成為AI部署規模擴大後的重要考量。

隨著Agentic AI升溫,AMD市值近期首度突破1兆美元,AMD持續從單一晶片供應商拓展至完整AI基礎設施的布局,也成為市場關注的焦點之一。AMD不再只提供單顆晶片,而是整合CPU、GPU、網路與軟體,協助資料中心以系統方式建置大規模AI基礎設施。

對企業來說, AI應用進入規模部署階段後,首先要釐清實際使用情境,包括模型規模、Agent數量、併發量、延遲要求,以及資料所在位置。這些條件會直接影響CPU與GPU配置比例、記憶體頻寬、網路架構,也會決定工作負載應部署在雲端、地端或邊緣。大型模型訓練、高效能運算、企業推論與Agent執行各有不同資源需求,因此基礎設施規劃必須先從工作負載出發,再決定硬體組合與部署方式。

AMD以「全方位算力(Full-Stack Compute)」概括AI基礎設施發展方向,涵蓋CPU、GPU、網路、軟體與機櫃級系統,對應不同工作負載與部署環境。針對大型模型訓練、高效能運算、企業推論與Agentic AI各自的資源需求,AMD提供EPYC CPU、Instinct GPU、Pensando網路技術與ROCm軟體,並透過Helios機櫃級架構整合運算、網路與軟體,將原本分散的資源納入系統層級規劃。

其中,CPU與GPU分工是AI基礎設施配置的基礎。在Agentic AI工作流程中,任務協調、工具呼叫、資料查詢與既有企業應用會增加CPU端的運算需求,大型模型訓練與推論則主要交由GPU加速。

AMD以EPYCCPU負責通用運算與GPU主機端工作負載,InstinctGPU則針對大型AI訓練、高效能運算與企業推論等場景提供不同選項。實際配置時,仍要回到模型規模、併發量與延遲需求,再決定CPU與GPU比例,讓不同工作負載取得相對合適的硬體組合。

系統層級的整合則由Helios機櫃級架構承接。AMD Helios整合72顆Instinct MI455X GPU、18顆第6代EPYC "Venice" CPU、Pensando網路與ROCm開放軟體,將運算、網路與軟體放進同一個機櫃級架構中,並採用業界開放標準設計機櫃與網路互連,讓企業可搭配不同廠商的設備,降低對單一供應商專有技術的依賴。

相較於NVIDIA Vera Rubin NVL72機櫃,Helios可提供15%的峰值FP4效能提升、50%的HBM容量提升、6%的HBM頻寬與50%的向外擴展頻寬提升,且每美元可處理的token數量最高提升30%。

而這種機櫃級設計也反映大型AI基礎設施的評估方式正在改變,隨著GPU數量增加,企業除了比較單顆晶片效能,也必須同時考量供電、散熱、網路互連與軟體成熟度。因此,整櫃系統的運算效率、部署難度與擴充能力,會比單一元件規格更接近實際營運需求。

軟體成熟度與維運成本,也是AI進入規模部署後必須考量的項目。企業導入Agentic AI後,往往需要串接不同模型、資料來源與既有應用。若底層架構過度依賴特定硬體或工具鏈,容易形成「供應商鎖定」,後續更換模型、擴充系統或調整供應商時,都可能增加移轉與維運成本。

AMD透過ROCm、HIP,以及對PyTorch、TensorFlow等主流框架與Hugging Face等AI生態的支援,提高不同模型與硬體之間的相容性。透過開放的軟體生態,企業得以降低對單一軟體平台的依賴,在擴充AI應用時保留較大的架構選擇空間,也有助於降低後續平台轉換與維運的複雜度。

實際部署案例也反映出大型AI工作負載對整體架構的要求。根據AMD在AAI 2026公布的案例資料,電信大廠AT&T已採用AMD Instinct GPU與開放式ROCm軟體平台,支援電信AI模型的訓練與應用,並透過依任務調度模型的機制,AI成本最高可降低80%。

在大型AI運算部署方面,OpenAI規劃自2026年第4季起部署Helios機櫃系統,並於2027年持續擴大部署。Anthropic也宣布將於AMD Helios機櫃級解決方案中部署最高達2GW的AMD Instinct MI450系列GPU。

這些案例顯示,當AI使用規模持續擴大,基礎設施評估也會延伸到算力配置、網路、軟體成熟度與長期運行成本。這些案例也顯示,當AI從模型開發走向長時間、大規模運行,企業評估基礎設施的單位正逐漸從單一元件,延伸至包含運算、網路、軟體與部署條件的整體系統。

除了大型AI運算與資料中心級部署,AMD在AAI 2026的產品布局也延伸到邊緣與嵌入式運算,鎖定機器人、工業自動化與Physical AI等場景。對2027年的AI基礎設施規劃而言,企業需要同時處理資料中心、地端與邊緣等不同環境的算力配置,也更重視整體平台能否穩定支撐不同工作負載。

AMD則透過EPYC、Instinct、Pensando、ROCm與Helios,整合運算、網路、軟體與系統能力,回應AI基礎設施由單一元件評估走向整體平台配置的趨勢,並持續布局新一代MI500系列GPU與下一代Helios產品路線,強化涵蓋資料中心到邊緣端的AI平台能力。