AWS與NVIDIA擴大合作 部署新一代GPU加速代理型與實體AI發展 智慧應用 影音
DIGITIMES Logo
231
DIGITIMES Logo
DIGITIMESApp

AWS與NVIDIA擴大合作 部署新一代GPU加速代理型與實體AI發展

  • 台北訊

AWS與NVIDIA將為代理型與物理AI新增部署200萬顆GPU,並提供新一代基礎設施。NVIDIA
AWS與NVIDIA將為代理型與物理AI新增部署200萬顆GPU,並提供新一代基礎設施。NVIDIA

Amazon旗下Amazon Web Services(AWS)與NVIDIA近日宣布大幅擴展雙方策略合作,以因應全球對於人工智慧(AI)基礎設施持續加速成長的需求。隨著客戶快速採用AWS上的NVIDIA加速運算,雙方計劃在AWS全球基礎設施中新增部署200萬顆NVIDIA GPU,並進一步深化AI工廠、CPU、網路、開放式模型、資料處理與機器人領域的合作,共同打造協同設計的AI解決方案,讓客戶能以前所未有的規模加速AI開發與部署。

AI工作負載正快速擴展,涵蓋模型訓練與執行,以及資料處理、建立索引並用於驅動智慧應用程式等個個環節。客戶正從試點階段邁向正式部署,並擴大代理型AI、科學探索、企業自動化與機器人等領域擴展工作負載。這些客戶需要更多元的模型選擇、更快速的資料管道,以及支援實體AI等新興使用情境的全新能力,同時也需要確保底層基礎設施能與自身創新同步發展,並為關鍵任務工作負載維持最高等級的安全性與可靠性。

為因應前瞻AI實驗室、全球企業、新創公司與政府機構快速成長的需求,AWS與NVIDIA將延續16年的共同創新基礎,擴充AI運算容量,並更快將共同設計的新型解決方案提供給客戶。

作為擴大合作的一部分,雙方正致力於2027至2028年間,在AWS全球基礎設施中新增部署200萬顆NVIDIA GPU。將以NVIDIA Vera CPU為基礎的基礎設施導入AWS。以NVIDIA客製化高頻寬記憶體(NVHBM)擴展NVIDIA NVLink Fusion。為美國政府打造AI工廠,包括在安全的AWS基礎設施上部署10萬顆GPU,以執行聯邦政府與國家安全工作負載。

將NVIDIA平台與AWS Nitro System及Elastic Fabric Adapter(EFA)整合,強化安全性與可靠性。持續在Amazon Bedrock與Amazon SageMaker上支援NVIDIA Nemotron開放式模型,為客戶提供更多開放式模型選擇。

運用NVIDIA cuDF與cuVS CUDA-X函式庫,加速Amazon EMR與Amazon OpenSearch上的資料處理與向量索引,實現更快速、更具成本效益的分析與AI應用。透過Amazon Robotics採用NVIDIA實體AI平台,進一步推動機器人工作負載,加速倉儲自動化與新一代機器人的創新。

AWS執行長Matt Garman表示:「客戶希望能自由選擇最適合其AI工作負載的工具,也希望確信所有技術都能彼此無縫協作。這正是我們與NVIDIA深度合作,致力讓AWS成為執行NVIDIA AI技術最佳平台的原因,我們從網路、安全到部署,全方位最佳化基礎設施效能。此次擴大合作,將讓前瞻實驗室、企業與政府機構有更多在AWS上建置與部署AI的管道。」

NVIDIA創辦人暨執行長黃仁勳表示:「NVIDIA與AWS共同打造了AI時代最強勁的成長引擎之一,而市場需求更遠超所有預測。過去16年來,我們攜手將NVIDIA的運算能力擴展至雲端。如今,我們正將合作擴展至全端堆疊,包括GPU、CPU、網路、開放式模型與軟體,以只有AWS與NVIDIA能實現的空前速度與規模,推動代理型AI與實體AI落地。此次擴大合作,亦反映出客戶對AWS上NVIDIA平台的需求。」

大規模擴充AI運算能力

AWS提供雲端服務供應商中最廣泛的GPU執行個體類型,可支援多元AI與機器學習工作負載。NVIDIA GTC 2026大會上,AWS宣布計劃自2026年起新增超過100萬顆NVIDIA GPU。此後,需求已超出原先預期。AWS計劃於2027至2028年間,在AWS全球基礎設施(包括AI工廠)中新增部署200萬顆NVIDIA Blackwell Ultra、Rubin與Rubin Ultra GPU。

新增的運算能力將協助驅動客戶的各項工作負載,涵蓋代理型AI、科學探索、企業自動化到物理AI等。此外,AWS也將擴充NVIDIA Blackwell容量,包括為Amazon EC2 G7執行個體導入NVIDIA RTX PRO 4500 Blackwell伺服器版本GPU。相較上一代G6執行個體,G7的 AI推論效能可達4.6倍,圖形效能可達2.1倍。

AWS是首家提供由RTX PRO 4500加速之運算執行個體的主要雲端服務供應商。AWS與NVIDIA也正合作導入NVIDIA Spectrum網路技術,進一步最佳化GPU叢集中大規模AI訓練工作負載的網路效能。

AWS與NVIDIA正合作將基於Vera CPU的基礎設施導入AWS,為需要兼具高效能CPU運算與加速運算基礎設施的代理型AI工作負載提供另一項選擇。Vera專為新一代AI打造,與AWS提供最廣泛運算選擇的策略相輔相成,選項涵蓋AWS客製化晶片,以及合作夥伴最新的加速器與CPU。

在re:Invent 2025大會上,AWS宣布將在下一代Trainium晶片支援NVIDIA NVLink Fusion高速晶片互連技術。NVIDIA與Amazon旗下Annapurna Labs正進一步擴展此支援,攜手記憶體供應商導入NVIDIA全新客製化高頻寬記憶體(NVHBM)技術,讓Trainium得以採用速度更快、能源效率更高的記憶體。結合NVLink Fusion技術後,Annapurna Labs即可運用NVIDIA客製化記憶體技術與垂直擴展架構,在提升AI工作負載效能與效率的同時,將Trainium與GPU無縫整合於共通的機架級架構。

以最高等級安全性驅動美國聯邦AI

政府機構需要安全的AI基礎設施,以因應國家安全的需求。AWS與NVIDIA計劃為美國政府打造AI工廠,導入NVIDIA的AI技術堆疊,其中包括計劃在AWS安全基礎設施上部署10萬顆GPU,以執行聯邦政府與國家安全工作負載。此次合作讓AWS與NVIDIA位居推進美國聯邦政府國家安全AI發展的核心,使政府機構能針對Impact Level 6(IL6)及以上等級的工作負載,大規模部署AI。

這些新的承諾奠基於AWS與NVIDIA深度技術整合的基礎之上,而這些整合目前已為客戶帶來實際成果,包括透過AWS Nitro System與EFA強化安全性與可靠性:此次擴大合作中,所有採用NVIDIA GPU Trainium 晶片的EC2執行個體,包括運用NVLink Fusion的執行個體,皆建置於AWS Nitro System之上,並透過EFA互連。無論是GPU加速或採用Trainium晶片的EC2執行個體,未來也將持續建置於Nitro System,並透過EFA進行水平擴展。

Nitro與EFA的結合有助確保AWS在擴充NVIDIA GPU規模並整合新互連技術時,客戶仍能維持其大規模正式環境AI工作負載所依賴的安全性、可靠性與網路效能。AWS上的NVIDIA Nemotron模型:作為AWS致力於提供最廣泛AI模型選擇承諾的一部分,NVIDIA Nemotron系列開放式模型現已透過Amazon Bedrock以完全託管、無伺服器模型的形式提供。

同時,對於希望在自有基礎設施上進行部署和微調的客戶,亦可透過Amazon SageMaker取得這些模型。這樣的整合讓客戶得以使用NVIDIA最新的開放式模型,同時運用AWS的安全性、可擴展性與營運工具。GPU加速資料處理與向量索引:隨著資料量成長,特徵工程、大規模ETL與即時分析等工作負載需要更快的處理速度。

AWS與NVIDIA正合作在Amazon EMR上透過Amazon EC2 G7執行個體與NVIDIA cuDF函式庫提供GPU加速的資料處理,相較基於CPU的配置,處理速度最高可提升3.7倍,且性價比提升30%。而隨著AI應用、檢索增強生成流程與語意搜尋將向量資料庫規模推升至數十億筆記錄的規模,索引建立與調校也成為瓶頸。

Amazon OpenSearch Service上的GPU加速向量索引,可將索引建立作業卸載至專用GPU,以四分之一的成本實現最高9倍的向量索引速度,並可用於託管叢集與Amazon OpenSearch Serverless。機器人領域的物理AI:Amazon Robotics正與NVIDIA合作,加速開發新一代機器人,整合NVIDIA全端堆疊物理AI平台,包括NVIDIA Jetson平台、NVIDIA Omniverse函式庫與NVIDIA Isaac開放式機器人開發平台。

合作範圍涵蓋模擬、合成資料生成、機器人訓練、路徑最佳化、功能安全與Real-to-Sim驗證,所有工作皆在GPU加速的Amazon EC2執行個體上執行。AWS與NVIDIA共同推進機器人工作負載在大規模部署時所需要的能力,包括大規模模擬、多元訓練資料,以及持續的真實世界驗證。更多内容請參考NVIDIA

關鍵字