AI推升記憶體需求 儲存技術扮演更關鍵角色 智慧應用 影音
DIGITIMES Logo
231
DIGITIMES Logo
Event

AI推升記憶體需求 儲存技術扮演更關鍵角色

  • 賴品如台北

NVIDIA Vera BlueField-4 STX 儲存處理器。NVIDIA
NVIDIA Vera BlueField-4 STX 儲存處理器。NVIDIA

人工智慧(AI)需求激增,帶動對大量資料集與情境窗口的需求,其規模已突破系統記憶體的容量限制。

然而,單純增加儲存容量,並不足以因應日益成長的需求。真正需要的是來自AI工廠、實用且符合現實需要的洞察,以及能夠實現這些洞察的高效、安全儲存架構。

AI推升記憶體需求,儲存技術扮演更關鍵角色。NVIDIA

AI推升記憶體需求,儲存技術扮演更關鍵角色。NVIDIA

在日前登場的Future of Memory and Storage(FMS)大會上,NVIDIA發表多項儲存技術進展,並展示AI的下一波躍進,不僅取決於運算能力本身,也同樣仰賴為加速運算供應資料的儲存基礎架構。

隨著AI代理消耗大量資料,加上GPU現在已能夠直接發出儲存請求,並產生數千項並行作業,儲存基礎架構所承受的壓力也持續加劇。為了處理這些請求,儲存系統必須持續對資料進行加密、壓縮、驗證與重建。當數千個代理同時存取儲存空間時,這些關鍵資料服務可能成為瓶頸。

NVIDIA技術部落格所列出的基準測試顯示,作為NVIDIA Vera BlueField-4 STX一部分的NVIDIA Vera CPU,在兩階段壓縮與加密管道中,其輸送量最高可達x86 CPU的3.21倍。這代表採用Vera後,儲存平台能更有效率地承接大量湧入的AI資料,在大幅減少所需運算基礎架構的同時,提供更高的輸送量。

透過加速運算,儲存不再只是被動保存資料的空間,而是成為資料路徑中的主動環節。

這徹底顛覆了過往關於何時應該將資料存放於記憶體(應用程式可更快讀取)或儲存裝置(能以較低成本提供充裕容量)的成本效益邏輯。這項取捨在40年前首次被提出,當時存取資料的時間以分鐘計。如今,搭配NVIDIA與合作夥伴的AI儲存解決方案,GPU已能在微秒尺度內處理相同的取捨。

要彌合AI需求與記憶體不足之間的差距,必須在整個生態系進行極致協同設計,涵蓋記憶體與儲存設備製造商,以及基於這些硬體所開發的軟體。

開源的NVIDIA cuFile API  實現儲存解決方案的互通性

NVIDIA於FMS大會宣布,將開源其cuFile應用程式介面(API)及其下層垂直整合的儲存軟體堆疊,讓 GPU不再只能透過CPU,而是能直接讀取儲存裝置中的資料,或將資料寫入儲存裝置。cuFile是NVIDIA GPUDirect Storage的開源套件。

運用數十萬個GPU執行緒、高速高頻寬記憶體及其他技術方法,cuFile讓系統能在短短數微秒內安全地存取儲存裝置中的資料。這體現業界如何依循Linux最佳實務,打造以安全為優先的統一儲存堆疊,實現GPU與資料間的互通性。

此外,快速且安全的資料與儲存存取,也是推動預防性與偵測性資安措施的基礎要素。cuFile開放使用後,將有助於以AI防禦所需的速度,存取安全情境資訊、資料與儲存資源。此類開放技術也能支援新成立的開放安全AI聯盟(Open Secure AI Alliance)等計畫。

此網站將成為這些API的全新平台,開放社群貢獻,並由Google、Intel、NVIDIA與Meta擔任首批維護者。這些API可針對各種軟硬體平台進行最佳化,進而為開發人員與企業推動創新並提升效率。

NVIDIA與業界領袖共同推進AI儲存新前沿

此外,NVIDIA與儲存產業領導廠商正透過名為Storage-Next的計畫,共同最佳化記憶體與儲存解決方案。這項由NVIDIA推動的計畫匯集儲存設備製造商、控制器供應商、散熱設計、冷卻與調度管理業者,以及標準制定組織,共同確立GPU驅動儲存空間應有的運作方式,再將相關技術進展轉化為具互通性且開放的產業標準。

Storage-Next匯集超過40家領先的儲存與快閃記憶體供應商,包括DDN、KIOXIA與美光科技。各家業者皆與NVIDIA共同投入下一代AI儲存技術的發展。

這項計畫的核心在於加速大型AI資料集的存取。為支援此目標,NVIDIA推出了SCADA(規模化加速資料存取;全稱為scaled, accelerated data access)框架,讓具大規模平行處理能力的GPU,僅將應用程式所需的資料直接從儲存裝置讀取至自身高速記憶體。

例如,DDN正將SCADA整合至Infinia。Infinia是一套軟體定義、AI原生的資料智慧平台,旨在大規模消除儲存瓶頸。

DDN技術長Sven Oehme表示:「AI的成功將不取決於組織擁有多少基礎設施,而是取決於能多有效率地運用這些資源。我們與NVIDIA的合作,正協助GPU與資料之間建立更直接、更高效的連結,確保加速運算資源維持高效運作、縮短取得洞察所需時間,並協助客戶從AI投資中獲得更強勁的業務與財務回報。」

Storage-Next與SCADA進一步拓展了NVIDIA長期投入AI儲存基礎架構的成果,其中包括NVIDIA Vera BlueField-4 STX。這是一套由NVIDIA Vera Rubin平台、NVIDIA Vera BlueField-4儲存處理器與NVIDIA Spectrum-X乙太網路技術驅動的模組化機架級基礎平台。

NVIDIA STX定義一種新型的AI原生資料平台,透過統一的NVIDIA DOCA安全堆疊,讓企業能在AI資料路徑中持續執行政策控管。

此外,基於NVIDIA STX打造的NVIDIA CMX情境記憶儲存平台,為長情境、多輪互動與代理型AI推論提供AI原生情境層。

SCADA實現高速且安全的AI儲存

提升儲存層的速度也伴隨一定風險。讓應用程式直接與儲存裝置通訊固然快速,但若處理不慎,應用程式可能覆寫其他程序的記憶體,形成安全漏洞,而非一項優勢。

NVIDIA SCADA將任務分成兩部分,以安全且穩健的方式實現大規模直接存取:1. 應用程式中需要原始速度的使用者端部分,維持在可信任運算基礎之外。2. 一個具特權權限的獨立元件,會在初始設定階段,於使用者應用程式與其獲准存取的儲存資源之間配置受保護的存取機制。該元件遵循標準 Linux 協定落實安全控管,同時有效保護資料。

這些進展共同推動高速、大規模平行、高效率且安全的AI儲存基礎架構,為應用程式與AI工廠提供更優質的資料,從而使其能夠大規模產出更實用、更精準且更符合實際需求的智慧成果。

深入了解NVIDIA AI儲存技術的最新資訊。

關鍵字