根據 NVIDIA 最新白皮書,Vera CPU 將於 2026 年下半年正式推出,這款基於 Arm 指令集的自主架構處理器專門為代理式 AI 設計,旨在解決現有通用資料中心 CPU 在處理代理式 AI 時的效能瓶頸。
Vera CPU 的設計理念
NVIDIA 在白皮書中強調,代理式 AI 頻繁在多個代理之間執行,需要將更多關鍵執行路徑轉移到 CPU 負載。因此,Vera CPU 與現行通用資料中心 CPU 在設計理念上有著顯著差異。Vera CPU 需要具備以下四項特質:
- 在插槽全負載的情況下仍保有強大的單執行緒效能
- 每個核心具有滿足多個活躍執行上下文所需的充裕記憶體頻寬
- 可預期的併行情況延遲,確保代理步驟能一致完成
- 高效處理不規則控制流、常依賴鍊與指標密集型資料結構
Olympus 架構的前端設計
Olympus 架構的前端設計旨在確保核心在大型、分支密集型軟體堆疊中獲得所需的指令。代理程式執行時間、解釋器、編譯器、圖分析與資料處理框架等工作負載經常會占用大量指令且控制流程變化頻繁。Olympus 的前端通過先進分支預測、高頻寬指令解取來自 10 路解碼引擎,每個周期向核心提供更多指令。
數據顯示,Olympus 的分支預測子系統包含一個神經分支預測器,藉此提高對複雜、統計偏差較大的分支模式提升預測精準度,進而降低錯誤路徑執行。
Olympus 的中核設計
Olympus 的中核 (Mid Core) 專為挖掘與加速代理式 AI 流程中的隱藏並行性而設計。中核利用強大的重新命名與分配引擎,將假碼後的指令映射至物理資源,並通過大容量重新排序緩衝區與豐沛的物理暫存器容量,確保更多指令可持續執行,進而實現更深層的亂序執行。
透過中核設計,Olympus 可打破包括記憶體重命名、數值預測與關鍵路徑加速等依賴關係,減少因指標密集性程式碼、串行記憶體操作與長依賴鍊造成的停頓。
Olympus 的執行引擎
Olympus 的執行引擎可將豐富的指令以高效率方式執行,透過動態調度,涵蓋整數、分支、向量、浮點、加密、載入及儲存等多種資源。Olympus 架構的有效處理分支密集型軟體、量化資料處理、AI 預處理、加密、壓縮、分析與其它記憶體密集型負載。
數據顯示,Olympus 的執行引擎通過前大的後端與深度亂序執行能力,有效處理分支密集型軟體,像量化資料處理、AI 預處理、加密、壓縮、分析與其它記憶體密集型負載。
Vera CPU 的快取子系統
Vera CPU 的快取子系統旨在解決傳統快取架構面對代理應用一些無法完全置入快取的資料結構引發的停頓。Olympus 的快取採用深層快取結構、記憶體消岐與多個硬體預取引擎,還包括一個圖預取器,用於提升資料密集型圖與分析工作負載。
數據顯示,Olympus 的快取子系統提升記憶體等級的併行性,解決代理、圖分析、資料處理負載等等待不規則記憶體存取時間,進而釋出更多可處理關鍵任務的時間。
專為代理式 AI 設計的多執行緒
Vera CPU 的最大特色之一是引入創新的空間多執行緒,專為工具呼叫、強化學習等應用設計。傳統多執行緒會引發資源爭奪,影響單執行緒效能。Vera 采取不同的多執行緒方式,使 Olympus 核心可在需要最大單執行緒時作為高吞吐量的單執行緒核心執行任務,需要高執行緒密度時則作為兩個獨立的執行緒。
數據顯示,Vera CPU 的多執行緒設計使代理式 AI 應用在高並行運算環境中保持高效能運作。
NVIDIA SCF 通訊骨幹
NVIDIA SCF (Scalable Coherency Fabric) 作为 Vera CPU 的通訊骨幹,通过高頻寬晶片統一架構連接内部包括 Olympus 核心、共享快取、記憶體控制器、I/O 與 NVLink-C2C 介面,具备高達 3.4TB/s 的雙向頻寬,並在所有核心整合一個 164MB 的統一 L3 快取。
數據顯示,NVIDIA SCF 作为通訊骨幹,可减少资源爭用、改善快取共享并维持 CPU 的一致性,特別適合代理式 AI 應用。
Vera CPU 的記憶體模組
Vera CPU 搭配基於 LPDDR5X 的 SOCAMM2 記憶體模組,兼具 AI 基礎設施所需的頻寬、效率與容量,可提供高達 1.2TB/s 的總頻寬,或每個核心達 14GB/s 的頻寬。相比傳統基於 DDR5 的 MRDIMM,Vera 能降低能耗並提供高頻寬,同時還具有可維護性。
數據顯示,Vera CPU 的記憶體模組在高並行運算環境中保持高效能運作。
Vera CPU 的擴展性
Vera CPU 既可作为单处理器
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。
本文改寫整理自公開新聞來源,原始報導由癮科技發布。


