
7月22日消息,英伟达(NVIDIA)近日进一步披露了其首款自主研发数据中心CPU——Vera的完整性能数据,并将其与当前主流x86服务器处理器进行了详细对比。
根据英伟达公布的数据,Vera CPU是一款围绕Agentic AI(智能体AI)工作负载重新设计的数据中心处理器。在官方公布的多项测试中,仅拥有88个CPU核心的Vera,整体性能已全面领先拥有128个核心的AMD EPYC Turin(Zen 5)处理器,在Agentic AI相关负载下最高可实现6倍性能提升。其中,全新的Olympus CPU核心可将Agent工作负载性能提升2倍;基于单芯片(Monolithic)架构和NVIDIA Scalable Coherent Fabric一致性互连技术,实现了3倍核心间带宽;同时,全新的LPDDR5X内存子系统将内存访问延迟降低40%,进一步提升了Agentic AI推理过程中的响应速度和执行效率。


英伟达认为,Agentic AI时代对于CPU的需求已经发生根本变化,传统面向通用计算优化的x86架构已难以满足AI推理过程中大量分支判断、高并发线程以及高内存带宽等需求,而Vera正是围绕这些AI工作负载进行了重新设计。
聚焦Agentic AI,四大能力成为设计重点
此次公布的数据中,英伟达主要围绕四项关键能力评估Vera CPU的性能:
①内存带宽与访问延迟:验证高带宽内存、低延迟访问及一致性互连架构对数据供给能力的提升;
②应用负载性能:覆盖Agentic AI、数据分析、图计算等CPU密集型应用;
③核心IPC(每时钟周期执行指令数):重点展示全新Olympus微架构带来的执行效率提升;
④强化学习(RL)及Agentic AI性能:考察分支密集型、高并发、低延迟AI推理场景下的综合表现。
值得注意的是,此次官方测试主要将Vera与AMD最新一代EPYC Turin(Zen 5)服务器处理器进行了对比。
全新Olympus核心,大幅提升单线程执行效率
Vera最大的变化来自于全新的Olympus CPU微架构。
英伟达表示,Agentic AI涉及大量Python执行、代码编译、推理调度以及复杂控制流,因此CPU单线程性能和分支预测能力比传统服务器应用更加重要。

官方数据显示,在多个典型负载下,Vera核心IPC相比AMD Zen 5最高提升至原来的1.9倍。
神经网络分支预测器提升分支执行效率
为了应对AI程序大量条件判断和复杂控制流,Olympus采用了全新的神经网络分支预测器(Neural Branch Predictor),并结合多种专用预测单元,大幅提升CPU前端效率。
官方数据显示:Olympus内核的分支预测性能最高提升2.3倍;平均提升约2倍;每周期可处理Taken Branch数量最高提升3.5倍。


英伟达表示,更精准的分支预测意味着CPU能够持续向执行流水线提供有效指令,减少错误预测造成的流水线清空,从而降低无效周期,提高整体执行效率。
无需uOP Cache,指令获取能力提升2.4倍
Olympus核心还重新设计了CPU前端。相比x86处理器普遍依赖uOP Cache缓存微指令,Olympus直接采用:64KB一级指令缓存(Instruction Cache)、每周期128Byte高带宽取指、10宽(10-wide)指令解码器。
官方数据显示,其每周期指令获取能力(Instruction Fetch Operations)最高达到AMD Zen 5的2.4倍。


整体来看,Olympus通过扩大前端解码宽度、优化分支预测以及增强执行资源,使CPU在复杂AI程序中的单线程性能实现了显著提升。
单芯片设计破解Chiplet瓶颈
除了核心架构,英伟达此次重点强调了Vera采用Monolithic(单芯片)设计的重要意义。
目前主流x86服务器CPU,包括AMD EPYC Turin,均采用Chiplet架构,即多个计算芯粒(CCD)通过I/O Die互连组成完整处理器。

虽然Chiplet有利于提升制造良率,但随着AI工作负载越来越依赖大量核心间通信,其弊端也逐渐显现。
英伟达指出,当数据需要跨CCD传输时,需要经历:CPU核心 → CCD → I/O Die → 另一CCD → 目标核心。
每增加一次Die间跳转,都会增加:通信延迟;Fabric带宽占用;核心间通信的不确定性。这些都会影响Agentic AI推理效率。
而Vera采用单芯片设计,所有CPU核心位于同一硅片内部,可避免上述问题。
官方公布的Core-to-Core延迟热力图显示,相比AMD EPYC 9755:Vera核心间通信延迟降低约50%;所有CPU核心之间保持一致的低延迟表现,不会因物理位置不同而出现性能波动。

英伟达认为,这种一致性的低延迟对于AI推理尤为重要。
内存带宽达到EPYCTurin四倍
针对AI推理中大量随机访问数据的特点,英伟达也重点强化了Vera的内存子系统。
官方数据显示:AMD EPYC Turin拥有128个CPU核心,每个核心平均可获得约3.1GB/s内存带宽。
相比之下,Vera虽然只有88个核心,但每个核心平均可获得约12.7GB/s内存带宽,在部分应用中甚至可达到14GB/s。

也就是说,Vera单核心内存带宽约为AMD EPYC的4倍。
此外,在内存压力测试中,随着带宽需求增加,AMD EPYC Turin内存访问延迟由约120ns迅速升高至约350ns。
而Vera不仅能够提供约3倍内存带宽,在90%内存利用率下,其峰值访问延迟甚至可降低至AMD平台的约1/40。

英伟达认为,对于Agentic AI而言,大量线程需要同时访问规模庞大且分布不规则的数据集,因此系统瓶颈更多来自内存而非CPU算力本身,高带宽、低延迟内存系统的重要性正不断提高。
Python性能最高提升1.8倍
在实际应用测试中,英伟达重点展示了Agentic AI相关软件栈表现。
测试涵盖:Python运行、软件编译、静态代码分析、自动化软件工具链。
结果显示,Vera单核心性能相比AMD EPYC最高提升:Python性能提升了1.8倍;其他软件工作负载提升了最高约1.7倍。

英伟达官方表示,这些测试均在CPU满载情况下完成,因此能够更加真实反映数据中心实际部署场景。
图计算性能最高提升29倍
由于AI知识图谱、RAG等应用大量依赖图计算(Graph Processing),英伟达也公布了多项图计算测试结果。
其中,Graph Traversal(图遍历)性能相比AMD EPYC提升约2.6倍。

而在PageRank算法测试中:随着核心数量增加,Vera展现出极佳扩展能力。在32核心配置下,其性能最高达到AMD平台的29.3倍。

英伟达表示,这主要得益于:更高内存带宽、更大的缓存效率、更低核心通信延迟。
ClickHouse数据库性能提升20%
除了AI推理,官方还展示了数据库分析能力。在列式数据库ClickHouse测试中:Vera相比AMD EPYC Turin性能提升约20%。

ClickHouse广泛应用于:在线分析处理(OLAP)、数据仓库、ETL(抽取、转换、加载)、大规模数据聚合分析。
英伟达认为,Vera对于高并发分析型数据库同样具有较好的适应能力。
瞄准2000亿美元CPU市场
英伟达认为,随着Agentic AI成为下一阶段AI发展的核心方向,传统服务器CPU市场也将迎来重构。
官方预计,到2026年,Vera有望成为AI数据中心部署规模最大的CPU平台之一。
目前,包括OpenAI、Anthropic、SpaceX、Perplexity等多家AI企业已开始部署Vera平台。

与此同时,Vera也将陆续进入各类超级计算中心、云计算数据中心,并获得更多服务器厂商及生态合作伙伴支持。
小结:
从此次公布的架构及性能数据来看,Vera并非简单意义上的Arm服务器CPU,而是一款围绕Agentic AI重新定义的数据中心处理器。
与当前主流x86服务器CPU相比,Vera最大的特点并非单纯提升CPU核心数量,而是针对AI推理中的高带宽、低延迟、高并发以及复杂控制流等特点,对CPU微架构、内存系统及片内互连进行了系统性优化。
尤其是单芯片(Monolithic)设计、高带宽内存架构以及Olympus微架构,使其在Python执行、图计算、强化学习等Agentic AI核心工作负载中展现出明显优势。
未来,随着Agentic AI、大模型推理和AI智能体应用持续快速增长,CPU作为AI基础设施的重要组成部分,其架构设计也将逐步从传统通用计算转向更加贴近AI工作负载的方向。而Vera,正是英伟达在这一趋势下推出的重要产品。
编辑:芯智讯-浪客剑