云霞资讯网

88核吊打128核?英伟达Vera CPU智能体AI性能6倍于AMD Turin

7月22日消息,英伟达(NVIDIA)近日进一步披露了其首款自主研发数据中心CPU——Vera的完整性能数据,并将其与当

7月22日消息,英伟达(NVIDIA)近日进一步披露了其首款自主研发数据中心CPU——Vera的完整性能数据,并将其与当前主流x86服务器处理器进行了详细对比。

根据英伟达公布的数据,Vera CPU是一款围绕Agentic AI(智能体AI)工作负载重新设计的数据中心处理器。在官方公布的多项测试中,仅拥有88个CPU核心的Vera,整体性能已全面领先拥有128个核心的AMD EPYC Turin(Zen 5)处理器,在Agentic AI相关负载下最高可实现6倍性能提升。其中,全新的Olympus CPU核心可将Agent工作负载性能提升2倍;基于单芯片(Monolithic)架构和NVIDIA Scalable Coherent Fabric一致性互连技术,实现了3倍核心间带宽;同时,全新的LPDDR5X内存子系统将内存访问延迟降低40%,进一步提升了Agentic AI推理过程中的响应速度和执行效率。

英伟达认为,Agentic AI时代对于CPU的需求已经发生根本变化,传统面向通用计算优化的x86架构已难以满足AI推理过程中大量分支判断、高并发线程以及高内存带宽等需求,而Vera正是围绕这些AI工作负载进行了重新设计。

聚焦Agentic AI,四大能力成为设计重点

此次公布的数据中,英伟达主要围绕四项关键能力评估Vera CPU的性能:

①内存带宽与访问延迟:验证高带宽内存、低延迟访问及一致性互连架构对数据供给能力的提升;

②应用负载性能:覆盖Agentic AI、数据分析、图计算等CPU密集型应用;

③核心IPC(每时钟周期执行指令数):重点展示全新Olympus微架构带来的执行效率提升;

④强化学习(RL)及Agentic AI性能:考察分支密集型、高并发、低延迟AI推理场景下的综合表现。

值得注意的是,此次官方测试主要将Vera与AMD最新一代EPYC Turin(Zen 5)服务器处理器进行了对比。

全新Olympus核心,大幅提升单线程执行效率

Vera最大的变化来自于全新的Olympus CPU微架构。

英伟达表示,Agentic AI涉及大量Python执行、代码编译、推理调度以及复杂控制流,因此CPU单线程性能和分支预测能力比传统服务器应用更加重要。

官方数据显示,在多个典型负载下,Vera核心IPC相比AMD Zen 5最高提升至原来的1.9倍。

神经网络分支预测器提升分支执行效率

为了应对AI程序大量条件判断和复杂控制流,Olympus采用了全新的神经网络分支预测器(Neural Branch Predictor),并结合多种专用预测单元,大幅提升CPU前端效率。

官方数据显示:Olympus内核的分支预测性能最高提升2.3倍;平均提升约2倍;每周期可处理Taken Branch数量最高提升3.5倍。

英伟达表示,更精准的分支预测意味着CPU能够持续向执行流水线提供有效指令,减少错误预测造成的流水线清空,从而降低无效周期,提高整体执行效率。

无需uOP Cache,指令获取能力提升2.4倍

Olympus核心还重新设计了CPU前端。相比x86处理器普遍依赖uOP Cache缓存微指令,Olympus直接采用:64KB一级指令缓存(Instruction Cache)、每周期128Byte高带宽取指、10宽(10-wide)指令解码器。

官方数据显示,其每周期指令获取能力(Instruction Fetch Operations)最高达到AMD Zen 5的2.4倍。

与此同时,Olympus后端执行单元也进行了大幅扩展。数据显示,其Backend Operations吞吐能力:峰值提升4.3倍,平均提升超过3倍。

整体来看,Olympus通过扩大前端解码宽度、优化分支预测以及增强执行资源,使CPU在复杂AI程序中的单线程性能实现了显著提升。

单芯片设计破解Chiplet瓶颈

除了核心架构,英伟达此次重点强调了Vera采用Monolithic(单芯片)设计的重要意义。

目前主流x86服务器CPU,包括AMD EPYC Turin,均采用Chiplet架构,即多个计算芯粒(CCD)通过I/O Die互连组成完整处理器。

虽然Chiplet有利于提升制造良率,但随着AI工作负载越来越依赖大量核心间通信,其弊端也逐渐显现。

英伟达指出,当数据需要跨CCD传输时,需要经历:CPU核心 → CCD → I/O Die → 另一CCD → 目标核心。

每增加一次Die间跳转,都会增加:通信延迟;Fabric带宽占用;核心间通信的不确定性。这些都会影响Agentic AI推理效率。

而Vera采用单芯片设计,所有CPU核心位于同一硅片内部,可避免上述问题。

官方公布的Core-to-Core延迟热力图显示,相比AMD EPYC 9755:Vera核心间通信延迟降低约50%;所有CPU核心之间保持一致的低延迟表现,不会因物理位置不同而出现性能波动。

英伟达认为,这种一致性的低延迟对于AI推理尤为重要。

内存带宽达到EPYCTurin四倍

针对AI推理中大量随机访问数据的特点,英伟达也重点强化了Vera的内存子系统。

官方数据显示:AMD EPYC Turin拥有128个CPU核心,每个核心平均可获得约3.1GB/s内存带宽。

相比之下,Vera虽然只有88个核心,但每个核心平均可获得约12.7GB/s内存带宽,在部分应用中甚至可达到14GB/s。

也就是说,Vera单核心内存带宽约为AMD EPYC的4倍。

此外,在内存压力测试中,随着带宽需求增加,AMD EPYC Turin内存访问延迟由约120ns迅速升高至约350ns。

而Vera不仅能够提供约3倍内存带宽,在90%内存利用率下,其峰值访问延迟甚至可降低至AMD平台的约1/40。

英伟达认为,对于Agentic AI而言,大量线程需要同时访问规模庞大且分布不规则的数据集,因此系统瓶颈更多来自内存而非CPU算力本身,高带宽、低延迟内存系统的重要性正不断提高。

Python性能最高提升1.8倍

在实际应用测试中,英伟达重点展示了Agentic AI相关软件栈表现。

测试涵盖:Python运行、软件编译、静态代码分析、自动化软件工具链。

结果显示,Vera单核心性能相比AMD EPYC最高提升:Python性能提升了1.8倍;其他软件工作负载提升了最高约1.7倍。

英伟达官方表示,这些测试均在CPU满载情况下完成,因此能够更加真实反映数据中心实际部署场景。

图计算性能最高提升29倍

由于AI知识图谱、RAG等应用大量依赖图计算(Graph Processing),英伟达也公布了多项图计算测试结果。

其中,Graph Traversal(图遍历)性能相比AMD EPYC提升约2.6倍。

而在PageRank算法测试中:随着核心数量增加,Vera展现出极佳扩展能力。在32核心配置下,其性能最高达到AMD平台的29.3倍。

英伟达表示,这主要得益于:更高内存带宽、更大的缓存效率、更低核心通信延迟。

ClickHouse数据库性能提升20%

除了AI推理,官方还展示了数据库分析能力。在列式数据库ClickHouse测试中:Vera相比AMD EPYC Turin性能提升约20%。

ClickHouse广泛应用于:在线分析处理(OLAP)、数据仓库、ETL(抽取、转换、加载)、大规模数据聚合分析。

英伟达认为,Vera对于高并发分析型数据库同样具有较好的适应能力。

瞄准2000亿美元CPU市场

英伟达认为,随着Agentic AI成为下一阶段AI发展的核心方向,传统服务器CPU市场也将迎来重构。

官方预计,到2026年,Vera有望成为AI数据中心部署规模最大的CPU平台之一。

目前,包括OpenAI、Anthropic、SpaceX、Perplexity等多家AI企业已开始部署Vera平台。

与此同时,Vera也将陆续进入各类超级计算中心、云计算数据中心,并获得更多服务器厂商及生态合作伙伴支持。

小结:

从此次公布的架构及性能数据来看,Vera并非简单意义上的Arm服务器CPU,而是一款围绕Agentic AI重新定义的数据中心处理器。

与当前主流x86服务器CPU相比,Vera最大的特点并非单纯提升CPU核心数量,而是针对AI推理中的高带宽、低延迟、高并发以及复杂控制流等特点,对CPU微架构、内存系统及片内互连进行了系统性优化。

尤其是单芯片(Monolithic)设计、高带宽内存架构以及Olympus微架构,使其在Python执行、图计算、强化学习等Agentic AI核心工作负载中展现出明显优势。

未来,随着Agentic AI、大模型推理和AI智能体应用持续快速增长,CPU作为AI基础设施的重要组成部分,其架构设计也将逐步从传统通用计算转向更加贴近AI工作负载的方向。而Vera,正是英伟达在这一趋势下推出的重要产品。

编辑:芯智讯-浪客剑