每token成本定成败:vera rubin如何改写ai基础设施法则-凯发官网首页
  1. 凯发官网首页-凯发k8官网下载
  2. 记者观察

每token成本定成败:vera rubin如何改写ai基础设施法则-凯发官网首页

 
2026年07月16日 来源:e-works作者:  
关键字:      
ai基础设施的竞争,已悄然从单一芯片的制程竞赛,转向全栈系统的协同效率竞赛。nvidia通过vera rubin平台及其配套的网络、存储与安全创新,构建了一个面向代理式ai时代的完整生产系统。
       2026年的ai基础设施市场正在经历一场静默的范式转移。gartner预测,全球ai支出将在2026年达到2.59万亿美元,同比增长47%,其中ai基础设施占比超过45%。更值得关注的是结构性变化:ai代理软件支出将从2025年的864亿美元跃升至2026年的2065亿美元,增幅高达139%。企业正在从“试用ai”转向“规模化运营ai”,基础设施的tco效率将直接决定这场转型的成败。

       在这一关键节点,nvidia给出的答案不是一颗更快的gpu,而是一套完整的“ai工厂”操作系统。从grace blackwell到vera rubin,nvidia正在从算力供应商转变为智能生产基础设施的定义者。
无
图1 黄仁勋宣布nvidia vera rubin正在加速进入全面量产阶段(来源:nvidia)

01 范式转移:为什么传统数据中心架构正在失效

       要理解vera rubin的战略意义,首先要回答:代理式ai究竟对基础设施提出了什么前所未有的要求?

       传统数据中心的设计理念是“存储—检索—处理”,但在代理式ai时代,这些设施已全面进化为“ai token工厂”——核心产出是以token形式制造的智能。这一转变背后绝非简单的算力需求增长,而是对整个系统架构的重新定义。

       现代ai智能体能够规划任务、调用工具、执行代码、检索数据,并跨多个连续多步骤工作流进行协调。这类交互会产生海量推理token、持续扩容kv缓存,同时还需要依托cpu沙盒环境完成结果测试与校验。这意味着,基础设施必须同时满足三个看似矛盾的要求:海量并行计算、极低延迟响应、以及复杂的cpu端协调。传统“gpu计算、cpu调度、网络连接”的分层架构,在这种混合负载下正面临严峻瓶颈。
无
图2 cpu 沙盒可加速基于 rl 的后训练和代理式调用(来源:nvidia技术博客,作者praveen menon;ivan goldwasser)

       nvidia的洞察在于:问题的根源不是某一颗芯片不够快,而是整个系统没有为代理式ai的端到端工作流进行协同设计。这正是vera rubin的出发点——并非对原有架构的小幅升级,而是一次系统性重构。

02 vera rubin:七颗芯片、五个机架、一台超级计算机

       nvidia在gtc 2026及台北gtc期间发布的vera rubin平台,是nvidia迄今为止规模最大的pod级平台。它将nvidia vera rubin nvl72系统、nvidia vera cpu、nvidia groq 3 lpx、nvidia vera bluefield-4 stx存储以及nvidia spectrum-6 spx以太网这五种机架整合为一个高度集成的统一系统。
无
图3 nvidia vera rubin pod 包括5个机架级系统、1台ai超级计算机、1台nvidia mgx机架架构和生态系统(来源:nvidia技术博客,作者rohil bhargava;taylor allison;harry petty)

       与上一代平台相比,vera rubin智能体处理吞吐量达到grace blackwell平台的10倍。这一架构的颠覆性在于,它打破了“围绕gpu组装系统”的传统思路,转向“为ai工厂设计整机”。七款芯片并非简单的功能叠加,而是围绕代理式ai的工作流特征进行了深度协同优化。

       其中,vera cpu的发布尤其值得细读。作为全球首款专为代理式ai与强化学习时代打造的处理器,它搭载了88颗nvidia定制的olympus核心,拥有1.2tb/s的内存带宽以及高速片上互连架构。在phoronix的stream triad测试中,vera能够持续保持其峰值内存带宽的90%。同时,与传统x86 cpu相比,vera每核心的内存带宽提升超过4倍。这些数字背后是一个关键判断:传统x86 cpu并非为智能体工作负载设计,其在并发任务调度、上下文切换和内存带宽方面的瓶颈,正在成为ai工厂效率的隐性天花板。vera cpu不是去替代x86,而是开创了一个全新的处理器类别。
无
图4  nvidia vera cpu 正式发布(来源:nvidia)

       vera rubin的架构价值,不仅在于性能数字的跃升,更在于其对ai工作负载全生命周期的覆盖——从大规模预训练、后训练、测试阶段扩展,到实时智能体式推理。平台通过机架级资源池化与任务调度,实现了计算、内存与i/o的动态匹配。企业不再需要为训练、推理、智能体协调分别搭建异构集群,一套vera rubin pod即可统一承载。

03 网络、存储与安全:被低估的“隐形战场”

       如果说计算是ai工厂的生产线,那么网络就是它的物流系统,存储是它的仓库,安全则是它的门禁。在vera rubin的全栈设计中,这三个看似“配角”,实际决定着系统的上限。

       在网络层面,nvidia spectrum-x以太网硅光技术现已全面量产。新一代spectrum-x交换机基于光电一体封装技术(cpo)构建,支持vera rubin平台在数据中心进行横向扩展和跨区域扩展部署ai工厂。对于代理式ai而言,这意味着多智能体协作、分布式推理与大规模模型并行将获得更高效的网络支撑,显著降低通信开销对整体吞吐量的侵蚀。凭借简化设计,为计算释放更多电力,nvidia 光电一体封装技术网络为百万 gpu ai 工厂提供了基础架构

       在存储层面,nvidia bluefield-4 stx模块化参考架构直接回应了代理式ai对长上下文推理能力的存储需求。该架构可助力企业、云计算及ai服务商轻松部署加速存储基础设施,满足智能体在多步骤工作流中产生的大量上下文数据与kv缓存的存取需求。bluefield-4 dpu将存储与网络功能从主cpu卸载,释放更多计算资源用于核心ai任务。stx架构将存储从“被动仓库”升级为“主动处理节点”——它不再只是存放数据,而是直接参与智能体与上下文记忆之间的交互管理。

       在安全层面,nvidia为vera bluefield-4 stx推出了全新的doca安全创新技术,实现代理式ai工厂的新型内置安全存储。基于统一的nvidia doca安全套件,并在bluefield-4芯片内强制执行,stx平台能够在线检查和管理智能体、数据与上下文记忆之间的交互,帮助企业在ai数据路径中持续执行策略。这种芯片级安全能力,在大规模ai环境中为基础设施、工作负载、智能体和数据提供了运行时检测、数据访问控制以及加速网络执行的全栈保护。考虑到ai工厂带来的全新攻击面——涵盖基础设施、软件供应链、模型、数据以及执行权限日益扩展的自主智能体——传统安全架构已明显不足。doca的芯片级强制执行,本质上是在数据流动的每一个节点嵌入安全基因,而非在事后增加安全层。

04 每token成本:ai基础设施竞争的终极标尺

       vera rubin全栈设计的最终指向,是一个看似简单却极具分量的指标:每token成本。

       传统数据中心过去主要用于数据的存储、检索与处理。但在生成式ai与代理式ai时代,这些设施已演变为ai token工厂。随着ai推理成为核心工作负载,它们的主要产出已转变为以token形式制造的智能。这一转变要求对包括总体拥有成本(tco)在内的ai基础设施经济效益评估方式进行全面调整。

       每token成本决定了企业能否实现ai的规模化盈利。它是唯一能够直接综合反映硬件性能、软件优化、生态系统支持以及实际利用率的tco指标。nvidia在这一指标上实现了行业更低的每token成本,这并非来自某一颗芯片的制程优势,而是来自vera rubin机架级协同设计的系统性效率——vera cpu减少协调开销、rubin gpu加速推理、spectrum-x降低通信延迟、bluefield-4优化存储路径、doca减少安全损耗。当竞争对手还在优化单点性能时,nvidia已经在优化整个系统的“token 产出率”。
无 
表1 每token成本比每美元flops的差异性(来源:nvidia技术博客,作者shruti koparkar)

小结

       ai基础设施的竞争,已悄然从单一芯片的制程竞赛,转向全栈系统的协同效率竞赛。nvidia通过vera rubin平台及其配套的网络、存储与安全创新,构建了一个面向代理式ai时代的完整生产系统。

       vera cpu对代理式工作负载的专门优化、spectrum-x硅光技术对数据中心横向扩展的支撑、bluefield-4 stx对长上下文存储的加速,以及doca芯片级安全对ai数据路径的守护,共同构成了ai工厂的“新基建”标准。gartner将2026年定义为企业ai支出的拐点——当企业从战术性试点走向规模化部署,基础设施的tco效率将直接决定ai商业化的成败。

       在这一背景下,nvidia以“每token成本”为核心指标,通过vera rubin的全面投产与全栈技术的深度协同,正在为全球ai工厂注入强劲动力。从grace blackwell到vera rubin,变的不仅是命名规则,更是ai基础设施从“算力供应商”到“智能生产伙伴”的角色跃迁。未来,随着代理式ai在企业工作流中的渗透率持续提升,nvidia所定义的机架级协同架构,或将成为ai基础设施的事实标准。
责任编辑:
您可以:

系列微信

数字化企业网
plm之神
e-works制信科技
mes百科
工业自动化洞察
智能制造im
ai智造圈
智能工厂前线
工业机器人洞察
智造人才圈
工业软件应用
智能制造网博会
erp之家
供应链指南针

旗下机构


e-works 公众号

e-works app

旗下其他网站

特色服务

© 2002-2026  武汉制信科技有限公司  凯发k8官网下载的版权所有  
     投诉举报电话:027-87592219

   |       |   

icp经营许可证:鄂b2-20080078
(于2003年首获许可证:鄂b2-20030029)
鄂公网安备:420100003343号
© 2002-2026  武汉制信科技有限公司  凯发k8官网下载的版权所有
投诉举报电话:027-87592219

扫码查看
凯发官网首页
网站地图