芯东西(公众号:aichip001)
编译 | 崔嫄伟
编辑 | 陈骏达
芯东西9月1日消息,在2026年全球顶级半导体架构行业研讨会Hot Chips上,英伟达正式揭晓Vera Rubin平台旗下新一代数据中心AI加速器Rubin GPU的完整技术细节。
英伟达首次披露Rubin GPU对应的工厂级满配性能指标。所有数据均针对100MW级AI工厂整体系统,而非单块GPU:NVFP4精度下推理性能达2ZFLOPS,训练性能达1.4ZFLOPS;配套11PB HBM4高带宽内存,内存总带宽达800PB/s,整套AI工厂系统功耗为100MW。

英伟达引用SemiAnalysis测试数据验证,在搭载140K+超长上下文的DeepSeek-v4-PRO模型、AgentX智能体工作负载下,Vera Rubin NVL72在60M总token处理规模后性能全面超越前代GB300 NVL72;且随着Agentic AI多轮推理、工具调用等高交互任务复杂度提升,其每兆瓦token吞吐可实现10倍提升,最高可达30倍。

一、Rubin GPU:面向Agentic AI的全栈重构
Vera Rubin被英伟达定位为全栈AI工厂平台,覆盖7类芯片与5种机架规格。平台不仅整合了Vera CPU、Rubin GPU、BlueField-4数据处理器、Spectrum-6交换芯片,还集成了Groq语言处理单元(LPU),在上层构建了存储、网络、工具调用与沙箱运行的完整支撑体系。对Agentic AI而言,从超长上下文窗口、大容量内存到高速扩展互联架构,每一层硬件资源都是支撑多轮推理的必要基础。
在以“每兆瓦token”为纵轴、交互性为横轴的性能坐标系中,Vera Rubin NVL72机架的表现大幅领先Blackwell NVL72,更远超Hopper架构的NVL8世代(对应HGX H100/H200 8-GPU服务器),尤其在高交互智能体场景下优势显著。

与之对应的是设计优化目标的转向:每瓦token数、首token生成时间(TTFT)、有效使用寿命、平均中断间隔时间四大指标的优先级,已经超过了传统的原始浮点运算速度(FLOPS)。Agent时代,平台的长期收益与持续产出能力,比峰值算力更重要。

二、核心技术:稀疏计算与互联升级
随着AI Agent每轮交互的上下文长度不断增长,注意力计算量呈平方级上升,一轮长时会话的前馈与注意力计算量远超40万token规模。英伟达称,单纯为GPU堆砌数学运算单元已不足以应对这一挑战,因此从计算效率、多卡同步、集群互联三个维度重构了技术栈。
计算效率层面,Rubin GPU采用自适应稀疏技术,搭配硬件管控的混合精度运算,为低精度运算配备专属硅片资源,同时结合结构化稀疏与精度保留压缩技术,覆盖训练与推理场景。
Rubin的自适应稀疏技术以2:4稀疏格式为基础,并实现了更灵活的动态判断能力,稀疏机制贯穿整个Transformer模块:在QKV矩阵、注意力投影层与MLP多层感知机中,硬件自动识别并跳过接近零的无效数值计算,在不改变模型结构的前提下降低运算量。英伟达称,绝大多数预训练模型无需修改或微调,仅需在推理运行时通过参数即可开启该功能。

为验证稀疏模式的精度保留能力,英伟达分别以BF16稠密模式与NVFP4稀疏模式运行Qwen-Image图像生成模型,生成同一场景的电影感肖像,视觉效果几乎一致。

多个硬件基准测试数据同样显示,稀疏模式在各类评测集上的精度表现与稠密模式基本持平。

分布式推理场景下,多GPU间的同步延迟是制约高交互场景吞吐量的核心瓶颈。Rubin GPU重构了多卡同步逻辑,用计数写入(Counted-Write)机制替代传统的内存屏障(MEMBAR)方案。传统Blackwell架构依靠内存屏障保证数据写入完成,再通过更新原子标志位、接收端轮询查询的方式实现同步,轮询过程会持续占用互联带宽与计算资源。

而计数写入机制由发送端附带数据计数信息,接收端依靠片上硬件计数器统计接收进度,计数达标后硬件自动触发后续计算,彻底消除了轮询开销与内存屏障带来的延迟,大幅降低NVLink交互延迟,在高交互智能体场景下显著提升系统吞吐量。
集群互联层面,第六代NVLink是提升token吞吐的另一核心支柱。作为英伟达专属的GPU间高速互联总线,第六代NVLink构建起最多72块GPU的统一扩展域,单卡全互联带宽达3.6TB/s。相比传统以太网扩展方案,NVLink 6实现4倍吞吐量提升、3倍延迟降低、10倍数据包速率提升,同时交换托盘硬件自带130TFLOPS的网内计算能力,可在数据转发途中完成聚合运算,减少数据往返搬运。

NVL72机架依托NVLink 6交换托盘,实现整个扩展域内所有GPU的硬件级缓存一致性,对上层软件而言,72块GPU可等效为一块巨型虚拟GPU,大幅简化分布式训练与推理的部署复杂度。
三、系统级创新:供电、散热与可靠性
在芯片技术之外,英伟达推出第三代MGX开放机架平台,从系统层面进一步释放AI工厂的能效与可靠性潜力。作为英伟达模块化加速计算的开放标准,MGX生态目前已拥有80余家合作伙伴,在全球30个国家、350多个工厂站点具备数百万平方英尺的产能。
NVL72机架采用45℃高温进水液冷、800V直流供电架构,搭配无重定时器设计,支持热插拔、无电缆托盘与铜缆扩展架构,全方位提升首token时间与平均中断间隔指标。其中Vera Rubin计算托盘采用无电缆、无风扇设计,去除了托盘内部的连接线与散热风扇,大幅简化机架级部署与运维流程,同时降低单点故障风险。
散热体系上,英伟达采用温水冷却方案,通过提升进水温度至45℃,拉大冷却液与环境的温差,多数场景下可省去冷水机组与配套水损耗,在保证满负载性能的同时,降低制冷系统的能耗占比,让更多电力预算用于算力输出。
供电系统是英伟达挖掘能效潜力的关键一环。NVL72搭载智能功率平滑技术,通过硬件与算法动态平抑负载的功率波动,削峰填谷降低峰值功耗。官方数据显示,在大语言模型训练场景下,单座Vera Rubin NVL72机架可实现峰值功耗降低13%,同时提升电网合规性;结合其他系统级功耗优化,每瓦供电容量可支撑的GPU数量最多提升40%,相当于在同等供电基础设施下部署更多算力。

可靠性方面,英伟达第二代RAS引擎(RIST,可靠性、可用性与可维护性引擎)支持工作负载运行时的零停机GPU健康检查,搭配进阶版SRAM ECC纠错机制与增强型NVLink热交换服务。不同于第一代RAS需要整个节点离线数小时完成检测,第二代引擎可在业务不中断的情况下完成健康巡检,直接提升系统有效吞吐量,同时为预测性维护提供数据支撑。
结语:算力交付范式转向:从芯片单元到百兆瓦AI工厂
整场发布会中,英伟达将Rubin GPU纳入AI工厂完整体系架构,作为系统核心计算层级。该平台整合计算、网络、供电、散热、运维服务的全链路基础设施能力。
Rubin GPU的落地,折射出英伟达算力产品战略的关键升级。产品价值维度从传统浮点运算峰值性能,延伸至全生命周期运行效率与整体拥有成本。行业传统算力交付单位集中于单GPU、单服务器级别,英伟达则将产品交付尺度升级至100MW级大型AI工厂。
当前行业不少产品宣传依旧以单芯片峰值算力作为主要衡量标尺,而Vera Rubin平台将评估维度拓展至数据中心整体可用性与持续产出能力,依托整套工厂级基础设施体系,实现规模化、高可靠的稳态算力输出。