芯东西(公众号:aichip001)
编译 | 崔嫄伟
编辑 | 陈骏达

芯东西8月25日消息,昨日,英伟达在官网上宣布,面向Vera Rubin平台的Groq 3 LPX交互式推理机架已进入全面投入生产阶段。

该产品是英伟达收购Groq相关技术后首款商业化落地的机架级专用推理系统,作为Vera Rubin平台的扩展组件,专门面向AI Agent场景,解决长上下文下实时交互推理的行业痛点,Nebius是首家采用NVIDIA Groq 3 LPX的AI云服务提供商。

同日,英伟达开发者博客发布深度技术长文,详解Groq 3 LPX与Vera Rubin NVL72的软硬件协同架构,并首次披露独立第三方机构Artificial Analysis的基准测试结果。

Artificial Analysis是行业公认的中立 AI 性能评测机构,本次测试选用谷歌 2026年4月发布的Gemma 4‑31B稠密模型,该模型已经完成针对英伟达硬件的官方适配优化。在10万tokens长上下文测试环境下,Groq 3 LPX实现 3431tokens/s 的输出速度,性能达到当前公开同类方案的近4倍,同时保证模型输出精度不受损失。

一、长上下文+高交互,成为AI算力新瓶颈

随着AI Agent应用普及,多轮对话、代码生成等场景的上下文长度持续膨胀,数百轮对话后,上下文可达到数十万tokens量级。模型每一轮生成内容,都需要重新处理全部历史信息。

行业普遍痛点在于:上下文越长,推理速度越慢;而实时交互又要求单用户低延迟响应,两者难以兼顾。

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露▲在多轮会话中,每轮对话中蕴含的上下文信息稳步增加

传统方案通常采用张量并行(将模型拆分到多颗芯片并行计算)提升速度,但该技术在高交互的小批量场景下会出现明显短板:芯片间通信的固定启动开销占比会急剧升高,最终抵消并行计算带来的速度收益。简单来说,用户请求越零散、数据量越小,“建立连接、调度链路” 的等待时间就越容易成为性能瓶颈。

二、两大核心技术路径,破解长上下文高速交互难题

Groq 3 LPX是英伟达Vera Rubin平台的专用推理扩展系统,主打小批量、低延迟、长上下文场景,核心通过两项技术设计解决通信开销问题。

为了规避运行时通信调度带来的性能损耗,Groq 3 LPX采用确定性执行架构。在任务开始运行前,编译器就已经掌握所有计算单元、高速内存、芯片间直连链路的全部信息,提前生成精确到时钟周期的传输时间表。

与传统 “数据到达后再申请链路、争抢带宽” 的动态调度不同,这套方案提前规划好每一份数据的传输时机与路径,完全省去了实时仲裁、链路冲突等待的时间,将芯片间通信的固定启动开销压到极低水平,让张量并行在小批量场景下也能发挥出加速效果。

除此之外,Groq 3 LPX还实现了细粒度的计算‑通信重叠,以此减少算力空转。传统推理模式需要等一整块矩阵运算全部完成,再统一传输结果,会产生明显的 “通信尾部” 等待时间。

Groq 3 LPX将计算拆分为320字节的极小粒度,每计算完一小块结果就立刻通过芯片间链路发送,实现计算与传输的高度重叠。这种 “边算边传” 的模式大幅压缩了总耗时,尤其适合长上下文推理中计算量最大的注意力算子。

三、实测验证:速度提升超30倍,性能几乎不受上下文长度影响

第三方机构Artificial Analysis选用谷歌开源的Gemma 4-31B稠密模型完成标准化测试。本次测试专门针对长上下文AI推理的输出速度开展评测,分别在1万tokens、10万tokens两种输入上下文条件下,验证硬件在不同上下文长度下的生成性能;同时额外开展代码生成专项测试,考察硬件处理智能体代码任务的实际表现。该模型于2026年4月发布,官方已针对英伟达算力平台做了性能适配,是行业通用的推理性能基准测试模型,核心结果如下:

10万tokens长上下文:中位数输出速度3431tokens/s,是当前公开最快端点(870tokens/s)的3.9倍;

1万tokens短上下文:中位数输出速度3382tokens/s,性能几乎不受上下文长度影响;

在SPEED-Bench编程基准中,Groq 3 LPX搭载同款Gemma 4‑31B模型,测得中位数速度达4767tokens/s,20%的任务速度超过5520tokens/s。

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露▲ Artificial Analysis测试结果

从体感来看,生成5000个token的内容,该方案仅需约1.5秒;而当前主流智能体工具速度约60tokens/s,完成相同内容需要近80秒,性能提升超过30倍。测试同时确认,该配置下模型输出无精度损失、无效果下降。

四、与Vera Rubin NVL72协同,支持三种部署模式

Groq 3 LPX并非独立运行的替代产品,而是Vera Rubin平台的能力扩展,与Vera Rubin NVL72机架形成互补:NVL72擅长大规模输入处理、长上下文缓存存储;Groq 3 LPX擅长高速解码生成。二者通过架构级协同,支持三种主流部署模式:

预填充-解码分离(标准模式):NVL72负责处理输入上下文、生成KV缓存,交给LPX完成高速输出生成,实现 “读资料” 和 “写回答” 的硬件分工;

注意力-前馈网络分离:NVL72运行注意力层并维护缓存,LPX运行前馈网络层,机架间仅传输少量中间结果;

投机解码协同:LPX运行小型草稿模型快速生成候选token,NVL72上的大模型负责校验纠错,进一步提升整体生成速度。

官方表示,这套协同方案可支撑2万亿参数级别的多智能体系统,兼顾长上下文与高交互需求。

结语:架构协同新范式:AI智能体算力走向专用化分工

从通用GPU大一统,走向 “通用算力 + 专用推理” 的架构协同,正在成为AI算力的新趋势。除英伟达Groq 3 LPX方案外,行业内也出现了不少异构分离推理的探索:例如部分厂商将预填充与解码阶段拆分,由不同硬件分别承担上下文处理、token生成两类任务;Cerebras、AMD也推出了机架级异构推理方案,尝试把高吞吐的通用算力与低延迟专用推理硬件做组合调度。

Groq 3 LPX的量产落地,补上了Vera Rubin平台在高交互长上下文场景的能力短板,也为AI智能体、代码助手等强交互应用的规模化落地,提供了关键的算力支撑。不过异构架构也对软硬件调度、芯片间通信、KV缓存跨硬件流转提出更高的工程要求,后续还需要在生态适配、成本控制上持续打磨。