在AI应用加速渗透各行各业的今天,推理延迟已成为决定用户体验的核心瓶颈。英伟达近日宣布其Groq 3 LPX机架进入全面量产阶段,这一承载着200亿美元收购成果的硬件,将重新定义AI推理的速度标准,为编程、实时交互等场景带来革命性变化。作为最新科技与科技产品融合的典范,Groq 3 LPX不仅展示了英伟达在AI基础设施上的野心,更揭示了低延迟推理在未来智能系统中的关键角色。

一、从200亿美元收购到量产:Groq 3 LPX的诞生之路

去年12月,英伟达以200亿美元(约合1347亿元人民币)收购了芯片初创公司Groq的核心资产,这一创纪录的并购案让业界震惊。如今,收购成果终于落地——Groq 3 LPX机架正式进入全面量产阶段。该机架集成了256颗独立的Groq 3芯片,每颗芯片在裸片内嵌了500MB高速SRAM,大幅减少了内存访问瓶颈。这种架构设计使得Groq 3 LPX在推理场景下展现出惊人的性能:根据Artificial Analysis基准测试,其处理速度达到每秒3400个Token。

英伟达高级总监迪翁·哈里斯表示,Groq机架将与Vera CPU和Rubin GPU协同部署在新型云服务商Nebius的平台,并于今年晚些时候上线。这一量产节奏凸显了英伟达对低延迟推理市场的重视——在AI应用从训练转向推理的关键阶段,AI工具导航中越来越多的工具需要毫秒级响应,Groq 3 LPX恰好填补了这一空白。值得注意的是,Groq芯片由三星代工,而英伟达GPU则由台积电生产,这体现了英伟达在供应链上的多元化布局,也为其最新科技产品组合增添了灵活性。

二、低延迟推理的“解码”革命:为什么Token速度如此重要?

在AI推理流程中,模型生成输出时存在一个关键的“解码”阶段,即逐Token生成文本或代码。这一阶段的延迟直接决定了用户等待时间。Groq 3 LPX每秒3400 Token的速度意味着,生成1000个Token的回复仅需不到0.3秒——几乎感觉不到延迟。对于编程辅助、实时对话、代码补全等场景,这种速度差异是决定性的。

哈里斯指出:“对于那些提供Token服务的人来说,这让他们能够为那些对延迟高度敏感的服务协议的用户提供高级服务等级。”换句话说,云服务商可以针对低延迟Token收取更高费用,这为AI图片生成等对实时性要求高的AI应用创造了新的商业模式。例如,当设计师使用AI画图工具生成创意草图时,每毫秒的延迟都会影响创作流,而Groq 3 LPX的低延迟能力可以让这类工具实现“所见即所得”的实时反馈。

三、Groq vs GPU:互补而非替代,AI芯片分工新格局

很多人的第一反应是:Groq 3 LPX是否会取代英伟达自家的GPU?答案是否定的。哈里斯明确表示:“这并不是要取代GPU,而是要针对工作负载的不同部分,使用价格合适、处理能力合适的处理器。”GPU依然是AI芯片领域的绝对主力,既能执行训练又能执行推理,灵活性极高。但Groq这类低延迟芯片专注于推理流程中的“解码”环节,形成了专业分工。

这种分工类似于CPU与GPU的协同:CPU处理串行任务,GPU处理并行计算。同样,在AI推理中,GPU负责复杂的并行计算,而Groq芯片则用极致的低延迟处理Token生成。英伟达CEO黄仁勋曾计划将数据中心中用于编程应用的空间的四分之一分配给Groq芯片,其余全部采用Vera Rubin系统。这意味着,大模型推理的硬件架构正从“单一GPU”走向“异构计算”,而企业数字化转型中,企业需要根据自身AI应用场景选择合适的芯片组合。

四、竞争格局:AMD、Cerebras与OpenAI的“速度战”

低延迟推理市场正在变得拥挤。今年早些时候,AMD宣布将其机架级系统与Cerebras芯片整合,而Cerebras刚刚上市,主攻低延迟推理。OpenAI推出的“Ultrafast”模式目前承诺每秒750 Token,也由Cerebras提供支持。相比之下,Groq 3 LPX的3400 Token速度是OpenAI的4.5倍,优势明显。

然而,速度并非唯一决胜因素。Cerebras的芯片采用晶圆级集成,在特定工作负载下也有独特优势;AMD的整合方案则强调与自身CPU的生态协同。英伟达的杀手锏在于其完整的软件栈和CUDA生态,这使Groq 3 LPX能无缝融入现有AI框架。此外,AI Agent技术的兴起对低延迟推理提出了更高要求,因为智能体需要在多轮对话中快速响应,这种场景恰好是Groq 3 LPX的强项。

五、Vera Rubin与Groq的协同:英伟达的万亿美元数据中心蓝图

英伟达正在逐步增加Vera Rubin系统的出货量,该系统已于今年早些时候开始生产。黄仁勋在3月发布时预计,到2027年,当前一代Blackwell芯片与全新Vera Rubin系统的累计销售额将达到1万亿美元(约合6.74万亿元人民币)。这一惊人数字背后,是英伟达对数据中心异构计算的全面布局:Vera Rubin负责训练和通用推理,Groq 3 LPX则专攻低延迟解码。

这种协同不仅体现在硬件层面,更体现在商业模式上。云计算公司可以针对低延迟Token收取更高费用,而Groq 3 LPX的机架化设计使得云服务商能够像部署GPU集群一样灵活扩展。黄仁勋透露,数据中心中用于编程应用的空间的四分之一将分配给Groq芯片,其余采用Vera Rubin。这意味着,未来的AI数据中心将不再是单一的GPU农场,而是由多种专用芯片组成的“智能工厂”。用户可以通过AI工具箱快速找到适配不同场景的推理解决方案。

六、AI应用的下一个风口:低延迟推理如何改变行业?

低延迟推理正在从技术问题演变为商业战略。对于编程AI,延迟降低一个数量级意味着开发者可以实时获得代码补全建议,而不必等待;对于客服机器人,毫秒级响应能显著提升用户满意度;对于实时翻译、语音助手等场景,低延迟更是刚需。英伟达的Groq 3 LPX机架量产,标志着这一趋势正式进入规模化阶段。

展望未来,AI应用将更加依赖推理时效性。例如,文生图工具需要实时生成图像,而抠图功能必须在一眨眼间完成背景去除,这些都离不开低延迟芯片的支持。此外,藏头诗生成、AI网名推荐等创意工具,也会因为推理速度提升而获得更好的用户体验。英伟达的这一步,不仅推动了最新科技的发展,更让科技产品真正走进了日常交互的每个角落。

英伟达计划于当地时间周三公布财报,届时可能会披露更多关于Groq 3 LPX的订单数据和客户案例。无论结果如何,低延迟推理已成为AI基础设施竞争的主战场,而英伟达正凭借Groq这张王牌,牢牢占据先机。