智通财经APP获悉,英伟达(NVDA.US)周一宣布,Groq 3 LPX机架级系统已经进入全面量产阶段,标志着公司去年斥资约200亿美元收购Groq相关资产后,这项低延迟AI推理技术正式进入商业化落地阶段。首批系统将部署于AI云计算服务商NEBIUS(NBIS.US),并计划于今年晚些时候上线。
英伟达高级总监Dion Harris向媒体表示,Groq 3 LPX将与英伟达Vera中央处理器和Rubin图形处理器共同部署在Nebius的数据中心。
此次Groq产品快速实现量产,反映出随着AI应用从模型训练进一步转向实际部署,低延迟AI推理正成为英伟达重点争夺的新市场。尤其是在AI智能体和AI编程等应用中,模型需要以更快速度持续生成内容,减少用户等待时间。
英伟达于去年12月斥资约200亿美元收购AI芯片初创公司Groq的相关资产,成为公司历史上规模最大的收购交易。
Groq芯片架构的一大特点是在芯片内部集成500MB高速SRAM,以减少传统内存访问可能造成的数据传输瓶颈,从而提高AI模型推理过程中的响应速度。
与英伟达主要GPU由台积电(TSM.US)生产不同,Groq芯片由三星负责制造。
英伟达目前将256颗Groq 3芯片集成至一个LPX机架中。根据英伟达引用Artificial Analysis的基准测试数据,Groq 3 LPX系统能够实现每秒生成约3400个token的性能。
对于生成式AI而言,token可以理解为模型处理和生成文本的基本单位。更高的每秒token生成速度意味着AI能够更快响应用户请求,对于AI编程、实时智能体等对延迟高度敏感的应用尤其重要。
Harris表示,对于提供AI推理服务的云计算企业而言,更低的延迟意味着它们能够向对响应速度要求更高的客户提供价格更高的高级服务。
不过,Groq芯片并不是为了取代英伟达传统GPU。
GPU仍然是当前AI计算基础设施的核心,不仅能够进行AI模型训练,也能够执行推理任务,同时拥有更强的通用性,可以适应不同模型和技术架构。
Groq这类低延迟芯片则更加专注于AI推理过程中的特定环节,尤其是模型生成内容时的“解码”阶段。
Harris表示:“这并不是要取代GPU,而是针对工作负载的不同部分,使用价格和性能最合适的处理器。”
这意味着英伟达正在尝试建立更加细分的AI计算架构:Vera CPU和Rubin GPU继续承担更广泛的AI计算任务,而Groq芯片则针对延迟高度敏感的推理工作负载进行优化。
随着AI行业逐渐从大规模模型训练进入推理需求快速增长阶段,低延迟推理市场的竞争正在升温。
AMD(AMD.US)今年早些时候宣布,将其机架级AI系统与Cerebras(CBRS.US)芯片进行整合,同样重点瞄准低延迟AI推理。
这一领域的重要性正在随着AI编程等应用普及进一步提高。报道提到,OpenAI最新公布的Ultrafast模式承诺达到每秒750个token,并由Cerebras提供底层算力支持。
相比之下,英伟达引用的基准测试数据显示,Groq 3 LPX能够达到每秒3400个token。不过,不同系统的测试条件和应用场景可能存在差异,因此这些数字并不能简单视为直接的性能对比。
与此同时,英伟达正在加快Vera Rubin系统的出货,该平台已于今年早些时候进入生产阶段。
英伟达CEO黄仁勋今年3月在发布Vera Rubin和Groq 3 LPX时曾预计,从目前的Blackwell芯片到新一代Vera Rubin系统,截至2027年的累计销售额可能达到1万亿美元。
黄仁勋当时还透露,在专门用于AI编程应用的数据中心空间中,他计划将约四分之一配置给Groq芯片,其余部分则全部部署Vera Rubin系统。
这一配置比例进一步显示出英伟达对低延迟推理市场的重视。随着AI智能体、AI编程以及实时生成式AI应用快速发展,推理速度正在成为云计算企业和AI开发商竞争的重要指标。
Groq 3 LPX正式进入全面量产,也意味着英伟达正在从以GPU为核心的AI芯片供应商,进一步扩展至针对不同AI工作负载提供专用计算架构。
市场接下来还将关注英伟达最新业绩表现。公司将于本周三公布财报,除Blackwell和Vera Rubin需求之外,AI推理业务以及Groq商业化进展也可能成为投资者关注的新焦点。