一诺倾情
英伟达宣布Groq 3 LPX全面投产:Vera Rubin推理效率实现数倍提升_我的网站

一 | 8月25日消息,英伟达宣布,面向交互式AI推理的Groq 3 LPX处理器正式进入全面投产阶段。 该芯片是Vera Rubin平台的关键组件之一,专注于超低延迟Token生成,旨在弥补传统GPU架构在此类场景下的不足。 当时我拍了照片上传取消了订单,没一会给我开了一张罚单好难受那时候刚好跑了50。 在Artificial Analysis的基准测试中,Groq 3 LPX搭载Gemma 4 31B模型、处理100,000 Token上下文时,实现了每秒3400个输出Token的吞吐量,创下该模型迄今最高纪录。

二 | 针对智能体编程等对延迟敏感的工作负载,其响应速度最高可达近期竞品平台的4倍。 英伟达指出,智能体任务与传统聊天或摘要生成存在本质差异:一次任务可能包含数百甚至数千个推理步骤,智能体需反复读取文件、调用工具、执行代码、校验结果并迭代推理,上下文长度随之累积至数十万Token。 因此,智能体AI带来两个并行的计算需求:一是高效处理持续增长的大规模上下文,二是以极低延迟持续生成每一个输出Token。 Vera Rubin平台通过多芯片协同设计应对这一挑战。其中,Rubin GPU负责大规模训练、推理及上下文处理;Groq 3 LPX则专为单用户交互场景优化Token生成速率;Vera CPU承担工具编排、代码执行、数据处理和模拟等CPU密集型工作;BlueField-4 DPU与Spectrum-6 SPX则分别负责网络与存储加速。 英伟达同步公布了Vera Rubin NVL72在真实智能体负载下的测试结果。基于SemiAnalysis的AgentX工作负载,采用DeepSeek V4 Pro模型,Vera Rubin NVL72每兆瓦(MW)吞吐量最高达到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。 结合Groq 3 LPX的表现,该组合可使智能体在代码编写、测试执行、工具调用和结果验证等连续任务中获得更快的响应速度,从而显著缩短端到端任务完成时间。 英伟达强调,Groq 3 LPX全面投产的核心目的并非以专用推理芯片取代GPU,而是为Vera Rubin平台补充传统GPU架构在超低延迟Token生成方面的短板。

三 | 整个Vera Rubin平台被定位为面向智能体AI时代的AI工厂系统,涵盖Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4 DPU、Spectrum-6 SPX等七款芯片及五种专用机架,所有组件围绕计算、网络、存储和软件进行深度协同设计,确保各类硬件各司其职,而非由单一处理器包揽全部工作负载。
Current article:http://weg9.shaihanhuangwoshang.cyou/news/20260826_8670593.html
Published on:16:12:48
- 神都风物 | 文峰塔:藏在文昌风铃声里的洛阳文脉
- “규백이 오라 그래” “깡패냐”…국군사관학교 공청회 욕설-고성 난무
- 台风“梅花”逼近 南京上空乌云密布
- 《纽约时报》:在中国,AI已经“无处不在”
- 先领教了歼-10C,又见识了歼-16,埃及空军恐怕会对F-16V失去兴趣,锋芒点兵,原创 先领教了歼-10C,又见识了歼-16,埃及空军恐怕会对F-16V失去兴趣
- 骑士多方交易4年8800万签下沃特森!哈登哈登苦心终于得到回报!
- 【坎幼之声】1000+的欢乐——坎山幼儿园趣味亲子运动会快乐不停歇
- 【一线经济观察】河北:深耕文化底蕴 创意赋能文旅高质量发展
- 华润材料:公司2026年半年度计提及转回各项减值准备合计导致公司将减少利润总额5063.79万元
- 市场监管总局就国际单位制及其应用向社会公开征求意见
- ETF追踪丨8月24日ETF净申购190.71亿元 资金加仓科创50ETF华夏
- 三大运营商半年报透视:算力与Token经营成转型主引擎
- 8月26日涨停复盘:56只股涨停 楚天龙4连板
- 福克斯:不打算竞标迪斯尼当地的体育网络
- गाजियाबाद के किसानों के लिए खुशखबरी, फ्री में बीज के लिए 31 अगस्त तक करें आवेदन
- 福建广东广西海南等地有暴雨到大暴雨 北方多对流天气
- 对抗性完整:AI时代,别让一个局部正确骗过整个系统
- 联合国为巴勒斯坦讨了公道,投票结果是人心所向,哈马斯终获回报
- 谷歌杀入法律 AI 赛道,推出专用 Gemini 工具
- 研究发现老年COVID-19幸存者面临更高的阿尔茨海默病风险
