快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-01 09:42 约 2 分钟读完

英伟达重启Rubin CPX项目:设计大改,瞄准AI推理预填充市场

摘要

分析师郭明錤透露,英伟达已重启AI推理预填充GPU Rubin CPX项目,设计大幅调整,预计2027年Q1量产。新芯片功耗2300W,配备168GB HBM4内存,算力接近标准Rubin GPU,采用独立MGX ETL机架与以太网互联方案,旨在以更低成本承接推理预填充负载。

据分析师郭明錤最新产业调查,英伟达已正式重启面向AI推理预填充加速的GPU项目Rubin CPX,但整体设计相较早期方案已大幅调整。该项目预计于2027年第一季度进入生产阶段,定位为对标准Rubin GPU在高并发推理场景下的功能补充。

在芯片层面,新版Rubin CPX的算力接近标准Rubin GPU,预填充性能进一步提升,单体最高功耗维持在2300W,与标准Rubin一致。内存配置上,新方案采用168GB HBM4,而非早期规划的128GB GDDR7,从规格推断可能采用7组24GB的堆叠设计,以满足大吞吐量KV Cache存储需求。

在系统架构层面,新Rubin CPX采用独立MGX ETL机架设计,每机架可容纳1至4组机架模组。单个计算托盘集成8颗Rubin CPX芯片,8个托盘构成一个机架模组,内部通过Spectrum-6全铜以太网实现横向扩展;机架模组之间则采用Spectrum-6配合OSFP光学方案互联。这一架构将预填充任务从标准推理流程中剥离,形成独立扩展单元。

在系统级部署上,英伟达建议Rubin CPX与标准Rubin按1:1比例配对使用,Rubin CPX ETL机架与Vera Rubin NVL72机架之间通过基于以太网的RDMA连接。郭明錤指出,当前AI推理工作量中超过50%集中于输入处理及KV Cache构建,新Rubin CPX能以更灵活的部署方式和更低成本承接这部分负载,有助于降低整体推理基础设施的TCO。

此次设计调整反映出英伟达对推理工作负载细分化的回应,即通过专用硬件优化预填充阶段,而非让标准GPU同时承担全部计算任务。随着2027年量产窗口临近,Rubin CPX的实际市场表现仍需观察其与软件生态的协同效果。

英伟达Rubin CPXAI推理预填充
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词