英伟达重启Rubin CPX项目:设计大改,瞄准AI推理预填充市场
分析师郭明錤透露,英伟达已重启AI推理预填充GPU Rubin CPX项目,设计大幅调整,预计2027年Q1量产。新芯片功耗2300W,配备168GB HBM4内存,算力接近标准Rubin GPU,采用独立MGX ETL机架与以太网互联方案,旨在以更低成本承接推理预填充负载。
据分析师郭明錤最新产业调查,英伟达已正式重启面向AI推理预填充加速的GPU项目Rubin CPX,但整体设计相较早期方案已大幅调整。该项目预计于2027年第一季度进入生产阶段,定位为对标准Rubin GPU在高并发推理场景下的功能补充。
在芯片层面,新版Rubin CPX的算力接近标准Rubin GPU,预填充性能进一步提升,单体最高功耗维持在2300W,与标准Rubin一致。内存配置上,新方案采用168GB HBM4,而非早期规划的128GB GDDR7,从规格推断可能采用7组24GB的堆叠设计,以满足大吞吐量KV Cache存储需求。
在系统架构层面,新Rubin CPX采用独立MGX ETL机架设计,每机架可容纳1至4组机架模组。单个计算托盘集成8颗Rubin CPX芯片,8个托盘构成一个机架模组,内部通过Spectrum-6全铜以太网实现横向扩展;机架模组之间则采用Spectrum-6配合OSFP光学方案互联。这一架构将预填充任务从标准推理流程中剥离,形成独立扩展单元。
在系统级部署上,英伟达建议Rubin CPX与标准Rubin按1:1比例配对使用,Rubin CPX ETL机架与Vera Rubin NVL72机架之间通过基于以太网的RDMA连接。郭明錤指出,当前AI推理工作量中超过50%集中于输入处理及KV Cache构建,新Rubin CPX能以更灵活的部署方式和更低成本承接这部分负载,有助于降低整体推理基础设施的TCO。
此次设计调整反映出英伟达对推理工作负载细分化的回应,即通过专用硬件优化预填充阶段,而非让标准GPU同时承担全部计算任务。随着2027年量产窗口临近,Rubin CPX的实际市场表现仍需观察其与软件生态的协同效果。