Modal 推出 Clusters 正式版:一个装饰器调用多节点 GPU 集群
摘要
Modal 宣布 Modal Clusters 正式可用,开发者通过 @modal.clustered 装饰器即可获得多节点 GPU 集群,节点间基于 InfiniBand verbs 通信,带宽可达 6.4 Tbps,并自动完成 PyTorch 与 NCCL 配置。
AI 基础设施平台 Modal 近日宣布,其多节点 GPU 集群功能 Modal Clusters 结束此前阶段,正式面向用户开放。该功能试图解决分布式训练中长期存在的集群搭建与通信配置门槛问题。
按照 Modal 的设计,用户无需手动编排节点或调试网络参数,只需在代码中引入 @modal.clustered 装饰器,即可将任务扩展到多节点集群上运行。这一接口把集群调度能力封装进装饰器语义,延续了 Modal 一贯的开发者体验优先思路。
在性能层面,Modal Clusters 的节点间通信基于 InfiniBand verbs 实现,官方公布的带宽数字为 6.4 Tbps。同时,该功能会自动完成 PyTorch 与 NCCL 的配置工作,减少用户在分布式训练环境上的手工调优成本。
对于需要跨节点扩展模型训练的团队而言,这一发布意味着多节点 GPU 资源的获取方式进一步简化:集群创建、网络通信与框架配置被收敛到同一套声明式接口中,而底层 InfiniBand 互联仍保留高吞吐能力。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗