Prime Intellect 推出 Prime Inference,日处理近万亿 token 推理服务
摘要
Prime Intellect 正式发布推理服务平台 Prime Inference,提供 serverless 端点与预留容量两种模式,基于多数据中心 GPU 基础设施运行前沿开源模型,官方披露内部每天处理近一万亿 token。
开源模型推理需求持续攀升之际,Prime Intellect 给出了自己的基础设施答案。该公司近日正式推出推理服务平台 Prime Inference,面向前沿开源模型提供托管式推理能力。
从服务形态看,Prime Inference 同时提供 serverless 端点与预留容量两种接入方式,前者适合按需调用、弹性扩缩的场景,后者则面向对稳定吞吐有要求的持续性负载。平台底层依托分布于多个数据中心的 GPU 基础设施运行。
值得关注的是其披露的运营规模:Prime Intellect 表示,该平台内部每天处理的 token 量已接近一万亿。这一数字直观反映了开源模型推理在真实业务中的调用体量。
对于依赖开源模型的开发者与团队而言,Prime Inference 的推出意味着在自建推理集群之外多了一个托管选项,而多数据中心部署与双模式容量供给,也为其在成本与稳定性之间提供了调节空间。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗