快讯 23:22加州叫停REK人机笼斗赛,未获许可组织格斗活动涉轻罪00:00Prime Intellect 推出 Prime Inference,日处理近万亿 token 推理服务23:50LMSYS 开源 Vicuna-13B:基于 ShareGPT 数据微调 LLaMA,训练成本仅约 300 美元 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期一 · 10-05 00:00 约 1 分钟读完

Prime Intellect 推出 Prime Inference,日处理近万亿 token 推理服务

摘要

Prime Intellect 正式发布推理服务平台 Prime Inference,提供 serverless 端点与预留容量两种模式,基于多数据中心 GPU 基础设施运行前沿开源模型,官方披露内部每天处理近一万亿 token。

开源模型推理需求持续攀升之际,Prime Intellect 给出了自己的基础设施答案。该公司近日正式推出推理服务平台 Prime Inference,面向前沿开源模型提供托管式推理能力。

从服务形态看,Prime Inference 同时提供 serverless 端点与预留容量两种接入方式,前者适合按需调用、弹性扩缩的场景,后者则面向对稳定吞吐有要求的持续性负载。平台底层依托分布于多个数据中心的 GPU 基础设施运行。

值得关注的是其披露的运营规模:Prime Intellect 表示,该平台内部每天处理的 token 量已接近一万亿。这一数字直观反映了开源模型推理在真实业务中的调用体量。

对于依赖开源模型的开发者与团队而言,Prime Inference 的推出意味着在自建推理集群之外多了一个托管选项,而多数据中心部署与双模式容量供给,也为其在成本与稳定性之间提供了调节空间。

Prime Intellect推理服务开源模型GPU 基础设施
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词