快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期四 · 09-24 08:00 约 1 分钟读完

vLLM 推出 vllm-metal v0.28.0,Apple Silicon 迎来并发推理服务支持

摘要

vLLM 官方发布 vllm-metal v0.28.0,将 V1 调度器、paged KV cache 及 OpenAI 兼容服务器引入 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。该版本使苹果芯片设备首次具备并发推理服务能力。

vLLM 官方近日推出 vllm-metal v0.28.0,该版本将 vLLM 的核心推理能力扩展至 Apple Silicon 平台。此前,vLLM 主要面向 NVIDIA GPU 等硬件环境,此次更新意味着苹果自研芯片正式进入 vLLM 的官方支持范围。

具体而言,v0.28.0 把 vLLM 的 V1 调度器、paged KV cache 以及 OpenAI 兼容服务器带到了 Apple Silicon 上。模型执行环节由 MLX 和 Metal 承担,前者是苹果开源的机器学习框架,后者为苹果的图形与计算 API。这一组合使 Apple Silicon 设备能够运行并发推理服务,而不仅限于单次推理。

版本号方面,vllm-metal v0.28.0 与上游 vLLM 保持对齐,便于用户和开发者跟踪功能对应关系。对于在苹果生态中部署 AI 应用的团队而言,该版本提供了一条与 vLLM 主线兼容的推理服务路径。

vLLMApple Silicon推理服务MLX
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词