vLLM 推出 vllm-metal v0.28.0,Apple Silicon 迎来并发推理服务支持
摘要
vLLM 官方发布 vllm-metal v0.28.0,将 V1 调度器、paged KV cache 及 OpenAI 兼容服务器引入 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。该版本使苹果芯片设备首次具备并发推理服务能力。
vLLM 官方近日推出 vllm-metal v0.28.0,该版本将 vLLM 的核心推理能力扩展至 Apple Silicon 平台。此前,vLLM 主要面向 NVIDIA GPU 等硬件环境,此次更新意味着苹果自研芯片正式进入 vLLM 的官方支持范围。
具体而言,v0.28.0 把 vLLM 的 V1 调度器、paged KV cache 以及 OpenAI 兼容服务器带到了 Apple Silicon 上。模型执行环节由 MLX 和 Metal 承担,前者是苹果开源的机器学习框架,后者为苹果的图形与计算 API。这一组合使 Apple Silicon 设备能够运行并发推理服务,而不仅限于单次推理。
版本号方面,vllm-metal v0.28.0 与上游 vLLM 保持对齐,便于用户和开发者跟踪功能对应关系。对于在苹果生态中部署 AI 应用的团队而言,该版本提供了一条与 vLLM 主线兼容的推理服务路径。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗