MacBook Pro 外接 iPhone 17 Pro Max 协同运行 AI 模型,预填充性能提升 44%
用户通过 USB-C 将 iPhone 17 Pro Max 外接至 M4 Pro MacBook Pro,借助自制软件拆分 AI 模型运算任务,使 Qwen3.8-27B 模型的预填充性能最高提升 44%,手机端 GPU 运算速度提升约 2.4 倍。
在本地运行大语言模型时,显存与统一内存容量往往是决定性能的关键瓶颈。一台搭载 M4 Pro 芯片、配备 24GB 统一内存的 MacBook Pro,在运行 Qwen3.8-27B 这类模型时,预填充阶段的速度会明显受到内存限制。据 Wccftech 报道,有用户尝试了一种非常规的扩展方案:通过 USB-C 接口将 iPhone 17 Pro Max 连接到这台 MacBook Pro,利用自制软件让两台设备协同分担模型运算。
具体实现上,Reddit 用户“u/StayLameBro”将模型按层切分,交由 Mac 本机和 iPhone 共同处理。在预填充加速场景中,MacBook Pro 负责每批 256 个 token 中第 1 至 40 层的计算,随后把激活值数据流传输至手机端;iPhone 则利用 A19 Pro 的 GPU 运行第 41 至 64 层,与此同时 Mac 已开始处理下一批数据,形成流水线式的并行作业。
性能数据方面,依靠 GPU 运算,手机端的运行速度相比不使用 GPU 时提升约 2.4 倍。此外,神经网络引擎也未被闲置——每 16K 长度的旧上下文会被编译为一套神经网络引擎模型。在 140K 上下文长度下,相较于仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒降至更低水平。最终,整套协同方案使该 AI 模型的预填充性能最高提升 44%。
这一案例展示了在统一内存受限的硬件上,通过外接移动设备分担计算任务来突破瓶颈的可行性,也为本地 AI 推理的异构协同提供了新的思路。不过,该方案依赖用户自制软件,目前尚不具备通用性。