高通联合阶跃等厂商,在第六代骁龙8平台端侧跑通300亿参数MoE模型
摘要
高通在2026骁龙峰会上宣布与阶跃、无量火、江波龙合作,基于第六代骁龙8超级至尊版实现300亿参数StepEdge-Omni 30B-MoE模型的端侧适配与推理优化,运行内存需求较常规方案降低超50%,预填充吞吐超330 Token/s,解码吞吐超28 Token/s,可本地完成邮件理解、行程规划等智能体任务。
夏威夷时间9月22日,高通在2026骁龙峰会上披露了一项端侧AI合作进展:联合阶跃、无量火及江波龙,基于第六代骁龙8超级至尊版移动平台,完成了阶跃StepEdge-Omni 30B-MoE模型的端侧适配与推理优化,并现场演示了相关智能体助手。该模型参数规模达300亿,采用混合专家架构,运行时仅激活与任务相关的部分专家模块,从而压缩计算量与内存带宽占用。
为让这一大模型在手机上稳定运行,合作方从推理引擎、异构调度及存储方案三个层面进行了针对性优化。据高通介绍,优化后模型的运行内存需求较行业常规方案降低超过50%。性能方面,测试数据显示其预填充吞吐超过每秒330个Token,解码吞吐超过每秒28个Token。其中预填充吞吐反映的是模型处理长提示词和批量请求时每秒可处理的输入Token数量,是衡量端侧推理效率的关键指标。
功能层面,该方案完全在本地运行,无需调用云端服务,可支持邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务。高通称,现场演示的智能体助手即基于上述能力构建。
业内观察认为,大参数MoE模型在手机端落地,有望推动低时延、隐私保护型智能体应用的发展。但规模化应用仍面临终端成本、功耗、模型可靠性及用户接受度等多重变量的制约。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗