快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 08-31 20:30 约 2 分钟读完

Qwen3.8-Flash-Next开源亮相,Qwen4架构前瞻性预览

摘要

通义千问发布Qwen3.8-Flash-Next,一款多模态MoE模型,作为Qwen4架构的早期预览。该模型集成GDN与QSA混合注意力等四项升级,总参数125B,每token仅激活6B,训练成本约为Qwen3.7-Plus的九分之一,在编码与办公任务上表现更优。

通义千问今日正式开源Qwen3.8-Flash-Next,这是一款面向多模态场景的混合专家(MoE)模型,同时被定位为下一代Qwen4架构的早期技术预览。此次发布标志着通义千问在模型架构演进上迈出关键一步,为开发者提供了提前接触未来核心设计的窗口。

该模型的核心亮点在于架构层面的四项升级,其中最具代表性的是GDN(门控动态网络)与QSA(查询选择性注意力)相结合的混合注意力机制。这一设计旨在平衡全局语义捕捉与局部细节处理,提升长序列任务中的推理效率。整体模型总参数规模达到125B,但得益于MoE的稀疏激活特性,每次token推理仅需激活6B参数,大幅降低了实际计算开销。

在训练效率方面,Qwen3.8-Flash-Next的算力成本仅为前代Qwen3.7-Plus的约九分之一,这一显著降幅得益于架构优化与训练策略的协同改进。官方测试数据显示,该模型在代码生成、文档处理等办公类任务上的能力较前代有明确提升,显示出更强的实用性与落地潜力。

作为Qwen4架构的早期预览,该模型不仅为社区提供了即用型工具,更承担着收集反馈、验证技术路线的角色。开发者可通过开源渠道获取模型权重,在真实场景中检验其性能,这也为通义千问后续正式版Qwen4的迭代提供了宝贵的实践数据。

从行业视角看,此次开源延续了通义千问以开放生态推动技术民主化的策略。在MoE模型竞争日趋激烈的当下,Qwen3.8-Flash-Next以低训练成本和高激活效率为特点,或将为中小团队部署大模型提供新的性价比选择,同时也为多模态AI应用的规模化落地铺垫了更经济的技术路径。

通义千问Qwen3.8-Flash-NextMoE模型Qwen4架构
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词