JetBrains发布Mellum2.1编程模型,高负载吞吐量接近Qwen3.5-9B两倍
摘要
JetBrains于10月8日发布Mellum2.1模型,延续12B混合专家架构与2.5B活跃参数,强化智能体编程能力。该模型在高负载下推理吞吐量接近Qwen3.5-9B两倍,单请求场景下MTP技术使速度提升约1.6倍。
JetBrains于10月8日通过博文宣布推出Mellum2.1模型,该版本在延续Mellum2架构的基础上,重点强化了智能体编程能力。模型仍采用12B混合专家架构,拥有2.5B活跃参数,并继续以Apache 2.0许可证发布。
此次升级的核心在于预训练后的强化学习阶段。JetBrains将强化学习从原先的短期收尾环节扩展为训练主体,并在数学、算法竞赛、科学、工具使用和软件工程等任务中补充了训练数据。为支撑这一训练过程,团队搭建了内部强化学习环境基础设施,训练期间启动了数百万个沙盒,覆盖数千个环境。此外,训练前团队还筛选了开放数据集,剔除测试缺陷、不可验证答案及难度失当的任务。
升级后的Mellum2.1具备探索代码库、编辑文件并检查自身修改的能力。JetBrains表示,最大改进出现在智能体编程领域,模型能够识别失败测试的根因,起草修复方案并验证结果。在性能方面,Mellum2.1与Mellum2架构一致,速度保持不变,多Token预测(MTP)进一步提升了响应速度。单请求场景下,MTP使其速度提高约1.6倍。
JetBrains将Mellum2.1与Mellum2、Qwen3.5-9B及Gemma 4 E4B在相同评估设置下进行了比较。结果显示,高负载时Mellum2.1的推理吞吐Token数量接近Qwen3.5-9B的两倍,并在编码任务中展现出竞争力。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗