蚂蚁开源百灵系列原生多模态模型,视觉反馈闭环提升任务执行可靠性
蚂蚁集团今日发布并开源百灵系列首个原生多模态模型Ling-3.0-flash-VL,总参数124B,激活参数5.5B,支持图像、文本及视频输入,上下文窗口256K Token。该模型引入视觉反馈闭环机制,在多项评测中表现优于纯文本版本及GPT-5.4,展示出多模态联合训练对文本能力的正向增益。
蚂蚁集团于今日正式推出并开源了百灵系列的首个原生多模态大模型Ling-3.0-flash-VL。该模型基于此前发布的Ling-3.0-flash的MoE架构进行扩展,总参数量达到124B,但在单次推理时仅激活5.5B参数,兼顾了性能与效率。模型原生支持图像、文本与视频输入,上下文窗口扩展至256K Token,为复杂多模态任务提供了充足的处理空间。
此次发布的核心亮点在于引入了视觉反馈闭环机制。与传统的一次性“看图生成”不同,该机制将任务执行过程重构为“观察→行动→验证→修正”的持续循环,使模型在医疗报告解读、前端代码生成及GUI自动化等真实场景中,能够基于视觉反馈反复调整执行结果,从而显著提升任务的可靠性与完成度。这一设计思路瞄准了多模态模型在落地应用中的关键痛点。
在训练层面,蚂蚁集团强调,通过原生多模态联合训练,视觉信息的融入并未削弱文本能力,反而带来了正向增益。据Artificial Analysis Intelligence Index v4.1.1评估显示,Ling-3.0-flash-VL相比纯文本版本Ling-3.0-Flash得分提升了4分。在图片转网页的实际测试中,模型不仅能理解页面布局与组件关系,还能通过渲染结果的对比进行自我修正,展现出较强的工程化能力。
在第三方评测中,该模型(代号linthium)在Image-to-WebDev Arena官方评测中得分高于GPT-5.4。此外,作为GUI Agent,模型可识别界面结构并执行跨工具操作;在医疗报告解读场景中,模型支持跨模态信息抽取与校验,进一步验证了多模态架构在专业领域的适用性。蚂蚁集团表示,Ling-3.0-flash-VL的开源将推动多模态AI在真实任务中的落地探索。