微信开源多模态嵌入模型WeMM-Embedding 日调用量达十亿级
微信AI团队宣布开源通用多模态嵌入模型WeMM-Embedding,含2B、4B、9B三版本,支持文本、图像、视频及交错输入。该模型已在视频号、公众号等微信核心场景大规模部署,日调用量超十亿次,9B版在MMEB-v2榜单以80.6分居首。
微信AI团队于9月4日正式宣布,将旗下通用多模态嵌入模型WeMM-Embedding全面开源。该模型提供2B、4B、9B三个参数版本,覆盖文本、图像、视频、视觉文档以及任意交错多模态输入的处理能力。据官方披露,这一模型已在微信生态内实现每日十亿量级的调用规模。
从技术架构来看,WeMM-Embedding选择了Qwen3.5多模态架构作为统一骨干网络,这意味着图像、视频与文字从模型输入端即进入同一处理通道,而非通过独立编码器后期融合。这种设计让跨模态语义对齐在更早期发生,为后续检索与排序任务提供更一致的表示空间。
在权威基准测试中,WeMM-Embedding-9B以80.6分登顶MMEB-v2榜单,而2B版本也以77.9分超越了此前领先的8B级开源模型。这一成绩表明,即便在较小参数量下,该模型仍具备较强的跨模态表征能力,对资源受限的部署场景具有实际意义。
目前,WeMM-Embedding已深度嵌入微信的推荐与搜索基础设施,覆盖视频号、直播、公众号、电商及朋友圈等主要业务板块。其输出的多模态表示被用于候选检索、排序特征构建、用户序列建模和跨域内容理解等关键环节。在26项内部任务基准上,2B版本相比同规模基线模型,整体得分从60.9提升至72.0,在分类、搜索、跨域匹配、文章相关性和视频相关性五类任务上均呈现正向增益。
微信AI团队同步开放了论文、代码仓库及模型权重,便于研究社区复现与二次开发。此次开源不仅展示了微信在端云协同场景下的多模态技术积累,也为业界提供了高性价比的嵌入模型新选项。随着开源生态的完善,该模型有望在更多垂直领域的检索增强生成(RAG)与多模态理解任务中落地。