微信开源多模态嵌入模型WeMM-Embedding,日调用量达10亿次
摘要
微信视觉团队开源多模态嵌入模型WeMM-Embedding,含2B、4B、9B三版本,支持文本、图像、视频等交错输入。该模型已大规模应用于朋友圈搜索、视频号推荐等场景,日调用量10亿次,并在MMEB-v2基准上排名第一。
微信AI团队于9月4日正式宣布开源通用多模态嵌入模型WeMM-Embedding,该模型提供2B、4B、9B三个参数版本,能够处理文本、图像、视频、视觉文档以及任意交错的多模态输入。这一动作标志着腾讯在基础模型层面向开发者开放其核心能力。
据微信员工@客村小蒋在社交平台上的分享,WeMM-Embedding的核心作用是将不同模态的信息映射至同一语义空间,使系统能够跨类型地进行语义比较与检索,例如用文字匹配图片,或用视频片段关联相关图文内容。这种能力是构建复杂推荐与搜索系统的基础技术。
该模型并非实验室产物,而是已在微信生态内实现大规模工业化应用。目前,朋友圈搜索、视频号推荐、公众号推荐以及微信电商等核心业务均已接入WeMM-Embedding,其每日调用量稳定在10亿次级别,充分验证了该模型在真实场景下的性能与稳定性。
在国际权威的多模态嵌入基准测试MMEB-v2中,WeMM-Embedding提交的成绩超过了所有此前已公开的开源及闭源模型,位列榜首。这一结果展示了腾讯在多模态理解和检索技术上的积累,也为行业提供了新的性能参照系。
目前,模型权重与相关代码已同步上线至GitHub和Hugging Face平台,学术论文也已公开至arXiv。开发者可自由获取并基于自身业务场景进行微调或集成,这有望加速多模态检索技术在更广泛行业的落地进程。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗