微信WeMM-Embedding多模态模型开源,已在微信多场景应用日调用达10亿次

   时间:2026-09-08 18:39 来源:天脉网作者:苏婉清

微信视觉团队近日宣布,其研发的通用多模态嵌入模型WeMM-Embedding正式开源,包含2B、4B、9B三个参数规模版本。该模型突破了传统单模态处理的局限,能够同时解析文本、图像、视频及视觉文档等多种数据类型,并支持任意组合的多模态输入,为跨模态内容理解与检索提供了全新解决方案。

据微信内部技术分享显示,WeMM-Embedding通过构建统一的语义空间,实现了不同模态内容的高效对齐与关联。例如,用户输入"秋日枫叶"的文字描述时,系统可同步检索包含相似视觉特征的图片、视频及图文混排内容。这种技术突破使得朋友圈搜索、视频号推荐、公众号内容分发等场景的匹配精度显著提升,目前日均调用量已突破10亿次。

在国际权威评测基准MMEB-v2的最新排名中,该模型以绝对优势登顶榜首,超越所有已提交的开源及闭源竞品。测试数据显示,其在多模态内容理解、跨模态检索等核心指标上均有突破性表现,特别是在处理复杂视觉文档与动态视频内容时展现出独特优势。

目前,WeMM-Embedding的开源版本已开放下载,开发者可根据不同应用场景选择适配的参数规模。微信团队表示,此次开源旨在推动多模态技术在更广泛领域的落地应用,后续将持续优化模型性能并拓展支持的数据类型,为人工智能领域的基础研究提供新的技术范式。

 
 
更多>同类内容
全站最新
热门内容