微信官方近日宣布,其视觉团队正式开源了一款名为WeMM-Embedding的通用多模态嵌入模型。该模型具备强大的多模态处理能力,支持文本、图像、视频、视觉文档以及任意交错的多模态输入,为人工智能领域的应用开发提供了新的技术支撑。
据了解,WeMM-Embedding模型包含2B、4B、9B三个版本,能够满足不同规模应用场景的需求。微信视觉团队从统一多模态架构出发,通过两阶段训练策略显著提升了模型的内容区分能力。同时,团队还创新性地采用知识蒸馏与套娃表示技术,在保证小模型效果的同时,优化了大规模部署的效率。
目前,微信线上每天调用该模型的数量已达到十亿量级,充分验证了其在实际应用中的稳定性和高效性。此次开源不仅为开发者提供了高性能的多模态处理工具,也将推动人工智能技术在更多领域的创新应用。












