小红书精读:WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

less than 1 minute read

📄微信多模态Embedding:2B反超8B

各位算法同学们,今天这篇最让我惊讶的地方是:2B参数的多模态embedding模型,居然在MMEB-v2上超过了之前最好的8B开源模型。微信团队开源的WeMM-Embedding,把通用多模态embedding又往前提了一截,而且模型和代码都放出来了。

📄 WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

🔧 统一数据格式是一大亮点:文本、图像、视频、文档甚至任意交错的输入,都被统一成“源-目标对”的格式,还能附带指令、硬负样本和相关性分数,一套框架吃下所有任务。 🧩 两阶段训练是核心:先在几亿对弱监督数据上做大规模对齐,再用一个精炼后的数据集做细粒度优化,其中用语义ID重采样来缓解分布偏斜,还加了跨尺度知识迁移,让2B和4B模型也能学习9B的表示能力。 ⚙️ 模型家族提供2B/4B/9B三档,支持灵活输出维度,方便在不同资源条件下做权衡。

📊 2B版在MMEB-v2上已经超过此前领先的8B开源基线,参数效率很突出。 📈 9B版拿下80.6分,排名官方MMEB-v2榜首,超过了所有开源和闭源模型。 ✅ 内部26任务基准有明显提升,14个线上A/B测试全部正向,目前已在视频号、公众号、朋友圈、电商等场景部署。

个人判断:如果你在做多模态检索或RAG,这个模型可以拿来跑一下自己的数据,尤其是2B的性价比很高。落地时注意它支持多模态输入,但不同输出维度的效果和存储成本需要自己权衡。另外训练思路里数据清洗和硬负样本的构造对提升效果贡献不小,别只盯着模型结构抄。

原文:AlphaXiv

Updated: