小红书精读:Douyin Multimodal Embedding Model Technical Report
把推理藏进隐空间,多模态检索又快又准
各位算法同学们,还在纠结要不要在检索里加CoT?别加了,显式CoT延迟扛不住。这篇来自抖音搜索多模态团队的技术报告,把CoT搬进隐藏空间,训练时帮你推理、上线时零额外生成,2B模型就在多模态检索基准上刷到SOTA。
📄 Douyin Multimodal Embedding Model Technical Report
🔧 两阶段训练:第一阶段用25M对弱监督数据做大规模对比预训练,先建立统一多模态语义空间;第二阶段用5M高质量指令数据做“语义充分性”微调,补上细粒度区分和证据感知能力。 🧩 证据锚定类型化潜推理:不显式生成文本推理链,而是用锚点token定位文本片段、图像区域、视频帧等证据,再用localize、align_pos、reject_neg这类类型化隐藏状态组织检索推理,最后融合成embedding。推理只在训练时发生,推理时照旧是单次前向的双塔编码器。 ⚙️ 跨条件重建:训练时用query embedding去重建文档侧内容、用document embedding去重建query侧内容,用NTP和MTP做生成式监督,逼着embedding保留对端的细粒度语义。这种监督还给了个副产品:embedding信息完备,可以直接量化“语义充分性”来指导工业调优。
📊 在MMEB-v2上,DME-2B和DME-9B分别拿74.8和78.4,同等规模对比均达到SOTA,视频检索和视觉文档检索的优势尤其明显。 📈 抖音自建离线评估集上总分数相对提升2.92%,所有跨模态检索方向都有一致增益。 ✅ 已经在抖音生成式搜索、图像搜索、AI搜索场景上线;在线A/B测试给抖音搜索带来0.1% Lifetime(LT)增益。额外query-side延迟只有边际开销,基本可以忽略。
这套“训练时重监督、推理时轻编码”的路线,适合做工业级多模态检索的同学参考。真要落地,建议先盯MMEB-v2的视频/视觉文档分项和自家LT增益;坑主要在Stage2需要老师模型生成结构化CoT数据,数据管道成本不低,小数据场景未必有同样收益。


原文:AlphaXiv