小红书精读:SAM-D2Q: Aligning Multimodal Doc2Query with Search Demand and Conversion for E-commerce

less than 1 minute read

电商搜索扩词,GMV涨3.38%🔍

各位算法同学们,电商搜索里扩写得更“语义相关”,不一定更赚钱。这篇把 Doc2Query 从纯文本、只优化相关性,改成多模态并直接对齐GMV和支付,AliExpress 线上 A/B 给出 GMV +3.38%、Pay Count +2.27%。

📄 SAM-D2Q: Aligning Multimodal Doc2Query with Search Demand and Conversion for E-commerce

🔧 先重构任务:布尔倒排下重复标题已有词没边际收益,Stage 1 用信息增益约束,只拿标题未覆盖的 query-item 对做词汇扩展。

🧩 Stage 2 做 CPV 引导的多模态反事实增强:mask 文本里的视觉属性词但保留商品图,逼模型从图片补回颜色、版型等属性,缓解短标题和长尾商品漏召回。

⚙️ Stage 3 用 GRPO 做偏好对齐,奖励同时考虑语义、商业和视觉信号,让生成词更贴近搜索需求和转化价值。

📊 离线实验里,检索效果超过传统 Doc2Query,说明多模态扩展比纯文本扩写更适配电商布尔召回。

📈 线上部署在 AliExpress 生产搜索,走离线索引,不做在线模型推理;A/B 里 GMV +3.38%,Pay Count +2.27%。

✅ 它强调扩展词要同时满足召回增益、视觉 grounding 和商业效用,这是和网页搜索 Doc2Query 最大的区别。

总结感想:做电商搜索、Query 扩写或稀疏召回的同学可以重点看三段式训练和 GRPO 奖励设计。要盯新词召回增量、索引膨胀、GMV 和 Pay Count,并和纯文本 Doc2Query 对比。坑在于反事实 mask 依赖 CPV 属性质量,日志噪声会被 RL 放大,离线索引更新还要算倒排成本。

图 1

原文:AlphaXiv

Updated: