小红书精读:CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
📈一个模型替代三个召回器,CTR和CVR双涨
💡 各位算法同学们,还在同时维护三个I2I召回encoder?Snap这篇CAMIE用一个MLLM统一了多模态、文本和图像检索,线上CVR最高相对提升13%。好奇它怎么让一个checkpoint同时干三种输入的活,往下看。
📄 CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
🔧 用LLM/MLLM做统一骨干,通过原生多模态接口把商品图像和元数据映射到同一个embedding空间,一个checkpoint同时支持多模态、text-only、image-only检索,不需要为每个模态单独训练和建索引。 🧩 从用户journey中挖co-engaged item pairs作为监督信号,用对称in-batch InfoNCE微调,让embedding表示贴近用户实际对比和购买行为,而不是纯靠内容相似度。 ⚙️ 对比实验显示,大部分离线增益来自co-engagement supervision,而不是MLLM骨干本身;但MLLM在text-only检索上带来显著优势。
📊 离线:在Snap DPA测试集上,CAMIE在Recall@10上超过最强的商业多模态embedding模型,且同一个checkpoint做text-only检索,质量损失很小。 📈 线上A/B:替换两个部署的content-based I2I encoder,相比多模态控制,CTR +0.390%、CVR +10.832%;相比文本控制,CTR +18.958%、CVR +13.12%。 ✅ 总体DPA流量:CTR +0.211%、CVR +1.911%,已上线生产。
🤔 这个工作的思路很清爽:不改造模型结构,直接用MLLM当骨干,再用co-engagement行为数据去微调。对工业I2I召回,尤其是多模态/文本/图像统一维护的场景,很有参考价值。盯住离线Recall@10和线上CTR/CVR,跟你们线上现有的基于内容的encoder对比。坑在于co-engagement pair的挖掘和过滤是重活,需要用户行为日志,没有这类数据的小团队落地效果可能打折扣。
原文:AlphaXiv