小红书精读:Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios
端到端多模态CTR翻车,先挖数据才是正道?
各位算法同学们,你以为把多模态编码器和CTR模型端到端一起训练就能涨点?淘宝和中科大的这篇CIKM论文说:不但没涨,还掉了,得先挖数据。它指出了多模态表示学习的正确打开方式——从CTR数据里先捞高质量样本,再微调编码器,让表示懂用户点击偏好。
📄 Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios
🔧 先泼冷水:端到端多模态训练(E2EM)在淘宝广告场景里,反而导致GAUC下滑,推翻“直连就能提升”的直觉。 🧩 找原因:CTR数据里的用户点击不只有多模态语义在驱动,价格、位置、误触这些非语义因素也会影响,直接端到端训练会让编码器收到模糊监督。 ⚙️ 新方案:Mine-Then-Train,先训练一个多模态注释模型,从CTR数据中挖出与点击偏好对齐的可解释样本,再用这些高质量数据微调预训练编码器,保证表示学习方向正确。
📊 实验数据来自淘宝展示广告系统,覆盖84M用户、88M商品、1.9B样本,规模真实硬核。 📈 评估用GAUC,两阶段基线在淘宝场景已带来百分比级GAUC提升,Mine-Then-Train在此之上再获正向增益。 ✅ 离线与在线实验双重验证,相比E2EM的负收益,新方法确确实实涨点。
想要在多模态CTR上落地,别急着端到端,先把数据挖干净、再微调编码器,收益更稳。要盯的指标永远是GAUC,对比对象是两阶段基线。注意E2EM是个坑,又贵又没用,别踩。


原文:AlphaXiv