小红书精读:DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search
排序权重自己学!淘宝DCEO直接优化因果
各位算法同学们,一个反常识的结论:预测得再准的代理分数,也不等于把分数加进排序就能涨GMV。淘宝这篇DCEO直接绕开关联,用相对因果效应来学item级排序分数,把用户级长期目标变成了可用监督信号。
📄 DCEO: Direct Causal Effect Optimization for Long-Term User Value Modeling in E-commerce Search
🔧 用相对因果效应定义代理指标和终极目标的对齐程度,而不是传统的预测关联,因为关联高不代表干预有效。 🧩 提出calibrated用户级聚合,把item级代理分数按曝光次数校准后聚合成用户级指标,让训练时的监督信号和线上评分是同一套逻辑。 ⚙️ actor-critic框架:actor根据上下文动态生成多目标融合权重,critic估计代理指标对最终GMV的因果效应,actor直接去最大化这个因果效应。
📈 离线实验验证了有效性和可解释性,模型学到的融合权重在不同场景下有明显分化。 📊 41天线上A/B测试中,DCEO相比常规GMV proxy,GMV提升0.36%。 ✅ 已在淘宝大规模电商搜索系统部署,线上推理只加了一个actor输出,训练时的critic和聚合模块不参与部署。
对做电商排序的同学,这是个明确信号:多目标融合的动态权重可以学,而且可以直接冲长期目标。落地坑在于critic的因果估计依赖观察数据,选择性和混淆问题得靠场景假设兜着,别指望一上来就是正收益。但0.36%的提升在大盘GMV上绝对值不小,建议在自家数据上试试。
原文:AlphaXiv