小红书精读:Incremental Recommendation via Causal Models

less than 1 minute read

🎯因果推荐:砍掉7%无效曝光

各位算法同学们,推荐位是稀缺资源,但很多推荐其实是在“陪跑”——用户本来就会去听。这篇论文直接用因果建模把推荐展示砍掉了7%,消费却没掉,值得琢磨。

📄 Incremental Recommendation via Causal Models

🔧 关键创新:识别出治疗组和holdback组的归因窗口不一致,短窗口vs两天窗口,直接相减算因果效应是错的,于是不用减法改用双阈值。 🧩 把线上多任务推荐模型扩展成Deep Twin Network,加一个holdback头,用已有实验数据训练,不用新采集数据。共享主干同时吃治疗和holdback样本,学到的表征更泛化。 ⚙️ 双阈值策略:只在高治疗概率且低有机概率时才给推荐,精准滤掉那些“你不推他也会听”的always-takers,同时保留能带来增量的推荐。

📊 生产级A/B测试,覆盖数百万Spotify用户,推荐展示量减少7%,推荐内容消费无统计显著下降。 ✅ 联合训练后治疗头的校准比生产基线更好,说明因果模型真的学到了更通用的表征。 📈 关键是holdback数据原本就存在于实验基础设施里,几乎零额外成本。

总结:这个做法适合已有holdback实验体系的大规模推荐系统,小厂没有holdback数据的话得先补这玩意儿。双阈值里那个有机概率阈值是个控制效率-覆盖的旋钮,调太狠可能误伤增量转化,需要离线先标定好。

图 1

图 2

原文:AlphaXiv

Updated: