小红书精读:Impression Share Prediction: An Offline Evaluation Task for Ranking Systems
📉离线评估漏掉的流量分配,这篇补上了
各位算法同学们,你以为离线指标涨了线上就一定好?不一定。模型可能把 impression 从高价值目标悄悄挪到低价值目标,而 AUC、NE 这些指标根本看不出来。这篇 Meta 的论文提出个新离线任务:直接预测候选模型上线后会把 impression 分到哪些 objective bucket。
📄 Impression Share Prediction: An Offline Evaluation Task for Ranking Systems
🔧 核心创新是把离线评估从“预测点击率准不准”升级成“预测流量分配长什么样”。候选模型从没上过线,所以这是个反事实任务。 🧩 他们构建了一个结构因果模型,证明在观测数据下就能识别这种反事实效应,不需要逆概率加权或者对抗训练这些复杂操作。 ⚙️ 预测框架很简单:用候选模型的置信度特征(比如分数分布直方图)加上当前系统状态(剩余投放容量、 pacing 系数等),直接学一个映射到未来24小时的 impression share 向量。
📊 对训练中见过的模型,Random Forest 把 L1 误差相对常数基线降了 48.6%,其中置信度特征单独就有 42.9% 的贡献。 📈 但对完全没见过的模型,上线第1小时 RF 反而比基线差 20.5%——因为这时系统状态还停留在旧模型的均衡,滚动置信度窗口也没填满。 ✅ 他们改用 PatchTST 编码器,先对最近2小时的拍卖动态做个 rollout,第1小时的 L1 立刻变成 +22.1%,前12小时都稳定领先。
这个任务的定位很聪明,补上了离线评估和线上真实效用之间的盲区。落地时注意第一小时的冷启动,论文里用在线滚动置信度近似离线置信度,如果真要做全离线输入,准确率可能还要再验证。

原文:AlphaXiv