小红书精读:DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation

less than 1 minute read

pxtr噪声别慌,DrEM双面修正

各位算法同学们,你信不信,工业推荐里上游多任务模型输出的pxtrs本身带预测噪声,直接拿去当监督和特征,会把排序模型带偏。这篇文章把噪声拆成监督侧和特征侧,用一套共享噪声模型双面修正,离线在线都涨。

📄 DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation

🔧 监督侧构造了风险去噪鲁棒损失。核心是估计每个pair的偏好翻转概率,翻转概率大的pair自动加大修正强度,而不是给所有pair一个全局去噪力度。理论证明即使翻转概率估计不准,鲁棒损失的期望风险也严格优于基础pairwise loss。

🧩 特征侧从预测噪声分布里采样扰动,加在pxtr的logit上,再约束扰动前后ranking score保持一致性。但只约束那些扰动前后偏好没翻转的pair,避免和主排序目标冲突。

⚙️ 两侧共享同一个logit空间的加性高斯噪声模型,参数共享,监督侧和特征侧是对齐的,不是各干各的。噪声方差用分桶聚合的probit估计,不依赖额外标注。

📊 在EMER backbone上,不同pxtr任务GAUC几乎全面涨,比如pltr从0.6622到0.6725,pwtr从0.6775到0.6871,pftr从0.6853到0.6965。单侧变体DrEM:S和DrEM:F也有涨,但双侧合起来最稳。

📈 在EASQ backbone上同样涨,pctr从0.6352到0.6376,pftr从0.6804到0.6879。而且baseline像SSM、PSL在EMER和EASQ上的表现不一致,有的还跌,DrEM两个backbone都涨。

✅ 在线A/B测试多个业务指标有显著提升,训练时只多一次带扰动的前向,推理零额外成本。

这套方法适合上游多任务模型和下游排序分离的架构,尤其是pxtrs噪声大的场景。落地时要注意噪声方差的估计质量,分桶太粗可能让矫正强度错位。想刷GAUC的同学可以试试,但先要确认你的pxtrs是不是真的存在可估计的噪声。

图 1

原文:AlphaXiv

Updated: