小红书精读:Decoupled Learning and Selection in Slate Recommendation for Privacy and Stability Under Noisy Scores

less than 1 minute read

🔍推荐加DP,隐私就够了吗?

各位算法同学们,给推荐系统套上差分隐私,端到端隐私就自动成立了吗?这篇的答案是:不一定,卡点不在学习器,而在那个确定性选择器读了什么。它把 slate 推荐拆成“随机打分 + 贪心选列表”两段,专门算清隐私、可审计和稳定性各在哪一层成立。

📄 Decoupled Learning and Selection in Slate Recommendation for Privacy and Stability Under Noisy Scores

🔧 把 slate 推荐形式化成随机分数学习器加确定性选择器:隐私靠后处理穿过选择器和审计轨迹,但范围取决于每个非学习器输入。公开或独立、先前 DP 输出、单独记账的输入才能撑起端到端 DP;直接固定原始 state 或候选信息,只剩条件保证。

🧩 给出一个可审计的 margin 证书:分数变化诱导的目标移动只要低于最小贪心决策 margin 的一半,有序 slate 就保证不变,margin 和扰动包络都写在决策日志里。

⚙️ anchor 混合可以压低 top-K 的分数不稳定,证书进一步说明这种稳定性什么时候能传到最终列表;审计成本是 O( C_t ) 个标量字段、至多 O(K_t C_t ) 次相似度查询,不是 O( C_t ^2) 的稠密矩阵。

📊 受控固定 margin 测试里,指数缩放的经验斜率是 -0.220,95% CI [-0.231, -0.210],独立噪声参考是 -1/4,接近线性。

📈 在 OULAD、MovieLens-25M、Amazon Musical Instruments 上,anchor 权重越大,分数噪声引起的排序 churn 越小。

✅ OULAD 和 EdNet 的证书检查对上了日志不等式;闭环仿真里目标漂移有界,但下游效用随设置变化,并不是一律变好。

我的判断:做两段式推荐、要写 DP 报告或做审计的同学可以跟,重点盯选择器输入清单和 margin 日志这两件事。坑也很明确:非私有 anchor 只能用于稳定性分析,混进端到端 DP 声明就错了;而且它没给普适效用提升,分数稳定不等于业务指标一定涨。

原文:AlphaXiv

Updated: