小红书精读:SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce
GRPO还能这么用?阿里电商检索新方案
各位算法同学们,R-GRPO在电商检索里的top-K候选经常混入简单负样本,奖励模型又和训练器同源、打分有偏,阿里这篇SSR-GRPO直接引入语义ID把这两个坑一起填了,而且已经在淘宝大规模上线。
📄 SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce
🔧 双视角相关性奖励:用RQ-VAE把物品压成层级语义ID(SID),查询侧用LLM的next token prediction生成SID,再按前缀匹配深度打成0/0.25/0.5/1分,和dense embedding的内积分数加权融合,替换掉原来又贵又不客观的TaoSR1奖励模型。
🧩 SID挖硬负例+masking:利用SID层级相似性,找前两级相同但第三级不同的物品做难负例。既构造R-DPO训练对,又拿它当阈值设计mask函数,把top-K里比难负例得分还低的easy negative直接mask,减少GRPO的噪音。
⚙️ R-DPO与SID-R-GRPO联合优化:用uncertainty-based动态权重融合两个loss,免掉手动调loss权重,让RL的方差被确定性的pair监督拉稳。
📊 离线General测试HR@4k 0.8218,比R-GRPO高0.6%;Long-Tail HR@4k 0.5943,高0.86%。
📈 消融里去掉R-DPO loss掉得最狠,HR@4k降0.49%;只用Sparse SID当奖励已经追平TaoSR1(0.8154 vs 0.8152),双视角融合最高。
✅ 线上A/B相对R-GRPO:UCTCVR +0.61%,GMV +0.39%,Ex. Imp +0.48%,Goodrate +0.61%。
对做电商检索和EBR的算法同学很值得盯:核心收益在奖励可靠性和硬负样本监督。要注意SID训练(RQ-VAE+查询生成)需要额外数据和算力,且融合权重α设0.8比较敏感。落地建议同时看HR@4k和线上UCTCVR/Goodrate,别只看GMV。

原文:AlphaXiv