推荐算法日报 · 2026-08-22

1 minute read

总览

今天这批 arXiv 推荐论文整体成色不错,核心火力集中在生成式推荐和序列推荐的基准反思上。浙大和阿里那篇 STAMP 把语义稀释效应讲得很通透,剪枝加多步预测的组合在工业场景下很实用;不过我更建议优先细读 BARGE,它对生成式推荐的结构性缺陷拆解得非常清晰,每个模块都有可验证的收益,线上数据也漂亮。另外 Spotify 那篇探针模型有点泼冷水,直接挑战了 Transformer 在序列推荐里的必要性,以后跑 benchmark 都该拿它垫一下底。阿里那篇电商检索偏工程,收益实在但复现成本高,适合做相关业务的人参考。一句话,今天最值得看的是 BARGE 和 Spotify 的探针,一个教你改进生成式推荐,一个教你重新审视序列基准。

论文列表

1. SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-20 03:19 UTC
  • 机构:Alibaba Group
  • 工业优先级:强

GRPO还能这么用?阿里电商检索新方案

各位算法同学们,R-GRPO在电商检索里的top-K候选经常混入简单负样本,奖励模型又和训练器同源、打分有偏,阿里这篇SSR-GRPO直接引入语义ID把这两个坑一起填了,而且已经在淘宝大规模上线。

📄 SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

🔧 双视角相关性奖励:用RQ-VAE把物品压成层级语义ID(SID),查询侧用LLM的next token prediction生成SID,再按前缀匹配深度打成0/0.25/0.5/1分,和dense embedding的内积分数加权融合,替换掉原来又贵又不客观的TaoSR1奖励模型。

🧩 SID挖硬负例+masking:利用SID层级相似性,找前两级相同但第三级不同的物品做难负例。既构造R-DPO训练对,又拿它当阈值设计mask函数,把top-K里比难负例得分还低的easy negative直接mask,减少GRPO的噪音。

⚙️ R-DPO与SID-R-GRPO联合优化:用uncertainty-based动态权重融合两个loss,免掉手动调loss权重,让RL的方差被确定性的pair监督拉稳。

📊 离线General测试HR@4k 0.8218,比R-GRPO高0.6%;Long-Tail HR@4k 0.5943,高0.86%。

📈 消融里去掉R-DPO loss掉得最狠,HR@4k降0.49%;只用Sparse SID当奖励已经追平TaoSR1(0.8154 vs 0.8152),双视角融合最高。

✅ 线上A/B相对R-GRPO:UCTCVR +0.61%,GMV +0.39%,Ex. Imp +0.48%,Goodrate +0.61%。

对做电商检索和EBR的算法同学很值得盯:核心收益在奖励可靠性和硬负样本监督。要注意SID训练(RQ-VAE+查询生成)需要额外数据和算力,且融合权重α设0.8比较敏感。落地建议同时看HR@4k和线上UCTCVR/Goodrate,别只看GMV。

图 1(方法 / 架构)

2. Bridging the Structural Gap: Adapting Autoregressive Generation for Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-20 03:22 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:14 pages, 15 figures

生成式推荐的两大结构裂缝,被腾讯补上了

各位算法同学们,生成式推荐把每个item拆成多token的语义ID再摊平成序列,听起来很优雅,但item边界就这么被抹掉了,解码时一个token错位就整条路径跑偏。腾讯这篇工作直接捅破了这层窗户纸,还给出了三个轻量修补模块。

📄 Bridging the Structural Gap: Adapting Autoregressive Generation for Recommendation

🔧 技术创新点一:Item Context-Aware Attention (ICA)。每个item的多个token先通过带可学习query的cross-attention聚合成一个item级上下文向量,再用门控残差融合回每个token。门控值学出来稳定在0.35-0.38,既保留了token本身的层级语义,又让模型重新“看见”item边界。

🧩 技术创新点二:Hierarchical Path Reranking (HPR)。不改变beam search宽度,每层用双塔对比学习打分器,对beam展开后的候选路径做全局语义重排,拿用户偏好锚点和累计路径embedding的相似度来纠正浅层错误。论文给出了一个很漂亮的恒等式:收益=被救回的ground-truth概率减去被误伤的概率,然后证明这俩是可衡量的。

⚙️ 技术创新点三:Dual-Path Decoding (DPD)。用正交旋转把item embedding劈成两个互补子空间,各自训一个解码器做beam search,最后在item ID空间做OR融合。两个通道的Top-K池Jaccard重叠只有0.17-0.18,意味着一个通道漏掉的item有大概率被另一个通道捞回来。

📊 实验效果:Beauty上R@10从最强基线APAO的0.0795提到0.0927,相对涨了16.6%;Sports上R@10和N@10分别+8.8%和+16.7%。腾讯媒体平台离线Hit@5从OneRec的0.5459提到0.6015,线上A/B测试点击率+0.60%、点击UV+1.34%、总阅读时长+1.70%。参数量比TIGER还少2.8M,训练推理耗时几乎没增加。

总结:这套组合拳把生成式推荐的“结构性裂缝”拆成编码侧的item边界消失和解码侧的语义漂移,分别用ICA和HPR+DPD去修,思路很干净,消融也证实收益可叠加。建议做生成式推荐的同学重点盯两个指标:离线R@10和线上阅读时长。坑在于双解码器和正交tokenizer的预训练要额外调,但论文给的效率数据说明落地成本可控。

图 1(方法 / 架构) 图 2(实验结果)

3. Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-20 09:33 UTC
  • 机构:Spotify
  • 工业优先级:强
  • 备注:Accepted at the 20th ACM Conference on Recommender Systems (RecSys 2026)

🤔 Transformer在推荐榜上白练了?

各位算法同学们,一个反直觉的结论:在五个常用序列推荐基准上,两个不学高阶序列表示的pairwise简单模型,居然在四个数据集上超过了SASRec/eSASRec,提升幅度还不小。这说明很多benchmark根本没测出高阶序列建模的价值,值得所有做推荐的人警惕。

📄 Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

🔧 技术创新点一:设计了两个“容量探针”——SeqRules和PCTM。它们只聚合历史里两两物品的转移信息,加上recency加权,完全不学习高阶序列表示,却能作为强基线衡量数据集的真实难度。 ⚙️ 技术创新点二:PCTM把每个历史物品当作一个“专家”,用贝叶斯平滑估计转移分布,再在log空间加权融合,还带一项目popularity纠正。它没有embedding和序列编码器,结构简单到“不像能打赢Transformer的样子”。 🧩 技术创新点三:提出“pairwise envelope”评估法,取两个探针中更强的作为下限。如果Transformer跑不过这个下限,就说明这个benchmark测不出高阶建模的增益。

📊 在eSASRec协议下,pairwise envelope在三个Amazon数据集上超过eSASRec复现结果15–38%,其中Toys上提升最大,达38.4%。 📈 在MovieLens-1M上超4.4%,但在MovieLens-20M上反而落后27.3%——只有这个数据集能清晰体现高阶序列建模的增益。 ✅ 对比sampled-softmax SASRec复现,pairwise envelope在另外四个数据集上领先9–28%,说明这些常用benchmark对高阶建模并不敏感。

总结一下,个人判断是:这篇给社区提了个醒,别再拿小Amazon集和ML-1M当“高阶序列建模”的试金石,发布新模型时至少要和pairwise基线对比一下;落地时注意它用的是全目录评估和固定协议,线上实时场景未必一样。盯紧ML-20M这类大尺度数据,以及时域漂移更明显的场景,才是验证高阶能力的下一步。

4. Semantic Trimming and Auxiliary Multi-step Prediction for Generative Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-19 03:37 UTC
  • 机构:Zhejiang University,Alibaba
  • 工业优先级:强
  • 备注:9 pages, Under Review

精读生成失败

(这篇的精读暂时没能生成出来,原因:Expecting value: line 1 column 1 (char 0)。可以先看上面的总结和图表。)

图 1(方法 / 架构) 图 2(实验结果)

Updated: