小红书精读:Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

less than 1 minute read

🤔 Transformer在推荐榜上白练了?

各位算法同学们,一个反直觉的结论:在五个常用序列推荐基准上,两个不学高阶序列表示的pairwise简单模型,居然在四个数据集上超过了SASRec/eSASRec,提升幅度还不小。这说明很多benchmark根本没测出高阶序列建模的价值,值得所有做推荐的人警惕。

📄 Do Sequential Recommendation Benchmarks Really Require Higher-Order Sequence Modelling?

🔧 技术创新点一:设计了两个“容量探针”——SeqRules和PCTM。它们只聚合历史里两两物品的转移信息,加上recency加权,完全不学习高阶序列表示,却能作为强基线衡量数据集的真实难度。 ⚙️ 技术创新点二:PCTM把每个历史物品当作一个“专家”,用贝叶斯平滑估计转移分布,再在log空间加权融合,还带一项目popularity纠正。它没有embedding和序列编码器,结构简单到“不像能打赢Transformer的样子”。 🧩 技术创新点三:提出“pairwise envelope”评估法,取两个探针中更强的作为下限。如果Transformer跑不过这个下限,就说明这个benchmark测不出高阶建模的增益。

📊 在eSASRec协议下,pairwise envelope在三个Amazon数据集上超过eSASRec复现结果15–38%,其中Toys上提升最大,达38.4%。 📈 在MovieLens-1M上超4.4%,但在MovieLens-20M上反而落后27.3%——只有这个数据集能清晰体现高阶序列建模的增益。 ✅ 对比sampled-softmax SASRec复现,pairwise envelope在另外四个数据集上领先9–28%,说明这些常用benchmark对高阶建模并不敏感。

总结一下,个人判断是:这篇给社区提了个醒,别再拿小Amazon集和ML-1M当“高阶序列建模”的试金石,发布新模型时至少要和pairwise基线对比一下;落地时注意它用的是全目录评估和固定协议,线上实时场景未必一样。盯紧ML-20M这类大尺度数据,以及时域漂移更明显的场景,才是验证高阶能力的下一步。

原文:AlphaXiv

Updated: