小红书精读:Closing the Long-Short View Gap in Sequential Recommendation without Cached History

less than 1 minute read

长序列推荐不缓存?两阶段微调搞定

各位算法同学们,如果训练时吃满200个历史交互,线上却只给你最近5个,推荐效果会崩多少?这篇CIKM’26的工作说,不用缓存任何历史状态,只微调bias和LayerNorm就能补回差距,甚至接近带缓存的方法。

📄 Closing the Long-Short View Gap in Sequential Recommendation without Cached History

🔧 第一个创新是揪出dot-product的norm bias:点积把方向和模长缠在一起,而模长在稀疏长序列里会悄悄拟合物品热度,输入一截断就成了错误捷径。改成angular similarity后,只保留方向信息。

🔧 第二个创新是针对softmax的prefix position bias:注意力权重会残余分配到早期前缀位置,短视推理时前缀被砍掉,注意力分布就被打乱。他们用有界softmax(softmax_1)限制这种残余分配。

🔧 第三阶段只微调bias和LayerNorm,不引入任何新参数,用点级对齐+长视模型蒸馏的联合目标,把训练和推理的长度分布差再拉近一截。

📊 在SASRec和HSTU两个骨干上,Taobao、XLong、MovieLens-10M三个数据集测试:短视推理下,两阶段框架超过直接用全序列训练但推理只用短窗的基线。

📈 只做bias/LayerNorm微调后,效果能追平甚至接近需要预先计算和存储每用户KV cache或token memory的方法,但完全不需要存任何历史状态。

📉 冷启动用户(没有缓存状态)也能直接用,因为推理输入就是最近几步交互,不需要外部记忆。

我的判断:这个思路对工业界短期在线推理很实用,省掉了缓存基础设施的维护成本。但要注意,实验里用户序列被截到200或400以上才算“长序列”,真实场景里大多数用户没这么长历史,冷启动增益可能有限。后续可以盯一下在中等长度序列上的表现,以及angular similarity对最终排序指标有没有副作用。

图 1

原文:AlphaXiv

Updated: