小红书精读:From Interests to Semantic IDs: Retrieval-Grounded Credit Assignment for Generative Recommendation

less than 1 minute read

SID奖励太稀疏?把信用分给兴趣句

各位算法同学们:一组 rollout 全都没命中目标 SID 时,group-relative RL 的优势直接归零,这批采样等于白跑;更隐蔽的是,两条推理完全不同的轨迹,只要 SID 奖励相同,拿到的更新就一模一样。这篇要补的就是这个 credit assignment 的缺口。

📄 From Interests to Semantic IDs: Retrieval-Grounded Credit Assignment for Generative Recommendation

🔧 把一条 rollout 拆成 history summary、若干条 interest hypothesis 和最终 SID,兴趣句用固定格式输出,因此可以逐条被独立检验,而不是只能靠最后那个 SID 背锅。

🧩 每条 interest 都拿去问一个冻结的 retriever,谁把目标捞进 top-K,正优势就只发给那一行兴趣;而且检索这条通道永远不会去更新最终 SID 那段 span,SID 还是由 exact-match 单独管。

⚙️ 于是同一个 SID 奖励的 rollout 能拿到不同更新;一组里 SID 奖励全为 0、但检索奖励有差异时,兴趣行依然有梯度可学。结构、检索、SID 三路奖励分别归一化。

📊 三个 Amazon Reviews 数据集上,SID 推荐指标一致提升。

📈 Video Games 的 oracle 分析显示,在生成的兴趣里挑出与目标相关的那条 query,recall 和 ranking 都会变好,说明兴趣条件化的 SID 解码还有余量;兴趣本身也能当辅助召回池,约束解码时的候选 trie。

✅ 论文还统计了检索通道能把多少 SID 全 0 的组重新激活,代码已开源。

总结:适合已经在跑 SID + reasoning RL、又被稀疏奖励卡住的人。落地先盯冻结 retriever 的召回和 top-K 取值,检索器不行的话,正信号会被系统性压低,反倒把兴趣句带偏;另外它没替换 SID 奖励,只是在旁边加了一条检索旁路,和 PROMISE、HCGRec 这类沿 SID 路径做过程监督的思路是互补而非替代。

原文:AlphaXiv

Updated: