推荐算法日报 · 2026-08-20
总览
今天这批 arXiv 推荐方向有点东西,但别指望有颠覆性的魔法。最值得读的是两篇生成式推荐:一篇讲整页生成式推荐,用 TUSID 把语义和协同信息揉进物品 ID,配合 list-wise 规划器直接输出有序列表,省掉两阶段,离线涨得猛但线上指标有涨有跌,工程成本和 beam search 开销都得掂量;另一篇是 Snap 把 LLM 真正端到端上线做生成式检索,Recall 翻倍但线上只涨零点几个百分点,而且发现 CPT 学的语义对齐在 SFT 后基本丢光,说明那步主要是给个好起点。另一条主线是 GEO 内容检测,作者搞了配对训练让模型区分“优化”和“润色”,F1 提升明显,还估了真实搜索里的 GEO 比例,但那只是估计值别较真。今天优先看 Snap 那篇,工业落地细节最实在,顺便把 GEO 那篇扫一眼,对你理解搜索侧的内容生态有帮助。
论文列表
1. Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs
- 论文链接:AlphaXiv
- 更新时间:2026-08-18 10:24 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:18 pages, 3 figures
一次生成就排好序,推荐系统还能这样?
各位算法同学们,先问一个问题:如果推荐模型不再先召回再精排,而是直接把整个推荐列表“生成”出来,会怎样?这篇来自快手的工作给出了答案——列表生成与排序合一,而且线上有效观看涨了1.12%。
📄 Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs
🔧 第一,TUSID:把多模态内容和品牌/类目等属性用注意力融合,再用CountSketch压缩共现信息,按置信度加权拼成统一的语义-协同ID,让SID既懂内容又懂行为。 🧩 第二,GL2P:用全局列表级偏好规划器先规划每个位置,再让位置级SID解码器流水线生成,把串行KD步变成K+D步,避免逐item解码。 ⚙️ 第三,SPA:用主奖励和辅助奖励校准后做保守策略优化,对齐整列表偏好,同时加KL约束防止政策漂移。
📊 实验效果:工业数据集NDCG@5相对提升48.2%,公开数据集相对提升27.2%。 📈 线上A/B测试有效观看提升1.120%,评论提升2.954%。 ✅ 解码吞吐比TIGER-Beam快2.43倍,比OneRec-Beam快2.49倍,且NDCG最高。
总结:这篇把生成式推荐从单item扩展到了slate级,对做推荐排序和生成式召回的同学有参考价值。要注意的是SPA需要额外构造奖励和rollout,线上落地成本不低;另外SID的码本质量直接影响生成上限,建议先在自己数据上评估TUSID的码本指标。
2. LLM-Based Generative Retrieval for Snapchat Content Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-08-18 16:58 UTC
- 机构:Snap, Inc.
- 工业优先级:强
LLM做检索上线,View Time涨了0.37%
各位算法同学们,生成式检索用LLM替换T5,线上View Time只涨了0.37%?但Snapchat还是把它推上线了,因为离线Recall@32直接翻倍。这篇是少见的工业级LLM生成式检索完整落地报告,值得看的是系统设计如何凑齐那么多工程细节。
📄 LLM-Based Generative Retrieval for Snapchat Content Recommendation
🔧 创新点一:语义ID不再是纯视觉。用Qwen3-VL多模态embedding过RQ-VAE,再加PPR共现对比学习,把用户协同信号揉进离散token里,codebook利用率从31.8%提到49.1%。
🧩 创新点二:两阶段训练。先用视频描述做CPT让新SID token对齐LLM语义空间,再做SFT学交互序列。CPT后RSA从0.016涨到0.322,但SFT后会掉回0.167,说明协同信号主导了后续表示。
⚙️ 创新点三:工程优化。TensorRT-LLM的CUDA beam search替代Python实现,加去中心化worker-loop和异步I/O,推理吞吐提了45.7倍,训练也靠打包和FlashAttention-2拿到3.63倍。
📊 线上7天A/B:View Time +0.37%,Time Spent +0.09%,Deep Sessions +0.18%,Deep Sessions Unique User +0.11%,统计显著。
📈 离线对比:SnapLGR的Pass@32是T5基线的2.27倍,Recall@32从4.62%提到11.11%。
✅ 消融发现:架构(decoder-only)贡献最大,其次是模型规模,预训练和CPT的增量是最小的。
想做检索的同学可以盯这组数字:线上涨幅不大但统计显著,说明在短视频场景,模型容量和序列建模确实能转化为业务指标,只是成本要算清楚。坑在于CPT的语义grounding会被SFT冲掉,别指望它给最终效果带来太多,主要价值可能在训练初期加速收敛。另外SID质量不能只看碰撞率,文中MM tokenizer碰撞更差但召回反而更好,说明materialization的复杂性也得考虑。
3. GEO-Flag: Detecting and Measuring GEO-Optimized Web Content
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 17:12 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:21 pages, 3 figures, 21 tables
精读生成失败
(这篇的精读暂时没能生成出来,原因:Expecting value: line 1 column 1 (char 0)。可以先看上面的总结和图表。)