推荐算法日报 · 2026-08-20

less than 1 minute read

总览

今天这批 arXiv 推荐方向有点东西,但别指望有颠覆性的魔法。最值得读的是两篇生成式推荐:一篇讲整页生成式推荐,用 TUSID 把语义和协同信息揉进物品 ID,配合 list-wise 规划器直接输出有序列表,省掉两阶段,离线涨得猛但线上指标有涨有跌,工程成本和 beam search 开销都得掂量;另一篇是 Snap 把 LLM 真正端到端上线做生成式检索,Recall 翻倍但线上只涨零点几个百分点,而且发现 CPT 学的语义对齐在 SFT 后基本丢光,说明那步主要是给个好起点。另一条主线是 GEO 内容检测,作者搞了配对训练让模型区分“优化”和“润色”,F1 提升明显,还估了真实搜索里的 GEO 比例,但那只是估计值别较真。今天优先看 Snap 那篇,工业落地细节最实在,顺便把 GEO 那篇扫一眼,对你理解搜索侧的内容生态有帮助。

论文列表

1. Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-18 10:24 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:18 pages, 3 figures

一次生成就排好序,推荐系统还能这样?

各位算法同学们,先问一个问题:如果推荐模型不再先召回再精排,而是直接把整个推荐列表“生成”出来,会怎样?这篇来自快手的工作给出了答案——列表生成与排序合一,而且线上有效观看涨了1.12%。

📄 Once Generated, Ranked: End-to-End Generative Slate Recommendation with Unified Semantic-Collaborative IDs

🔧 第一,TUSID:把多模态内容和品牌/类目等属性用注意力融合,再用CountSketch压缩共现信息,按置信度加权拼成统一的语义-协同ID,让SID既懂内容又懂行为。 🧩 第二,GL2P:用全局列表级偏好规划器先规划每个位置,再让位置级SID解码器流水线生成,把串行KD步变成K+D步,避免逐item解码。 ⚙️ 第三,SPA:用主奖励和辅助奖励校准后做保守策略优化,对齐整列表偏好,同时加KL约束防止政策漂移。

📊 实验效果:工业数据集NDCG@5相对提升48.2%,公开数据集相对提升27.2%。 📈 线上A/B测试有效观看提升1.120%,评论提升2.954%。 ✅ 解码吞吐比TIGER-Beam快2.43倍,比OneRec-Beam快2.49倍,且NDCG最高。

总结:这篇把生成式推荐从单item扩展到了slate级,对做推荐排序和生成式召回的同学有参考价值。要注意的是SPA需要额外构造奖励和rollout,线上落地成本不低;另外SID的码本质量直接影响生成上限,建议先在自己数据上评估TUSID的码本指标。

图 1(方法 / 架构) 图 2(实验结果)

2. LLM-Based Generative Retrieval for Snapchat Content Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-18 16:58 UTC
  • 机构:Snap, Inc.
  • 工业优先级:强

LLM做检索上线,View Time涨了0.37%

各位算法同学们,生成式检索用LLM替换T5,线上View Time只涨了0.37%?但Snapchat还是把它推上线了,因为离线Recall@32直接翻倍。这篇是少见的工业级LLM生成式检索完整落地报告,值得看的是系统设计如何凑齐那么多工程细节。

📄 LLM-Based Generative Retrieval for Snapchat Content Recommendation

🔧 创新点一:语义ID不再是纯视觉。用Qwen3-VL多模态embedding过RQ-VAE,再加PPR共现对比学习,把用户协同信号揉进离散token里,codebook利用率从31.8%提到49.1%。

🧩 创新点二:两阶段训练。先用视频描述做CPT让新SID token对齐LLM语义空间,再做SFT学交互序列。CPT后RSA从0.016涨到0.322,但SFT后会掉回0.167,说明协同信号主导了后续表示。

⚙️ 创新点三:工程优化。TensorRT-LLM的CUDA beam search替代Python实现,加去中心化worker-loop和异步I/O,推理吞吐提了45.7倍,训练也靠打包和FlashAttention-2拿到3.63倍。

📊 线上7天A/B:View Time +0.37%,Time Spent +0.09%,Deep Sessions +0.18%,Deep Sessions Unique User +0.11%,统计显著。

📈 离线对比:SnapLGR的Pass@32是T5基线的2.27倍,Recall@32从4.62%提到11.11%。

✅ 消融发现:架构(decoder-only)贡献最大,其次是模型规模,预训练和CPT的增量是最小的。

想做检索的同学可以盯这组数字:线上涨幅不大但统计显著,说明在短视频场景,模型容量和序列建模确实能转化为业务指标,只是成本要算清楚。坑在于CPT的语义grounding会被SFT冲掉,别指望它给最终效果带来太多,主要价值可能在训练初期加速收敛。另外SID质量不能只看碰撞率,文中MM tokenizer碰撞更差但召回反而更好,说明materialization的复杂性也得考虑。

3. GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-17 17:12 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:21 pages, 3 figures, 21 tables

精读生成失败

(这篇的精读暂时没能生成出来,原因:Expecting value: line 1 column 1 (char 0)。可以先看上面的总结和图表。)

Updated: