小红书精读:LLM-Based Generative Retrieval for Snapchat Content Recommendation

less than 1 minute read

LLM做检索上线,View Time涨了0.37%

各位算法同学们,生成式检索用LLM替换T5,线上View Time只涨了0.37%?但Snapchat还是把它推上线了,因为离线Recall@32直接翻倍。这篇是少见的工业级LLM生成式检索完整落地报告,值得看的是系统设计如何凑齐那么多工程细节。

📄 LLM-Based Generative Retrieval for Snapchat Content Recommendation

🔧 创新点一:语义ID不再是纯视觉。用Qwen3-VL多模态embedding过RQ-VAE,再加PPR共现对比学习,把用户协同信号揉进离散token里,codebook利用率从31.8%提到49.1%。

🧩 创新点二:两阶段训练。先用视频描述做CPT让新SID token对齐LLM语义空间,再做SFT学交互序列。CPT后RSA从0.016涨到0.322,但SFT后会掉回0.167,说明协同信号主导了后续表示。

⚙️ 创新点三:工程优化。TensorRT-LLM的CUDA beam search替代Python实现,加去中心化worker-loop和异步I/O,推理吞吐提了45.7倍,训练也靠打包和FlashAttention-2拿到3.63倍。

📊 线上7天A/B:View Time +0.37%,Time Spent +0.09%,Deep Sessions +0.18%,Deep Sessions Unique User +0.11%,统计显著。

📈 离线对比:SnapLGR的Pass@32是T5基线的2.27倍,Recall@32从4.62%提到11.11%。

✅ 消融发现:架构(decoder-only)贡献最大,其次是模型规模,预训练和CPT的增量是最小的。

想做检索的同学可以盯这组数字:线上涨幅不大但统计显著,说明在短视频场景,模型容量和序列建模确实能转化为业务指标,只是成本要算清楚。坑在于CPT的语义grounding会被SFT冲掉,别指望它给最终效果带来太多,主要价值可能在训练初期加速收敛。另外SID质量不能只看碰撞率,文中MM tokenizer碰撞更差但召回反而更好,说明materialization的复杂性也得考虑。

原文:AlphaXiv

Updated: