小红书精读:KUAISHOU Explorer LLM-Rec Challenge 2026: Reasoning Generative Recommendation
推理加进推荐,指标反而掉了?
各位算法同学们,给推荐模型加思维链,效果不一定涨——这是快手这篇挑战赛报告里反复强调的反常识结论。他们干脆把“推理式生成推荐”做成赛题,顺手把模型权重、推理 SFT 数据、评测基准全开源了。
📄 KUAISHOU Explorer LLM-Rec Challenge 2026: Reasoning Generative Recommendation
🔧 物品用 Semantic ID 表示:领域标记加三层残差量化码,每层 8192 个码字,RQ-KMeans 把多模态内容压成 LLM 词表里的特殊 token,推荐目标就是自回归吐这些码。
🧩 四类任务塞进同一个模型:理解物品、理解用户(按给定兴趣主题挑出相关历史行为并生成兴趣演化链)、跨域预测下一交互、外加世界知识选择题,考验训练后通用能力还剩多少。
⚙️ OneReason 的应对是强化 SID 与自然语言的语义对齐,用结构化模板监督兴趣推理,再叠 RL/RFT,让 CoT 真正对推荐有用,而不是模型自嗨。
📊 开源 SFT 数据 792,797 条,其中 412,438 条带 CoT 轨迹;另有 50 万匿名用户行为,覆盖短视频、电商、广告、直播四域。
📈 评测用 thinking 与 non-thinking 两种模式各跑 Pass@32 再合并算分,思路是逼 thinking 捞到非思考模式预测不出的多样兴趣物品。
✅ 榜首队伍总分 1.44,其后是 1.42、1.41、1.41、1.40,头部咬得很紧,没出现断层方案。
做 LLM 与推荐融合的同学可以盯这个赛题,重点看双模式合并后指标怎么涨、RL 阶段怎么筛 rollout 轨迹、SID 对齐做到哪一层。坑也很明确:CoT 不加约束就是拖后腿,直接套通用推理模板大概率白跑一轮。
原文:AlphaXiv