推荐算法日报 · 2026-10-01
总览
今天这批论文数量不多,但方向挺集中,基本都围着「大规模推荐模型怎么把结构和效率同时做好」这件事打转。一条主线是特征交互和序列建模的融合,HELIX 走的就是这条路线,试图把过去长期分家的两套建模范式捏到一起,这个思路我觉得是今天最值得细读的。另一条主线是推理效率,OneLatent 把 latent reasoning 引到推荐基础模型上,思路更大胆一些,但工程落地的说服力还得看实验细节。两篇的共同气质是都不满足于在现有架构上小修小补,而是重新思考模型该长什么样,这种「重想一遍」的论文最近确实不多见。相对而言 HELIX 的问题定义更贴近工业界的真实痛点,OneLatent 的想象力更足但风险也更高。今天就优先看 HELIX,有余力再顺着 OneLatent 想想 latent 推理在推荐里到底能撑多久。
论文列表
1. HELIX: Purified and Unified - Rethinking Feature Interaction and Sequence Modeling for Large-Scale Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-09-29 10:06 UTC
- 机构:未披露机构
- 工业优先级:未标注
- 备注:17 pages, 3 figures. Technical report
推荐模型只卷一条轴?HELIX说不
各位算法同学们,推荐模型把特征交互或序列建模单独往大里堆,涨点总会撞天花板?这篇论文直接下结论:单轴 scaling 天花板有限、scaling law 斜率也难看,两条轴得一起 scale。
📄 HELIX: Purified and Unified — Rethinking Feature Interaction and Sequence Modeling for Large-Scale Recommendation
🔧 三条 token 流分工明确:非序列特征走 MixTokenizer 变成 mix-token,U-only 行为序列和 U×C 序列各自走 SeqTokenizer,互不搅在一起。
🧩 单向信息流是核心:SeqFormer Encoder 先把用户侧 U-only 序列压成与候选无关的 K/V cache,MixFormer 从 U×C 序列取候选相关信息并做 Mixup-PerToken-FFN 交互,SeqFormer Decoder 再反复从这个 cache 取。用户侧状态不被候选改写,所以能按请求、按用户复用。
⚙️ 论文反复强调 purified:砍掉 LHUC、DCN-M、FM 模块、跨层残差和辅助 loss,全模型只留一处 LayerNorm(MixTokenizer 里的 per-token LN,顶替 field-aware bias 的作用),其余全 RMSNorm;由此支持序列建模和特征交互非对称地扩。
📊 离线在 TikTok 电商视频推荐中,CTR AUC、CVR AUC 等排序指标一致提升,scaling-law 分析显示加容量、加算力能稳定换成排序质量。
📈 线上 A/B:电商视频人均 GMV 提升约 6%。
✅ 工程侧配了 pyramidal query compression、变长序列执行和用户侧计算摊销,说明结构是按线上延迟约束设计的,不是纯玩具。
总结感想:如果序列侧和特征侧已经在互相拖后腿,这套单向信息流加可复用 cache 的结构可以直接抄。重点盯两个指标:用户侧计算是否真摊销掉了(QPS 和延迟),以及 M 和序列长度变大时 AUC 是否还线性涨。坑在于它依赖 U-only 与 U×C 序列的干净切分,如果你的“用户序列”里混了候选相关信息,摊销收益会缩水。
2. OneLatent: Latent Reasoning for Efficient Foundation Recommendation Models
- 论文链接:AlphaXiv
- 更新时间:2026-09-29 13:01 UTC
- 机构:Kuaishou Technology
- 工业优先级:未标注
推荐模型不写CoT,吞吐还快17倍
各位算法同学们,推理链写得越长,推荐就一定越准吗?快手这篇给出的答案有点反直觉:把整段显式CoT压成3个可学习的latent token,SID@64反而比Think版高17.44%,线上吞吐还高17倍以上。对于正在纠结FRM推理开销的团队,这个思路值得拆开看。
📄 OneLatent: Latent Reasoning for Efficient Foundation Recommendation Models
🔧 MV-ACoT:不靠人工模板,而是从兴趣探索、正样本评估、交互归因三个视角构造互补的教师CoT监督,并让推理深度随样本复杂度自动伸缩,缓解固定单路径推理带来的兴趣漂移。
🧩 三阶段latent token对齐:先在latent位置上做rationale预测学出上下文表示,再把同一个latent接口接到next-item预测,用渐进方式把教师CoT内化进3个共享的token ID,而不是样本级向量。
⚙️ 课程式后训练:分阶段激活latent推理,同时保留直接预测和latent推理两种模式,推理token开销恒定,不再随请求动态变长。
📊 工业规模快手数据集上,比显式Think变体SID@64提升17.44%,比No-Think变体提升9.33%。
📈 相比显式rationale解码,吞吐提升17.49倍;换到9B骨干,同样超过直接预测和显式CoT基线。
✅ 快手本地生活广告线上A/B,对比OneRec、OneReason等强基线,预估收入提升9.6%。
我的判断:做生成式推荐、准备把LLM当FRM骨干的同学可以重点跟这条线。要盯的是SID@64和吞吐的联合曲线,以及latent token到底是真在承载推理,还是只做了语义关联——论文自己也把这两者区分开了。落地有两个坑:latent token是全体共享的固定ID,效果强依赖教师CoT质量;另外单靠模型加速仍扛不住全量同步推理的延迟,必须配异步serving把基础模型推理挪出在线请求路径。
