小红书精读:HELIX: Purified and Unified - Rethinking Feature Interaction and Sequence Modeling for Large-Scale Recommendation
推荐模型只卷一条轴?HELIX说不
各位算法同学们,推荐模型把特征交互或序列建模单独往大里堆,涨点总会撞天花板?这篇论文直接下结论:单轴 scaling 天花板有限、scaling law 斜率也难看,两条轴得一起 scale。
📄 HELIX: Purified and Unified — Rethinking Feature Interaction and Sequence Modeling for Large-Scale Recommendation
🔧 三条 token 流分工明确:非序列特征走 MixTokenizer 变成 mix-token,U-only 行为序列和 U×C 序列各自走 SeqTokenizer,互不搅在一起。
🧩 单向信息流是核心:SeqFormer Encoder 先把用户侧 U-only 序列压成与候选无关的 K/V cache,MixFormer 从 U×C 序列取候选相关信息并做 Mixup-PerToken-FFN 交互,SeqFormer Decoder 再反复从这个 cache 取。用户侧状态不被候选改写,所以能按请求、按用户复用。
⚙️ 论文反复强调 purified:砍掉 LHUC、DCN-M、FM 模块、跨层残差和辅助 loss,全模型只留一处 LayerNorm(MixTokenizer 里的 per-token LN,顶替 field-aware bias 的作用),其余全 RMSNorm;由此支持序列建模和特征交互非对称地扩。
📊 离线在 TikTok 电商视频推荐中,CTR AUC、CVR AUC 等排序指标一致提升,scaling-law 分析显示加容量、加算力能稳定换成排序质量。
📈 线上 A/B:电商视频人均 GMV 提升约 6%。
✅ 工程侧配了 pyramidal query compression、变长序列执行和用户侧计算摊销,说明结构是按线上延迟约束设计的,不是纯玩具。
总结感想:如果序列侧和特征侧已经在互相拖后腿,这套单向信息流加可复用 cache 的结构可以直接抄。重点盯两个指标:用户侧计算是否真摊销掉了(QPS 和延迟),以及 M 和序列长度变大时 AUC 是否还线性涨。坑在于它依赖 U-only 与 U×C 序列的干净切分,如果你的“用户序列”里混了候选相关信息,摊销收益会缩水。
原文:AlphaXiv