小红书精读:UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation

less than 1 minute read

🎯 一个点积统一特征交互和序列建模

🚀 各位算法同学们,一个反直觉的点:FM的点积和attention的QK点积本质上是同一个操作,Meta这次直接把这个统一思路做到了KDD Cup 2026工业赛道第二名。这篇工作能打,不是因为刷榜,而是它把特征交互和序列建模拧成了一个可堆叠的块。

📄 UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation

🔧 核心创新:从FM视角出发,embedding内积既是协同过滤的底座,也是attention的query-key打分,所以干脆用点积统一两种建模。设计上整一个shared token space,非序列字段和多域行为序列都token化,再堆L个宏块,每个块里token-mixing bus和sequence-retrieval bus并行跑,每层用MLP-Mixer融合。

🔧 另一个点是FM Highway:把每层的显式点积交互(per-sequence dots、Gram矩阵、user-item cross-dots)直接拼到分类器,绕过残差堆叠,避免二阶信号被深网洗掉。序列侧只embed一次、所有消费者共享,推理延迟可控。

🔧 训练上用了双稀疏/稠密优化器(Adagrad+Muon),还加了转化延迟辅助头和多路径互学习(两个UniDot路径共享embedding表、互相蒸馏)。

📊 最终成绩:TAAC KDD Cup 2026工业赛道第二名,测试AUC 0.83217,距第一仅0.037%。单路径推理(1x成本)也有0.83184,照样超过第三名。

📈 增量实验:从baseline 0.81398到最终0.83217,总共+1.818%。消融里去掉FM Highway损失最大(-0.127%),去掉序列cross-attention只掉0.053%,说明multi-channel pooling吃掉了不少序列信号。

✅ 扩展性:把dense宽度从64扩到128,AUC只涨0.050%;但加一条互学习路径在d=64时直接涨0.135%,说明dense容量花在路径数上比花在宽度上划算。

🧠 总结:UniDot的思路对做工业推荐的同学很有参考价值,尤其是用点积显式保留二阶交互、以及多路径互学习这种低成本提点手段。落地要盯的是FuseFFN融合那块——消融里去掉它AUC反而微涨,说明静态融合是短板,后续大概率要做input-conditioned fuser。另外数据量不够大的团队慎追大宽度,先把互学习用起来更实际。

原文:AlphaXiv

Updated: