小红书精读:Bumblebee: Interleaved Mixed-Layer Building Blocks for Large-Scale Recommendation Systems

less than 1 minute read

推荐系统:把序列和特征交叉交错起来🐝

各位算法同学们,推荐模型一直在两条路上各走各的:序列建模管用户历史,特征交叉管上下文特征,但很少有人让它们在同一个块里反复混合。Bumblebee 这篇就是把这两条路交错起来,而且消融显示交错的组合方式本身才是涨点主因。

📄 Bumblebee: Interleaved Mixed-Layer Building Blocks for Large-Scale Recommendation Systems

🔧 交错混合层块:每个 block 内部把序列个性化、注意力编码、目标感知过滤注意力、跨注意力融合和特征交叉串成一个自包含微流水线,而不是先序列后特征、或先特征后序列。 🧩 跨模态残差通路:块与块之间的残差连接不再只传单模态信息,而是同时搬运序列和特征交互信号。消融里这个机制单独贡献 0.25% NE,且不增加额外参数。 ⚙️ 可配置组件丢弃:块内组件可以按需丢掉,用来在质量和吞吐之间做权衡,也支持把多个块堆起来做迭代精炼。

📊 消融实验:跨模块残差信息流单独带来 0.25% NE 提升,参数没多。 📈 在多个分类和回归任务上,Bumblebee 相比可比基线模型取得一致提升,但论文没有给出具体相对增益。 ✅ 大规模工业数据评估显示,交错组合本身是主要提升来源,而不是简单加深堆叠。

总结一下,如果你在做大规模推荐,且序列模型和特征交叉还是两套分开的 pipeline,这篇的思路值得跟。要盯的指标是 NE 和吞吐的 trade-off,坑在于组件可丢弃会放大调参空间,0.25% NE 是消融单因素收益,端到端线上收益得看你的基线和数据规模;和 DHEN 比它补了 UIH 处理,和 HSTU 比它在注意力前后都保留了上下文注入。

原文:AlphaXiv

Updated: