小红书精读:HeMix: Scaling Industrial Ranking Models with Heterogeneous Token Mixing
HeMix:推荐模型1亿到15亿还能涨
各位算法同学们,推荐模型从1亿参数干到15亿,精度还在涨,你猜怎么做的?HeMix没重设计架构,而是把序列token和特征交互全改成异构混合了。
📄 HeMix: Scaling Industrial Ranking Models with Heterogeneous Token Mixing
🔧 Query-Mixed Interest Extraction:用动态查询(来自非序列特征)和固定查询一起对行为序列做注意力,同时抓到上下文相关和上下文无关的兴趣,而且全局序列和实时序列分开建模。 🧩 HeteroMixer块:把自注意力换成“融合-交互-重建”三段式,包括multi-head token fusion、异构token交互、分组对齐重建,实现了线性复杂度下的多粒度特征交互。 ⚙️ 扩展性设计:模型宽度和深度可以独立加,从1亿参数平滑涨到15亿参数,不需要改架构,精度一直涨。
📊 离线在~100M参数量级,比DLRM基线CTR-AUC相对提升+1.64%,同时计算量比最强的对比模型还低。 📈 在线AB测试,GMV +0.88%,PV_CTR +2.74%,UV_CVR +0.84%。 ✅ 参数量从~100M扩到~1500M,性能持续提升,没有掉点。
这套设计对工业级排序团队是个不错的方向,尤其是用固定+动态查询分离长期和实时兴趣,很实用。但实现细节多,group怎么划分、重建怎么对齐得自己调,想直接抄作业怕是要花点时间。
原文:AlphaXiv