小红书精读:HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation

less than 1 minute read

快手HubMixer:用潜在枢纽搞定特征交互

各位算法同学们,你们有没有想过,推荐系统里那么多特征token,直接两两交互其实是又贵又低效的?快手和清华这篇工作提出HubMixer,用一小撮可学习的潜在枢纽来组织交互,参数更少,线上转化率还涨了5.48%。

📄 HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation

🔧 核心创新是把token交互拆成三个阶段:induction——用少量可学习枢纽(latent hubs)通过cross-attention从所有token里提炼关键信息,相当于先做一次信息压缩。 🧩 第二个阶段是让这些枢纽自己在更干净的低维空间里做高阶交互,绕开直接在异构token空间里两两乱碰的问题,交互的路由更清晰、也更省参数。 ⚙️ 最后用token-conditioned readout,让每个原始token按需从交互过的枢纽里取回全局交互信号,再用残差接回原表示,堆叠多层就能从低阶到高阶渐进细化特征语义。

📊 离线实验里,HubMixer在工业推荐任务上超过了SOTA token-mixing基线,而且参数量更少。 📈 消融实验验证了hub interaction和token-conditioned readout都有效,缺一个都不行。 ✅ 在快手短视频招聘业务上做了线上A/B,简历投递转化率提升5.48%,统计显著,而且已经全量部署到生产环境了。

这个思路对做工业推荐排序的同学很友好,尤其是特征组多且杂的场景。落地时要注意latent hub的数量和维度是个超参,太小装不下信息,太大又退化成自注意力,得拿自己业务数据多调几组。另外线上部署时hub数量不大,推理开销基本可以忽略,值得试。

原文:AlphaXiv

Updated: