小红书精读:SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders
📈 Transformer排序上线:GMV涨8.65%
各位算法同学们,Transformer终于把工业级排序模型的效率和效果同时拉上来了:AliExpress全量部署,在线GMV提升8.65%。这篇工作把高特征稀疏和低标签密度的问题一一拆掉,落地细节里藏了不少工程取舍,适合做推荐排序的同学细读。
📄 SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders
🔧 请求级样本组织:把同一次请求里的多个候选拼进一条样本,避免重复计算用户序列和画像特征,再配合局部注意力与查询剪枝,直接砍掉长历史序列里与候选无关的注意力开销。
🧩 生成式预训练:先用用户点击序列做下一项预测,给item embedding做预热。这样在稀疏二分类标签之外额外制造监督信号,缓解大参数空间的过拟合。
⚙️ 架构细节也做了系统性改造:tokenization加入特殊token作为特征边界;MHA中引入QKNorm和attention gate稳定训练;FFN替换为稀疏MoE,扩大容量而不显著增加计算。整体也吸收了RMSNorm、RoPE、SwishGLU这类LLM常用设计。
📊 离线实验验证了跨数据规模、模型规模和序列长度的可扩展性,均优于强基线。
📈 在线A/B测试:订单量+7.47%,买家数+6.67%,GMV+8.65%。
⚡ 延迟降低62%,吞吐量提升589%,训练MFU达到45%。
对工业级排序团队,这套路把Transformer的规模化优势真正迁移到推荐场景,但复现门槛不低:请求级样本、生成式预训练、稀疏MoE和推理剪枝需要整套系统工程,单改网络结构很难出同样效果。后续要盯长序列剪枝后的推荐多样性,以及预训练分布偏移后是否需要重训。

原文:AlphaXiv