小红书精读:From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs
推荐排序别硬套LLM,字节ReST有戏
各位算法同学们,为什么LLM能靠Transformer一路scale,推荐里的行为序列直接搬效果却很快饱和?字节这个ReST找出了两个关键差别,改完在真实广告排序上收入涨了11.93%。
📄 From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs
🔧 针对信号质量:行为噪声大,加了个dual-gated attention,分别gating value流和输出流,先过滤不可靠交互,再决定上下文贡献多少;同时用RoPE+RoTE把顺序位置和物理时间都旋转编码,时间粒度按head拆开,精细到秒、粗放到周,还能稳定着扩深度。 ⚙️ 针对计算不对称:排序是“一个用户历史对N个候选”,所以把重计算都塞给只跑一次的sequence encoder,候选侧用一个很轻的cross decoder,去掉了KV投影,用token-specific参数化塞进FFN,保证每个候选只花很少的激活计算。 🧩 训练和serving也做了绑定:user-level shared-prefix训练共用同一用户的前缀计算,线上用shared-prefix serving复用encoder状态,实现真正的一次编码、多次打分。
📊 一周线上A/B:在线AUC提升1.31%,核心收入指标提升11.93%,P99延迟压在50ms以内。 📈 在工业数据集和公开benchmark上,比起LLM-style Transformer block,ReST在序列长度、深度、宽度上都能更持续地涨点,后者到规模后就饱和。 ✅ 目前该模型已全量部署在字节的广告排序上,说明行为序列这条scale轴还有红利可挖。
这篇最亮眼的不是单个模块,而是“序列encoder重、候选decoder轻”的异步拆分,加上训练/服务前缀共享,把工业延迟约束和模型scale绑定在一起。做广告/推荐排序的同学要盯两个数:同P99延迟下增量AUC能有多少,以及扩展曲线是否比LLM-style更平缓。落地坑在于RoTE需要按业务调时间粒度分组,线上增益也依赖行为序列的覆盖密度,小流量场景不一定能复现。
原文:AlphaXiv