小红书精读:UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation
百度把召回和排序塞进同一个模型了
各位算法同学们,召回和排序合并成一个模型这件事,学术界喊了好几年,真敢在十亿级流量上全量跑 A/B、还把 P99 延迟一起公布出来的工业论文,其实没几篇。这篇 UNIQUE 就是其中之一,而且它的重点不在涨点,在怎么把两阶段的信息损失补回来。
📄 UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation
🔧 核心是 early fusion:用户历史 token、候选 item、候选 code 全部塞进同一个 Transformer 计算图,一次前向同时产出生成式召回的 code logits 和排序用的多目标分数。排序监督因此可以直接塑造共享的用户表示,而不是像级联那样靠候选列表传话。
🧩 量化上放弃 RQ-VAE 的多层残差,改成单层扁平 codebook,最近邻硬分配,从结构上消掉层级误差累积;量化处用 straight-through estimator 让梯度照常回传。
⚙️ codebook 不是拿 item 元信息直接学,而是先过一个 DSSM 多任务双塔,让 item 表征吃进 CTR、时长、完播这些后验反馈再做量化;外加一个平衡量化机制缓解码本被头部 item 占满的问题。
📊 线上 A/B:总观看时长 +0.96%,总分发量 +1.08%。
📈 新用户和高活跃用户这两类人群的涨幅明显高于大盘,论文专门点了出来。
✅ 服务端 P99 延迟 89 ms,在线推理 MFU 44.23%,这是它敢说 production-ready 的底气。
⚖️ 码本分析显示比层级量化的资源分配更均衡,这条对长尾和冷启动的判断价值,其实比那两个 +1% 更关键。
我的判断:如果你在做召排级联的工业推荐,且正被码本长尾偏斜、候选质量卡住排序上限这两件事折磨,这篇的工程细节比结论更值得抠。要盯的指标是长尾和冷启动的召回覆盖率、码本利用率,而不是只看大盘那 +1%。坑有两个:单层扁平量化对码本规模有多敏感,论文没展开,换到你的数据上得重扫;target-attention 那个交互切分对训练稳定性影响不小,结构别直接照搬。
原文:AlphaXiv