小红书精读:TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation

less than 1 minute read

📈召回也讲规模定律?加权平均是关键

各位算法同学们,召回阶段也有Scaling Law?这篇工作用一个“加权平均”把Transformer塞进了工业召回,在400亿交互数据上Recall@2000涨了19.3个点,线上收入提升2.53%——不是靠堆算力,而是修了一个让特征对齐的小算子。

📄 TransRetrieval: Scaling Up Transformer-Based Retrieval for Industrial Recommendation

🔧 加权平均聚合:把特征池化从sum换成weighted average,让异构特征的token范数不再随特征基数膨胀,恢复Transformer对同质token的假设,这是能稳定缩放的前提。 🧩 目标token压缩:所有target侧特征用轻量MLP压成一个D维token,每候选FLOPs降低85%,同时支持HNSW近似检索;用户侧KV缓存每个请求只算一次,所有候选共享。 ⚙️ 位置式领域embedding:像位置编码一样把领域信息加进去,用单模型统一4个业务域,稀疏域靠跨域迁移吃到了数据红利。

📊 工业数据上,计算量从0.1到2 MFLOPs/目标,Recall@2000提升19.3个百分点;KuaiRand公开集提升22.2个百分点。 📈 线上A/B测试,在端到端延迟与生产基线一致的前提下,平台收入提升2.53%。 ✅ 目标token压缩省下85%每候选FLOPs,KV共享又进一步压缩推理成本,这是能扛住10^8量级候选池的关键。

这个工作把召回阶段的scaling law从理论变成了可落地的工程样板,做检索的算法同学可以认真读一下。落地有个坑:它基于model-based retrieval范式,如果你们还在用双塔,迁移成本不低;另外加权平均里的权重v_i怎么设计,直接决定效果,得结合具体业务特征去调,不是无脑换聚合函数就能复现的。

图 1

原文:AlphaXiv

Updated: