小红书精读:Balancing Trial and Reorder: A Hybrid Sequential Transformer-GBDT Ranker for On-Demand Delivery

less than 1 minute read

外卖排序怎么平衡尝鲜和复购🔍

各位算法同学们,先来个反差点:一个排序模型把尝鲜MRR拉高12%到30%,代价是6个国家里5个复购MRR回退,但上线核心指标Global CVR统计上基本没动。Wolt这篇的看点在于,它把探索/利用这个老问题,在本地即时配送的硬约束下做成了可调、可上线的生产系统,还连做了三场A/B。

📄 Balancing Trial and Reorder: A Hybrid Sequential Transformer-GBDT Ranker for On-Demand Delivery

🔧 双阶段结构:双向Transformer编码器做用户序列建模,输出原始logit,再作为单特征喂给GBDT排序器,融合上下文、用户和门店特征;推理时再套本地配送约束。

🧩 不按品类拆模型:一个国家、全门店、跨餐厅和零售共享一套store词表,UVR直接替掉原来3个餐厅加1个零售共4个排序模型。

⚙️ 把试新/复购写成可调权重:目标端只mask最近一次购买,配合标签平滑和trial偏置样本加权,让尝鲜与复购的权衡能直接调,而不是靠拍脑袋换目标。

📊 离线尝鲜MRR相对生产模型提升+12%到+30%,但6个国家中5个复购MRR回退;混合试新和复购的Global CVR统计上不变。

📈 A/B:V1相对上一版生产排序器 +5.5% Merchant Trial Rate、+0.16% Global CVR。

✅ V2在V1基础上再加+0.45% Merchant Trial Rate;V3跨餐厅和零售统一后再加+1.31% Retail Merchant Trial Rate,三场A/B依次覆盖最大市场、全部运营国家和两个域。

总结感想:这篇对做本地生活、即时零售排序的人更有用,尤其是候选集受距离和运力约束、又背着多目标权重的团队。要盯的不是单一离线MRR,而是能同时混合试新和复购的核心CVR,以及分城市、分域的复购回退;坑在于trial偏置权重是经验调的,换市场或品类得重新校准,否则很容易用复购换尝鲜。

图 1

原文:AlphaXiv

Updated: