小红书精读:MetaStrategy: Generative Ranking with Executable LLM Strategies
生成式排序新招:LLM输出可执行策略
各位算法同学们,今天分享一篇来自淘宝首页猜你喜欢的生成式排序论文,核心思路是不让LLM直接输出商品序列,而是生成一份可执行的排序策略,让生产排程器来执行,这样既能用上LLM的联合决策能力,又不破坏现有系统的规则和护栏。
📄 MetaStrategy: Generative Ranking with Executable LLM Strategies
🔧 策略生成而非物品生成:LLM根据请求上下文输出一个类型化的JSON策略包,控制目标权重、内容偏好、体验约束和位置策略,再由确定性验证器和编译器接入现有排序模块。 🧩 Generator-Evaluator架构:LLM控制一个独立的生成器,与约十个生产生成器在列表级评估器下原子竞争,保证可验证、可回退,不干扰主线。 ⚙️ 训练方法:自竞争课程把高频策略变成下一轮对手,缓解奖励崩塌;评估器路由的在线蒸馏把多个4B教师的最佳输出压缩到0.8B学生,且保留GE奖励信号。
📊 离线replay中,Routed OPD(0.8B)学生选择率16.24%,增量GE提升0.73%,有效性98.03%,超过4B模型。 📈 在线7天A/B测试中,MetaStrategy赢得27.93%的GE调用。 ✅ 点击PV提升2.11%,IPV提升3.12%,交易额提升2.83%,且无RT增加。
💡 总结感想:这个思路很务实,把LLM放在策略层而不是列表生成层,落地阻力小,也更容易对齐业务指标。值得关注的是他们用近线生成和蒸馏解决了成本问题,坑可能在于策略空间的构造和评估器偏差,需要持续监控。


原文:AlphaXiv