小红书精读:EAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search

less than 1 minute read

点击商品生成搜索词?EAGER这么练

各位算法同学们,一个点击背后能藏多少种购物意图?过去靠历史日志挖query,长尾和新品直接躺平;现在EAGER用生成式模型直接把query写出来,还拉上强化学习做线上对齐,这套方案已经在电商平台上线了。

📄 EAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search

🔧 两阶段设计是核心:SFT先做“扩写”,把点击商品和用户上下文变成一长串候选query;再用GRPO做“对齐”,把线上规则和真实点击偏好一起优化进奖励。 🧩 SFT里面藏了个四段课程:从只看商品生成query,到加思维链,再到引入用户信息,最后让模型边分析边生成,难度一点点抬起来。 ⚙️ 还搞了个偏好感知奖励模型PARM,先预测用户会不会点这个query,再决定要不要把它当训练标签,比直接拿LLM生成结果当监督靠谱。

📊 三种监督源——点击query、点击后搜索query、LLM补充query——离线跑完,意图覆盖和多样性明显压过历史池挖掘。 📈 GRPO奖励里混了8条规则奖励,格式、长度、重复全给你管住,再用PARM当点击奖励,A/B测试比纯SFT更贴近真实投放。 ✅ 最终在一个大型电商平台完成生产部署,能在真实流量里活下来,这个份量比一个刷出来的涨点更有说服力。

做电商搜索或推荐的同学可以借鉴这套“先丰富再对齐”的框架,它把业务约束和用户点击信号揉进了训练目标,落地思路很清晰。坑在于奖励权重和课程顺序要慢慢调,换场景还得重新清洗标签;个人判断是,可以先盯GRPO混合奖励的稳定性和线上格式违规率再动手迁移。

图 1

图 2

原文:AlphaXiv

Updated: