小红书精读:LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining

less than 1 minute read

拆完多兴趣再生成,电商引导Query变了

各位算法同学们,你以为电商的AI引导搜索词是顺着用户历史搜索记录关联出来的,但Q2AIGQ那套两阶段在中途就会丢语义。这篇工作从用户行为序列里直接拆出多个消费兴趣,再为每个子兴趣单独生成引导Query,把识别和生成放在一个LLM链路里,线上还跑赢了。

📄 LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining

🔧 创新点一:不用先召回“主搜索词”再套规则扩展,而是把用户画像+历史行为序列直接交给LLM,先做多兴趣分解,再对每个子兴趣生成有购买意图的AIGQ,避免两阶段级联带来的语义漂移。 🧩 创新点二:训练上走了SFT→RL→DPO三段式。SFT阶段只给单一兴趣子序列,让模型先学会引导词表达风格;RL阶段换成混合多兴趣序列,用推理过程和最终答案分开打分的方式,逼着模型自主拆兴趣、写Query;DPO阶段再让模型去掉显式推理也能保持质量,省在线token。 ⚙️ 创新点三:部署采用近线生成+在线读取。每天近线把用户的引导Query池算好,在线只做检索,再加上非思考模式压缩输出,把LLM推理延迟从实时链路里挪走。

📊 实验上,离线评估里生成Query的相关性、多样性和兴趣一致性都优于传统规则型基线,消融实验也证明SFT、RL、DPO三段都不可少。 📈 在线A/B测试整体正向,用户进入AI搜索后的点击和成交引导有稳定提升。很遗憾论文公开摘要没有放出具体百分比,想去抄作业的同学还是得自己翻原文表格。 ✅ 从能看到的描述来看,它对噪声交互更多、兴趣更杂的大用户量的收益应该更明显。

我的判断:这个框架适合做搜索推荐中台的同学参考,尤其是“兴趣拆分作为前置任务+RL多目标奖励+DPO压缩推理”这套组合,基本可以直接复用到商品标题生成、短视频搜索词推荐上。注意坑在于近线更新频率和奖励权重设计,如果业务指标和语义质量打架时,Reward大权重给谁还是得线上小流量慢慢试。

图 1

图 2

原文:AlphaXiv

Updated: