小红书精读:Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation
CTR涨2.57%:标题生成别只出一条
各位算法同学们,给LLM做个性化标题,最大的坑不是数据不够,而是你让它直接输出“唯一最优解”——越训越像平均水平,长尾用户的兴趣直接被抹掉。这篇来自百度的GESE,把这件事拆成“探索+利用”两步,还在1亿DAU的商业平台上跑出了正向收益。
📄 Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation
🔧 结构上直接解耦:LLM不再兼任排序,只当“探索器”,一次推理生成一组语义覆盖度高的候选标题;真正挑哪条交给轻量、实时的selector。
🧩 训练用 GSPO,配分层reward,把生成多样性、预测CTR、内容忠实度揉在一起,目标从“单点最优”换成“分布覆盖”,从机制上压住mode collapse。
⚙️ 一次前向出整个候选集,不再重复采样K次,推理成本降下来;selector 吃的是即时会话反馈和实时用户meta标签,而不是静态ID历史。
📊 落地在日活超1亿的平台,跟 SFT、DPO 这类强基线做线上A/B。
📈 CTR +2.57%,停留时长 +0.87%,两个指标同向。
✅ 生成侧用 Qwen3-14B 打底,SFT冷启动数据约3万条,先把JSON格式和单次多候选的能力教会。
总结:如果你在做推荐展示层、push或标题文案生成,这套解耦思路比继续死磕DPO性价比高。要盯的坑有三个:selector的实时特征延迟和线上线下一致性、reward里预测CTR的偏差会不会被生成器钻空子、候选多样性上去后内容忠实度和低质标题的兜底。和端到端对齐比,它的优势是拿多样性当对冲,但前提是你的selector真的够快够准。

原文:AlphaXiv