小红书精读:Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation

less than 1 minute read

CTR涨2.57%:标题生成别只出一条

各位算法同学们,给LLM做个性化标题,最大的坑不是数据不够,而是你让它直接输出“唯一最优解”——越训越像平均水平,长尾用户的兴趣直接被抹掉。这篇来自百度的GESE,把这件事拆成“探索+利用”两步,还在1亿DAU的商业平台上跑出了正向收益。

📄 Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation

🔧 结构上直接解耦:LLM不再兼任排序,只当“探索器”,一次推理生成一组语义覆盖度高的候选标题;真正挑哪条交给轻量、实时的selector。

🧩 训练用 GSPO,配分层reward,把生成多样性、预测CTR、内容忠实度揉在一起,目标从“单点最优”换成“分布覆盖”,从机制上压住mode collapse。

⚙️ 一次前向出整个候选集,不再重复采样K次,推理成本降下来;selector 吃的是即时会话反馈和实时用户meta标签,而不是静态ID历史。

📊 落地在日活超1亿的平台,跟 SFT、DPO 这类强基线做线上A/B。

📈 CTR +2.57%,停留时长 +0.87%,两个指标同向。

✅ 生成侧用 Qwen3-14B 打底,SFT冷启动数据约3万条,先把JSON格式和单次多候选的能力教会。

总结:如果你在做推荐展示层、push或标题文案生成,这套解耦思路比继续死磕DPO性价比高。要盯的坑有三个:selector的实时特征延迟和线上线下一致性、reward里预测CTR的偏差会不会被生成器钻空子、候选多样性上去后内容忠实度和低质标题的兜底。和端到端对齐比,它的优势是拿多样性当对冲,但前提是你的selector真的够快够准。

图 1

原文:AlphaXiv

Updated: