推荐算法日报 · 2026-09-15
总览
今天这两篇都是工业推荐的实战派,主线挺清晰:把生成式模型往推荐链路里塞,一篇塞在标题文案这一层,一篇塞在预训练到排序的迁移这一层。第一篇明显是今天最值得细读的,它没空谈「LLM 写标题」,而是把探索和利用拆开,直接用百亿 DAU 级的线上 A/B 数字把话说死了——只有多样性生成不行,只有实时选择器也不行,更妙的是它把 reward hacking 那个坑摆得明明白白:去掉质量约束 CTR 反而涨,说明质量模型是护栏不是发动机。第二篇工程含金量也高,多 epoch 把 sparse 训崩、reset 回预训练再叠 dense 那组数字,凡是做过大规模排序的都懂那种痛,但它只有自家电商数据、效率优势也谈不上绝对,线上收益还停在「声称」,可信度得打个折。两篇放一起还有个共同味道:生成式本身不稀奇,真正难的是对齐、融合,以及别让模型钻奖励的空子。所以今天优先看标题生成那篇,重点吃透它的探索-利用拆分和消融;LazFormer 当工程手册翻,看它怎么处理预训练与排序的特征错位和 sparse 过拟合就够了。
论文列表
1. Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-09-14 06:14 UTC
- 机构:未披露机构
- 工业优先级:强
CTR涨2.57%:标题生成别只出一条
各位算法同学们,给LLM做个性化标题,最大的坑不是数据不够,而是你让它直接输出“唯一最优解”——越训越像平均水平,长尾用户的兴趣直接被抹掉。这篇来自百度的GESE,把这件事拆成“探索+利用”两步,还在1亿DAU的商业平台上跑出了正向收益。
📄 Generate to Explore, Select to Exploit: Aligning LLM-based Headline Generation with Personalized Recommendation
🔧 结构上直接解耦:LLM不再兼任排序,只当“探索器”,一次推理生成一组语义覆盖度高的候选标题;真正挑哪条交给轻量、实时的selector。
🧩 训练用 GSPO,配分层reward,把生成多样性、预测CTR、内容忠实度揉在一起,目标从“单点最优”换成“分布覆盖”,从机制上压住mode collapse。
⚙️ 一次前向出整个候选集,不再重复采样K次,推理成本降下来;selector 吃的是即时会话反馈和实时用户meta标签,而不是静态ID历史。
📊 落地在日活超1亿的平台,跟 SFT、DPO 这类强基线做线上A/B。
📈 CTR +2.57%,停留时长 +0.87%,两个指标同向。
✅ 生成侧用 Qwen3-14B 打底,SFT冷启动数据约3万条,先把JSON格式和单次多候选的能力教会。
总结:如果你在做推荐展示层、push或标题文案生成,这套解耦思路比继续死磕DPO性价比高。要盯的坑有三个:selector的实时特征延迟和线上线下一致性、reward里预测CTR的偏差会不会被生成器钻空子、候选多样性上去后内容忠实度和低质标题的兜底。和端到端对齐比,它的优势是拿多样性当对冲,但前提是你的selector真的够快够准。
2. LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training
- 论文链接:AlphaXiv
- 更新时间:2026-09-14 03:31 UTC
- 机构:Alibaba International Digital Commerce Group, Beijing, China
- 工业优先级:强
推荐排序预训练,顺手治了两个坑🧩
各位算法同学们,工业推荐里最贵的一块成本,往往不是模型多大,而是从零开始训一个排序模型:稀疏 embedding 和稠密参数全都要从随机初始化裸跑。LazFormer 想干的事就是先用生成式预训练给这两类参数一个像样的起点,再迁进排序继续训,同时专门解决迁移时最容易踩的两个坑。
📄 LazFormer: Scaling Transformers for Industrial Recommendation via Transferable Generative Pre-training
🔧 生成式预训练做初始化:在用户历史交互序列上做自回归的 next item 预测,稀疏 embedding 和 Transformer 稠密参数一起学,而且预训练参数在排序阶段不冻结、继续更新,这点和以往冻结预训练权重的做法相反。
🧩 迁移残差适配器对付稠密参数负迁移:预训练和排序可用的特征本来就不一致,直接硬塞排序特有特征会打乱预训练学到的表示空间。他们借鉴 LoRA 的思路,用残差方式把排序专属特征注入进去,而不是改原有的稠密表示。
⚙️ request-aware 排序模块加非对称多轮训练:长序列侧用粗到细的序列压缩、混合稀疏注意力加渐进式 token 剪枝;训练侧每轮重置稀疏参数、让稠密参数跨轮持续累积,既压住稀疏参数多轮过拟合,也不至于因为冻结而丢掉对排序目标的适应性。
📊 论文用离线实验加线上 A/B 两套验证,结论是效果和可扩展性都有收益。
✅ 它已经上线到真实工业推荐系统,摘要原话是给平台带来显著提升。
📈 但摘要没给具体百分比,正文实验表格在这份分享里被截断了,CTR、CVR 的涨幅和对比基线得翻全文,看到数字再判断量级。
总结:如果你在做推荐排序的规模化,或者走预训练加迁移这条路线,这套三件套可以拆开看实现细节,对照 HSTU、MTGR、OneTrans 这类单塔从零训的方案,重点比收敛速度和算力开销。落地最容易出问题的是稀疏参数重置的频率,重置太狠会短期掉点;另外适配器的注入方式如果和自家特征体系不兼容,负迁移可能换个地方冒出来。
