推荐算法日报 · 2026-09-07
总览
今天这批货整体质量在线,两条主线都很清晰:一条是推荐系统结构层面的探索,另一条是电商搜索里生成式召回与对齐的工程化落地。前者那篇 MORE 把多任务信号从塔里搬进 backbone,用 Anchor Tokens 打破 task-blind 的僵局,ablation 里还点出任务隔离比容量更关键,是值得细读的思路型工作;后者那篇 EAGER 深耕 I2Q 场景,两阶段连招和课程学习的设计非常务实,虽然算法创新不强,但胜在把已知组件拼成了能上线的完整系统。今天如果要选着看,建议优先啃 MORE,你会看到近期统一架构演进的一个新方向。
论文列表
1. Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones
- 论文链接:AlphaXiv
- 更新时间:2026-09-07 09:36 UTC
- 机构:Hello Group,University of Science and Technology of China,Institute of Software, Chinese Academy of Sciences,University of Chinese Academy of Sciences 等 5 家机构
- 工业优先级:强
- 备注:Accepted at CIKM 2026
多任务信息流不再被截断,MORE帮你省30%延迟
各位算法同学们,多任务建模和统一骨干网络难道只能一个在头一个在底吗?MORE论文给出的答案是:把任务信号直接灌进每一层骨干,让任务表征和序列特征一起进化。这篇 CIKM ’26 的工作来自陌陌等团队,实测线上时长+3%,交互+3.6%,深聊+2%,值得各位做工业排名模型的同学细品。
📄 Task-Blind No MORE: Multi-Task Information Flow in Unified Ranking Backbones
🔧 技术创新点一:提出 Anchor Tokens 贯穿骨干网络,共享 Anchor 编码跨任务共性,私有 Anchor 捕获各自任务先验。 🧩 技术创新点二:每个 MORE Block 里,Anchor Tokens 先做任务条件化的序列读取,再加任务边界 mask 做选择性语义混合,最后通过独立分支精炼任务表征,避免任务间干扰。 ⚙️ 技术创新点三:任务信息不再只在浅层塔里做后融合,而是与用户行为和特征逐层协同演化;同时可支持请求级并行打分,模型不改就降约 30% 在线延迟。
📊 离线实验在百万级工业数据上,七个子任务全部取得正向 GAUC 提升,且参数量和 FLOPs 预算与基线相近。 📈 线上 A/B 测试在陌陌上进行,使用时长提升 3%,互动率提升 3.6%,深聊率提升 2%。 ✅ 已部署到生产环境,请求级共享计算让打分延迟降低约 30%,没有牺牲指标。
总结感想:这个思路把多任务从塔里挪到 backbone 内部,确实解决了 task-agnostic 骨干的结构性瓶颈。想落地的话,主要看你们是否有明确的共享/私有任务边界,比如点赞和聊天这类强异质场景会很受益;如果任务语义太接近,可能会增加 mask 调参成本。建议盯紧 GAUC 和延迟双指标,不要光看 AUC。
2. EAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search
- 论文链接:AlphaXiv
- 更新时间:2026-09-07 07:44 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:Accepted to the EMNLP 2026 Industry Track. 13 pages, 6 figures
点击商品生成搜索词?EAGER这么练
各位算法同学们,一个点击背后能藏多少种购物意图?过去靠历史日志挖query,长尾和新品直接躺平;现在EAGER用生成式模型直接把query写出来,还拉上强化学习做线上对齐,这套方案已经在电商平台上线了。
📄 EAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search
🔧 两阶段设计是核心:SFT先做“扩写”,把点击商品和用户上下文变成一长串候选query;再用GRPO做“对齐”,把线上规则和真实点击偏好一起优化进奖励。 🧩 SFT里面藏了个四段课程:从只看商品生成query,到加思维链,再到引入用户信息,最后让模型边分析边生成,难度一点点抬起来。 ⚙️ 还搞了个偏好感知奖励模型PARM,先预测用户会不会点这个query,再决定要不要把它当训练标签,比直接拿LLM生成结果当监督靠谱。
📊 三种监督源——点击query、点击后搜索query、LLM补充query——离线跑完,意图覆盖和多样性明显压过历史池挖掘。 📈 GRPO奖励里混了8条规则奖励,格式、长度、重复全给你管住,再用PARM当点击奖励,A/B测试比纯SFT更贴近真实投放。 ✅ 最终在一个大型电商平台完成生产部署,能在真实流量里活下来,这个份量比一个刷出来的涨点更有说服力。
做电商搜索或推荐的同学可以借鉴这套“先丰富再对齐”的框架,它把业务约束和用户点击信号揉进了训练目标,落地思路很清晰。坑在于奖励权重和课程顺序要慢慢调,换场景还得重新清洗标签;个人判断是,可以先盯GRPO混合奖励的稳定性和线上格式违规率再动手迁移。
