推荐算法日报 · 2026-09-05
总览
今天这批论文的“干货密度”比平时高一点,但真正能直接动手跟进的其实就两篇:美团的 UniCon 和 HUST/阿里的 LLM4AIGQ。前者把 CTR 预测重新组织成上下文单元结构,统一了历史行为和候选的建模,离线 AUC 和线上指标都给出了实打实的提升;后者想用 LLM 代替传统召回-改写链路来做电商引导查询,思路很工程化,但数据量小、依赖外部 teacher,还缺给力数值。另外两篇更像是提醒我们要警惕“实验室自嗨”:SHELF 用合成语料测试嵌入模型,发现主题分类还行、体裁和受众这种细粒度全崩,值得做语义任务的人拿去当镜子照一下;数据中心能耗优化那篇干脆是一篇元研究,结论是控制算法多数只在模拟器里吹牛,连水耗都没人管——虽然离推荐有点远,但对我们这种喜欢堆模型的人是个警醒。今天优先看 UniCon,想追 LLM 应用的话再读 LLM4AIGQ。
论文列表
1. UniCon: A Unified Context-Centric Modeling Paradigm for CTR Prediction
- 论文链接:AlphaXiv
- 更新时间:2026-09-03 02:33 UTC
- 机构:Meituan
- 工业优先级:强
- 备注:10 pages, 5 figures, 2 tables
CTR统一建模新姿势:把上下文当基本单位
😯 各位算法同学们,有没有想过,我们一直把用户行为拆成“序列信号”和“非序列特征”,这个分类习惯可能正在限制CTR模型的上限?美团这篇UniCon提出,用户行为本质上是一连串同构的“上下文单元”,历史行为和当前候选,只差在“结果是否已知”。整篇用统一的上下文建模方式,把搜索、广告场景里的“列表效应”和“决策演变”装进同一个框架,对做工业级排序的朋友会很有启发。
📄 UniCon: A Unified Context-Centric Modeling Paradigm for CTR Prediction
🔧 以“上下文单元”为最小建模单位:把同一次曝光里一起展示的item连同当时场景信号打包成一个上下文单元。用户历史不再是散装token串,而是一串历史上下文;当前候选则初始化成一个“目标隐上下文单元”,训练时用曝光和位置目标去逼近真实展示列表的结构。 🧩 引入层级交互来刻画“局部性”和“动态性”:上下文内部做intra-context attention,捕捉item间的竞争、互补、位置偏差等局部耦合;上下文之间做inter-context attention,沿着时间轴建模用户决策状态的演化。 ⚙️ 面向工业部署的压缩设计:上下文单元成为天然计算边界,结合padding-free变长注意力,并用上下文级序列压缩只保留与目标最相关的历史上下文,降低训练和serving开销。
📊 离线AUC在美团搜索广告的强生产基线上提升0.0139。 📈 在线A/B结果:RPM提升3.09%,CTR提升2.07%,收入提升2.95%,均统计显著。 ✅ 配合padding-free变长注意力和编译部署,上下文级压缩把系统开销控制在工业可承载范围,让这套结构真正上了线。
💭 个人判断是这篇把“上下文”从辅助特征升级成架构的组织方式,对搜索列表、瀑布流这类展示上下文很强的场景尤其有价值。落地时最大的坑在于如何从日志中还原“真实展示过但没被点击”的item集合,上下文单元的构建质量直接影响效果;上下文压缩的阈值也需要按不同流量重新调。
2. LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining
- 论文链接:AlphaXiv
- 更新时间:2026-09-03 11:13 UTC
- 机构:Huazhong University of Science and Technology, Alibaba Group,Alibaba Group,Nankai University, Alibaba Group
- 工业优先级:强
拆完多兴趣再生成,电商引导Query变了
各位算法同学们,你以为电商的AI引导搜索词是顺着用户历史搜索记录关联出来的,但Q2AIGQ那套两阶段在中途就会丢语义。这篇工作从用户行为序列里直接拆出多个消费兴趣,再为每个子兴趣单独生成引导Query,把识别和生成放在一个LLM链路里,线上还跑赢了。
📄 LLM4AIGQ: LLM-based AI Guidance Query Generation Framework for Multi Interest Mining
🔧 创新点一:不用先召回“主搜索词”再套规则扩展,而是把用户画像+历史行为序列直接交给LLM,先做多兴趣分解,再对每个子兴趣生成有购买意图的AIGQ,避免两阶段级联带来的语义漂移。 🧩 创新点二:训练上走了SFT→RL→DPO三段式。SFT阶段只给单一兴趣子序列,让模型先学会引导词表达风格;RL阶段换成混合多兴趣序列,用推理过程和最终答案分开打分的方式,逼着模型自主拆兴趣、写Query;DPO阶段再让模型去掉显式推理也能保持质量,省在线token。 ⚙️ 创新点三:部署采用近线生成+在线读取。每天近线把用户的引导Query池算好,在线只做检索,再加上非思考模式压缩输出,把LLM推理延迟从实时链路里挪走。
📊 实验上,离线评估里生成Query的相关性、多样性和兴趣一致性都优于传统规则型基线,消融实验也证明SFT、RL、DPO三段都不可少。 📈 在线A/B测试整体正向,用户进入AI搜索后的点击和成交引导有稳定提升。很遗憾论文公开摘要没有放出具体百分比,想去抄作业的同学还是得自己翻原文表格。 ✅ 从能看到的描述来看,它对噪声交互更多、兴趣更杂的大用户量的收益应该更明显。
我的判断:这个框架适合做搜索推荐中台的同学参考,尤其是“兴趣拆分作为前置任务+RL多目标奖励+DPO压缩推理”这套组合,基本可以直接复用到商品标题生成、短视频搜索词推荐上。注意坑在于近线更新频率和奖励权重设计,如果业务指标和语义质量打架时,Reward大权重给谁还是得线上小流量慢慢试。
3. SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking
- 论文链接:AlphaXiv
- 更新时间:2026-09-02 18:17 UTC
- 机构:未披露机构
- 工业优先级:中
- 备注:17 pages, 15 tables. Code available at https://github.com/mjbommar/shelf-benchmark ; data available at https://huggingface.co/datasets/mjbommar/SHELF
图书馆任务评测:SHELF基准的冷与热
各位算法同学们,论文里最扎眼的数字你猜是哪个?不是最高的0.8887,而是最低的0.2605——同一个系统里,主题分类能飘到快0.9,体裁分类却趴在地上,这种反差值得想想为什么。
📄 SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking
🔧 技术创新点 🔧 用国会图书馆词表加写作规范,自动生成带标注的合成文献数据,支持分类、聚类、检索、配对、指令检索五种任务,而且能把主题、体裁、受众、语域等维度分开控制。 🔧 不只给固定集,系统本身能生成模型训练截止之后的新文档,未来模型用旧数据污染不了它。 🔧 对比了几类方法:TF、TF-IDF、BM25、常见编码器,只在主题分类上加了零样本解码器,每种方法只跑能支持的任务,比Leaderboard更实在。
📊 实验效果 ✅ 主题分类最高0.8887,但体裁形式分类只有0.2605,差距不是一点半点。 ✅ 主题检索0.7104,体裁形式检索掉到0.1173,受众和语域配对任务基本接近随机。 ✅ 在主题分类上,稀疏方法不输稠密编码器,TF-IDF还是计时实验里最快的。 ✅ 与LCSHBench和Gutenberg对比发现,模型排名能转移,但绝对分数不能直接当生产数据准确率用。
总结感想:对这个基准,别只盯平均分,要看具体任务和标签空间。如果你做的是编目、文档元数据标注这摊事,可以拿来当模型体检工具;但落地到真实馆藏时,分数大概率会缩水,得自己做一轮验证。已有编码器都在训练截止前生成,换新模型前记得用同套流程再生成一遍,不然污染问题说不清。
4. Artificial Intelligence for Energy Optimization in Data Centers
- 论文链接:AlphaXiv
- 更新时间:2026-09-03 11:51 UTC
- 机构:未披露机构
- 工业优先级:中
- 备注:11 pages, 6 figures, 7 tables
数据中心节能AI:63篇里仅5篇上真机
💡 各位算法同学们,翻了63篇数据中心节能AI论文,只有5篇上过真机。这篇综述把现有研究的老底揭了:节能结果多半只在仿真里跑过,而且各方法之间没法直接比。
📄 Artificial Intelligence for Energy Optimization in Data Centers: Closing the Optimizer–Load Loop
🔧 系统编码:筛选194篇、编码63篇,按验证场地、资源范围和收益口径归类,发现控制类研究普遍把负载当外生变量,忽视“效率提高→算力变便宜→需求增长”的回弹路径。 🧩 CLEAR-DC框架:把控制策略和负载需求通过弹性项耦合,目标是评估净收益而非直接收益,并把水耗、隐含碳也纳入边界。 ⚙️ 最小报告Schema:要求论文强制声明能量、碳、水、隐含碳占比和验证场地,让不同研究的节能数字终于可以互相比较。
📊 28篇主要控制类研究中,18篇仅靠仿真验证,只有5篇跑到物理硬件或生产环境。 📈 同样是这批28篇,没有一篇考虑水耗,也没有一篇考虑隐含碳。 ✅ 四个技术族报告的节能区间几乎完全重叠,现有方法无法被客观排序。
📌 这份工作适合做数据中心节能优化的人读,尤其是准备投控制类论文的。投稿前先自查:验证场地是仿真还是真机?有没有把水耗和隐含碳算进去?报的是净收益还是直接节能?落地最大的坑是CLEAR-DC目前只是一个架构提案,没有配套训练好的系统;另外语料编码只读了摘要,不是全文,而且是单人编码有主观偏差。后续如果看到有团队按它的schema做了真实部署对照实验,那个结果需要重点盯一下。