推荐算法日报 · 2026-08-19
总览
今天这批货整体是“工业界味道”很重的一期,大部分工作都来自大厂一线,很多都带着离线实验和线上A/B结果,务实程度比纯学术的刷点要强。有几条值得说的主线:一是把LLM/VLM往推荐系统里嵌,像富媒体重排序、LLM当自动judge,都在探索怎么用生成模型解决传统召回排序的软肋;二是对推荐系统里那些“隐性问题”做显式建模,比如内容过时的双过滤框架、曝光份额预测、模型结构终身学习,这些角度在国内外的技术分享里都很少见。最值得细读的是DME多模态向量那篇,它把对比学习和隐空间推理结合,训练时增加复杂度、推理时不加成本,思路很实用;还有Spotify那篇LLM judge,用Cranfield范式暴露出传统评估的标签严重不全,系统排名能直接翻车,这个提醒分量很重。另外,Meta那篇曝光份额预测虽然只解决了离线评估,但“反事实曝光分配”这个问题确实是被忽视的盲区。今天优先看DME和LLM judge那两篇,其他按兴趣。
论文列表
1. Douyin Multimodal Embedding Model Technical Report
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 14:02 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:Technical Report
把推理藏进隐空间,多模态检索又快又准
各位算法同学们,还在纠结要不要在检索里加CoT?别加了,显式CoT延迟扛不住。这篇来自抖音搜索多模态团队的技术报告,把CoT搬进隐藏空间,训练时帮你推理、上线时零额外生成,2B模型就在多模态检索基准上刷到SOTA。
📄 Douyin Multimodal Embedding Model Technical Report
🔧 两阶段训练:第一阶段用25M对弱监督数据做大规模对比预训练,先建立统一多模态语义空间;第二阶段用5M高质量指令数据做“语义充分性”微调,补上细粒度区分和证据感知能力。 🧩 证据锚定类型化潜推理:不显式生成文本推理链,而是用锚点token定位文本片段、图像区域、视频帧等证据,再用localize、align_pos、reject_neg这类类型化隐藏状态组织检索推理,最后融合成embedding。推理只在训练时发生,推理时照旧是单次前向的双塔编码器。 ⚙️ 跨条件重建:训练时用query embedding去重建文档侧内容、用document embedding去重建query侧内容,用NTP和MTP做生成式监督,逼着embedding保留对端的细粒度语义。这种监督还给了个副产品:embedding信息完备,可以直接量化“语义充分性”来指导工业调优。
📊 在MMEB-v2上,DME-2B和DME-9B分别拿74.8和78.4,同等规模对比均达到SOTA,视频检索和视觉文档检索的优势尤其明显。 📈 抖音自建离线评估集上总分数相对提升2.92%,所有跨模态检索方向都有一致增益。 ✅ 已经在抖音生成式搜索、图像搜索、AI搜索场景上线;在线A/B测试给抖音搜索带来0.1% Lifetime(LT)增益。额外query-side延迟只有边际开销,基本可以忽略。
这套“训练时重监督、推理时轻编码”的路线,适合做工业级多模态检索的同学参考。真要落地,建议先盯MMEB-v2的视频/视觉文档分项和自家LT增益;坑主要在Stage2需要老师模型生成结构化CoT数据,数据管道成本不低,小数据场景未必有同样收益。
2. Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay
- 论文链接:AlphaXiv
- 更新时间:2026-08-16 15:00 UTC
- 机构:Google LLC
- 工业优先级:强
- 备注:CIKM Applied Research Track 2026
谷歌如何把推荐系统的“陈旧”拆解掉?
各位算法同学们,你有没有想过,一个推荐系统里用户抱怨最多的“内容太旧”问题,居然能靠两个模型把根因拆开分别干掉?谷歌在Google Discover上部署了一套叫SDF的过滤框架,两年内用户反馈的陈旧内容报告直接降了54.9%。这篇是CIKM ‘26的工作,一整套从数据生成到线上部署的完整闭环,做推荐或者内容生态的值得看一看。
📄 Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay
🔧 技术创新点:第一个是把“陈旧”拆成两个独立机制——supersession(新内容把旧内容顶掉)和decay(内容本身随时间贬值),分别建模。第二个是supersession用LLM生成标注数据,再蒸馏成小模型做pairwise判断,还加了NLI辅助训练,让模型学会“谁把谁变旧”。第三个是decay用了一个多模态多任务模型PTR,直接预测内容在多个时间窗口(12h到14d)的流量占比,来判断是否已过生命周期,两个过滤器用OR逻辑融合,在排序前直接剪枝。
📊 实验效果:离线方面,关系陈旧模型在人工标注集上precision 83.5%,recall 95%;PTR在7天阈值下F1随人工标注一致度从78%升到87.5%。线上A/B测试里,SDF整体的prevalence delta达到了-6.91%,而基线只有-0.10%。长期部署回报上,两年内总陈旧反馈降54.9%,其中supersession降64%,decay降34%。另外SDF还省了8.74%的serving CPU和TPU耗时,候选剪枝确实省钱。
总结一下:这个工作的核心价值在于把“旧”这个模糊概念拆成了可建模的两个信号,并且用了LLM+蒸馏的务实路线解决标注成本。如果你是做内容推荐或者搜索的,值得关注的是它怎么设计PTR的训练标签——用搜索点击而不是浏览日志来避免曝光偏差,这个点很细。落地的话,政治评论类内容依然是识别难点,还有用户“看过了”造成的陈旧感不在这个框架范围内,需要另外考虑。
3. Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies
- 论文链接:AlphaXiv
- 更新时间:2026-08-16 03:30 UTC
- 机构:Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University Taobao & Tmall Group of Alibaba,Taobao & Tmall Group of Alibaba,Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University
- 工业优先级:强
- 备注:11 pages, 5 figures
自动出价必看:QGA如何跳出次优轨迹🍀
各位算法同学们,离线数据里全是次优轨迹,纯靠模仿学出来的出价策略天花板肉眼可见,但加一个Q值正则就能让生成式模型自己往高价值动作上靠,这种改法你之前可能真没想过。今天这篇KDD工作给了一个很实际的解法。
📄 Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies
🔧 创新点一:在Decision Transformer主干上直接插入Q值正则项,用Double Q-learning训练Critic,让策略同时做行为克隆和动作价值最大化,告别纯模仿的局限。 🔧 创新点二:提出Q值引导的双重探索机制,推理时对多个Return-to-Go目标采样,再对每个候选动作加噪声扰动,最后用Q值筛出最优动作,把OOD探索控制在安全范围。 🔧 创新点三:整体架构比GAVE更紧凑,不需要复杂的多损失函数和大量超参调优,训练成本更友好。
📊 离线实验:在AuctionNet-Sparse上,QGA在50%预算时拿到19.6分,对比GAVE的19.6持平;150%预算时拿到50.1分,比GAVE高出2.7分,比GAS高3.6分。 📈 模拟环境:QGA得分8113,明显超过GAS的7454和CQL的7138,说明在更贴近真实拍卖的动态场景下优势依然在。 ✅ 线上A/B:淘宝直通车场景,日常时段广告GMV提升3.27%,广告ROI提升2.49%;大促时段GMV提升4.70%,ROI提升2.16%,成本增长在可接受范围内。
如果你在做出价策略或者研究离线RL生成式模型,这篇值得跟进。落地时主要盯训练时Q值正则系数α和双探索的采样个数,论文里α=1.0、采样数=3效果最好,不同业务量级可能要重新调。另外要注意Critic在稀疏转化场景下容易估值偏差,上线前最好在模拟环境里多压测几轮。
4. Impression Share Prediction: An Offline Evaluation Task for Ranking Systems
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 17:52 UTC
- 机构:Meta Platforms, Inc.
- 工业优先级:强
📉离线评估漏掉的流量分配,这篇补上了
各位算法同学们,你以为离线指标涨了线上就一定好?不一定。模型可能把 impression 从高价值目标悄悄挪到低价值目标,而 AUC、NE 这些指标根本看不出来。这篇 Meta 的论文提出个新离线任务:直接预测候选模型上线后会把 impression 分到哪些 objective bucket。
📄 Impression Share Prediction: An Offline Evaluation Task for Ranking Systems
🔧 核心创新是把离线评估从“预测点击率准不准”升级成“预测流量分配长什么样”。候选模型从没上过线,所以这是个反事实任务。 🧩 他们构建了一个结构因果模型,证明在观测数据下就能识别这种反事实效应,不需要逆概率加权或者对抗训练这些复杂操作。 ⚙️ 预测框架很简单:用候选模型的置信度特征(比如分数分布直方图)加上当前系统状态(剩余投放容量、 pacing 系数等),直接学一个映射到未来24小时的 impression share 向量。
📊 对训练中见过的模型,Random Forest 把 L1 误差相对常数基线降了 48.6%,其中置信度特征单独就有 42.9% 的贡献。 📈 但对完全没见过的模型,上线第1小时 RF 反而比基线差 20.5%——因为这时系统状态还停留在旧模型的均衡,滚动置信度窗口也没填满。 ✅ 他们改用 PatchTST 编码器,先对最近2小时的拍卖动态做个 rollout,第1小时的 L1 立刻变成 +22.1%,前12小时都稳定领先。
这个任务的定位很聪明,补上了离线评估和线上真实效用之间的盲区。落地时注意第一小时的冷启动,论文里用在线滚动置信度近似离线置信度,如果真要做全离线输入,准确率可能还要再验证。
5. UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 16:52 UTC
- 机构:Meta
- 工业优先级:强
🎯 一个点积统一特征交互和序列建模
🚀 各位算法同学们,一个反直觉的点:FM的点积和attention的QK点积本质上是同一个操作,Meta这次直接把这个统一思路做到了KDD Cup 2026工业赛道第二名。这篇工作能打,不是因为刷榜,而是它把特征交互和序列建模拧成了一个可堆叠的块。
📄 UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation
🔧 核心创新:从FM视角出发,embedding内积既是协同过滤的底座,也是attention的query-key打分,所以干脆用点积统一两种建模。设计上整一个shared token space,非序列字段和多域行为序列都token化,再堆L个宏块,每个块里token-mixing bus和sequence-retrieval bus并行跑,每层用MLP-Mixer融合。
🔧 另一个点是FM Highway:把每层的显式点积交互(per-sequence dots、Gram矩阵、user-item cross-dots)直接拼到分类器,绕过残差堆叠,避免二阶信号被深网洗掉。序列侧只embed一次、所有消费者共享,推理延迟可控。
🔧 训练上用了双稀疏/稠密优化器(Adagrad+Muon),还加了转化延迟辅助头和多路径互学习(两个UniDot路径共享embedding表、互相蒸馏)。
📊 最终成绩:TAAC KDD Cup 2026工业赛道第二名,测试AUC 0.83217,距第一仅0.037%。单路径推理(1x成本)也有0.83184,照样超过第三名。
📈 增量实验:从baseline 0.81398到最终0.83217,总共+1.818%。消融里去掉FM Highway损失最大(-0.127%),去掉序列cross-attention只掉0.053%,说明multi-channel pooling吃掉了不少序列信号。
✅ 扩展性:把dense宽度从64扩到128,AUC只涨0.050%;但加一条互学习路径在d=64时直接涨0.135%,说明dense容量花在路径数上比花在宽度上划算。
🧠 总结:UniDot的思路对做工业推荐的同学很有参考价值,尤其是用点积显式保留二阶交互、以及多路径互学习这种低成本提点手段。落地要盯的是FuseFFN融合那块——消融里去掉它AUC反而微涨,说明静态融合是短板,后续大概率要做input-conditioned fuser。另外数据量不够大的团队慎追大宽度,先把互学习用起来更实际。
6. Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 15:47 UTC
- 机构:SKLCCSE, School of Computer Science and Engineering Beihang University,Baidu Inc,SKLCCSE, School of Computer Science and Engineerin Beihang University
- 工业优先级:强
- 备注:Accepted by the Full Research Track of CIKM-2026
重排新方案:让LLM多看封面图
各位算法同学们,搜索重排光看文本已经不够了,封面图和多意图拆分才是用户满意的关键。这篇来自北航和百度的CIKM’26工作,直接把重排的NDCG@10刷到96.7%,比第二名高17个点,而且已经在工业系统上线。
📄 Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search
🔧 先上Query Planner,根据session里的query改写序列,把复杂query拆成多个互补子query,比如“北京旅游”会被拆成景点、演出、交通、住宿四个方向,再分别检索合并候选集。 🧩 引入VLM打分器,对封面图做相关性和质量两个维度的四级评分,评分结果直接作为特征喂给LLM重排器,解决纯文本忽略视觉信号的问题。 ⚙️ 重排原则不只看相关性,还综合信息增益、新颖性、封面图表现,并通过多任务GRPO对VLM和LLM做后训练,让模型适应具体业务场景。
📊 在1.4万条真实搜索query上,整体NDCG@10达到96.7%,Recall@10达到88.1%,分别比最强的baseline高17.1%和27.0%。 📈 复杂query和宽泛query提升更明显,复杂query的Recall@10达到89.3%,说明多意图拆分确实有效。 ✅ 消融实验显示,去掉LLM后训练NDCG@4直接掉12.1个点,去掉封面图评估也掉1.7个点,两个模块都不可缺。
总结:这套框架对富媒体搜索重排很有参考价值,尤其适合图文信息流场景。落地时要重点盯Query Planner的拆分质量和VLM打分与人工标注的一致性,否则LLM喂进去的视觉信号本身不准,排序结果也会偏。另外GRPO训练成本不低,小团队建议先用小模型验证reward设计再上规模。
7. From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 16:57 UTC
- 机构:Spotify
- 工业优先级:强
- 备注:v2 paper accepted at the RecSys’26 Unified Search & Recommendation Workshop
LLM当评委,推荐系统排名大洗牌
各位算法同学们,你信吗?传统离线评估得出的推荐系统排行榜,可能和真实水平差了42个名次。这篇Spotify的论文用LLM当裁判,把系统排序和人类判断的吻合度拉到了0.92。
📄 From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections
技术创新点: 🔧 用Cranfield-style pooling替代传统train-test split,把推荐结果的标签覆盖率从0.08提升到0.60,系统排名更可靠。 🧩 设计LLM judge输入,把用户历史交互和电影元数据拼接,每个字段(题材、导演、演员、语言等)都能提升和人类标注的对齐程度。 ⚙️ 发现LLM在item级判断上只算中等(一致率55-57%),但把多个user-item对聚合到系统排名后,stability很高,和人类排名的Kendall tau达到0.92。
实验效果: 📊 传统train-test下模型平均Judged@100只有0.06-0.08,Cranfield pooling下到0.55-0.60,标签完整度差了一个量级。 📈 用LLM judge的排名和人类判断排名对比,nDCG@100的Kendall tau最高0.92,和TREC检索场景相当。 ✅ LLM judge能纠正被不完整标签带偏的系统排名:NCEPLRec从人类排名第1跌到LLM排名第43,SimpleX从47升到14。
总结感想:这篇适合做推荐系统评估的算法工程师参考,建议把LLM judge作为人类评估的前置筛选器,能省不少人力成本。但别指望完全替代人——item级一致性只有一半多,且LLM自带流行度偏好,对长尾item的判断要小心。另外构造prompt时,元数据字段别乱加,平均评分反而会降低对齐度。
8. SoftModel: A Neural Model That Grows Its Own Topology – Governed Structural Growth for Continual In-Service Learning
- 论文链接:AlphaXiv
- 更新时间:2026-08-17 11:03 UTC
- 机构:未披露机构
- 工业优先级:未标注
- 备注:99 pages, 16 figures, 12 tables
结构也能训练?模型自己长拓扑!
各位算法同学们,如果我说模型的结构应该像权重一样终身可训练,甚至能在服役期间自己长出神经元和注意力头,你会不会觉得有点反常识?这篇工作干脆把“总可塑性”当公理:训练完不等于冻结,拓扑结构也是可学习自由度。
📄 SoftModel: A Neural Model That Grows Its Own Topology – Governed Structural Growth for Continual In-Service Learning
🔧 核心创新之一是所有结构操作都是“精确保持”的。加宽、加深、新增输入特征、加注意力头,应用瞬间模型输入输出完全不变,之后由held-out真实性门控决定要不要采纳,参数更新和结构变化用同一套标准审判。 🧩 第二个创新是“治理式增长”:成长变成低风险投机,模型想怎么长都行,但提交服务版本时必须在最近的真实数据切片上严格超过当前版本。稳定不再靠冻结参数,而是靠生命周期审计。 ⚙️ 第三个是局部求解环:长出带收缩认证的有向循环,让计算在局部迭代,还有自处理单元在新结构内部按局部目标精炼,不扰动全局学习契约。
📊 在标准持续学习基准上,受治理的增长保住了沿长任务序列继续学习的能力,不会越学越僵。 📈 预注册的EWC基线对比:四个终身任务里三个在适应性和保留性上同时达到或超过EWC最佳网格,一个miss如实报告。 ✅ 还测出一个反直觉结论:新容量的边际价值在采用前根本观测不到,所以增长治理只能事后裁决,事前投机无门。
💡 这个工作最打动我的是把稳定性从参数属性变成审计属性,而且失败也按预注册协议全量公开。对做持续学习、动态架构的同学,这个治理框架可以仔细拆解;但落地前要盯住两个坑:LLM操作整个生命周期的可靠性,以及门控在概念漂移下是否真的严格。别指望开箱即用。