推荐算法日报 · 2026-08-27

less than 1 minute read

总览

今天的 arXiv 推荐系统方向信息量不小,三条主线泾渭分明:直播广告里的生成式推荐、电商场景下的多模态表征学习、以及微信工业级多模态 Embedding 的落地报告。最值得细读的是淘宝那篇多模态 CTR 工作,它反直觉地证明端到端训练在强 baseline 上会掉点,然后用「先提纯再投喂」的 Mine-Then-Train 方案把事办了,工程上落地友好且线上效果扎实;快手直播广告那篇也硬核,动态 ID 加意图感知生成,收入提升 16.1%,但里头的价值加权设计容易把短期 bias 包装成长期能力,读的时候得留个心眼。微信那篇更像是一份高质量技术报告,展示了大模型底座做多模态 Embedding 的实操路径,参数效率和线上验证都很能打,但音频支持缺失和 reranker 增益不稳也是实际局限。整体来看,今天这批货既有方法创新又有工业细节,适合想落地的人仔细咀嚼。优先看淘宝那篇和快手那篇,能帮你避开多模态端到端的大坑,同时理解生成式推荐在真实场景里的取舍。

论文列表

1. TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-25 03:47 UTC
  • 机构:1
  • 工业优先级:强
  • 备注:13 pages, 7 figures, under review

生成式推荐搞直播广告,TAGR涨16%

各位算法同学们,生成式推荐一般默认商品ID是静态的,但直播广告里的场景和带货商品每分钟都在变,直接套用会翻车。TAGR针对这个痛点,把token、意图、对齐三层都做了时序自适应,在快手电商直播广告场景把收入提升了16.1%。

📄 TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising

🔧 LSID(Live Semantic-Collaborative ID):把直播广告的ID从静态变成动态,定期根据当前直播场景和带货商品刷新标识,同时保留一个稳定的层级词表,既跟得上变化又不破坏自回归生成的搜索空间。 🧩 IAG(Intent-Aware Generation):把进房历史按多个时间粒度作为主意图序列,辅助行为单独作为输入,并在NTP训练时用请求后的反馈和商业价值加权,让模型更关注强意图样本。 ⚙️ IOPO(Intermittent On-Policy Preference Optimization):周期性地从当前策略采样候选组做偏好更新,并穿插监督式NTP维护,既吃到在线反馈的“新鲜度”,又稳住已经学到的行为分布。

📊 直播进房率(live-room entry)提升8.5% 📈 加购点击率(shopping-cart click)提升7.4% 💰 相比生产基线收入提升16.1%

这套方案的亮点是把“时序自适应”拆到token、意图、对齐三层,每层都有对应设计,不靠堆模块。对做直播电商或动态商品推荐的团队很有参考价值。落地时要注意LSID的刷新频率和IOPO的更新节奏,这两个超参直接决定效果和稳定性,建议从小步快跑开始调。

图 1(方法 / 架构) 图 2(实验结果)

2. Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-25 05:36 UTC
  • 机构:Taobao & Tmall Group of Alibaba,University of Science and Technology of China
  • 工业优先级:强
  • 备注:Accepted at CIKM 2026

端到端多模态CTR翻车,先挖数据才是正道?

各位算法同学们,你以为把多模态编码器和CTR模型端到端一起训练就能涨点?淘宝和中科大的这篇CIKM论文说:不但没涨,还掉了,得先挖数据。它指出了多模态表示学习的正确打开方式——从CTR数据里先捞高质量样本,再微调编码器,让表示懂用户点击偏好。

📄 Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios

🔧 先泼冷水:端到端多模态训练(E2EM)在淘宝广告场景里,反而导致GAUC下滑,推翻“直连就能提升”的直觉。 🧩 找原因:CTR数据里的用户点击不只有多模态语义在驱动,价格、位置、误触这些非语义因素也会影响,直接端到端训练会让编码器收到模糊监督。 ⚙️ 新方案:Mine-Then-Train,先训练一个多模态注释模型,从CTR数据中挖出与点击偏好对齐的可解释样本,再用这些高质量数据微调预训练编码器,保证表示学习方向正确。

📊 实验数据来自淘宝展示广告系统,覆盖84M用户、88M商品、1.9B样本,规模真实硬核。 📈 评估用GAUC,两阶段基线在淘宝场景已带来百分比级GAUC提升,Mine-Then-Train在此之上再获正向增益。 ✅ 离线与在线实验双重验证,相比E2EM的负收益,新方法确确实实涨点。

想要在多模态CTR上落地,别急着端到端,先把数据挖干净、再微调编码器,收益更稳。要盯的指标永远是GAUC,对比对象是两阶段基线。注意E2EM是个坑,又贵又没用,别踩。

图 1(方法 / 架构) 图 2(实验结果)

3. WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-25 04:23 UTC
  • 机构:未披露机构
  • 工业优先级:强

📄微信多模态Embedding:2B反超8B

各位算法同学们,今天这篇最让我惊讶的地方是:2B参数的多模态embedding模型,居然在MMEB-v2上超过了之前最好的8B开源模型。微信团队开源的WeMM-Embedding,把通用多模态embedding又往前提了一截,而且模型和代码都放出来了。

📄 WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

🔧 统一数据格式是一大亮点:文本、图像、视频、文档甚至任意交错的输入,都被统一成“源-目标对”的格式,还能附带指令、硬负样本和相关性分数,一套框架吃下所有任务。 🧩 两阶段训练是核心:先在几亿对弱监督数据上做大规模对齐,再用一个精炼后的数据集做细粒度优化,其中用语义ID重采样来缓解分布偏斜,还加了跨尺度知识迁移,让2B和4B模型也能学习9B的表示能力。 ⚙️ 模型家族提供2B/4B/9B三档,支持灵活输出维度,方便在不同资源条件下做权衡。

📊 2B版在MMEB-v2上已经超过此前领先的8B开源基线,参数效率很突出。 📈 9B版拿下80.6分,排名官方MMEB-v2榜首,超过了所有开源和闭源模型。 ✅ 内部26任务基准有明显提升,14个线上A/B测试全部正向,目前已在视频号、公众号、朋友圈、电商等场景部署。

个人判断:如果你在做多模态检索或RAG,这个模型可以拿来跑一下自己的数据,尤其是2B的性价比很高。落地时注意它支持多模态输入,但不同输出维度的效果和存储成本需要自己权衡。另外训练思路里数据清洗和硬负样本的构造对提升效果贡献不小,别只盯着模型结构抄。

Updated: