推荐算法日报 · 2026-08-21
总览
今天这批货整体偏工业落地,干货不少,最明显的信号是生成式模型和LLM开始真正往推荐系统里扎,但都不是花架子,全都有线上验证。值得优先细读的是小红书的两篇——GateDiffInt把扩散去噪和意图提取做成闭环,直接戳中噪声和意图互相纠缠的痛点,OneModel则展示了多场景统一排序的完整工程解法,从特征、模型到延迟优化都交代得很实在;Netflix那篇多模态embedding虽然方法不新,但筛选embedding的探针任务和A/B验证思路特别值得抄作业。另外美团和淘宝的LLM应用也各有亮点,一个做推理+检索的个性化,一个用LLM代理做实验优化,但都更偏探索性。今天优先看GateDiffInt和OneModel,能给你不少工业落地的启发。
论文列表
1. GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling
- 论文链接:AlphaXiv
- 更新时间:2026-08-19 10:14 UTC
- 机构:Fudan University,Xiaohongshu Inc.
- 工业优先级:强
噪声和意图纠缠?双门控扩散破解
各位算法同学们,行为序列里的噪声和真实意图不是各过各的,而是互相纠缠——噪声稀释意图,缺少意图先验又让去噪没方向。这篇来自复旦+小红书的 GateDiffInt 直接用转化信号当共享监督,把去噪和意图提取放进同一个目标里,线上已部署在首页主流量。
📄 GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling
🔧 技术创新点 🔧 提出 Noise-Intent Coupling (NIC) 现象,拆成 NID(噪声导致意图漂移)和 IDF(无意图先验的去噪失效),并用诊断实验证实两者存在。 🧩 Gate-Mediated Controllable Diffusion (GMCD):按行为可靠性做掩码和加噪,用 DDIM 确定性采样去噪,再用双门控融合去噪表示和原始表示,同时输出可解释的位置重要性信号。 ⚙️ Multi-Intent LLM Distillation (MILD):用冻结 LLM 做教师,蒸馏出长期、短期、潜在、转化四类意图向量,用 per-intent LoRA 路由防止四头坍缩,满足线上延迟约束。 ⚙️ 两阶段训练:先分别预训练 GMCD 和 MILD,再冻结骨干、注入 LoRA 联合微调到 CVR 目标,让去噪和意图提取互相校准。
📊 实验效果 ✅ 公开集 Taobao 上 AUC 0.8515,比最强基线 DMIN(0.8397)提升明显;Amazon-Electronics 上 AUC 0.8016,比 HSTU(0.7829)高近 2 个点。 ✅ 工业数据集上相对 HSTU:AUC +3.00%,GAUC +1.82%,LogLoss 改善 2.81%。 ✅ 线上 A/B 14 天,GMV 显著提升 +1.13%,已全量到主feed,累计 GMV 增益 +5.13%。 ✅ 诊断实验:NID 下意图漂移比无去噪版本低约 6.5 倍;对弱信号的保真度从普通扩散的 0.44 提升到 0.98。
总结感想:这条路子对工业排序挺有参考价值,核心是用任务监督把去噪和意图捏在一起,而不是各搞各的。落地要注意工程成本:LLM 蒸馏和双阶段训练都不便宜,线上节奏是周级预训练+日级 LoRA 微调,想复现得先把数据管道和资源预算算清楚。还有位置重要性信号的质量很关键,别只盯 AUC。
2. Multimedia Asset Personalization via Multimodal Embeddings at Netflix
- 论文链接:AlphaXiv
- 更新时间:2026-08-18 21:15 UTC
- 机构:Netflix,Cohere
- 工业优先级:强
精读生成失败
(这篇的精读暂时没能生成出来,原因:Expecting value: line 1 column 1 (char 0)。可以先看上面的总结和图表。)
3. OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking
- 论文链接:AlphaXiv
- 更新时间:2026-08-19 06:50 UTC
- 机构:Algorithm, Xiaohongshu,Inference Infra, Xiaohongshu,Training Infra, Xiaohongshu,Xiaohongshu
- 工业优先级:强
一个模型扛起全场景排序,小红书OneModel的工程魔法
各位算法同学们,你们有没有想过,推荐、广告、商家三个场景的排序模型其实可以合并成一个?小红书这篇OneModel直接上线验证,线上广告CTR涨了8.18%,商家GMV也涨了,而且推理延迟还从270ms降到90ms。这篇不是画饼,是已经跑在生产环境里的真东西。
📄 OneModel: A Unified Foundation for Platform-Scale Multi-Scenario Ranking
🔧 技术创新点:第一,把不同场景的异构行为统一映射成共享事件序列,用场景感知投影和结构上下文编码对齐特征空间,让一套模型吃下混合历史。第二,引入Scenario-aware Information Modulation(SAIM),在FFN里加场景条件门控,既共享大部分参数,又能按业务流做通道级调制,缓解跨场景干扰。第三,优化在线serving,用分层用户表示、用户特征预取、共享user-tower计算和图级推理优化,把长序列模型变成可落地的工业方案。
📊 实验效果:离线广告流上,统一训练的OneModel比GenRank的Ads Click AUC高6.4‰,比单独训练的广告模型高3.0‰。线上A/B测试中,Explore Feed的Engagement提升1.25%,Feed Advertising的广告价值提升3.43%,CTR提升8.18%,Merchant Recommendation的DGMV提升1.1867%,GPM提升2.1585%。更关键的是,模型参数从173M涨到230M,但延迟反而砍掉66.7%,这个工程优化是真的狠。
总结一下,OneModel的价值在于证明了多流共享不是牺牲精度换成本,而是能同时提效和降本。对做多场景推荐或者广告排序的同学来说,这套“共享长序列骨干+场景调制+分层用户表示”的框架值得参考,但落地时要盯紧跨场景负迁移和延迟指标,别只看离线AUC。
4. PILOT Technical Report
- 论文链接:AlphaXiv
- 更新时间:2026-08-19 07:35 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:Technical Report, 42 pages, 10 figures
PILOT:推荐调参从被动变主动⚡
各位算法同学们,推荐系统优化还在等指标跌了再调参?这篇工作把LLM agent从“反应式调参工”变成了“主动设计实验的试错官”,还在淘宝5个实验桶上验证了一轮。
📄 PILOT Technical Report
🔧 核心创新一:Experiment Manager。它不再是看到指标波动才动手,而是主动管理整个实验生命周期:任务接入、观察治理、异常恢复、复盘。但每一步都只能从规则生成的合法指令里选,安全和统计边界由确定性服务锁死,LLM不能瞎推理。
🧩 核心创新二:Search Planner。优化不再只做全局调参,而是生成决策树,按用户分群绑定不同策略包,做到人口级别的个性化。候选来自确定性基线、LLM带证据的假设和受限探索三条路,上线前必须过确定性校验。
⚙️ 核心创新三:Memory Curator。实验结算后异步蒸馏,把结果拆成“策略证据”和“方法经验”两个存储。前者只记策略之间的对比结果,后者记录方法来源和置信度生命周期,并用fork-merge隔离任务分支,避免跨任务污染。
📊 线上效果:淘宝首页猜你喜欢,5个实验桶。PILOT最好桶IPV +1.40%,Core IPV +1.60%,成交笔数 +0.96%,成交金额 +1.50%。 📈 对比ROAM(无生命周期治理的自由探索agent),ROAM最好桶是+1.00% / +0.90% / +0.60% / +1.13%,PILOT四项全部更高。 ✅ 搜索效率从53.3%提到93.3%,涨了40个百分点,整个实验周期零人工干预。
这套框架的价值在于把LLM的“判断权”锁进规则笼子,决策树做分群个性化,记忆沉淀形成方法论飞轮。对大流量平台和有成熟AB统计基建的团队,值得盯线上收益的持续性和策略证据的质量;小团队直接复刻成本不低,坑主要在随机化、权限控制和统计校验上。
5. Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
- 论文链接:AlphaXiv
- 更新时间:2026-08-19 12:28 UTC
- 机构:University of Science and Technology of China,Meituan
- 工业优先级:强
- 备注:Accepted at CIKM 2026. 11 pages, 8 figures, and 9 tables
检索之前先想一步?TTP把推理揉进召回✨
各位算法同学们,过去做个性化检索都是把用户历史拼进特征再学个向量,但有没有想过:与其让模型自己从嘈杂行为里猜意图,不如让它先把“这人到底想买啥”推理出来,再拿这个推理结果去检索?今天这篇美团和科大的工作就把这件事做成了端到端,线上订单量还涨了。
📄 Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
🔧 核心创新是把用户历史序列和当前query一起喂给LLM,让它先输出一个
📊 在自建数据集上,TTP在General上Recall@20达到47.52%,比最强的隐式建模基线MAPs高1.76%;在Broad这种模糊query场景,Recall@20比Qwen-Embedding高7.47%,说明它对意图消歧特别有效。 📊 在公有Amazon和KuaiSearch上也是全面领先,Amazon的HR@20到90.17%,KuaiSearch的HR@20到21.94%,都比Decoupled-Stage这种拆成两段的强。 📈 线上A/B测试订单量提升0.46%,虽然数字不大,但检索场景这种量级已经能说明问题了。
总结一下,这个思路适合那些query短、历史行为丰富的电商/本地生活场景。注意点是推理会带来额外延迟,论文里加了长度惩罚来控制输出,落地时得评估线上时延;另外RL阶段的检索奖励依赖SFT模型打分,如果SFT模型本身很拉,奖励信号也不可信,所以先得把第一段训扎实。
