推荐算法日报 · 2026-08-15

1 minute read

总览

今天这批 arXiv 选题明显偏工业落地,大部分都在跟真实系统的开销和噪声较劲。最值得细读的是字节的 TM20K 和快手的 DrEM:前者把电商广告序列从 5K 拉到 20K 还能控制训练和延迟成本,用蒸馏加 token 合并就把 20K 压到 2K 附近,并且用实验推翻了目标注意力够用的惯性;后者正视了上游 pxtr 噪声被当干净信号用的问题,从监督和特征两侧做鲁棒化,线上也有效果。多模态 checkpoint 选择那篇也挺有意思,结论是光看验证损失不靠谱,数据可判定性才是前提,但泛化还存疑。Search-R1 那篇的停止判断思路不错,但早停风险近四成,离实用还远。今天优先看 TM20K 和 DrEM 就行。

论文列表

1. Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 08:12 UTC
  • 机构:ByteDance
  • 工业优先级:强
  • 备注:ByteDance 20K Ultra-long Sequence Modeling for Ad E-Commerce Recommendation

电商序列20K,延迟只涨5.6%

各位算法同学们,当你还在为序列长度和算力打架时,字节已经用20K序列上线了:ADSS涨了1.036%,服务延迟只多了5.6%。这篇工作把“教师保留全量token、学生合并token”的蒸馏玩法搬到了电商广告推荐,既吃到了超长序列的红利,又没让训练和serving崩掉。

📄 Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation

🔧 全注意力(FA)替代纯目标注意力(TA),实验显示20K序列下FA比TA的AUC高0.25%,说明序列内部依赖不能只靠target query去抽。 🧩 设计了三种token合并:LITM按商品ID在局部窗口内合并重复交互,PATM对最近10%的token少合并(它们占了约一半注意力),LPTM在Transformer层间逐层减半,把20K压到约2K。 ⚙️ 两阶段蒸馏:教师模型一次性训练完整20K token,学生模型用合并后的token学习,线上部署的是轻量学生,成本几乎不变。

📊 线上A/B:ADSS +1.036%,服务延迟仅+5.6%,训练和serving成本几乎与线上SOTA持平。 📈 离线对比:直接上20K FA会让训练时间变3.5倍、GPU内存+49GB、延迟6.3倍;用TM20K后,学生模型能达到完整20K建模约85%的性能。 ✅ 额外设计:Stack Sequence最多省10GB GPU内存,QK Norm解决了长序列+蒸馏的训练不稳定问题。

这套玩法比单纯换attention结构更实用,适合序列很长但不敢上全注意力的团队。坑在于LITM的窗口T和PATM的分段都要自己调,业务数据分布不同效果会抖;教师模型20K全量训练的资源消耗也不小,得算好账再上。后续落地重点盯AUC和延迟的性价比,别光看指标涨了多少。

图 1(方法 / 架构)

2. DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 03:36 UTC
  • 机构:Shenzhen University,Kuaishou Technology
  • 工业优先级:强

pxtr噪声别慌,DrEM双面修正

各位算法同学们,你信不信,工业推荐里上游多任务模型输出的pxtrs本身带预测噪声,直接拿去当监督和特征,会把排序模型带偏。这篇文章把噪声拆成监督侧和特征侧,用一套共享噪声模型双面修正,离线在线都涨。

📄 DrEM: Dual-Side Robust Ensemble Ranking from Noisy User Preference Predictions in Video Recommendation

🔧 监督侧构造了风险去噪鲁棒损失。核心是估计每个pair的偏好翻转概率,翻转概率大的pair自动加大修正强度,而不是给所有pair一个全局去噪力度。理论证明即使翻转概率估计不准,鲁棒损失的期望风险也严格优于基础pairwise loss。

🧩 特征侧从预测噪声分布里采样扰动,加在pxtr的logit上,再约束扰动前后ranking score保持一致性。但只约束那些扰动前后偏好没翻转的pair,避免和主排序目标冲突。

⚙️ 两侧共享同一个logit空间的加性高斯噪声模型,参数共享,监督侧和特征侧是对齐的,不是各干各的。噪声方差用分桶聚合的probit估计,不依赖额外标注。

📊 在EMER backbone上,不同pxtr任务GAUC几乎全面涨,比如pltr从0.6622到0.6725,pwtr从0.6775到0.6871,pftr从0.6853到0.6965。单侧变体DrEM:S和DrEM:F也有涨,但双侧合起来最稳。

📈 在EASQ backbone上同样涨,pctr从0.6352到0.6376,pftr从0.6804到0.6879。而且baseline像SSM、PSL在EMER和EASQ上的表现不一致,有的还跌,DrEM两个backbone都涨。

✅ 在线A/B测试多个业务指标有显著提升,训练时只多一次带扰动的前向,推理零额外成本。

这套方法适合上游多任务模型和下游排序分离的架构,尤其是pxtrs噪声大的场景。落地时要注意噪声方差的估计质量,分桶太粗可能让矫正强度错位。想刷GAUC的同学可以试试,但先要确认你的pxtrs是不是真的存在可估计的噪声。

图 1(方法 / 架构)

3. Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 14:28 UTC
  • 机构:未披露机构
  • 工业优先级:强

📊 多模态LLM选checkpoint,别只盯平均分

各位算法同学们,多模态LLM训练到后期,候选checkpoint的分数差异可能比评估噪声还小,这时候靠平均分定胜负很容易翻车。这篇工作把checkpoint选择当成不确定性下的稳健决策问题,用多阶段排序和稳定性估计来解决,思路很直接。

📄 Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

🔧 多阶段渐进式排序:先点式打分过滤明显差的,再对剩下的候选做列表式排序,最后用两两对比解决临界情况。高置信度就提前收手,低置信度才增加评估力度,控制成本。 🧩 子采样稳定性估计:对评估集重复子采样,用非参数bootstrap算排名置信度,不假设分数分布,比参数化置信区间更贴合实际评估噪声。 ⚙️ 百分位聚合评分:用P50、P20、P80组合代替均值,惩罚尾部糟糕表现,同时适当奖励高分,避免离群值和模态崩塌干扰选择。

📊 把OCR模糊、不可判读的数据过滤掉后,排名翻转率从32.5%降到11.2%,跨次评估一致性从0.61升到0.84,说明数据可评估性是可靠选择的前提。 📈 列表式排序的Top-1一致性是0.82,点式只有0.38;两两对比进一步到0.89,分数标准差从0.112降到0.018,区分度明显增强。 ✅ 置信度方面,点式P(A>B)只有0.61,列表式0.83,两两对比0.92;换成百分位评分后排序稳定性从0.76提到0.85,最坏情况错误率从18.3%降到11.7%。

这套框架对正在做多模态LLM后期训练的同学很有参考价值,尤其是OCR-heavy场景。坑在于评估数据本身要先做质量清洗,否则排名反复横跳;复现时重点盯子采样置信度和listwise ranking,别迷信验证集loss走势。

图 1(方法 / 架构) 图 2(实验结果)

4. When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 13:42 UTC
  • 机构:未披露机构
  • 工业优先级:中
  • 备注:16 pages, 3 figures. Code: https://github.com/luobostorm/search-r1-s2g-stopping

多轮RAG何时停?结构化裁判省3.7%检索

各位算法同学们,多轮RAG搜到什么时候该停?这篇工作用了一个2B小裁判,让Search-R1少检索77次,EM只掉0.6个点。最反直觉的是:它把停止建模成序列选择,而不是独立状态分类,所以哪怕状态排序变好了,线上策略也可能更差。对做自适应检索的人来说,这个坑必须知道。

📄 When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

🔧 核心创新是把S2G-RAG的结构化“充分性+缺失信息”判断迁移到冻结的Search-R1流程上,只训练一个Qwen3.5-2B的judge,不改reasoner、retriever、搜索预算。 🧩 Judge输出sufficient布尔值和gap_items列表,在线策略只用布尔字段的log-prob margin作为停止信号,结构化目标只用来正则化训练,避免早期误判。 ⚙️ 论文强调停止是轨迹级问题:策略由每条轨迹上第一个阈值交叉决定,状态分类指标再好看,也不代表线上安全,所以必须分开评估reachability、state ranking和first crossing。

📊 在800题的confirmatory测试集上,检索调用从2081降到2004,绝对减少77次,相对降3.70%。 📈 官方EM从0.44875降到0.44250,差值为−0.00625,损失0.625个百分点,95%区间上限是0,落在预先设定的允许损失2个百分点以内。 ✅ 69个early stop里42个安全、27个不安全,unsafe比例39.13%,验证时的STOP precision从0.9091掉到0.6216,说明这个策略远不算安全停止。

这篇真正有价值的地方在于把“省检索”和“省总推理成本”彻底拆开:judge自己也要算计算量,论文只报检索次数减少,没敢报总效率。落地时建议盯EM差值的置信区间和early-stop风险比例,纯看检索降幅容易被误导。对做RAG自适应停止的人是个干净的可复现基线,但想直接上生产还得加校准或风险控制。

5. Doubly Robust Estimation of Causal Effect on CVR with Targeted Regularization

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 16:44 UTC
  • 机构:未披露机构
  • 工业优先级:未标注 图 1(方法 / 架构)

Updated: