推荐算法日报 · 2026-08-26

1 minute read

总览

今天这批货整体偏工业落地,六篇里有五篇都带着真实系统或亿级数据的痕迹,读起来比纯理论爽快。值得拎出来的主线有两条:一是推荐系统里显式结构正在回归,比如用分布头直接预测观看时长、在trigger推荐里显式建模相关性,都是把业务直觉硬塞进模型结构,而且都拿了线上A/B或大规模离线收益;二是生成式推荐和LLM的落地开始被泼冷水,推理轨迹质量跟推荐效果脱钩、富化元数据只在稀疏场景有效,这两篇建议放在一起读,能帮你省下不少盲目追热点的算力。最值得细读的是那篇观看时长分布建模,坑和诀窍写得非常实,另一个是llm能力发现的缩放曲线,交叉点数据很扎心。今天优先看这两篇,其他的可以扫一眼结论就够了。

论文列表

1. Hierarchical Exponential-Gaussian Mixtures for Watch-Time Distribution Prediction

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 15:06 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:16 pages, 8 figures, 7 tables, accepted at IEEE International Conference on Data Mining (ICDM 2026)

EGMN会崩?HEGM:时长预测更稳了

各位算法同学们,你以为SOTA的时长分布预测模型就稳了吗?这篇论文用大规模复现实验告诉你,EGMN会方差坍缩、组件冗余、还有一堆不干活的分量,排名甚至干不过简单回归。作者基于此提出了HEGM,一个更稳的层次化混合模型,线上A/B测试还涨了9.26%的会话深度。

📄 Hierarchical Exponential-Gaussian Mixtures for Watch-Time Distribution Prediction

🔧 第一点:作者先给EGMN做了个“体检”,发现它在工业规模下容易方差坍缩,也就是某个高斯分量的方差趋近于零,导致NLL很低但预测失真;同时组件冗余和无效分量浪费了模型容量。这些诊断让改进有的放矢。

🧩 第二点:HEGM把时长分布拆成“跳过”和“观看”两个层次,用指数分布建模快速跳过,高斯混合建模真实观看,避免强制高斯偏移,这样结构上更贴合短视频消费行为。

⚙️ 第三点:加入KL方差正则化防止方差坍缩,并用结构化初始化让每个分量一开始就有明确分工,同时去掉了原来的熵正则器,最终在稳定性和可解释性上明显改善。

📊 在KuaiRec和VK-LSVD公共数据集上,HEGM相比EGMN提升了XAUC排序质量和阈值事件预测AUC,点估计MAE/MSE也保持同等水平。

📈 在282M交互的工业数据集上,同样验证了排序和阈值预测优势,混合分量利用率更高,不再有“死分量”。

✅ 线上跑了一个半月的A/B测试,会话深度显著提升+9.26%,且计算开销可接受,代码已开源。

总结一下,这篇的价值在于把EGMN的“暗病”挖了出来,并给出了可复现的修法。如果你是做短视频推荐或时长预测的,值得盯一下XAUC和阈值AUC这两个指标,别只看NLL。坑就是KL正则化和初始化对超参有点敏感,上线前需要多调一调。

2. Cascading Relevance-driven Recommendation Network for CTR Prediction in Trigger-Introduced Recommendation

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 08:33 UTC
  • 机构:未披露机构
  • 工业优先级:强

别再忽略触发品了!CRRN的新解法🎯

💡 各位算法同学们,有没有发现电商里“点进一个商品后,下面推荐一溜相似款”的场景越来越重要?但大多数CTR模型并没有专门建模那个“触发品”和“推荐品”之间的相关性。这篇来自淘宝天猫的论文稳准狠地补上了这个缺口,提出了CRRN,既拿了SOTA还开源了代码,是能直接复现的那种。

📄 Cascading Relevance-driven Recommendation Network for CTR Prediction in Trigger-Introduced Recommendation

⚙️ 技术创新点可以总结成三点: 🧩 Trigger-Target Interaction层:用显式+隐式交叉的门控机制,把触发品和目标品的共线特征(同品牌/同品类/同价位)强化出来。 🔧 Cascading Interest Fusion:先用multi-head attention提取个性化行为兴趣,再级联上触发注意力,并用预测出来的“触发意图”概率和余弦相似度,把即时兴趣和个性化兴趣自适应加权融合。 ⚗️ Category-assisted Pairwise Loss:引入类别相关性,把排序关系变成“点击数且相关 > 点击数不相关 > 曝光且相关 > 曝光不相关”的四层顺序,直接在loss层面教模型看重触发相关性。

📊 实验效果: ✅ 在两个数据集(工业级+公开)上都超过了DIHN、DEI2N等近期SOTA,离线指标全面领先。 📈 线上A/B测试同样验证有效,说明真实点击率上有增量。 🎯 图3揭示同品类触发-目标的平均CTR明显更高,这也是模型重点建模相关性的原因。

✨ 总结感想: 这个框架对做电商推荐、尤其是TIR场景的同学很有参考价值。几个模块都是可插拔的,落地难度不大。不过要注意pairwise loss需要构造四元组,数据量大的时候训练会更重,别盲目堆参。

图 1(方法 / 架构)

3. Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 15:38 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:28 pages, 13 figures, technical report

💥 堆数据不如提密度?用户表征有定律

💥 各位算法同学们,用户行为序列从30天拉到270天,原始数据建模的AUC只涨了1.6个点,而tokenized表示能涨2.5个点,差距不是调参能补的。这篇工作将这个规律总结成“行为稠密定律”,并给出自适应token分配方法,做大规模用户表征的团队值得看看。

📄 Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

🔧 技术创新点: 🔧 提出 User Behavioral Densing Law:在千亿级支付宝数据上验证原始数据扩展撞墙,用理论加实验拟合出最小充分token容量与输入token数的对数尺度近似线性关系,斜率随tokenizer和数据源变化。 🔧 揭示 raw data scaling wall:当把编码器从0.2B扩到0.4B参数时,预训练loss下降但下游AUC几乎不变,说明数据信息密度才是瓶颈。 🔧 设计 ALGN:根据量化残差和表达不确定性给每个样本分配不同长度token,高信息熵行为多给码,低信息熵行为少给码,逼近最小充分容量。

📊 实验效果: 📊 序列长度从30天扩到270天时,tokenized模型AUC从72.28升到74.78,raw模型只从72.36升到73.96,差距从0.08扩大到0.82。 📈 用户量从1000万扩到1亿时,tokenized模型AUC从73.39升到74.56,raw模型从73.47升到73.92,tokenization的提升约是raw的2.6倍。 ✅ 编码器参数从0.2B翻倍到0.4B时,raw数据下下游准确率几乎不变。

💬 总结感想:这个定律对已遇到原始数据扩展收益递减的团队很实用,配置token容量可以直接按数据量推算。但缩放斜率需要用自己的数据源和tokenizer先标定,跨域套用会有偏差;ALGN的可变长度机制会增加工程开销,但换的是容量效率。

图 1(方法 / 架构)

4. Enrich-Retrieve-Rank: Scaling Capability Discovery Beyond In-Context Routing

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 01:21 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:11 pages, 4 figures, and 12 tables

N=7278,LLM选工具崩了?换检索!

📌 各位算法同学们,当注册表里有7278个能力时,让LLM自己看清单选工具的准确率直接从0.85暴跌到0.12,而换一种思路只降到0.39。这篇工作把能力发现重新建模成搜索问题,对做agent平台的人有参考价值。

📄 Enrich-Retrieve-Rank: Scaling Capability Discovery Beyond In-Context Routing

🔧 离线富化:注册时用LLM把稀疏的name和描述改写成结构化profile(摘要、关键词、正反例),一次注册付一次钱,查询时不再调用。🧩 在线两段式:先BM25加向量检索捞top-k,再用LLM rerank打成短列表,全程不对候选做在线invoke,省掉试错成本。⚙️ 拆解指标:把端到端性能拆成检索recall和rerank条件准确率,发现大注册表下约70%的失败来自检索,rerank在规模变大后依然稳坐在0.70到0.87。

📊 从N=10到7278,in-context routing的Match@1从0.85崩到0.12,检索加重排从0.81缓降到0.39。📈 在Nova Micro上,交叉点在N约等于500,小于500直接全量塞上下文反而更划算。✅ 全规模时Match@1比Search&Pick高6.5个百分点,token成本约一半,比Full-Ctx便宜70倍。📉 重排器条件准确率保持在0.70到0.87,说明只要检索能捞到正确项,重排基本能把它放第一。

💡 对工具或Agent注册表超过500的平台,把上下文路由换成检索加重排是明确的升级方向,但别盲目补离线富化——在公共数据集上富化几乎没增益甚至掉点,它只对脏元数据有用。要盯的指标是Match@1和检索recall,下一步大概率得在召回上下功夫。

图 1(方法 / 架构)

5. TSWAP: A Multilingual Retrieval-Augmented Thai Wellness Advisor

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 07:54 UTC
  • 机构:未披露机构
  • 工业优先级:中
  • 备注:8 pages, 2 tables. Data and evaluation logs: https://huggingface.co/datasets/iapp/tswap-wellness-benchmark

8语泰医RAG,零样本但量化有坑

✨ 各位算法同学们,一篇把RAG落地细节写透的论文:八种语言零样本,不微调模型,但一个量化坑直接让泰语变乱码——部署前必看。

📄 TSWAP: A Multilingual Retrieval-Augmented Thai Wellness Advisor

🔧 混合检索:稠密bge-m3加稀疏BM25,RRF融合,top10召回后cross-encoder重排序取3,相似度够高直接跳过重排。 🧩 强制检索路由:第一轮查询分类器把实体查询绑死tool_choice,杜绝模型从参数记忆里编推荐,这是“不微调”也能落地的关键。 ⚙️ 多语言零样本翻译-检索:八种语言共用英文prompt,先把查询翻译成泰语再检索,回答用用户语言,没有语言模板。

📊 发布首个泰医检索基准:50问,Recall@5=0.88,但草药和套餐子集只有0.75,短板明显。 📈 生产QA日志:259例test-retest通过率91.1%;无安全prompt时,模型会给出完整用药剂量表。 ✅ 无知识库时零条可验证推荐,证明检索是唯一可信来源;还发现4-bit AWQ量化会破坏泰语声调符号。

💡 这篇最值钱的是两个可迁移结论:量化要按目标语言校准,安全要靠路由而不是生成后过滤。对做多语言RAG的朋友,尤其是小语种,避坑意义大于技术新意。落地时记得盯泰语变音和紧急路由,别光调向量。

6. The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-24 11:58 UTC
  • 机构:未披露机构
  • 工业优先级:中
  • 备注:Accepted at the Recsys’26 Workshop on Agentic and Generative AI for E-Commerce

推理痕迹变好了,推荐效果反而降了?

各位算法同学们,今天这篇论文给生成式推荐泼了盆冷水:推理痕迹质量上去了,推荐效果反而没动。它用2×2因子实验把物品表示和语义对齐拆开,发现两条路都能让推理痕迹更可解释,但都带不动传统离线推荐指标。

📄 The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness

🔧 首次在共享Qwen3-1.7B骨架下,对语义ID和自然语言标题做受控对比,覆盖三个Amazon商品域。 🧩 把“物品表示”和“语义对齐程度”作为两个独立因子,SID需要额外对齐(对齐税),Title天然有语义,可以分开观察各自贡献。 ⚙️ 同时用SFT和GRPO训练,并引入LLM-as-a-judge的丰富奖励信号,看更高质量推理痕迹能否转化为推荐性能。

📊 显式推理痕迹在SID和Title上都降低了传统离线推荐效果(按用户留一交互评估)。 📈 自然语言标题产生的推理痕迹明显更可解释,但推荐效果没有跟着涨。 ✅ 大规模SID对齐提高了痕迹质量,却不提升排序效果;用LLM judge奖励后,推荐性能才部分恢复。

总结感想:对做生成式推荐的同学,这篇的价值是提醒你别只盯着推理痕迹的可读性,最终离线指标才是硬道理。SID的对齐成本可能白花,不如直接试Title或更丰富的优化目标。要盯的gap是“痕迹质量”和“召回/命中率”之间的脱节,坑在于更“合理”的推理反而可能干扰协同信号。

Updated: