推荐算法日报 · 2026-08-13
总览
今天的货不算多,但这一篇MERGE值得好好看。它把工业推荐里item indexing的老问题重新挖了一遍,指出传统VQ在流式、长尾分布下的三个死穴,然后用动态簇生成加层次合并的方式去解,离线指标确实漂亮,余弦相似度从0.6拉到0.9,线上也有正收益,只是幅度不大,而且代价是工程复杂度上来了。整篇读下来,问题分析比方案本身更让我有启发,尤其在生成式推荐还没完全接管检索的当下,这种扎实的工程优化还是很有参考价值的。如果你只打算看一篇,那就选它吧。
论文列表
1. MERGE: Next-Generation Item Indexing Paradigm for Large-Scale Streaming Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-08-11 03:15 UTC
- 机构:Bytedance,National University of Singapore
- 工业优先级:强
- 备注:Accepted by CIKM’26
MERGE:流式推荐索引新范式,彻底告别VQ痛点🔥
各位算法同学们,今天分享一篇来自字节跳动和新国立的工作,针对工业级流式推荐中物品索引的三大痛点提出了新范式MERGE,效果很扎实,值得一读。
📄 MERGE: Next-Generation Item Indexing Paradigm for Large-Scale Streaming Recommendation
🔧 技术创新点:与VQ固定码本不同,MERGE从零动态构建簇,通过相似度阈值判断匹配,未匹配物品用Union-Find生成新簇,低质簇自动回收,适配流式分布漂移。 🧩 实时监控簇占用率,设置underfilled/growing/stable三种状态,自动重置过小簇、约束过大簇,显著改善长尾物品分配不均。 ⚙️ 在细粒度簇基础上做fine-to-coarse合并,用silhouette剪枝并重连,构建层级码本,兼顾检索效率与语义粒度。
📊 实验效果:离线I2C余弦相似度从VQ的0.6提升到0.9,最大簇规模从40k降到17.5k,簇间余弦相似度从0.6降到近0,分离度大幅提升。 📈 线上A/B测试:WatchTime +0.1006%,AAD +0.0081%,AAH +0.0546%,低VV和新鲜内容曝光显著增加,如(1k,5k] VV +11.07%,(2h,12h]新鲜度+7.64%。 ✅ 单路径指标更亮眼:Pass-Through Rate +45.04%,Output Ratio +85.99%,Comment +39.43%,且MERGE只需单30核实例,对比VQ的1000个4核实例,资源消耗大幅降低。
总结:MERGE用生成簇替代匹配簇,本质上是索引范式的转变,离线在线都很能打。落地时需要注意阈值和EMA等超参调优,以及层级构建的复杂度,但在工业场景下收益明显,值得跟进。
