小红书精读:MERGE: Next-Generation Item Indexing Paradigm for Large-Scale Streaming Recommendation
MERGE:流式推荐索引新范式,彻底告别VQ痛点🔥
各位算法同学们,今天分享一篇来自字节跳动和新国立的工作,针对工业级流式推荐中物品索引的三大痛点提出了新范式MERGE,效果很扎实,值得一读。
📄 MERGE: Next-Generation Item Indexing Paradigm for Large-Scale Streaming Recommendation
🔧 技术创新点:与VQ固定码本不同,MERGE从零动态构建簇,通过相似度阈值判断匹配,未匹配物品用Union-Find生成新簇,低质簇自动回收,适配流式分布漂移。 🧩 实时监控簇占用率,设置underfilled/growing/stable三种状态,自动重置过小簇、约束过大簇,显著改善长尾物品分配不均。 ⚙️ 在细粒度簇基础上做fine-to-coarse合并,用silhouette剪枝并重连,构建层级码本,兼顾检索效率与语义粒度。
📊 实验效果:离线I2C余弦相似度从VQ的0.6提升到0.9,最大簇规模从40k降到17.5k,簇间余弦相似度从0.6降到近0,分离度大幅提升。 📈 线上A/B测试:WatchTime +0.1006%,AAD +0.0081%,AAH +0.0546%,低VV和新鲜内容曝光显著增加,如(1k,5k] VV +11.07%,(2h,12h]新鲜度+7.64%。 ✅ 单路径指标更亮眼:Pass-Through Rate +45.04%,Output Ratio +85.99%,Comment +39.43%,且MERGE只需单30核实例,对比VQ的1000个4核实例,资源消耗大幅降低。
总结:MERGE用生成簇替代匹配簇,本质上是索引范式的转变,离线在线都很能打。落地时需要注意阈值和EMA等超参调优,以及层级构建的复杂度,但在工业场景下收益明显,值得跟进。


原文:AlphaXiv