小红书精读:Efficient Clustering with Quality Guardrails for LLM-based Recommender Systems at Industry Scale
聚类加道护栏,LLM推荐成本直降50倍
各位算法同学们,你有没有算过,3800万用户每人跑一次LLM要多少钱、多少天?这篇工作直接用聚类把规模问题变成代表性问题——只对簇代表调用LLM,再把结果传播给簇内其他用户,下游LLM成本和耗时砍掉50倍。关键是它给聚类加了可证明的逐样本护栏,而不是赌“平均相似度还行”。
📄 Efficient Clustering with Quality Guardrails for LLM-based Recommender Systems at Industry Scale
🔧 传统聚类优化的是整体目标,没法保证某个样本和它的簇代表真的像。这篇的SGC采用两阶段:先用Mini-batch K-Means把数据切成初始簇,再在簇内计算两两相似度和属性匹配矩阵,用覆盖最多样本的贪心逻辑选代表,保证任何样本与代表之间相似度高于你设的阈值,且业务关键属性完全相同。 🧩 贪心选代表还有个好处:它天然构造出代表-成员的映射关系,后续LLM只要对代表生成结果,再原样复制给成员即可。相比普通K-Means那种点到质心的关系,这种基于真实样本的代表更方便传播输出。 ⚙️ 它在工程上故意绕开了全量相似度矩阵,只在每个初始簇内部算两两相似度,复杂度可控;另外还支持尾簇裁剪,把少数无法被任何代表满足护栏的样本剔掉,换取更高的压缩比。论文把这个tradeoff讲得很清楚。
✅ 在3800万客户的真实部署中,下游LLM成本和运行时间下降50倍,直接让基于persona的推荐系统从“不可能按时跑完”变成可上线。 📊 在内部和公开数据集上和K-Means、BIRCH、GMM、Star Clustering、SimClus等对比,SGC在保证每个样本与代表相似度不低于阈值的前提下,运行时间大幅领先;多数标准方法在千万级样本已经跑不动,SGC还能扩展。 📈 上线的A/B测试中,推荐系统的收入和用户engagement都有显著提升(论文没给具体数值,但方向很明确)。
这方法最值得借鉴的是把全局质量约束拆成两阶段局部约束,对想规模化上LLM的推荐、搜索团队都有参考价值。落地时要盯两个数:相似度阈值α和裁剪率,α设太低护栏失效,太高又省不了钱;另外属性硬约束可能把样本切碎,业务上要提前想好能容忍多少样本被裁掉。


原文:AlphaXiv