推荐算法日报 · 2026-09-08

less than 1 minute read

总览

今天这两篇放在一起看挺有意思,一个在工业级超长序列上硬啃效率,一个在LLM推荐规模化上做质量护栏,都属于典型的“工程驱动型”工作,没有花哨理论,但落地价值很实在。ByteDance那篇SequenceO1把100K行为序列端到端跑进排序,用Sketch Attention压缩加缓存命中把成本压到可接受,线上全量还涨了Finish,是那种看完会感叹“工业界就是敢做”的硬结果;另一篇则解决了LLM逐个跑推理扛不住的真实痛点,用带质量约束的聚类把3800万客户分簇处理,成本降50倍的同时还能保证每个用户不被代表带偏,思路比单纯拼加速更值得借鉴。要说最值得细读的,两篇都够格:前者对做超长序列和排序的人有直接参考价值,后者对想上LLM但被延迟和成本卡住的团队几乎是必读。今天优先看这两篇,尤其是工业落地部分,比不少刷榜论文实用多了。

论文列表

1. SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-08 08:49 UTC
  • 机构:ByteDance
  • 工业优先级:强
  • 备注:RecSys’26 Industry Track, accepted as a long oral presentation. Production deployment on Douyin. Topics: industrial recommender systems, sequential recommendation, ultra-long user behavior sequence modeling, long-term user modeling, end-to-end ranking, CTR prediction, efficient attention, sequence compression, user representation caching, and large-scale recommendation systems

100K序列也能端到端建模了?🔥

各位算法同学们,你敢信推荐精排模型能直接端到端吃下10万步用户行为序列?字节这篇SequenceO1已经在抖音全流量跑100K历史建模,核心不是把attention改得花哨,而是把“压缩”和“缓存”塞进同一个框架。做工业推荐或长期行为建模的,重点看它怎么把长序列的边际成本压成常数。

📄 SequenceO1: End-to-End Ultra-Long (100K) Sequence Modeling in Recommendation with Low-Rank Caching

🔧 创新一:Sketch Attention压缩100K历史。用可学习原型加逐原型归一化,把原始序列压成固定大小的用户草图,不依赖当前候选。草图只用用户信息生成,所以训练和推理时可以被反复缓存,成本不跟原始100K长度线性上涨。

🧩 创新二:10K后缀+草图的双时间尺度推理。最近10K走目标条件STCA抓短期兴趣,草图再进一个STCA补长期偏好。压缩后的固定输入还能让端到端目标条件和排序梯度传到长序列分支,不用拆成两段式。

⚙️ 创新三:系统侧低秩缓存。训练用本地KV Cache加多请求user-level batching,让同一用户sketch跨训练实例共享;线上把sketch当可缓存状态,连续请求直接复用,命中后相对原始100K长度的开销是O(1)。配套还写了FlashSA kernel处理ragged batching。

📈 实验数字:100K长度下,训练FLOPs比直接STCA降49.9倍,推理FLOPs降63.9倍,系统收益是真的明显。

📊 质量收益:平均85K历史的ablation里,SequenceO1相对512截断baseline有+1.07% Finish AUC涨幅;直接端到端STCA跑约100K是+1.29%。固定草图大概保留83%的超长序列增益,这个代价挺划算。

✅ 部署状态:已经全流量上线抖音,属于工业级验证。

总结判断:这套做法最聪明的是把长度难题拆成“模型侧压缩”和“系统侧缓存”,让100K的额外代价不再线性增长,比硬堆长度外推要稳。落地主要卡在工程:本地缓存、用户级batching和融合kernel都得自己造,小团队硬上会很吃力。真正要盯的是缓存命中率,还有草图相比全量100K到底留下多少涨点,直接决定值不值得跟。

2. Efficient Clustering with Quality Guardrails for LLM-based Recommender Systems at Industry Scale

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-03 18:12 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:V1 accepted at High Dimensional Learning Dynamics workshop, ICML 2026 (non-archival), V2 accepted at The Third Workshop on Agentic and Generative AI for E-Commerce, RecSys 2026 (non-archival)

聚类加道护栏,LLM推荐成本直降50倍

各位算法同学们,你有没有算过,3800万用户每人跑一次LLM要多少钱、多少天?这篇工作直接用聚类把规模问题变成代表性问题——只对簇代表调用LLM,再把结果传播给簇内其他用户,下游LLM成本和耗时砍掉50倍。关键是它给聚类加了可证明的逐样本护栏,而不是赌“平均相似度还行”。

📄 Efficient Clustering with Quality Guardrails for LLM-based Recommender Systems at Industry Scale

🔧 传统聚类优化的是整体目标,没法保证某个样本和它的簇代表真的像。这篇的SGC采用两阶段:先用Mini-batch K-Means把数据切成初始簇,再在簇内计算两两相似度和属性匹配矩阵,用覆盖最多样本的贪心逻辑选代表,保证任何样本与代表之间相似度高于你设的阈值,且业务关键属性完全相同。 🧩 贪心选代表还有个好处:它天然构造出代表-成员的映射关系,后续LLM只要对代表生成结果,再原样复制给成员即可。相比普通K-Means那种点到质心的关系,这种基于真实样本的代表更方便传播输出。 ⚙️ 它在工程上故意绕开了全量相似度矩阵,只在每个初始簇内部算两两相似度,复杂度可控;另外还支持尾簇裁剪,把少数无法被任何代表满足护栏的样本剔掉,换取更高的压缩比。论文把这个tradeoff讲得很清楚。

✅ 在3800万客户的真实部署中,下游LLM成本和运行时间下降50倍,直接让基于persona的推荐系统从“不可能按时跑完”变成可上线。 📊 在内部和公开数据集上和K-Means、BIRCH、GMM、Star Clustering、SimClus等对比,SGC在保证每个样本与代表相似度不低于阈值的前提下,运行时间大幅领先;多数标准方法在千万级样本已经跑不动,SGC还能扩展。 📈 上线的A/B测试中,推荐系统的收入和用户engagement都有显著提升(论文没给具体数值,但方向很明确)。

这方法最值得借鉴的是把全局质量约束拆成两阶段局部约束,对想规模化上LLM的推荐、搜索团队都有参考价值。落地时要盯两个数:相似度阈值α和裁剪率,α设太低护栏失效,太高又省不了钱;另外属性硬约束可能把样本切碎,业务上要提前想好能容忍多少样本被裁掉。

图 1(方法 / 架构) 图 2(实验结果)

Updated: