推荐算法日报 · 2026-09-02
总览
今天这批货工业味很重,几乎每篇都有真实业务场景和线上A/B,比起学术玩具扎实不少。主线有两条:一是把特征交互和Transformer往工业规模推,以SORT最具代表性,通过系统级优化直接干翻DLRM,AliExpress线上数据很硬;二是生成式检索开始进入深水区,GeoGR、ICEGR、SPARC都在SID这条路上往前走,其中GeoGR在导航场景的三个月A/B尤其值得细读。另外SetMIR在解决多兴趣坍缩上做得很干净,和CAMIE一起代表召回侧的新尝试。今天最推荐优先看SORT和GeoGR,一个是排序架构的工程天花板,一个是生成式推荐落地的标杆。
论文列表
1. HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 04:55 UTC
- 机构:Kuaishou Technology,Tsinghua University
- 工业优先级:强
快手HubMixer:用潜在枢纽搞定特征交互
各位算法同学们,你们有没有想过,推荐系统里那么多特征token,直接两两交互其实是又贵又低效的?快手和清华这篇工作提出HubMixer,用一小撮可学习的潜在枢纽来组织交互,参数更少,线上转化率还涨了5.48%。
📄 HubMixer: Progressive Latent Hub Mixing for Parameter-Efficient Feature Interaction in Recommendation
🔧 核心创新是把token交互拆成三个阶段:induction——用少量可学习枢纽(latent hubs)通过cross-attention从所有token里提炼关键信息,相当于先做一次信息压缩。 🧩 第二个阶段是让这些枢纽自己在更干净的低维空间里做高阶交互,绕开直接在异构token空间里两两乱碰的问题,交互的路由更清晰、也更省参数。 ⚙️ 最后用token-conditioned readout,让每个原始token按需从交互过的枢纽里取回全局交互信号,再用残差接回原表示,堆叠多层就能从低阶到高阶渐进细化特征语义。
📊 离线实验里,HubMixer在工业推荐任务上超过了SOTA token-mixing基线,而且参数量更少。 📈 消融实验验证了hub interaction和token-conditioned readout都有效,缺一个都不行。 ✅ 在快手短视频招聘业务上做了线上A/B,简历投递转化率提升5.48%,统计显著,而且已经全量部署到生产环境了。
这个思路对做工业推荐排序的同学很友好,尤其是特征组多且杂的场景。落地时要注意latent hub的数量和维度是个超参,太小装不下信息,太大又退化成自注意力,得拿自己业务数据多调几组。另外线上部署时hub数量不大,推理开销基本可以忽略,值得试。
2. SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 11:00 UTC
- 机构:Alibaba International Digital Commercial Group
- 工业优先级:强
- 备注:CIKM’26
📈 Transformer排序上线:GMV涨8.65%
各位算法同学们,Transformer终于把工业级排序模型的效率和效果同时拉上来了:AliExpress全量部署,在线GMV提升8.65%。这篇工作把高特征稀疏和低标签密度的问题一一拆掉,落地细节里藏了不少工程取舍,适合做推荐排序的同学细读。
📄 SORT: A Systematically Optimized Ranking Transformer for Industrial-scale Recommenders
🔧 请求级样本组织:把同一次请求里的多个候选拼进一条样本,避免重复计算用户序列和画像特征,再配合局部注意力与查询剪枝,直接砍掉长历史序列里与候选无关的注意力开销。
🧩 生成式预训练:先用用户点击序列做下一项预测,给item embedding做预热。这样在稀疏二分类标签之外额外制造监督信号,缓解大参数空间的过拟合。
⚙️ 架构细节也做了系统性改造:tokenization加入特殊token作为特征边界;MHA中引入QKNorm和attention gate稳定训练;FFN替换为稀疏MoE,扩大容量而不显著增加计算。整体也吸收了RMSNorm、RoPE、SwishGLU这类LLM常用设计。
📊 离线实验验证了跨数据规模、模型规模和序列长度的可扩展性,均优于强基线。
📈 在线A/B测试:订单量+7.47%,买家数+6.67%,GMV+8.65%。
⚡ 延迟降低62%,吞吐量提升589%,训练MFU达到45%。
对工业级排序团队,这套路把Transformer的规模化优势真正迁移到推荐场景,但复现门槛不低:请求级样本、生成式预训练、稀疏MoE和推理剪枝需要整套系统工程,单改网络结构很难出同样效果。后续要盯长序列剪枝后的推荐多样性,以及预训练分布偏移后是否需要重训。
3. HeMix: Scaling Industrial Ranking Models with Heterogeneous Token Mixing
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 04:03 UTC
- 机构:AMAP, Alibaba Group
- 工业优先级:强
HeMix:推荐模型1亿到15亿还能涨
各位算法同学们,推荐模型从1亿参数干到15亿,精度还在涨,你猜怎么做的?HeMix没重设计架构,而是把序列token和特征交互全改成异构混合了。
📄 HeMix: Scaling Industrial Ranking Models with Heterogeneous Token Mixing
🔧 Query-Mixed Interest Extraction:用动态查询(来自非序列特征)和固定查询一起对行为序列做注意力,同时抓到上下文相关和上下文无关的兴趣,而且全局序列和实时序列分开建模。 🧩 HeteroMixer块:把自注意力换成“融合-交互-重建”三段式,包括multi-head token fusion、异构token交互、分组对齐重建,实现了线性复杂度下的多粒度特征交互。 ⚙️ 扩展性设计:模型宽度和深度可以独立加,从1亿参数平滑涨到15亿参数,不需要改架构,精度一直涨。
📊 离线在~100M参数量级,比DLRM基线CTR-AUC相对提升+1.64%,同时计算量比最强的对比模型还低。 📈 在线AB测试,GMV +0.88%,PV_CTR +2.74%,UV_CVR +0.84%。 ✅ 参数量从~100M扩到~1500M,性能持续提升,没有掉点。
这套设计对工业级排序团队是个不错的方向,尤其是用固定+动态查询分离长期和实时兴趣,很实用。但实现细节多,group怎么划分、重建怎么对齐得自己调,想直接抄作业怕是要花点时间。
4. CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 05:05 UTC
- 机构:Snap Inc.
- 工业优先级:强
📈一个模型替代三个召回器,CTR和CVR双涨
💡 各位算法同学们,还在同时维护三个I2I召回encoder?Snap这篇CAMIE用一个MLLM统一了多模态、文本和图像检索,线上CVR最高相对提升13%。好奇它怎么让一个checkpoint同时干三种输入的活,往下看。
📄 CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
🔧 用LLM/MLLM做统一骨干,通过原生多模态接口把商品图像和元数据映射到同一个embedding空间,一个checkpoint同时支持多模态、text-only、image-only检索,不需要为每个模态单独训练和建索引。 🧩 从用户journey中挖co-engaged item pairs作为监督信号,用对称in-batch InfoNCE微调,让embedding表示贴近用户实际对比和购买行为,而不是纯靠内容相似度。 ⚙️ 对比实验显示,大部分离线增益来自co-engagement supervision,而不是MLLM骨干本身;但MLLM在text-only检索上带来显著优势。
📊 离线:在Snap DPA测试集上,CAMIE在Recall@10上超过最强的商业多模态embedding模型,且同一个checkpoint做text-only检索,质量损失很小。 📈 线上A/B:替换两个部署的content-based I2I encoder,相比多模态控制,CTR +0.390%、CVR +10.832%;相比文本控制,CTR +18.958%、CVR +13.12%。 ✅ 总体DPA流量:CTR +0.211%、CVR +1.911%,已上线生产。
🤔 这个工作的思路很清爽:不改造模型结构,直接用MLLM当骨干,再用co-engagement行为数据去微调。对工业I2I召回,尤其是多模态/文本/图像统一维护的场景,很有参考价值。盯住离线Recall@10和线上CTR/CVR,跟你们线上现有的基于内容的encoder对比。坑在于co-engagement pair的挖掘和过滤是重活,需要用户行为日志,没有这类数据的小团队落地效果可能打折扣。
5. SetMIR: Multi-Interest Retrieval as Set Prediction
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 05:02 UTC
- 机构:Snap Inc.
- 工业优先级:强
SetMIR:兴趣不塌,召回查询省33%
各位算法同学们,K个兴趣向量练到最后变成1个,这事你遇到过吗?Snap的SetMIR把多兴趣召回当成集合预测来做,用匈牙利匹配做一对一分配,再靠presence score动态决定发几个查询,最后每个请求少发33%的ANN查询,兴趣还不塌。
📄 SetMIR: Multi-Interest Retrieval as Set Prediction
🔧 把多兴趣召回建模成集合预测,K个可学习的query通过transformer decoder解码出K个兴趣embedding,每个embedding还带一个presence score,表示这个兴趣在当前请求下是否激活。
🧩 训练时用匈牙利匹配把目标商品和query做一对一分配,匹配上的query收到检索梯度,没匹配上的query收到显式absence监督,从源头避免兴趣坍缩,不靠辅助正则。
⚙️ 推理时不再固定发K个ANN查询,而是用presence score加query级NMS,只发激活且不冗余的查询,实际查询数每请求平均少1/3。
📊 在Snap DPA数据上,SetMIR在所有指标上超过4个多兴趣召回基线,同时每个请求少发33%的ANN查询。
📈 在DPA生产栈上线后,整体CVR提升3.1%。
✅ 与item-to-item召回源对比,在相同item embedding、ANN索引和检索配额下,SetMIR带来CTR提升44%、CVR提升51%。
如果你们的多兴趣模型已经出现坍缩且查询成本偏高,可以直接拿SetMIR做对比试验;否则先观望,因为它的训练流程比常规多兴趣模型复杂不少,匈牙利匹配和presence head的联调需要一些成本。
6. GeoGR: Enabling Spatio-Temporal Aware Industrial-scale Generative POI Recommendations
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 08:56 UTC
- 机构:AMAP, Alibaba Group
- 工业优先级:强
高德POI生成式推荐,CTR涨5.55%
各位算法同学们,POI推荐还没卷完?高德这篇直接把生成式推荐搬进导航场景,线上CTR涨了5.55%——不是刷点,是跑了三个月的真实A/B。看完你会明白,SID构建的姿势,可能比模型结构更决定上限。
📄 GeoGR: Enabling Spatio-Temporal Aware Industrial-scale Generative POI Recommendations(AMAP, Alibaba Group)
🔧 它首先把地理先验直接焊进SID构建:用地理约束下的共访POI对做对比学习,让跨类别协作关系(比如机场-酒店-停车场)能被显式建模,而不是只靠文本描述猜语义。 🧩 接着用RQ-Kmeans把POI表示离散化成层级SID,再用EM式迭代细化。这套流程让离散ID既紧凑又稳定,长尾POI不至于因为稀疏就学成乱码。 ⚙️ LLM训练也分了两步:先拿文本+SID混合语料做continued pre-training,把“外来token”对齐到底座LLM的语义空间,再做行为序列的SFT,让模型自回归生成目标POI的SID。
📊 离线评测在多个真实数据集上超过现有SOTA基线,不是那种勉强打平。 📈 高德平台线上跑了三个月,服务数百万用户,WINRATE提升2.91%。 ✅ PV_CTR提升5.55%,而且多场景增益一致,说明不是单一流量入口的偶然。
总结一句:这套方案的价值不在于“用LLM做推荐”本身,而是把地理协作信号从特征工程搬到了ID表示层,让生成式模型天生带空间感。落地坑也明显:SID构建和两阶段训练都不便宜,数据稀疏时EM迭代容易不稳。想上车的团队建议先盯离线召回和线上CTR的绝对值,别被相对涨点冲昏头。
7. ICEGR: An Intent-Coherent End-to-End Generative Retrieval Framework for E-commerce Search
- 论文链接:AlphaXiv
- 更新时间:2026-08-30 08:28 UTC
- 机构:未披露机构
- 工业优先级:强
🛒端到端生成式检索把意图焊死在每个环节
各位算法同学们,生成式检索在电商里最大的坑不是模型不够强,而是从语义ID构建到偏好优化,每一步都可能把query意图带偏。这篇WSDM’27的工作把意图一致性焊进GR全链路,离线Recall@20提升21.7%,在线订单量提升15.96%,能直接落地。
📄 ICEGR: An Intent-Coherent End-to-End Generative Retrieval Framework for E-commerce Search
🔧 意图感知的SID构建(IA-SID):不是只用静态内容建ID,而是把query共点击、历史关联query揉进语义ID再离散化。内容不同但满足同一意图的商品(比如口红或项链当情人节礼物)在ID空间里也能靠得近。 🧩 合成查询增强的统一SFT(SQE-SFT):线上日志长尾商品监督稀疏,他们用商品库自动构造多粒度合成query,把“商品记SID”改成“query生成SID”,补足低曝光商品的意图监督,训练和推理输入更一致。 ⚙️ 相关性校准的偏好优化(RCPO):直接拿业务信号做偏好优化会让模型偏向高曝光的商品。RCPO只在语义相关候选内做比较,用行为+业务价值排序,再用pairwise margin控制更新幅度,保住相关性也不耽误商业目标。
📊 离线实验:相比基线,Recall@20相对提升21.7%,NDCG@20相对提升26.6%。 📈 线上A/B测试已部署在百度电商搜索的端到端生成式检索路径上,CTR相对提升3.52%,订单量相对提升15.96%,GMV相对提升7.53%。
✅ 对做电商检索、尤其想上生成式检索但怕长尾商品召不回的同学,这个框架挺适合参考。落地时重点盯合成query的质量和低曝光商品的召回变化,另外三个模块建议一起上,单拆一个收益会明显打折。
8. SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation
- 论文链接:AlphaXiv
- 更新时间:2026-08-31 04:31 UTC
- 机构:Alibaba Group
- 工业优先级:强
🧠 静态SID不够用?先理解再压缩试试
各位算法同学们,生成式推荐里每个历史行为只给一个token,却要装下品类、品牌、价格、行为类型和时间戳,这可能吗?SPARC说可以,而且是在不增加主模型输入长度的前提下。这篇来自阿里,专门解决静态SID放不进动态上下文的问题,思路很值得琢磨。
📄 SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation
🔧 先做字段级上下文建模:把同一字段类型(比如品牌)在用户历史里按顺序建模,得到上下文感知的字段表示,而不是孤立地看待每一次点击或购买。
🧩 再做上下文感知属性路由:综合原始字段、上下文字段和字段身份,把它们路由到固定数量的槽位中,在预算不变的前提下保留互补信息,避免直接压缩造成信息丢失。
⚙️ 最后做跨交互轻量整合:把中间token重新组织成细粒度序列,做轻量级跨交互建模,再把每个历史行为压回单个token喂给生成主模型。整体原则是“先理解再压缩”,不增加主模型输入长度。
📊 在淘宝工业数据集和两个Amazon公开数据集上,SPARC一致优于强常规基线和生成式基线。
📈 和静态压缩变体对比,提升主要来自上下文条件的信息保留,而不是压缩模块本身更强。说明“什么时候该保留什么信息”比“能不能压缩”更关键。
各位算法同学们,这个工作对工业生成式推荐很有参考价值,尤其是那些想往输入里塞更多特征又怕序列太长的场景。落地时要注意:路由槽位数量和字段选择都是超参数,不同业务可能要重新调;前处理模块虽然轻量,但毕竟多了几步,工程上要控制好延迟。
