推荐算法日报 · 2026-08-12
总览
今天的这批货总体偏工业落地,八篇里有六篇都是大厂实测,Meta、淘宝、快手、Netflix、Yandex全在讲同一个故事:LLM进推荐系统不再是纯炫技,而是开始往线上真正能跑的架构上收敛。最值得细读的是Meta的ConnectionMind和淘宝的MetaStrategy,一个把社交推荐做成LLM路径推理并给出可解释证据,另一个干脆让LLM生成可执行的排序策略来绕过直接产item的集成难题,两者都给出了线上A/B的实在收益。Netflix的GenRec和Yandex的Sona也值得翻翻,一个证明prefill-only的判别式打分就够用,一个用生成式模型端到端干掉了多级联系统,虽然场景特殊但思路很开脑洞。整体感觉这波LLM推荐已经过了‘能不能用’的阶段,大家都在拼怎么用最小的成本塞进现有管道里,同时还得守住可解释性和线上稳定性。今天优先看ConnectionMind和MetaStrategy,尤其是对做工业推荐的同学,这两篇的工程细节和踩坑记录比刷点数的论文值钱得多。
论文列表
1. ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta {: #note-1}
- 论文链接:AlphaXiv
- 更新时间:2026-08-10 20:02 UTC
- 机构:Michigan State University,Meta Platforms, Inc.
- 工业优先级:强
✨ Meta新作:社交网络+LLM做推荐
各位算法同学们,今天分享一篇Meta发表的推荐系统论文:ConnectionMind。它把社交网络结构和LLM结合起来,把推荐建模成图上的路径推理,既带了社交信号,又能解释推荐理由,非常值得读。
📄 ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta
🔧 第一个创新是把推荐变成异构图上的路径发现:用户、好友、群组、创作者和内容都作为节点,LLM策略在多跳路径上做选择,而不是把所有邻居压成embedding。 🧩 第二个创新是两阶段训练:先用SFT在历史交互轨迹上让模型学会合法的图游走,再用强化学习(GRPO)端到端优化推荐质量,奖励里同时考虑了格式、推荐F1和逐步路径一致性。 ⚙️ 第三个创新是生产部署的教师-学生混合推理:最活跃的5-10%用户走完整LLM推理,其余流量由一个离线蒸馏的轻量GNN学生模型模拟,延迟降到毫秒级。
📊 在公共数据集Delicious和Foursquare上,8B模型Recall@5达到0.0631,Foursquare上Recall@10达到0.0966,都超过所有传统社交推荐基线。 📈 离线对比Meta生产GNN基线,Recall@10相对提升88%;对比70B纯LLM排序也明显更优。 ✅ 线上A/B测试覆盖数千万用户、持续多周,视频曝光+0.33%,观看时长+0.43%,视频会话+0.22%,全部统计显著。
总结:这个思路把LLM的推理能力用在了社交图谱上,方向很扎实。落地瓶颈主要是生成延迟,蒸馏方案很务实。值得跟进,但别期待线上收益是数量级提升,成熟系统里零点几个百分点已经很值了。

2. MetaStrategy: Generative Ranking with Executable LLM Strategies {: #note-2}
- 论文链接:AlphaXiv
- 更新时间:2026-08-10 11:16 UTC
- 机构:Taobao & Tmall Group of Alibaba,Wuhan University,The University of Hong Kong,University of Cambridge
- 工业优先级:强
生成式排序新招:LLM输出可执行策略
各位算法同学们,今天分享一篇来自淘宝首页猜你喜欢的生成式排序论文,核心思路是不让LLM直接输出商品序列,而是生成一份可执行的排序策略,让生产排程器来执行,这样既能用上LLM的联合决策能力,又不破坏现有系统的规则和护栏。
📄 MetaStrategy: Generative Ranking with Executable LLM Strategies
🔧 策略生成而非物品生成:LLM根据请求上下文输出一个类型化的JSON策略包,控制目标权重、内容偏好、体验约束和位置策略,再由确定性验证器和编译器接入现有排序模块。 🧩 Generator-Evaluator架构:LLM控制一个独立的生成器,与约十个生产生成器在列表级评估器下原子竞争,保证可验证、可回退,不干扰主线。 ⚙️ 训练方法:自竞争课程把高频策略变成下一轮对手,缓解奖励崩塌;评估器路由的在线蒸馏把多个4B教师的最佳输出压缩到0.8B学生,且保留GE奖励信号。
📊 离线replay中,Routed OPD(0.8B)学生选择率16.24%,增量GE提升0.73%,有效性98.03%,超过4B模型。 📈 在线7天A/B测试中,MetaStrategy赢得27.93%的GE调用。 ✅ 点击PV提升2.11%,IPV提升3.12%,交易额提升2.83%,且无RT增加。
💡 总结感想:这个思路很务实,把LLM放在策略层而不是列表生成层,落地阻力小,也更容易对齐业务指标。值得关注的是他们用近线生成和蒸馏解决了成本问题,坑可能在于策略空间的构造和评估器偏差,需要持续监控。

3. UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking {: #note-3}
- 论文链接:AlphaXiv
- 更新时间:2026-08-11 03:42 UTC
- 机构:Taobao & \& Tmall Group of Alibaba
- 工业优先级:强
- 备注:Accepted at CIKM 2026
🔧 数据模型协同缩放,搜索排序新高度
各位算法同学们,今天聊一篇来自淘宝的搜索排序论文。它把数据和模型放在一起缩放,而不是只堆参数,离线在线都涨得很明显,值得一看。
📄 UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking
🔧 核心思想是数据与架构协同设计。纯参数缩放会边际收益递减,问题其实出在数据上,所以要同时扩数据和改模型。 🔧 数据侧提出ES³,做全域样本扩展:域内加入未曝光样本并设计分层标签归属,把跨域反馈补到搜索样本上;跨域则把非搜索交互改造成带伪查询的搜索样式样本,样本量能放大5倍。 🔧 模型侧提出HHSFT,用异构分层特征交互处理复杂特征分布,再用全域用户兴趣融合做跨域知识迁移,避免直接混数据带来的负迁移。
📊 在淘宝几十亿样本上,HHSFT+ES³比基础MLP模型AUC提升1.14%,GAUC提升0.86%,模型参数300M,TFLOPs只有1.22。 📈 线上A/B测试10天,购买转化提升1.70%,GMV提升2.04%,统计显著。 ✅ 有意思的是,同样扩数据,标准backbone会掉0.43% AUC,但配合HHSFT能涨0.32%,说明架构必须跟着数据一起设计。
整体感觉落地性强,ES³只在训练时加开销,线上推理零成本。但要注意跨域样本的负迁移,直接拼数据会翻车,DREF和DAPGA这两个模块是收益关键,值得细读。

4. Sona Technical Report {: #note-4}
- 论文链接:AlphaXiv
- 更新时间:2026-08-11 14:58 UTC
- 机构:未披露机构
- 工业优先级:强
🔥单模型生成式推荐:替代整个级联
各位算法同学们,今天分享一篇来自Yandex Music的技术报告,讲的是用单个生成式推荐模型直接替代生产环境里的整套多阶段推荐级联,在线效果还显著提升。
📄 Sona Technical Report
🔧 单模型统一生成与排序:encoder把用户行为序列编码为共享隐状态,decoder做候选生成,Ranking Module做排序,一次前向搞定两件事。 🧩 完全去手工特征:模型和teacher只靠日志事件字段和学到的Semantic ID,不再需要几百维人工特征,连大transformer的信号都省了。 ⚙️ 联合训练与蒸馏:next-token prediction和teacher蒸馏共同更新encoder,teacher只在训练时提供排序目标,serving时只部署单模型。
📊 在线A/B实验中,Sona替换了包含15+候选生成器的整个生产级联,Active Users提升4.53%。 📈 Total Listening Time提升6.30%。 ✅ Likes提升11.42%,且Active Users增量是此前最强模型Argus的2.35倍。
我的感觉是,这篇工作把生成式推荐从离线可行性推到了线上可部署的程度,纯事件输入也能打。落地时可能要注意history compression和teacher规模带来的训练成本,以及线上模型更新频率,这些细节决定了它能不能在自家场景复现。

5. PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation {: #note-5}
- 论文链接:AlphaXiv
- 更新时间:2026-08-08 07:56 UTC
- 机构:Kuaishou Technology, Beijing, China
- 工业优先级:强
PushDualGen:生成式推荐也能讲清理由
各位算法同学们,今天聊一篇快手发表在工业推荐上的工作:用轻量级生成模型同时输出语义ID和可跳过解释,既保住效果又让推荐逻辑可追溯,已在快手推送场景全量上线。
📄 PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation
🔧 核心创新之一是并行语义ID,用多个独立的embedding slot做量化,避免传统残差量化层层累积误差,长行为序列能被压成更紧凑离散序列。
🧩 第二个创新是双生成目标,先生成SID再生成一段可跳过的解释文案,解释不是硬性推理链,线上可以只跑SID,解释按需生成,兼顾可解释性和推理开销。
⚙️ 第三个是表示融合,把生成模型产出的Top-20 SID编码后与用户特征加权融合,再走ANN检索,让生成信号补全点击行为之外的用户兴趣。
📊 线上A/B测试覆盖1.5亿用户,有效播放率相对提升8.50%,不满率相对下降37.70%。
📈 点击PV相对提升0.43%,DAU相对提升0.05%,说明推送吸引力和用户留存都有正收益。
✅ 消融实验显示SID适配阶段贡献最大,去掉后Pass@1从0.335降到0.319,并行SID和多token绑定也都有正向提升。
总体来说,PushDualGen把“可解释性”做成了可选附件,落地代价小,非常适合工业推送这类高吞吐、低延迟场景。不过论文里LLM用的是0.6B小模型,效果和更大模型之间的差距没细聊,想迁移到别的场景可能需要重新调SID的码本和融合权重,这块坑应该不少。

6. GenRec: An LLM-Backed Recommendation Ranker at Netflix {: #note-6}
- 论文链接:AlphaXiv
- 更新时间:2026-08-10 21:43 UTC
- 机构:Netflix,Amazon
- 工业优先级:强
- 备注:9 pages
Netflix的LLM排序器有点强
各位算法同学们,这篇论文讲的是Netflix把推荐排序器整体换成了大语言模型,用自然语言直接表示用户历史、物品和上下文,而且在大规模A/B测试里真的打败了线上跑了很多年的传统排序模型,值得细读。
📄 GenRec: An LLM-Backed Recommendation Ranker at Netflix
🔧 技术创新点:把手工构造的几千个特征交互直接丢掉,改为对用户行为和上下文做“语言化”描述,让模型自己看到原始文字,创新点在于“上下文工程”。 🧩 两阶段训练框架:第一阶段用Netflix自有数据继续预训练基础LLM,建立用户和内容理解能力;第二阶段用排序专用的数据、标签和奖励信号做后训练,两者分工明确,更新节奏也解耦。 ⚙️ 在生成式LLM上加了目录感知的打分头,一次前向就能给整个目录打分,配合prefill-only推理,不需要逐token生成,服务端成本可控;还把多路奖励信号用加权排序损失融进训练。
📊 离线效果:只用了生产模型约1/40的Phase-2标注样本和更少输入信号,离线MRR相对提升约1.6%,说明数据效率确实高。 ✅ 线上效果:约10%流量跑4周,短期首页参与度和长期核心指标都达到统计显著提升,长期核心指标相对提升约0.006%,别小看这个数,Netflix体量下已经算赢。 📈 成本控制:通过事件筛选和压缩,把输入上下文从约5000 token减到约1700 token,离线指标几乎没有掉,推理成本直接降到原来的约1/3。
个人觉得这篇的工程参考价值很大,它证明了LLM排序器在真实工业场景里是能落地的,不是只能发paper。最难的部分其实是上下文设计和成本权衡,但论文给出了很具体的操作路径,跟着做一遍应该能少踩不少坑。

7. DREAM Technical Report {: #note-7}
- 论文链接:AlphaXiv
- 更新时间:2026-08-11 09:30 UTC
- 机构:未披露机构
- 工业优先级:强
- 备注:Technical Report
🔥手淘推荐新范式:DREAM智能调控
各位算法同学们,今天分享一篇来自淘宝首页feed的论文,讲的是如何用智能体方法给现有推荐管线加一层自主优化控制,不替换模型就能带来显著的业务指标提升,工业落地的参考价值很高。
📄 DREAM Technical Report
🔧 三层Intent Engine:把设备端行为信号融合成L0/L1/L2结构化意图,边云触发链只上报约8.7%的行为,既能实时感知意图变化,又能控住成本。 🧩 Meta Engine分层推理:由MetaModel按M1→M2→M3逐层做意图总结、策略规划和参数翻译,再通过带安全护栏的统一出口下发到重排、精排等模块。 ⚙️ Reward Dual Loop:离线模拟做策略空间探索,在线反馈校准真实效果,形成“生成-执行-评估-经验积累”的持续闭环。
📊 仅控制重排阶段,IPV提升2.06%,Core IPV提升2.39%,GMV提升0.88%。 📈 将控制扩展到精排阶段后,增益进一步提升到IPV +2.71%、Core IPV +3.06%、GMV +1.31%。 ✅ PV提升始终超过1%,全程无需替换现有管线模型,也不牺牲服务稳定性。
DREAM的核心思路是给已有管线叠加一个“可感知、可编排、可审计”的策略控制层,工程侵入性小,效果又很扎实。不过离线模拟和在线反馈的双闭环依赖较强的基础设施,小团队直接照搬会有一定门槛,值得关注它后续的轻量化方案。

8. IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation {: #note-8}
- 论文链接:AlphaXiv
- 更新时间:2026-08-10 14:13 UTC
- 机构:未披露机构
- 工业优先级:强
IntHQ:破解多任务生成推荐的三种崩溃
各位算法同学们,这篇论文提出了 IntHQ,一个把多任务学习融入生成式推荐的新框架,专门解决现有模型在三层语义上的信息崩塌问题。从工业落地到理论分析都很扎实,值得一读。
📄 IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation
🔧 双流解耦(DSD):任务 token 从底层就开始分叉,与共享上下文流完全隔离,避免任务信号被稀释。 🧩 任务交互建模(TIM):用注意力机制显式建模任务之间的依赖,替代固定漏斗,依赖强度随输入自适应。 ⚙️ 分层查询(HQ):每个任务通过深度注意力从不同层聚合多尺度特征,训练阶段也能动态调整最优点。
📊 离线实验在 163M 用户、4.1B 交互的 IntTravel 数据集上,IntHQ 在四种任务头配置下均取得最佳指标。 📈 在线部署在高德地图,覆盖数亿用户,UVCTR 相对提升 1.60%。 ✅ 服务峰值 30k QPS,平均推理延迟仅 40ms,99% 延迟 100ms,工业落地友好。
个人觉得这工作把生成式推荐的多任务问题拆解得很清晰,双流设计值得借鉴。不过训练时需要构造任务 token 序列,工程复杂度不低,小团队可能要权衡成本。
