RecSys 日报 每日自动更新的推荐算法 arXiv 论文日报:从 cs.IR、cs.LG、stat.ML 最近更新中筛选,下载全文后由大模型深度阅读并撰写总览、总结与点评。按日期倒序排列。 2026 年 09 月 25 日 总览今天这四篇没有那种一看就要掀桌子的新范式,但整体成色相当扎实,而且罕见地都愿意把自己的坑讲清楚。主线基本两条:一条是生成式推荐怎么在真实工业约束下落地,另一条是把大家习以为常的中间表示和输出接口拎出来做受控打假。落地这条线上,最值得看的是那篇把 LLM 式序列生成以「加法式升级」滑进成熟排序栈的工作——换回旧配置能精确退化成基线、支持按请求级 fallback、还敢拿两个大流量 surface 的七天在线 A/B 说话,这种工... 阅读全文 → 2026 年 09 月 24 日 总览今天这批论文一眼扫过去几乎全是工业界的落地报告,学术味很淡但可读性反而高,百度、Meta、小红书、快手轮番讲自己线上是怎么改的,真正拿出新模型原语的几乎没有。主线其实就两条:一条是大厂召回排序架构的重构,代表是百度把召回排序合到一个模型里、以及 Meta 用 GPU 精选池加 CPU 大库存的「编排」思路;另一条是用多模态大模型去补冷启和语义短板,小红书造替身 ID、快手把用户口述理由做成排序特征都属这一路。最值得细读的是百度... 阅读全文 → 2026 年 09 月 18 日 总览今天这批货整体成色相当高,工业味浓、负结果报得也实在,读下来最强烈的感受是:序列化建模还在扩张,但它的边界和隐藏成本第一次被讲得这么清楚。主线大致有两条,一条是序列模型继续吃特征工程——LinkedIn 那篇用真刀真枪三个多月的线上 A/B 证明砍掉八成手工特征还能涨,但也坦白 LLM-Ranker 从没打赢过原生产模型、pre-LN 不到位 AUC 直接崩到 0.5;另一条是「谁的收益到底来自哪」这件事开始被认真对待,KDD... 阅读全文 → 2026 年 09 月 17 日 总览今天这批货数量不多但质量挺顶,两篇都是能直接上手抄作业的类型,而且凑巧撞在同一个母题上——到底什么才是真正涨点的东西。快手那篇做低活用户序列增广的,思路我挺买账:别人都在协同信号里卷,它把图文多模态用 Stein kernel 对进统一空间再去做检索,越稀疏的数据集涨得越多,单模态反而掉到基线以下,这个消融基本把故事讲圆了,而且线上数亿用户跑了两周 A/B 已经上主流量,属于少数能拿业务指标背书的工作,不过它用户侧表征就是历史... 阅读全文 → 2026 年 09 月 16 日 总览今天这批论文工业味很重,三篇里两篇是实打实的线上落地复盘,读起来比刷一堆离线刷榜的论文舒服,但别指望有什么颠覆性方法论——本质都是把已有模型和已有调参流程搬到更靠前的链路去解题。一条主线是「试新和复购怎么平衡」,配送场景那篇把序列模型的输出直接降格成单个标量特征喂给 GBDT,再把多目标约束翻译成样本权重和 label smoothing 去搜 Pareto 前沿,最值钱的其实是它自己坦白的那个结论:离线单目标 MRR 涨了,... 阅读全文 → 2026 年 09 月 15 日 总览今天这两篇都是工业推荐的实战派,主线挺清晰:把生成式模型往推荐链路里塞,一篇塞在标题文案这一层,一篇塞在预训练到排序的迁移这一层。第一篇明显是今天最值得细读的,它没空谈「LLM 写标题」,而是把探索和利用拆开,直接用百亿 DAU 级的线上 A/B 数字把话说死了——只有多样性生成不行,只有实时选择器也不行,更妙的是它把 reward hacking 那个坑摆得明明白白:去掉质量约束 CTR 反而涨,说明质量模型是护栏不是发动机... 阅读全文 → 2026 年 09 月 14 日 总览今天这两篇都是很典型的工业界问题,一篇啃超长用户序列怎么塞进排序模型,一篇啃电商 query 到品牌实体的映射,共同点是都没什么花哨的新架构,全靠对场景的理解硬抠工程细节。ChronicleRec 是今天最值得细读的一篇,它接着 VISTA 那套「历史压一次、所有候选复用」的 target-independent 路线往下走,但把 query token 按时间锚点插进序列做因果编码,再配一个 mask-and-predict... 阅读全文 → 2026 年 09 月 13 日 总览今天这批只有两篇,量少但主题出奇地集中,都在啃生成式召回这条线,而且都指向同一个焦虑:生成出来的东西到底能不能信。最值得细读的是那篇电商搜索的 VARG,它不是实验室里的玩具,是天猫搜索真上线的通道,生成候选直接拿预留配额绕过粗排塞进最终排序器,14 天 20% 流量的 A/B 拿到 GMV +1.45%,这个涨幅在电商搜索里相当能打。它真正有意思的地方不在模型结构,而在那套 SID 设计——第三层不靠聚类、直接按经验贝叶斯平... 阅读全文 → 2026 年 09 月 12 日 总览今天这批五篇基本压在两条主线上:一条是想办法把外部信号更聪明地塞进推荐模型,另一条是生成式推荐真正落地时的推理效率。前一条里,联邦推荐那篇和知识图谱自适应融合那篇其实是同源的思路——都在质疑「所有客户端、所有节点一视同仁地聚合」这件事,一个换聚合对象、一个给节点打门控,方向都站得住,但前者涨点普遍只有 1~3 个点、所谓 utility 本质还是重建误差的负梯度,后者的实验数字在正文里根本没给全,读的时候得多留个心眼。P3Re... 阅读全文 → 2026 年 09 月 11 日 总览今天这三篇清一色是工业界的活儿,阿里国际、淘系加计算所、华为各占一篇,读完的整体感觉是没有那种让人拍大腿的新范式,但工程味都很足,真正值得看的是它们怎么把「业务目标」和「系统自己的历史」塞进模型里。主线其实就两条,一条是让模型直接对齐商业结果而不是对齐相关性,SAM-D2Q 把电商搜索的文档扩展做成多模态加 GRPO 偏好对齐,里面有个很关键的观察——布尔检索下对已有词做 TF 重加权毫无意义,扩展器的价值只在于带来新词,所以... 阅读全文 → 2026 年 09 月 10 日 总览今天这批论文的主线非常集中,基本都在围绕「检索」打转:既有电商AI搜索、序列推荐、低比特向量检索这类偏落地的工程活,也有生成式检索的复现纠错和RAG可信框架、证据污染评测这类偏体系和方法论的工作,真正的推荐系统新模型几乎没有,所以做推荐的同学今天可能得靠序列推荐那篇解渴。整体质量中上,但一个共同的毛病是绝大多数只有离线实验,敢拿出线上A/B证据的只有AI搜索那一篇,而纯理论零实验的PAGR也堂而皇之地摆在这儿,读的时候得自己分... 阅读全文 → 2026 年 09 月 09 日 总览今天这批货整体偏工业向,没有太多花哨的新模型,但两篇都踩在真实痛点上前进:一篇是电商互补推荐的落地复盘,另一篇是营销发券场景下的因果纠偏。前者最有意思的不是双塔或Adapter本身,而是他们花力气建ComCat映射,把规则、人工、LLM和统计整合成可更新的目标类目字典,模型和知识解耦,这个工程思路值得借鉴;同时还用线上AB揭示了一个反直觉的结论——纯互补在商品页organic场景打不过混入同类替代品的方案,说明用户要的从来不只... 阅读全文 → 2026 年 09 月 08 日 总览今天这两篇放在一起看挺有意思,一个在工业级超长序列上硬啃效率,一个在LLM推荐规模化上做质量护栏,都属于典型的“工程驱动型”工作,没有花哨理论,但落地价值很实在。ByteDance那篇SequenceO1把100K行为序列端到端跑进排序,用Sketch Attention压缩加缓存命中把成本压到可接受,线上全量还涨了Finish,是那种看完会感叹“工业界就是敢做”的硬结果;另一篇则解决了LLM逐个跑推理扛不住的真实痛点,用带质... 阅读全文 → 2026 年 09 月 07 日 总览今天这批货整体质量在线,两条主线都很清晰:一条是推荐系统结构层面的探索,另一条是电商搜索里生成式召回与对齐的工程化落地。前者那篇 MORE 把多任务信号从塔里搬进 backbone,用 Anchor Tokens 打破 task-blind 的僵局,ablation 里还点出任务隔离比容量更关键,是值得细读的思路型工作;后者那篇 EAGER 深耕 I2Q 场景,两阶段连招和课程学习的设计非常务实,虽然算法创新不强,但胜在把已知... 阅读全文 → 2026 年 09 月 06 日 总览今天这批稿子整体不是那种刷榜刷到爆的“大新闻”,但胜在几条线都比较务实,值得翻一翻。最打动我的是清华和美团的这篇《SelfDR》,它把“推荐任务自己训的reasoner比外部大模型更管用”这个点讲得很透,而且直接解决了LLM推荐线上推理太贵的老大难问题,工程上几乎可以拿来就试。另一条有意思的线是《HypRQ-VAE》,用双曲空间做semantic ID,对长尾item的改善在离线数据上很扎实,说明索引层的改进还是有空间。相比之... 阅读全文 → 2026 年 09 月 05 日 总览今天这批论文的“干货密度”比平时高一点,但真正能直接动手跟进的其实就两篇:美团的 UniCon 和 HUST/阿里的 LLM4AIGQ。前者把 CTR 预测重新组织成上下文单元结构,统一了历史行为和候选的建模,离线 AUC 和线上指标都给出了实打实的提升;后者想用 LLM 代替传统召回-改写链路来做电商引导查询,思路很工程化,但数据量小、依赖外部 teacher,还缺给力数值。另外两篇更像是提醒我们要警惕“实验室自嗨”:SHE... 阅读全文 → 2026 年 09 月 04 日 总览今天这批货整体上以“大模型/Transformer改造工业推荐”为主,从排序到召回再到POI生成都有动作,看着挺过瘾。其中腾讯TGR和字节ReST是重头戏,一个试图用生成范式统一全链路,一个用纯工程手段把序列Transformer塞进50ms排序预算,都值得细读。高德那篇空间感知的生成式POI推荐也很有意思,直接点出地理信息不能只当文本属性,空间感知比堆参数管用。另外有几篇偏评估的方法论论文,特别是语义缓存那篇指出PR-AUC... 阅读全文 → 2026 年 09 月 02 日 总览今天这批货工业味很重,几乎每篇都有真实业务场景和线上A/B,比起学术玩具扎实不少。主线有两条:一是把特征交互和Transformer往工业规模推,以SORT最具代表性,通过系统级优化直接干翻DLRM,AliExpress线上数据很硬;二是生成式检索开始进入深水区,GeoGR、ICEGR、SPARC都在SID这条路上往前走,其中GeoGR在导航场景的三个月A/B尤其值得细读。另外SetMIR在解决多兴趣坍缩上做得很干净,和CAM... 阅读全文 → 2026 年 08 月 29 日 总览今天这批货整体偏工程落地,但有好几篇思路挺有意思。最值得细读的是Astar和ProRetrieval,前者把大模型放进工业AI的自我演化闭环,用git历史造数据训练模型来提演化方向,成功率直接干翻人类专家;后者把检索重新定义成程序合成,让模型自己编排混合检索,4B模型在benchmark上超过GPT-5.5,说明强化学习在复杂动作空间里真有大用。另外两篇推荐系统文章,一个在大规模社交图上做GNN好友推荐,多哈希embeddin... 阅读全文 → 2026 年 08 月 28 日 总览今天的这批货整体质量在线,五篇里能拎出两条主线:一条是工业级系统在真实约束下的‘结构调整’——阿里的DCEO把优化目标从item级对齐到用户级长期价值,TransRetrieval则证明检索阶段Transformer不吃LayerNorm那套、先治特征范数再谈深度,都是工程味很重的务实工作;另一条是LLM在垂直场景的落地试探,Netflix用LLM做封面个性化、OpenSanctions用LLM做实体匹配,都打到接近生产上限,... 阅读全文 → 2026 年 08 月 27 日 总览今天的 arXiv 推荐系统方向信息量不小,三条主线泾渭分明:直播广告里的生成式推荐、电商场景下的多模态表征学习、以及微信工业级多模态 Embedding 的落地报告。最值得细读的是淘宝那篇多模态 CTR 工作,它反直觉地证明端到端训练在强 baseline 上会掉点,然后用「先提纯再投喂」的 Mine-Then-Train 方案把事办了,工程上落地友好且线上效果扎实;快手直播广告那篇也硬核,动态 ID 加意图感知生成,收入提... 阅读全文 → 2026 年 08 月 26 日 总览今天这批货整体偏工业落地,六篇里有五篇都带着真实系统或亿级数据的痕迹,读起来比纯理论爽快。值得拎出来的主线有两条:一是推荐系统里显式结构正在回归,比如用分布头直接预测观看时长、在trigger推荐里显式建模相关性,都是把业务直觉硬塞进模型结构,而且都拿了线上A/B或大规模离线收益;二是生成式推荐和LLM的落地开始被泼冷水,推理轨迹质量跟推荐效果脱钩、富化元数据只在稀疏场景有效,这两篇建议放在一起读,能帮你省下不少盲目追热点的算... 阅读全文 → 2026 年 08 月 23 日 总览今天这批货整体不算惊艳,但两条主线都踩在要害上:一条是临床模型上线后的概念漂移治理,一条是流式专家池的动态决策。前者最值得细读,虽然具体方法有点工程向,但把可审计性和更新范围用结构锁死这个思路很实在,实验也证明约束几乎不伤性能;后者理论味道更重,把’先攒证据再动手’的语义定义清楚了,不过落地时超参敏感和计算成本要掂量。如果你只挑两篇精读,我建议优先看ICU漂移那篇,它把治理问题讲得比技术问题更透;专家池那篇适合对在线学习框架感... 阅读全文 → 2026 年 08 月 22 日 总览今天这批 arXiv 推荐论文整体成色不错,核心火力集中在生成式推荐和序列推荐的基准反思上。浙大和阿里那篇 STAMP 把语义稀释效应讲得很通透,剪枝加多步预测的组合在工业场景下很实用;不过我更建议优先细读 BARGE,它对生成式推荐的结构性缺陷拆解得非常清晰,每个模块都有可验证的收益,线上数据也漂亮。另外 Spotify 那篇探针模型有点泼冷水,直接挑战了 Transformer 在序列推荐里的必要性,以后跑 benchma... 阅读全文 → 2026 年 08 月 21 日 总览今天这批货整体偏工业落地,干货不少,最明显的信号是生成式模型和LLM开始真正往推荐系统里扎,但都不是花架子,全都有线上验证。值得优先细读的是小红书的两篇——GateDiffInt把扩散去噪和意图提取做成闭环,直接戳中噪声和意图互相纠缠的痛点,OneModel则展示了多场景统一排序的完整工程解法,从特征、模型到延迟优化都交代得很实在;Netflix那篇多模态embedding虽然方法不新,但筛选embedding的探针任务和A/... 阅读全文 → 2026 年 08 月 20 日 总览今天这批 arXiv 推荐方向有点东西,但别指望有颠覆性的魔法。最值得读的是两篇生成式推荐:一篇讲整页生成式推荐,用 TUSID 把语义和协同信息揉进物品 ID,配合 list-wise 规划器直接输出有序列表,省掉两阶段,离线涨得猛但线上指标有涨有跌,工程成本和 beam search 开销都得掂量;另一篇是 Snap 把 LLM 真正端到端上线做生成式检索,Recall 翻倍但线上只涨零点几个百分点,而且发现 CPT 学的... 阅读全文 → 2026 年 08 月 19 日 总览今天这批货整体是“工业界味道”很重的一期,大部分工作都来自大厂一线,很多都带着离线实验和线上A/B结果,务实程度比纯学术的刷点要强。有几条值得说的主线:一是把LLM/VLM往推荐系统里嵌,像富媒体重排序、LLM当自动judge,都在探索怎么用生成模型解决传统召回排序的软肋;二是对推荐系统里那些“隐性问题”做显式建模,比如内容过时的双过滤框架、曝光份额预测、模型结构终身学习,这些角度在国内外的技术分享里都很少见。最值得细读的是D... 阅读全文 → 2026 年 08 月 16 日 总览今天这批货不算多,但两条线都挺有嚼头:一条是把对齐从‘事后补课’变成‘从零开始’的Synthetic Persona Pretraining,想法很硬核,实验也扎实,虽然算力门槛高得让人劝退,但至少证明了价值观注入这事越早越好,而且后期补的确实容易被撬开;另一条是Sci-Surf这个学术论文发现系统,真正在解决‘读不完’和‘读不懂’的痛点,把用户画像口头化塞进重排和多模态博客摘要都挺接地气,就是15个人的评估样本太小,效果只能... 阅读全文 → 2026 年 08 月 15 日 总览今天这批 arXiv 选题明显偏工业落地,大部分都在跟真实系统的开销和噪声较劲。最值得细读的是字节的 TM20K 和快手的 DrEM:前者把电商广告序列从 5K 拉到 20K 还能控制训练和延迟成本,用蒸馏加 token 合并就把 20K 压到 2K 附近,并且用实验推翻了目标注意力够用的惯性;后者正视了上游 pxtr 噪声被当干净信号用的问题,从监督和特征两侧做鲁棒化,线上也有效果。多模态 checkpoint 选择那篇也挺... 阅读全文 → 2026 年 08 月 14 日 总览今天这批货整体很硬,几条线都指向同一个主题:别被花哨方法忽悠,先搞清楚它到底在什么条件下、能不能真的带来收益。最值得细读的是第一篇和第三篇,一个用信噪比下限戳穿了’LLM辅助信号可学习’的幻觉,一个用复现揭露了锚点式重排序论文里藏了8个没写的设置,两篇都让人后背发凉。相比之下TimeRoute的时间感知模态路由器设计确实精巧,但扩散重构的成本和收益需要自己掂量。最后一篇数据信任的构想离工业落地太远,可以扫一眼。今天优先看前两篇... 阅读全文 → 2026 年 08 月 13 日 总览今天的货不算多,但这一篇MERGE值得好好看。它把工业推荐里item indexing的老问题重新挖了一遍,指出传统VQ在流式、长尾分布下的三个死穴,然后用动态簇生成加层次合并的方式去解,离线指标确实漂亮,余弦相似度从0.6拉到0.9,线上也有正收益,只是幅度不大,而且代价是工程复杂度上来了。整篇读下来,问题分析比方案本身更让我有启发,尤其在生成式推荐还没完全接管检索的当下,这种扎实的工程优化还是很有参考价值的。如果你只打算看... 阅读全文 → 2026 年 08 月 12 日 总览今天的这批货总体偏工业落地,八篇里有六篇都是大厂实测,Meta、淘宝、快手、Netflix、Yandex全在讲同一个故事:LLM进推荐系统不再是纯炫技,而是开始往线上真正能跑的架构上收敛。最值得细读的是Meta的ConnectionMind和淘宝的MetaStrategy,一个把社交推荐做成LLM路径推理并给出可解释证据,另一个干脆让LLM生成可执行的排序策略来绕过直接产item的集成难题,两者都给出了线上A/B的实在收益。N... 阅读全文 →