推荐算法日报 · 2026-09-10

1 minute read

总览

今天这批论文的主线非常集中,基本都在围绕「检索」打转:既有电商AI搜索、序列推荐、低比特向量检索这类偏落地的工程活,也有生成式检索的复现纠错和RAG可信框架、证据污染评测这类偏体系和方法论的工作,真正的推荐系统新模型几乎没有,所以做推荐的同学今天可能得靠序列推荐那篇解渴。整体质量中上,但一个共同的毛病是绝大多数只有离线实验,敢拿出线上A/B证据的只有AI搜索那一篇,而纯理论零实验的PAGR也堂而皇之地摆在这儿,读的时候得自己分辨清楚哪些是可抄的、哪些只是好看。我个人最推荐细读的是那篇库存感知的无训练AI搜索,它把「策略」和「事实」拆开、用离线rollout构造对比信号这套思路很实用,14天线上CTR涨3.17%、bad case降38.9%是今天最硬的数字,尽管它自家基线偏弱、对检索接口和元数据质量依赖很重。其次是DSI复现那篇,它不算刷分而是来拆台的,指出的docid构建差异和indexing-to-retrieval ratio从32:1改成1:2.8这类细节,能解释一批人复现翻车的原因,做生成式检索前值得先看。序列推荐那篇把长短视图的gap归到模长捷径和attention sink、只微调bias和LayerNorm就能追平全序列,工程性价比很高,但数据集是筛过长序列用户的,短用户和冷启动别太乐观。建议今天优先看AI搜索那篇和DSI复现那篇,一个给落地套路、一个帮你避坑,如果关心RAG的可信边界再补HAE-GEO那个污染基准。

论文列表

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-04 07:10 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:Accepted at the EMNLP 2026 Industry Track

库存天天变,AI搜索不训练也能调?📊

各位算法同学们,商品库天天涨跌、改名换类目,固定prompt三天就过期,不微调模型权重也能持续优化AI搜索,你信吗?这篇IGPO要讲的就是这件事:只维护一份人类可读的“策略指南”,让冻结的检索和精排流程学会用实时库存证据做决策。

📄 Inventory-Grounded Policy-Level Optimization for Training-Free AI Search

🔧 先区分“临时缺货”和“搜索没找对”:IGPO把“决策策略”和“商品事实”解耦,学到的是类似“查照片定制时别只搜实物商品,也要查打印服务目录”的指导语,而不是记住某个SKU一定存在。 🧩 在线先把当前库存摸一遍:通过embedding检索构建“库存画像”,包含类别、密度、字段覆盖率和库存变化场景,再把匹配的Policy Guidelines注入检索和精选prompt,让冻结的pipeline能感知今天有什么商品。 ⚙️ 离线用轨迹分组拿对比信号:同一query的多条随机rollout有成功有失败,直接构成对比样本;若全部失败,就启动库存引导的探索,区分“检索路径没走对”和“当前库存根本没有支撑”,只把验证过的结论写回策略库,避免把偶然缺货当成永久事实。

📊 商用智能助手部署后,14天线上A/B测试显示相对CTR提升3.17%。 ✅ 审计bad case数量相对下降38.9%,证明不调权重只调策略也能压低实质错误。 📈 方法被描述为“training-free”,只维护策略指南,不碰模型权重和向量检索器,适合库存频繁变动的早期AI搜索。

总结:这篇对做电商或本地生活AI搜索的同学比较有参考价值,核心启发是把“策略”和“环境事实”分开存;落地时要盯住bad case审计口径和库存画像的时效性,如果库存更新本身就慢,这套探索很容易被虚假缺货误导。

2. Closing the Long-Short View Gap in Sequential Recommendation without Cached History

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-05 18:33 UTC
  • 机构:Texas A&M University,University of New South Wales
  • 工业优先级:强
  • 备注:Accepted at CIKM 2026

长序列推荐不缓存?两阶段微调搞定

各位算法同学们,如果训练时吃满200个历史交互,线上却只给你最近5个,推荐效果会崩多少?这篇CIKM’26的工作说,不用缓存任何历史状态,只微调bias和LayerNorm就能补回差距,甚至接近带缓存的方法。

📄 Closing the Long-Short View Gap in Sequential Recommendation without Cached History

🔧 第一个创新是揪出dot-product的norm bias:点积把方向和模长缠在一起,而模长在稀疏长序列里会悄悄拟合物品热度,输入一截断就成了错误捷径。改成angular similarity后,只保留方向信息。

🔧 第二个创新是针对softmax的prefix position bias:注意力权重会残余分配到早期前缀位置,短视推理时前缀被砍掉,注意力分布就被打乱。他们用有界softmax(softmax_1)限制这种残余分配。

🔧 第三阶段只微调bias和LayerNorm,不引入任何新参数,用点级对齐+长视模型蒸馏的联合目标,把训练和推理的长度分布差再拉近一截。

📊 在SASRec和HSTU两个骨干上,Taobao、XLong、MovieLens-10M三个数据集测试:短视推理下,两阶段框架超过直接用全序列训练但推理只用短窗的基线。

📈 只做bias/LayerNorm微调后,效果能追平甚至接近需要预先计算和存储每用户KV cache或token memory的方法,但完全不需要存任何历史状态。

📉 冷启动用户(没有缓存状态)也能直接用,因为推理输入就是最近几步交互,不需要外部记忆。

我的判断:这个思路对工业界短期在线推理很实用,省掉了缓存基础设施的维护成本。但要注意,实验里用户序列被截到200或400以上才算“长序列”,真实场景里大多数用户没这么长历史,冷启动增益可能有限。后续可以盯一下在中等长度序列上的表现,以及angular similarity对最终排序指标有没有副作用。

图 1(方法 / 架构)

3. Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-07 09:38 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:10 pages, 2 figures, 6 tables

32字节检索新SOTA,MHR怎么做到的?

各位算法同学们,量化检索码一直有个两难:短码省内存但掉点,长码保效果但费存储。这篇工作直接告诉你,256bit二值码可以同时长出64/128/256三种可检索前缀,32字节下NDCG@10做到0.5561,把同预算最好的baseline甩开3个点以上。

📄 Matryoshka Hash Representations for Model-Aware Compact Semantic Retrieval

🔧 先把全宽码训好,再冻结模型,用零初始化的残差adaptor去组织前缀。这样短码不再拖累长码,规避了直接多宽度联合训练里early bits反复翻转的问题。 🔧 文档端存硬二值码,query端保留连续logits,不对称打分和部署一致,而不是像传统PQ那样两端都量化。 🔧 用FAISS FastScan实现搜索,不需要复杂图索引,flat或IVF都能直接跑,还能无缝接rerank或LEANN这类剪枝图。

📊 MS MARCO上32字节预算:MHR的NDCG@10是0.5561,Recall@100是0.6535,而最强baseline只有0.5239和0.6426。 📈 换到更紧的8字节、16字节预算,优势更明显,说明短码场景下“为排序优化+前缀解耦”确实有用。 ✅ 零样本迁移到7个BEIR数据集,macro平均全部超过对比方法,不是只在源域上自嗨。

我的判断:这个工作适合做向量检索压缩的同学跟进,尤其是RAG里想省显存/内存又不想牺牲召回的场景。落地坑在于Stage II的adaptor是拿logits训的,换底座encoder要重新跑一遍;另外它默认query必须连续,如果部署环境只能存整型query,可能还得做一层量化。想压到32字节以下的朋友,建议先看它和RaBitQ在自家数据上的差距。

图 1(方法 / 架构)

4. REDSI: Addressing the Reproducibility and Evaluation Consistency of Differentiable Search Indexing for Document Retrieval

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-08 15:07 UTC
  • 机构:未披露机构
  • 工业优先级:中

复现DSI难?REDSI:原子ID最优🔧

各位算法同学们,你复现过DSI吗?同一份NQ320K,不同代码跑出来的Hits@1可能差三十个点——这锅不只在调参,更多是数据预处理和标识符实现不一致导致的。这篇REDSI把三种标识符统一了,还在小模型上发现了反直觉结论:原子标识符比想象中能打。

📄 REDSI: Addressing the Reproducibility and Evaluation Consistency of Differentiable Search Indexing for Document Retrieval

🔧 开源了第一个覆盖atomic、naive、semantic三种原始DSI标识符的实现,训练和评估管线统一,不用再各自复现各说各话。 🧩 把NQ320K的构建流程参数化,从NQ到检索语料的清洗、去重、选标题还是页码都能配置,解释了为什么以前各家数据差很多。 ⚙️ 在模型缩小场景下做了系统对比,不只看大模型刷分,还评估了参数效率、训练方式和解码策略,给后续研究提供了新角度。

📊 在论文给出的四种NQ320K重建变体上,T5-Base加atomic标识符的Hits@1为62.0~63.1,而原论文中DSI报告的atomic Hits@1是20.7(数据版本不同不能直接横比,但差距之大确实吓人)。 📈 在MRR@10上,44M参数的atomic模型甚至超过220M参数的naive或semantic模型——小参数反而赢过5倍大的模型,这个结论很反直觉。 ✅ 公平统一条件下,atomic在每个模型规模上都优于naive和semantic,而且训练也更快;之前的DSI复现很少把atomic当主力,这算是一种纠偏。

💭 这篇工作对想做生成式检索的同学来说是一个靠谱的起点,代码和数据都开放,能省掉很多自己踩坑的时间。个人觉得最有价值的判断是:别再默认模型越大越好,原子标识符在小参数区间反而更省更稳。落地时要注意坑:atomic需要往词表里加额外token,动态语料场景要重训;semantic虽然不扩词表但需要聚类预处理,选型前先想清楚自己的数据更新频率。

5. PDMR: Passage-Driven Multi-ID Document Retrieval

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-08 13:58 UTC
  • 机构:Institut de Recherche en Informatique de Toulouse (IRIT)
  • 工业优先级:中

文档只配一个ID?PDMR拆段多ID

各位算法同学们,生成式检索里每个文档只绑定一个标识符,真的是最优解吗?PDMR这篇工作用实验回答:不是,把文档拆成段落、每个段落给一个ID,看起来绕路,反而能提升检索效果。

📄 PDMR: Passage-Driven Multi-ID Document Retrieval

🔧 大多数GR模型假设“一文档一ID”,把多面内容硬塞进一条序列里。PDMR先按语义把长文档切成小段落,再用LLM挑出关键片段,为每个片段生成标题式ID,相当于给文档开了多个访问入口。 🧩 训练时把相关文档的所有段落ID都当作合法目标,用加权多目标损失分散概率质量,消除一对多监督带来的歧义;推理时生成任意一个段落ID就能映射回原文档。 ⚙️ 和MINDER那种多视图描述不同,PDMR不是给整篇文档换花样,而是真正操作段落级语义单元,并且只做一次受约束解码,不额外增加推理开销。

📊 NQ320K上,PDMR在Recall@1和MRR@100上双双超过强生成式与非生成式基线。 📈 MS MARCO Document上,PDMR的Recall@1和MRR@10在报告方法中最高,Recall@10也保持在有竞争力的一档。 ✅ 消融实验显示,段落级监督、TC-ID标识符设计、训练查询增强、多目标学习这四个模块都能带来互补增益。

我觉得这套路适合长文档和弱标注场景,落地时的主要坑是前端的LLM切段和ID构建会引入额外成本,需要控制质量。复现时盯着Recall@1和MRR@10,同时调好多目标损失的权重,防止模型在多个候选ID之间摇摆。

6. PAGR: Proof-Carrying Algebraic-Geometric Retrieval: A Quiver-, Provenance-, and Sheaf-Theoretic Framework for Grounded LLM Retrieval

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-05 14:51 UTC
  • 机构:未披露机构
  • 工业优先级:中
  • 备注:42 pages

几何与逻辑分离的RAG框架PAGR 📐🔍

各位算法同学们,RAG 有个被长期混淆的问题:一条图边到底是“事实”、“推导结果”还是“预测”?PAGR 直接把这三者切开,用数学证明约束检索的边界,这种做法在 RAG 论文里很少见。

📄 PAGR: Proof-Carrying Algebraic-Geometric Retrieval: A Quiver-, Provenance-, and Sheaf-Theoretic Framework for Grounded LLM Retrieval

🔧 核心创新在于把知识来源拆成四个层:符号层用带类型的 quiver 和 Horn 规则决定什么能被证明;代数层把关系映射成线性算子;几何层只负责语义排序和召回;层片层(sheaf)检测局部和全局是否一致。 🔧 关键原则是“认识论分离”:几何可以帮你找证据、排证据,但不能把一条假设提升为被证实的真命题。想被认证,必须走符号规则加 provenance 的可检查证明链路。 🔧 论文还证明了几个硬结论:认证边界对任意替换学习组件都不变;检索分数真正对称的群是等距群,不是更宽泛的基变换群;零 sheaf 能量能推出路径方程成立,说明表示层和一致性层是耦合的。

📊 实验部分属于理论架构分析,没有传统 benchmark 的数字。主要结果是四条命题:非干涉定理说明学到的部分全换掉,认证标准也不变;条件完备界刻画了几何种子召回会漏哪些已认证事实;层上同调区分“某个子图是否一致”和“是否存在任何一致全局结构”;有界互模拟索引能精确判定哪些路径扩展是允许的。 ✅ 另外,zero sheaf energy 的命题把表示层和 sheaf 层绑在一起,避免两套系统各算各的;Mayer-Vietoris 拼接定理保证局部一致性能组装成全局一致性判断。

总的来说,这篇不是给你一个拿来即用的模型,而是一套设计原则。如果你在做知识密集型 RAG,又想严格区分“检索到的相关”和“允许当作事实的”,PAGR 值得吃透;落地时最大的坑是符号规则和 provenance 的工程成本不低,而且它没有给端到端效果数字,想直接对比 SOTA 的话会比较失望。盯住他们对 GraphRAG 的对比方式就明白:改进的不是扩散本身,而是扩散后子图被许可作证的边界。

7. Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning

  • 论文链接:AlphaXiv
  • 更新时间:2026-09-05 11:05 UTC
  • 机构:未披露机构
  • 工业优先级:未标注
  • 备注:36 pages, 9 figures, and 10 tables. Code and benchmark: https://github.com/zhonganbi102-netizen/HAE-GEO

网页投毒分三级,AI搜索代理栽在哪一步

🎯 各位算法同学们,当几个看似独立的网页都在交叉引用同一个不存在的产品,AI搜索代理往往会先采信后验证,而且验证完也不一定翻案。这篇工作提出的HAE-GEO基准,把“暴露→采信→验证→恢复→终答”这条完整路径拆开统计,让你看清agent到底是在哪一道环节上被假证据带走的。

📄 Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning

🔧 把评估粒度从最终答案改成轨迹级:显式追踪暴露、采信、验证、恢复、终答五种状态,能区分是“被假证据骗进去”还是“验证之后没自纠”。 🧩 核心创新是分层投毒机制:同一句假话分别按L1直接断言、L2上下文伪装、L3跨页面交叉印证来包装,控制住虚构品牌和查询,再逐步加难度。 ⚙️ 配套了一个干净与投毒配对的语料库:72,039个真实网页,每个攻击层级再注入770个投毒页面,覆盖8个消费品类、154个品牌,让agent用多轮Search-Scrape真实搜索。

📊 在120条主评测query上跑了10个闭源和开源agent,得出了几个很一致的结论。 📈 agentic搜索确实比静态全上下文检索更能压低最终推荐被污染的比例,也就是说“多找几次”能减少最后翻车。 📉 但是攻击升级到L3表面佐证时,agent的证据识别表现反而比L1更差,看起来来源越互相印证,反而越难被识破。 ✅ 防御性prompt能明显增加验证动作,可验证完后真正改成正确结论的比例依然很低——看得见是坑,还是踩了进去。

💡 对做Agent安全评估的团队,这个基准最有用的地方是定位拦截点:最该关注的指标不是最终acc,而是Verification到Recovery的转化率。实际落地中最大的坑是防御prompt只是让agent“表演验证”,缺乏把验证结果反馈到结论的机制,所以想自救还得靠搜索策略或记忆结构上动刀。

图 1(方法 / 架构) 图 2(实验结果)

Updated: