推荐算法日报 · 2026-08-29

1 minute read

总览

今天这批货整体偏工程落地,但有好几篇思路挺有意思。最值得细读的是AstarProRetrieval,前者把大模型放进工业AI的自我演化闭环,用git历史造数据训练模型来提演化方向,成功率直接干翻人类专家;后者把检索重新定义成程序合成,让模型自己编排混合检索,4B模型在benchmark上超过GPT-5.5,说明强化学习在复杂动作空间里真有大用。另外两篇推荐系统文章,一个在大规模社交图上做GNN好友推荐,多哈希embedding和时序采样很实用;另一个用因果模型做增量价值推荐,想法好但落地依赖校准,结论有点软。剩下那篇能源数据采集框架偏诊断工具,跟推荐算法关系不大,可以不花太多时间。今天优先看AstarProRetrieval,会有收获。

论文列表

1. Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-27 15:56 UTC
  • 机构:未披露机构
  • 工业优先级:强

大模型提演化方向,8B小模型反超?

各位算法同学们,通用大模型给工业AI提演化方向的成功率只有0.3071,而一个专门训练的8B模型做到0.6786——这是阿里在Lazada广告系统上跑出来的真实数字。这篇Astar让我看到“AI自己迭代自己”终于不是ppt概念了。

📄 Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

🔧 核心是把“工程师怎么改模型”的历史commits变成训练语料,通过pairwise sample expansion把稀疏监督样本扩成二次数量级,再用噪声过滤清洗掉配置、日志等无关改动。 🧩 模型侧用mid-training + SFT + RL三段式训练,生成演化方向前先输出三级分层hint,一步步收敛搜索空间,而不是在巨大方向空间里瞎猜。 ⚙️ 额外训练一个奖励模型当快速代理评估器,把原本需要几天完整实现-训练-评估的验证变成秒级预测,同时给RL当reward信号。

📊 Astar-8B单次提议成功率0.6786,人类专家0.3229,最强通用LLM 0.3071。 📈 奖励模型预测“这次改动是否有效”的AUC达0.8487,人类专家只有0.6142。 ✅ 在Lazada广告召回模型上闭环跑了两周,连续20次迭代,离线Hitrate@200涨了23.6%;在线A/B测试GMV相对提升4.86%,广告收入提升1.82%。

这个思路对“有大量历史迭代日志”的团队特别有用,核心落地坑是语料清洗和训练成本——如果commit记录本身很脏,光过滤噪音就够喝一壶。要盯的指标不是单次成功率,而是连续迭代能否长期稳定上升;另外这类方法在推荐广告系统之外是否成立,还得看数据基础设施的成熟度。

图 1(方法 / 架构) 图 2(实验结果)

2. Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-27 17:41 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:12 pages, 4 figures, 8 tables; accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026); code: https://github.com/makut/VK-GNN

ID表砍98%,好友推荐线上+16%

🔥 各位算法同学们,一张200GB的ID embedding表,怎么砍到2GB还不掉点?这篇论文给出了一个工业级答案。它把multi-hash和时序采样在1.94亿用户、280亿边的社交图上落地,线上好友添加数+16%。

📄 Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling

🔧 多哈希ID嵌入:每个用户ID映射进共享小表,ID表从>200GB降到2GB,压缩98%+,排序质量几乎不损。 🧩 时序邻居采样:邻接表按时间戳排序存CSR,采样时二分查找定位合法历史前缀,单点复杂度从O(deg+k)降到O(log deg+k),训练吞吐提升约2.5倍。 ⚙️ 端到端训练管线:CPU采样与GPU训练解耦,配合离线embedding刷新,单台8卡机器就能处理225GB图。

📊 离线消融:在1.94亿节点、280亿边上逐项验证multi-hash和时序采样各自贡献。 📈 在线A/B:好友添加数比强基线+16%,独立添加用户数+11.5%。 ✅ ID表从>200GB降到2GB,压缩超过98%,排序质量与全量ID表持平。

💬 个人看法:这工作胜在工程决策,模型本身还是GATv2,网上能抄的细节很多。落地时注意两点:multi-hash要接受哈希碰撞的代价,时序采样要求边时间戳干净,否则剪错历史会带偏邻居分布。

3. Incremental Recommendation via Causal Models

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-27 08:43 UTC
  • 机构:Hologen,Imperial College London, UK,Spotify, Sweden,Spotify, UK 等 6 家机构
  • 工业优先级:强
  • 备注:Accepted at the CONSEQUENCES Workshop @ RecSys’26

🎯因果推荐:砍掉7%无效曝光

各位算法同学们,推荐位是稀缺资源,但很多推荐其实是在“陪跑”——用户本来就会去听。这篇论文直接用因果建模把推荐展示砍掉了7%,消费却没掉,值得琢磨。

📄 Incremental Recommendation via Causal Models

🔧 关键创新:识别出治疗组和holdback组的归因窗口不一致,短窗口vs两天窗口,直接相减算因果效应是错的,于是不用减法改用双阈值。 🧩 把线上多任务推荐模型扩展成Deep Twin Network,加一个holdback头,用已有实验数据训练,不用新采集数据。共享主干同时吃治疗和holdback样本,学到的表征更泛化。 ⚙️ 双阈值策略:只在高治疗概率且低有机概率时才给推荐,精准滤掉那些“你不推他也会听”的always-takers,同时保留能带来增量的推荐。

📊 生产级A/B测试,覆盖数百万Spotify用户,推荐展示量减少7%,推荐内容消费无统计显著下降。 ✅ 联合训练后治疗头的校准比生产基线更好,说明因果模型真的学到了更通用的表征。 📈 关键是holdback数据原本就存在于实验基础设施里,几乎零额外成本。

总结:这个做法适合已有holdback实验体系的大规模推荐系统,小厂没有holdback数据的话得先补这玩意儿。双阈值里那个有机概率阈值是个控制效率-覆盖的旋钮,调太狠可能误伤增量转化,需要离线先标定好。

图 1(方法 / 架构) 图 2(实验结果)

4. ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-27 12:03 UTC
  • 机构:未披露机构
  • 工业优先级:强
  • 备注:15 pages, 5 figures, 6 tables

🔍 检索=写程序?4B模型反超GPT-5.5

各位算法同学们,一个4B模型在混合检索上干翻了GPT-5.5和Claude Opus 4.7,靠的不是更大的模型,而是让模型自己写检索程序。这篇工作把检索从“生成查询”变成了“合成可执行程序”,思路挺清奇。

📄 ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

技术创新点: 🔧 把检索重构成写程序:模型输出一个DSL程序,SQL负责结构化过滤和逻辑组合,向量检索以占位符形式嵌入SQL,天然支持AND/OR/NOT和嵌套子查询,覆盖任意布尔逻辑。 🧩 层次化奖励训练:先用SFT热启动,再用GRPO/DAPO做强化学习,奖励拆成格式、可执行性、结果质量、长度四项,让模型学会编排多个异构后端。 ⚙️ 多模态统一编排:同一个DSL能同时调文本和图像向量检索,SQL的集合代数把候选集融合,超越了RRF和self-querying的固定组合方式。

实验效果: 📊 电商基准上,4B模型Hit@1达到0.81,GPT-5.5只有0.69,Claude Opus 4.7也没打过。 📈 邮件基准上Hit@1 0.91 vs 0.86,同样领先。 ✅ 对比Search-R1、DeepRetrieval、SQL-R1等基线全胜;消融实验显示去掉向量检索后Hit@1从0.809掉到0.650,证明混合DSL的增量很关键。

总结感想:对做RAG或复杂搜索的同学有参考价值:把action space从查询扩展到程序,再用RL直接优化可执行性。落地坑在于构造带结构化字段+语义标注的训练数据不便宜,而且DSL的schema得按领域定制。后续先盯Hit@1和程序可执行率,跟GPT-5.5比已经赢了。

图 1(方法 / 架构) 图 2(实验结果)

5. STREAM: An Objective-Driven and Uncertainty-Aware Framework for Industrial Energy Data Acquisition

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-27 07:50 UTC
  • 机构:未披露机构
  • 工业优先级:中
  • 备注:It has been accepted by Energy Informatics.Academy Conference 2026 (EI.A 2026)

数据能采≠能用?工业数据采集有门道

各位算法同学们,工业数据不是能采到就完事了,采到的数据可能根本没法用。这篇工作提出的STREAM框架,就是为了解决这个坑,把数据采集从“先有数据再找用途”倒过来,逻辑正好相反。

📄 STREAM: An Objective-Driven and Uncertainty-Aware Framework for Industrial Energy Data Acquisition

🔧 核心创新是把数据采集从“先有数据再找用途”倒过来,先明确能源绩效目标,再反推需要哪些变量和精度要求,而不是守着现有传感器凑合用。 🧩 六阶段流程(目标定义→技术要求→资源映射→源提取→元数据归档→数据库迁移)每一步都有具体产物和最小证据门槛,不达标就触发失败动作,返回最早期阶段修正,而不是硬着头皮继续采。 ⚙️ 不确定性评估贯穿全程,分测量、时间、上下文、处理四类,每个变量给出适合/有条件适合/不适合/不可用四档判定,最终输出一个带追溯记录的干净数据集。

📊 在铸造厂感应炉熔炼和奶酪粉干燥两个工业批处理案例中,STREAM成功识别出多个“可访问但不可用”的数据源,验证了数据可访问性不等于分析适用性。 ✅ 通过最小证据门槛和四类不确定性评估,每个变量都得到明确的适用性判定,使得数据能直接用于监控、基准对比和决策支持,同时暴露出基础设施的优先改进点。

这个框架对做工业数据分析或能源管理系统的人有参考价值。落地时要注意,每个阶段的证据门槛必须定得足够具体,否则容易变成走过场;另外元数据模板和不确定性细则需要结合自己工厂的实际情况调整,不能照搬。

Updated: