小红书精读:Advancing Model Research in AgentX: Long-Horizon Autonomy for Industrial Recommender Systems
🤖636次实验560次跑赢基线
各位算法同学们,636次改模型的实验里,560次AUC超过业务基线。这不是人工调参刷出来的,是两个Agent自己排实验、自己接着往下排出来的。
📄 Advancing Model Research in AgentX: Long-Horizon Autonomy for Industrial Recommender Systems
🔧 双Agent分工:Research Agent负责跨实验规划,从论文和已有实验结果里写提案并自审;Model Agent负责在业务沙箱里多轮改代码、跑训练、返回代码+测量+未解问题。提案和结果来回交换,一次实验的产出直接变成下一次的起点,不用每次都等人类提需求。
🧩 四种研究动作:Reproduce引入方法,Follow-up精修实现,Composition把不同实验的改动拼起来,这三个跑常规研究;Diagnose则专门针对业务反馈和线上评估暴露的问题取证,比如用PCOC衡量的预测偏差,先拿证据再决定怎么修。
⚙️ 一个依赖感知的历史回放benchmark,473个实验节点、6个环境,用来研究下一个实验该怎么选。
📊 约25天生产观察内完成636次改模型实验,560次AUC高于基线。
📈 最长跑的场景里,77次Follow-up有7次、120次Composition有5次,AUC超过了同一血脉里所有可比祖先。
✅ 最新5次跨业务线上A/B:拉新效率提升10-15%,目标人群广告消耗提升15-20%,观看时长提升0.3-0.8%;观看时长模型的FLOPs和参数量还各少约10%。
🔍 调度上有个反直觉结果:agent已经会分析并选出具体候选时,更复杂的自适应分配没有稳定收益,固定任务类型轮换加agent选候选就够用。
总结:对做推荐模型迭代、想在固定业务沙箱里跑自动化实验的团队有用。要盯的是AUC相对基线的分布和血脉里能不能持续刷新纪录,以及线上那几个百分比能否在别的场景复现。坑有两个:agent只能改模型内部的特征表示、路由、骨干和任务塔,上游特征采集和预测任务定义动不了;另外别急着上花哨的调度器,先把候选选择做扎实。跟Dream-RSI那类历史回放工作比,这篇多出来的是把实验结果回灌成下一个研究问题这一步。
原文:AlphaXiv