小红书精读:PILOT Technical Report

less than 1 minute read

PILOT:推荐调参从被动变主动⚡

各位算法同学们,推荐系统优化还在等指标跌了再调参?这篇工作把LLM agent从“反应式调参工”变成了“主动设计实验的试错官”,还在淘宝5个实验桶上验证了一轮。

📄 PILOT Technical Report

🔧 核心创新一:Experiment Manager。它不再是看到指标波动才动手,而是主动管理整个实验生命周期:任务接入、观察治理、异常恢复、复盘。但每一步都只能从规则生成的合法指令里选,安全和统计边界由确定性服务锁死,LLM不能瞎推理。

🧩 核心创新二:Search Planner。优化不再只做全局调参,而是生成决策树,按用户分群绑定不同策略包,做到人口级别的个性化。候选来自确定性基线、LLM带证据的假设和受限探索三条路,上线前必须过确定性校验。

⚙️ 核心创新三:Memory Curator。实验结算后异步蒸馏,把结果拆成“策略证据”和“方法经验”两个存储。前者只记策略之间的对比结果,后者记录方法来源和置信度生命周期,并用fork-merge隔离任务分支,避免跨任务污染。

📊 线上效果:淘宝首页猜你喜欢,5个实验桶。PILOT最好桶IPV +1.40%,Core IPV +1.60%,成交笔数 +0.96%,成交金额 +1.50%。 📈 对比ROAM(无生命周期治理的自由探索agent),ROAM最好桶是+1.00% / +0.90% / +0.60% / +1.13%,PILOT四项全部更高。 ✅ 搜索效率从53.3%提到93.3%,涨了40个百分点,整个实验周期零人工干预。

这套框架的价值在于把LLM的“判断权”锁进规则笼子,决策树做分群个性化,记忆沉淀形成方法论飞轮。对大流量平台和有成熟AB统计基建的团队,值得盯线上收益的持续性和策略证据的质量;小团队直接复刻成本不低,坑主要在随机化、权限控制和统计校验上。

图 1

图 2

原文:AlphaXiv

Updated: