小红书精读:Inventory-Grounded Policy-Level Optimization for Training-Free AI Search
库存天天变,AI搜索不训练也能调?📊
各位算法同学们,商品库天天涨跌、改名换类目,固定prompt三天就过期,不微调模型权重也能持续优化AI搜索,你信吗?这篇IGPO要讲的就是这件事:只维护一份人类可读的“策略指南”,让冻结的检索和精排流程学会用实时库存证据做决策。
📄 Inventory-Grounded Policy-Level Optimization for Training-Free AI Search
🔧 先区分“临时缺货”和“搜索没找对”:IGPO把“决策策略”和“商品事实”解耦,学到的是类似“查照片定制时别只搜实物商品,也要查打印服务目录”的指导语,而不是记住某个SKU一定存在。 🧩 在线先把当前库存摸一遍:通过embedding检索构建“库存画像”,包含类别、密度、字段覆盖率和库存变化场景,再把匹配的Policy Guidelines注入检索和精选prompt,让冻结的pipeline能感知今天有什么商品。 ⚙️ 离线用轨迹分组拿对比信号:同一query的多条随机rollout有成功有失败,直接构成对比样本;若全部失败,就启动库存引导的探索,区分“检索路径没走对”和“当前库存根本没有支撑”,只把验证过的结论写回策略库,避免把偶然缺货当成永久事实。
📊 商用智能助手部署后,14天线上A/B测试显示相对CTR提升3.17%。 ✅ 审计bad case数量相对下降38.9%,证明不调权重只调策略也能压低实质错误。 📈 方法被描述为“training-free”,只维护策略指南,不碰模型权重和向量检索器,适合库存频繁变动的早期AI搜索。
总结:这篇对做电商或本地生活AI搜索的同学比较有参考价值,核心启发是把“策略”和“环境事实”分开存;落地时要盯住bad case审计口径和库存画像的时效性,如果库存更新本身就慢,这套探索很容易被虚假缺货误导。
原文:AlphaXiv