小红书精读:Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies

less than 1 minute read

自动出价必看:QGA如何跳出次优轨迹🍀

各位算法同学们,离线数据里全是次优轨迹,纯靠模仿学出来的出价策略天花板肉眼可见,但加一个Q值正则就能让生成式模型自己往高价值动作上靠,这种改法你之前可能真没想过。今天这篇KDD工作给了一个很实际的解法。

📄 Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies

🔧 创新点一:在Decision Transformer主干上直接插入Q值正则项,用Double Q-learning训练Critic,让策略同时做行为克隆和动作价值最大化,告别纯模仿的局限。 🔧 创新点二:提出Q值引导的双重探索机制,推理时对多个Return-to-Go目标采样,再对每个候选动作加噪声扰动,最后用Q值筛出最优动作,把OOD探索控制在安全范围。 🔧 创新点三:整体架构比GAVE更紧凑,不需要复杂的多损失函数和大量超参调优,训练成本更友好。

📊 离线实验:在AuctionNet-Sparse上,QGA在50%预算时拿到19.6分,对比GAVE的19.6持平;150%预算时拿到50.1分,比GAVE高出2.7分,比GAS高3.6分。 📈 模拟环境:QGA得分8113,明显超过GAS的7454和CQL的7138,说明在更贴近真实拍卖的动态场景下优势依然在。 ✅ 线上A/B:淘宝直通车场景,日常时段广告GMV提升3.27%,广告ROI提升2.49%;大促时段GMV提升4.70%,ROI提升2.16%,成本增长在可接受范围内。

如果你在做出价策略或者研究离线RL生成式模型,这篇值得跟进。落地时主要盯训练时Q值正则系数α和双探索的采样个数,论文里α=1.0、采样数=3效果最好,不同业务量级可能要重新调。另外要注意Critic在稀疏转化场景下容易估值偏差,上线前最好在模拟环境里多压测几轮。

图 1

图 2

原文:AlphaXiv

Updated: