小红书精读:Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

less than 1 minute read

大模型提演化方向,8B小模型反超?

各位算法同学们,通用大模型给工业AI提演化方向的成功率只有0.3071,而一个专门训练的8B模型做到0.6786——这是阿里在Lazada广告系统上跑出来的真实数字。这篇Astar让我看到“AI自己迭代自己”终于不是ppt概念了。

📄 Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

🔧 核心是把“工程师怎么改模型”的历史commits变成训练语料,通过pairwise sample expansion把稀疏监督样本扩成二次数量级,再用噪声过滤清洗掉配置、日志等无关改动。 🧩 模型侧用mid-training + SFT + RL三段式训练,生成演化方向前先输出三级分层hint,一步步收敛搜索空间,而不是在巨大方向空间里瞎猜。 ⚙️ 额外训练一个奖励模型当快速代理评估器,把原本需要几天完整实现-训练-评估的验证变成秒级预测,同时给RL当reward信号。

📊 Astar-8B单次提议成功率0.6786,人类专家0.3229,最强通用LLM 0.3071。 📈 奖励模型预测“这次改动是否有效”的AUC达0.8487,人类专家只有0.6142。 ✅ 在Lazada广告召回模型上闭环跑了两周,连续20次迭代,离线Hitrate@200涨了23.6%;在线A/B测试GMV相对提升4.86%,广告收入提升1.82%。

这个思路对“有大量历史迭代日志”的团队特别有用,核心落地坑是语料清洗和训练成本——如果commit记录本身很脏,光过滤噪音就够喝一壶。要盯的指标不是单次成功率,而是连续迭代能否长期稳定上升;另外这类方法在推荐广告系统之外是否成立,还得看数据基础设施的成熟度。

图 1

图 2

原文:AlphaXiv

Updated: