小红书精读:ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

less than 1 minute read

🔍 检索=写程序?4B模型反超GPT-5.5

各位算法同学们,一个4B模型在混合检索上干翻了GPT-5.5和Claude Opus 4.7,靠的不是更大的模型,而是让模型自己写检索程序。这篇工作把检索从“生成查询”变成了“合成可执行程序”,思路挺清奇。

📄 ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

技术创新点: 🔧 把检索重构成写程序:模型输出一个DSL程序,SQL负责结构化过滤和逻辑组合,向量检索以占位符形式嵌入SQL,天然支持AND/OR/NOT和嵌套子查询,覆盖任意布尔逻辑。 🧩 层次化奖励训练:先用SFT热启动,再用GRPO/DAPO做强化学习,奖励拆成格式、可执行性、结果质量、长度四项,让模型学会编排多个异构后端。 ⚙️ 多模态统一编排:同一个DSL能同时调文本和图像向量检索,SQL的集合代数把候选集融合,超越了RRF和self-querying的固定组合方式。

实验效果: 📊 电商基准上,4B模型Hit@1达到0.81,GPT-5.5只有0.69,Claude Opus 4.7也没打过。 📈 邮件基准上Hit@1 0.91 vs 0.86,同样领先。 ✅ 对比Search-R1、DeepRetrieval、SQL-R1等基线全胜;消融实验显示去掉向量检索后Hit@1从0.809掉到0.650,证明混合DSL的增量很关键。

总结感想:对做RAG或复杂搜索的同学有参考价值:把action space从查询扩展到程序,再用RL直接优化可执行性。落地坑在于构造带结构化字段+语义标注的训练数据不便宜,而且DSL的schema得按领域定制。后续先盯Hit@1和程序可执行率,跟GPT-5.5比已经赢了。

图 1

图 2

原文:AlphaXiv

Updated: