小红书精读:Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition Agents
检测到效应≠学会行动?SNR地板
各位算法同学们,这篇论文点破了一个容易忽略的坑:即使某个辅助信号平均上有用,也不代表你能学会“逐样本”决定何时获取它。作者用一个reward-SNR地板解释了为什么很多昂贵的LLM调用策略根本学不出来,值得一读。
📄 Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition Agents
🔧 核心创新是把“检测平均效应”和“学习逐实例获取策略”彻底分开,并给出一个必要条件:reward-SNR ρ 需要超过 2.8/√N,否则离线数据里根本学不出可部署的路由策略。 🧩 提出 Structured Hypothesis Embeddings(SHE),用冻结LLM把用户历史拆成带置信度和证据的意图假设,融合进推荐器,但重点不是提升多少,而是什么时候这个信号“值得获取”。 ⚙️ 用匹配矩的噪声安慰剂复现了in-sample oracle的大部分“增益”,证明看似可学习的结构其实是噪声的顺序统计量。
📊 在MIND上,SHE在GRU骨干上显著提升NDCG@10 +0.0114(95% CI [+0.0030, +0.0209]),但全局冗余gap与0无差异。 📈 多粒度(per-impression、K=4-64簇、regime、uplift tree)下,学出的路由都不优于随机;噪声安慰剂复现了≥100%的oracle增益。 ✅ MIND的reward-SNR仅为0.048,Amazon-Beauty为0.014,都远低于地板;REES46虽高于地板,但SHE反而显著伤效果。
这篇论文的结论比较“劝退”:如果数据量不够、SNR不够,别指望学出逐样本的获取策略,老老实实做设计时的regime gate更现实。落地时建议先算一下自己的ρ和N,别被in-sample oracle的漂亮数字骗了。代码和可复现脚本已放出,适合想验证这个坑的同学跟进。
原文:AlphaXiv