小红书精读:Closing the Operational Gap in Semantic Caching
语义缓存选模型,PR-AUC高≠好用
各位算法同学们,衡量语义缓存模型的好坏,别死盯PR-AUC了——论文实测发现,PR-AUC最高的模型在线上部署时常常是最差的。选模型的思路可能从一开始就偏了。
📄 Closing the Operational Gap in Semantic Caching
🔧 提出P-CHR AUC,画的是缓存利用率升高时精度的真实变化,直接看“这个阈值能不能用”,而不是只比排序分高低。 🧩 提出ORR,量化离线排序质量有多少能存活到线上阈值决策中。 ⚙️ 把离线PR-AUC和线上表现之间的gap拆成两部分:不可消除的结构gap,和可恢复的阈值效用gap,并指出后者主要由训练目标决定,数据规模增大也补不回来。
📊 用9个retriever和10个reranker,在74,265条测试query上做评估,正样本率约45%。 📈 即使排序完全正确,P-CHR AUC上限也只有约0.809,而PR-AUC可以到1,两边的数字天然差一截。 ✅ 训练数据从1.05M扩到40M(约38倍),阈值效用gap没有随规模变大而消失;改用重归一化分数或换训练目标才有效。
对做LLM成本优化的同学,这篇建议自己复现一下那组对比。落地时记住一句话:语义缓存选模型是一个阈值效用问题,不是一个排序问题,PR-AUC高不代表线上更省钱,上指标你得带上P-CHR AUC。
原文:AlphaXiv