小红书精读:Closing the Operational Gap in Semantic Caching

less than 1 minute read

语义缓存选模型,PR-AUC高≠好用

各位算法同学们,衡量语义缓存模型的好坏,别死盯PR-AUC了——论文实测发现,PR-AUC最高的模型在线上部署时常常是最差的。选模型的思路可能从一开始就偏了。

📄 Closing the Operational Gap in Semantic Caching

🔧 提出P-CHR AUC,画的是缓存利用率升高时精度的真实变化,直接看“这个阈值能不能用”,而不是只比排序分高低。 🧩 提出ORR,量化离线排序质量有多少能存活到线上阈值决策中。 ⚙️ 把离线PR-AUC和线上表现之间的gap拆成两部分:不可消除的结构gap,和可恢复的阈值效用gap,并指出后者主要由训练目标决定,数据规模增大也补不回来。

📊 用9个retriever和10个reranker,在74,265条测试query上做评估,正样本率约45%。 📈 即使排序完全正确,P-CHR AUC上限也只有约0.809,而PR-AUC可以到1,两边的数字天然差一截。 ✅ 训练数据从1.05M扩到40M(约38倍),阈值效用gap没有随规模变大而消失;改用重归一化分数或换训练目标才有效。

对做LLM成本优化的同学,这篇建议自己复现一下那组对比。落地时记住一句话:语义缓存选模型是一个阈值效用问题,不是一个排序问题,PR-AUC高不代表线上更省钱,上指标你得带上P-CHR AUC。

原文:AlphaXiv

Updated: