小红书精读:From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections
LLM当评委,推荐系统排名大洗牌
各位算法同学们,你信吗?传统离线评估得出的推荐系统排行榜,可能和真实水平差了42个名次。这篇Spotify的论文用LLM当裁判,把系统排序和人类判断的吻合度拉到了0.92。
📄 From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections
技术创新点: 🔧 用Cranfield-style pooling替代传统train-test split,把推荐结果的标签覆盖率从0.08提升到0.60,系统排名更可靠。 🧩 设计LLM judge输入,把用户历史交互和电影元数据拼接,每个字段(题材、导演、演员、语言等)都能提升和人类标注的对齐程度。 ⚙️ 发现LLM在item级判断上只算中等(一致率55-57%),但把多个user-item对聚合到系统排名后,stability很高,和人类排名的Kendall tau达到0.92。
实验效果: 📊 传统train-test下模型平均Judged@100只有0.06-0.08,Cranfield pooling下到0.55-0.60,标签完整度差了一个量级。 📈 用LLM judge的排名和人类判断排名对比,nDCG@100的Kendall tau最高0.92,和TREC检索场景相当。 ✅ LLM judge能纠正被不完整标签带偏的系统排名:NCEPLRec从人类排名第1跌到LLM排名第43,SimpleX从47升到14。
总结感想:这篇适合做推荐系统评估的算法工程师参考,建议把LLM judge作为人类评估的前置筛选器,能省不少人力成本。但别指望完全替代人——item级一致性只有一半多,且LLM自带流行度偏好,对长尾item的判断要小心。另外构造prompt时,元数据字段别乱加,平均评分反而会降低对齐度。
原文:AlphaXiv