小红书精读:OpenSanctions Pairs: Large-Scale Entity Matching with LLMs
制裁名单匹配新基准:75万对冲到99% F1 🎯
各位算法同学们,当规则匹配还在91% F1挣扎时,GPT-4o已经把这个任务刷到99%了。这篇工作直接把制裁与OSINT数据上的实体匹配做成了公开基准,规模比之前最大的EM数据集还高一个数量级,值得每个做实体对齐的人看一眼。
📄 OpenSanctions Pairs: Large-Scale Entity Matching with LLMs
🔧 技术创新点: 🧩 发布首个大规模制裁与OSINT实体匹配基准,包含755,540对专家标注样本,覆盖100万+实体,来自45个司法辖区的293个数据源,横跨拉丁、西里尔、阿拉伯等多语言书写系统。 ⚙️ 用MIPROv2做提示词优化,把规则基、开源和闭源LLM在zero-shot和few-shot下统一控制变量,避免“提示词玄学”带来的评估偏差。 🧠 对比了生产环境规则匹配器与多种LLM,明确刻画了两类系统互补的失败模式:规则过度匹配,LLM在跨文字转写上容易出错。
📊 实验效果: 📈 规则基线(nomenklatura RegressionV1)F1为91.3%,GPT-4o达到99.0%,是本基准最佳。 ✅ 本地可部署的开源模型DeepSeek-R1-Distill-Qwen-14B拿到98.2% F1,与闭源差距不到1个点。 📉 正负样本比约76.9% / 23.1%,其中33.6%的自动合并对全为正样本,真正的人工难例占比没那么高。
总结一下:这个基准的价值不在“谁赢了”,而在把任务推到了实际天花板附近。对做反洗钱、制裁筛查或者多源知识图谱对齐的团队,直接拿这个数据测自己的pipeline很合适。但要注意负样本偏少,而且作者明确说blocking、聚类和不确定性审查才是下一步瓶颈——单点匹配刷分接近极限,别只盯pairwise指标。坑是开源模型在跨文字转写上还会漏,落地时要配合名字归一化或者转写增强。
原文:AlphaXiv