小红书精读:GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

less than 1 minute read

GEO检测新基准,F1拉到94.4%📈

各位算法同学们,你有没有想过,生成式搜索给出的答案里,引用的网页可能是被人为优化过的“托”?今天这篇工作直接把GEO检测的F1拉到了94.4%。

📄 GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

🔧 技术创新点: 第一,构建了GEOFlagBench基准,包含3200个网页,覆盖400个查询、4个领域和8种GEO优化器,把检测任务从“猜风格”变成“找干预”。 第二,提出Intervention-Paired Training,让检测器学习GEO干预前后的差异,同时忽略普通AI润色,避免依赖作者身份等捷径。 第三,设计了GEO-gated Agent系统,对检出的GEO页面自动审计引用URL的来源层级和可验证性。

📊 实验效果: 在ModernBERT上,IPT把F1从0.862提升到0.944,最差组准确率从0.725提升到0.883。 在真实搜索场景中,对1000个真实用户查询、10095个可用页面,估计GEO整体流行率为8.90%,2026年修改的页面中高达16.36%。 检出GEO页面的6663个引用URL中,69.34%被标记为低可验证性,其中Gemini渠道高达74.15%。

总结:这篇的价值在于把GEO检测从“凭感觉”推向可评测、可审计。落地时注意基准里的作者信息容易成为捷径,实际部署要盯住worst-group accuracy,而不是只看平均F1。

原文:AlphaXiv

Updated: