小红书精读:Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

less than 1 minute read

论文推荐新玩法:反馈调教+可视化摘要

各位算法同学们,传统论文推荐靠关键词订阅,能不能用你的点击和点赞来持续修正推荐方向?Sci-Surf给出一个可落地的答案:它把用户反馈“说”成结构化意图画像,让推荐和真实兴趣的对齐度平均提升10.4%,同时把论文变成带图带表的博客式摘要,读起来省力不少。

📄 Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

🔧 反馈驱动的意图画像:不再只靠用户注册时填的兴趣,而是用LLM从历史点赞/点踩记录里提取“人设+负向约束+排序启发式”,每次反馈都会周期化更新到重排提示词里,让推荐跟着你的研究轨迹走。

🧩 多模态博客式摘要:把论文全文、图表、公式一起喂给LLM,按TL;DR、动机、方法、图表解读、实验、展望的顺序生成摘要,并自动在对应位置插入图片占位符,替换成真实图表路径。比一句abstract信息量大得多。

⚙️ 批处理式每日管线:每天定时抓arXiv CS分类(300-500篇),先离线完成向量索引和摘要生成,用户上线只做向量检索+LLM重排,避免了实时计算压力,保证低延迟。

📊 在LitSearch检索基准上,GritLM的Recall@5达到0.705,Recall@20达0.823,超过BM25和SPECTER。

📈 15个真实用户一个月的交互日志上,加入verbalized profile后,推荐相关率(Rel.%)从18.9%提升到29.3%,其中高度相关从0.5%升到3.6%。

✅ 1000篇论文-摘要对的幻觉检测中,基于JSON的Gemini管道平均每篇只有0.22个严重错误和0.76个小错,优于PDF源和Qwen系列;人工评估相关度0.61,Cohen’s κ 0.45,说明摘要基本忠实于原文。

这个系统的关键是“离线重计算+在线轻量重排”,工程上很聪明。但注意用户反馈如果太稀疏,画像容易漂移,需要配合冷启动策略。做学术搜索或知识发现系统的同学,可以重点盯推荐相关率和摘要幻觉率这两个指标去复现。

图 1

原文:AlphaXiv

Updated: