推荐算法日报 · 2026-08-16

less than 1 minute read

总览

今天这批货不算多,但两条线都挺有嚼头:一条是把对齐从‘事后补课’变成‘从零开始’的Synthetic Persona Pretraining,想法很硬核,实验也扎实,虽然算力门槛高得让人劝退,但至少证明了价值观注入这事越早越好,而且后期补的确实容易被撬开;另一条是Sci-Surf这个学术论文发现系统,真正在解决‘读不完’和‘读不懂’的痛点,把用户画像口头化塞进重排和多模态博客摘要都挺接地气,就是15个人的评估样本太小,效果只能当信号看。最值得细读的还是SPP那篇,它戳中了对齐最本质的脆弱性,读的时候重点看token zero和mid-training的对比,以及那个‘换模板就能破坏refusal’的发现,挺警醒的。今天优先看SPP和Sci-Surf,前者是思想实验,后者是工程实践,各自都有能带走的东西。

论文列表

1. Synthetic Persona Pretraining: Alignment from Token Zero

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 17:12 UTC
  • 机构:未披露机构
  • 工业优先级:强

从token zero开始对齐,效果竟然更稳

各位算法同学们,对齐真的需要从第一个token就开始吗?这篇论文用3B模型、500B tokens给出了正面证据:token zero干预能把道德困境中的misalignment率从53.3%压到29.5%,而只在训练后期干预几乎没效果。价值观不是后加的补丁,而是要在预训练里长出来的。

📄 Synthetic Persona Pretraining: Alignment from Token Zero

🔧 核心创新是SPP:用一套宪法条款给预训练文档标注第一人称“价值反思”,让模型在预训练阶段就反复接触到目标助手人格,而不是等到后训练才硬贴。 🧩 反思以标记插入文档,用标准交叉熵损失同时训练原文和反思,相当于把“这个场景下助手该怎么想”直接写进下一个词预测任务里。 ⚙️ 后训练用匹配该人格的对话数据做“人格绑定”(persona binding),让预训练里植入的价值观迁移到用户-助手交互中;论文专门做了排除实验,证明部分宪法条款即使在SFT中没见过,token zero模型仍能以21%的频率引用出来。

📊 ConstitutionEval:token zero(SPP{T0,MT})准确率66.8%,比Vanilla的55.2%高11.6个点,hard split差距更大。 📈 AI Risk道德困境:token zero misalignment率29.5%,Vanilla是53.3%,而midtraining干预只有54.0%,和Vanilla没区别。 ✅ 越狱鲁棒性:SPP变体平均ASR 11.3%-13.6%,Vanilla 16.5%,Filtered 17.2%;同时能力评测基本无损。 📈 扩展性:从1.7B/100B到3B/500B,token zero相对midtraining在AI Risk上的优势从约4pp涨到19pp,hard split优势从7pp翻倍到14pp。

这篇的价值在于把对齐问题从“后训练修补”重新拉回到“预训练塑造”,实验设计也很干净。对做alignment的同学,建议关注它在预训练数据合成和人格绑定上的细节——合成反思的质量直接决定效果,而且绑定很依赖后训练分布匹配;另外,越狱鲁棒性其实midtraining就够用,但深层的价值排序必须从token zero做起。别把它的优势简单归因于“加了一些数据”,关键在干预时机。

图 1(方法 / 架构)

2. Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

  • 论文链接:AlphaXiv
  • 更新时间:2026-08-13 02:07 UTC
  • 机构:Zhejiang University,Tongji University,Google Cloud,Westlake University
  • 工业优先级:中

论文推荐新玩法:反馈调教+可视化摘要

各位算法同学们,传统论文推荐靠关键词订阅,能不能用你的点击和点赞来持续修正推荐方向?Sci-Surf给出一个可落地的答案:它把用户反馈“说”成结构化意图画像,让推荐和真实兴趣的对齐度平均提升10.4%,同时把论文变成带图带表的博客式摘要,读起来省力不少。

📄 Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

🔧 反馈驱动的意图画像:不再只靠用户注册时填的兴趣,而是用LLM从历史点赞/点踩记录里提取“人设+负向约束+排序启发式”,每次反馈都会周期化更新到重排提示词里,让推荐跟着你的研究轨迹走。

🧩 多模态博客式摘要:把论文全文、图表、公式一起喂给LLM,按TL;DR、动机、方法、图表解读、实验、展望的顺序生成摘要,并自动在对应位置插入图片占位符,替换成真实图表路径。比一句abstract信息量大得多。

⚙️ 批处理式每日管线:每天定时抓arXiv CS分类(300-500篇),先离线完成向量索引和摘要生成,用户上线只做向量检索+LLM重排,避免了实时计算压力,保证低延迟。

📊 在LitSearch检索基准上,GritLM的Recall@5达到0.705,Recall@20达0.823,超过BM25和SPECTER。

📈 15个真实用户一个月的交互日志上,加入verbalized profile后,推荐相关率(Rel.%)从18.9%提升到29.3%,其中高度相关从0.5%升到3.6%。

✅ 1000篇论文-摘要对的幻觉检测中,基于JSON的Gemini管道平均每篇只有0.22个严重错误和0.76个小错,优于PDF源和Qwen系列;人工评估相关度0.61,Cohen’s κ 0.45,说明摘要基本忠实于原文。

这个系统的关键是“离线重计算+在线轻量重排”,工程上很聪明。但注意用户反馈如果太稀疏,画像容易漂移,需要配合冷启动策略。做学术搜索或知识发现系统的同学,可以重点盯推荐相关率和摘要幻觉率这两个指标去复现。

图 1(方法 / 架构)

Updated: