小红书精读:Synthetic Persona Pretraining: Alignment from Token Zero

less than 1 minute read

从token zero开始对齐,效果竟然更稳

各位算法同学们,对齐真的需要从第一个token就开始吗?这篇论文用3B模型、500B tokens给出了正面证据:token zero干预能把道德困境中的misalignment率从53.3%压到29.5%,而只在训练后期干预几乎没效果。价值观不是后加的补丁,而是要在预训练里长出来的。

📄 Synthetic Persona Pretraining: Alignment from Token Zero

🔧 核心创新是SPP:用一套宪法条款给预训练文档标注第一人称“价值反思”,让模型在预训练阶段就反复接触到目标助手人格,而不是等到后训练才硬贴。 🧩 反思以标记插入文档,用标准交叉熵损失同时训练原文和反思,相当于把“这个场景下助手该怎么想”直接写进下一个词预测任务里。 ⚙️ 后训练用匹配该人格的对话数据做“人格绑定”(persona binding),让预训练里植入的价值观迁移到用户-助手交互中;论文专门做了排除实验,证明部分宪法条款即使在SFT中没见过,token zero模型仍能以21%的频率引用出来。

📊 ConstitutionEval:token zero(SPP{T0,MT})准确率66.8%,比Vanilla的55.2%高11.6个点,hard split差距更大。 📈 AI Risk道德困境:token zero misalignment率29.5%,Vanilla是53.3%,而midtraining干预只有54.0%,和Vanilla没区别。 ✅ 越狱鲁棒性:SPP变体平均ASR 11.3%-13.6%,Vanilla 16.5%,Filtered 17.2%;同时能力评测基本无损。 📈 扩展性:从1.7B/100B到3B/500B,token zero相对midtraining在AI Risk上的优势从约4pp涨到19pp,hard split优势从7pp翻倍到14pp。

这篇的价值在于把对齐问题从“后训练修补”重新拉回到“预训练塑造”,实验设计也很干净。对做alignment的同学,建议关注它在预训练数据合成和人格绑定上的细节——合成反思的质量直接决定效果,而且绑定很依赖后训练分布匹配;另外,越狱鲁棒性其实midtraining就够用,但深层的价值排序必须从token zero做起。别把它的优势简单归因于“加了一些数据”,关键在干预时机。

图 1

原文:AlphaXiv

Updated: