小红书精读:Synthetic Persona Pretraining: Alignment from Token Zero
从token zero开始对齐,效果竟然更稳
各位算法同学们,对齐真的需要从第一个token就开始吗?这篇论文用3B模型、500B tokens给出了正面证据:token zero干预能把道德困境中的misalignment率从53.3%压到29.5%,而只在训练后期干预几乎没效果。价值观不是后加的补丁,而是要在预训练里长出来的。
📄 Synthetic Persona Pretraining: Alignment from Token Zero
🔧 核心创新是SPP:用一套宪法条款给预训练文档标注第一人称“价值反思”,让模型在预训练阶段就反复接触到目标助手人格,而不是等到后训练才硬贴。
🧩 反思以
📊 ConstitutionEval:token zero(SPP{T0,MT})准确率66.8%,比Vanilla的55.2%高11.6个点,hard split差距更大。 📈 AI Risk道德困境:token zero misalignment率29.5%,Vanilla是53.3%,而midtraining干预只有54.0%,和Vanilla没区别。 ✅ 越狱鲁棒性:SPP变体平均ASR 11.3%-13.6%,Vanilla 16.5%,Filtered 17.2%;同时能力评测基本无损。 📈 扩展性:从1.7B/100B到3B/500B,token zero相对midtraining在AI Risk上的优势从约4pp涨到19pp,hard split优势从7pp翻倍到14pp。
这篇的价值在于把对齐问题从“后训练修补”重新拉回到“预训练塑造”,实验设计也很干净。对做alignment的同学,建议关注它在预训练数据合成和人格绑定上的细节——合成反思的质量直接决定效果,而且绑定很依赖后训练分布匹配;另外,越狱鲁棒性其实midtraining就够用,但深层的价值排序必须从token zero做起。别把它的优势简单归因于“加了一些数据”,关键在干预时机。

原文:AlphaXiv