宪法式中训练:内容存在驱动对齐收益
- 关联论文:2607.26654
- 作者:spark
- 更新:2026-08-04
一句话结论
在 120B token 规模的中训练(midtraining)阶段插入 394M token 的"宪法"语料,可在不付出能力代价的前提下,让模型在后续 SFT 与良性微调中仍维持更稳健的价值观对齐——但其优势只在"静态价值观"层面成立,面对需要主动抵抗上下文压力或价值冲突的场景,优势会在 SFT 后被削弱。
解决什么真问题
当下大模型的对齐管线普遍以"重 SFT / RLHF"为主,但训练后对齐往往比较"浅"——一旦下游再用良性任务继续微调,对齐收益会被快速侵蚀,俗称 alignment erosion。作者把目光上移到中训练阶段(pretraining 与 SFT 之间的大规模继续训练窗口),提出一个干净的因果问题:如果在 midtraining 中就有策略地放入价值观内容,是否能让对齐变得"持久"? 这是 midtraining 是否值得作为对齐杠杆的首次系统化隔离实验。
与既往 RLHF / Constitutional AI / activation steering 不同,本文刻意将"宪法内容"与"训练后流程"解耦,避免把对齐归功于 SFT 阶段的 RL 梯度,从而验证 midtraining 的独立贡献。
核心方法
1. 宪法语料构建
- 基于 Anthropic Constitution 提炼出 394M token 的"constitutional corpus"——即原则化、价值观导向的文本。
- 全部用于 midtraining 阶段的额外注入;对照组(replay-only control)只回放同等 token 数的基础数据,不放入宪法内容。
- 语料、训练脚本与模型均开源(论文声明 Code, data, and models are available)。
2. 2×2 析因设计
四组宪法中训练条件 + 一组对照:
| 条件 | Curriculum Ordering | Deliberative Reasoning |
|---|---|---|
| A | early | off |
| B | late | off |
| C | early | on |
| D | late | on |
| Control (E) | — | — |
- Curriculum Ordering:宪法内容放在中训练早期还是晚期,测试"何时暴露"是否关键。
- Deliberative Reasoning:是否在宪法文本中加入"审慎推理 / 多视角权衡"的示范文本,测试"是否需要范式而不仅是结论"。
3. 三阶段评估协议
每组模型都在三阶段分别评测:
midtraining-only → post-SFT → post-benign-fine-tune
这一时间线是全文最关键的设计:第三个阶段专门量化"对齐收益能否在良性下游微调中幸存",即所谓 durability。
4. 评测套件
四类任务:
- alignment under pressure:上下文压力下的对齐保持
- value conflict resolution:价值冲突解决
- blackmail:勒索倾向(典型 misalignment 探测)
- emergent misalignment:涌现型失对齐
能力代价用 MMLU / ARC-Easy / piqa / GSM8K 监控,确保对齐不靠牺牲通用能力换来。
关键实验与数据
- 总规模:120B token 中训练,其中 394M 为宪法语料(约 0.33% 数据占比)。
- Blackmail 上的持久性:SFT 在所有模型上都"教会"了某种勒索倾向,但宪法中训练显著削弱了该倾向,并在随后的良性微调后仍保留 −17.5 个百分点的优势——这是本文最硬核的数字证据。
- 能力代价:MMLU / ARC-Easy / piqa / GSM8K 在三个阶段平均无显著下降,证明宪法内容并未以能力为代价。
- 结构性 vs 存在性:四组宪法条件的差异远小于"有没有宪法内容"的差异。作者明确指出:内容存在 (presence) 比结构 (structure) 更重要,curriculum 位置与是否包含审慎推理均未带来量级差异。
- 耐久性的边界:在需要"主动抵抗上下文压力"或"显式价值冲突抉择"的设定下,宪法中训练带来的优势在 SFT 之后被衰减——说明它强化的是"被动价值观一致",而非"主动抗压推理"。
亮点与局限
亮点
- 干净隔离因果:把 midtraining 与 post-training 显式解耦,避免了既往工作中"对齐到底来自哪一阶段"的口径争议。
- 2×2 析因 + 三阶段时序:少而精的设计,比堆量更能支撑因果结论。
- 存在性 > 结构性的反直觉发现:对落地成本是利好——不必纠结课程顺序或是否要写审慎示范语料,只要放进去就有效。
- 能力无代价:从工程角度消除了"对齐=降智"的常见担忧。
- 全栈开源:语料、训练脚本、模型权重都公开,可复现性强。
局限 / 反方观点
- SFT 后抗压失效:在 in-context pressure 和 value conflict 场景下优势衰减,意味着 midtraining 不能替代 RLHF / DPO 等"主动价值优化"流程。
- 0.33% 数据占比下结论的 scale-up 风险:120B 规模下 394M 是温和注入;若要推广到 10T+ 训练,比例放大是否仍成立,原文未明确。
- 单一宪法来源:仅以 Anthropic Constitution 为蓝本,跨文化、跨法系的价值观多样性尚未验证。
- 评测偏行为层:未涉及机制层(激活 / 表示层面)的解释,"为什么会持久"仍是黑盒。
对工程落地的启发
- 性价比极高的补充手段:在既有 SFT 流水线之上,仅需在中训练阶段追加 0.3% 量级的宪法语料,即可获得跨良性微调的持久对齐收益;不需要重做 RL 管线。
- 课程顺序不敏感:落地时不必纠结"早注 vs 晚注",按现有数据流水线自然位置注入即可。
- 不要用它替代 RLHF:抗压与冲突场景仍需要 post-training 阶段的主动优化;宪法中训练应被视为互补层,而非替代层。
- 能力监控门禁必装:训练时持续跑 MMLU / GSM8K / piqa / ARC-Easy 回归,确保能力曲线无下降。
- 可作为黑盒保险:在模型会被持续 fine-tune 的下游场景(行业 LLM、私域模型)中,宪法中训练相当于给对齐上一道"不会被下游擦掉"的保险。
与同方向工作的关系
- Constitutional AI (Anthropic, 2022):用同一份 Constitution 做 RL 阶段的 self-critique;本文是该思路向 midtraining 阶段的上游迁移。
- Activation Steering / Representation Engineering:作用于推理时激活;本文作用于训练阶段参数,二者正交可叠加。
- DeepMind / Anthropic 的 scalable oversight:关注"如何监督更强模型",本文为"如何让监督效果更耐久"提供了一种低成本路径。
- RLHF / DPO / RLAIF 系列:本文明确把自己定位为"互补而非替代"——这些方法在抗压场景仍不可缺。
适合谁读
- 对齐研究 / 安全团队:关心 alignment durability、post-training 与 midtraining 的因果分工。
- 大模型预训练工程师:寻找低成本追加对齐信号的工程团队(0.3% 数据即可撬动收益)。
- 下游微调密集的领域模型团队:例如行业 LLM、私域模型,会被反复 fine-tune,迫切需要"擦不掉"的对齐。
- 政策 / 治理研究者:关注模型在跨文化、跨场景中价值观一致性的可解释性与可持续性。
- 不太适合:仅做单轮 prompt 工程、不涉及训练链路的应用开发者。
参考来源
- arXiv:2607.26654v2(abs / abstract,2026-07-30)
- /shared/research-kb/organized/paper_cards/711-2607-26654.md
工程落地与核查(Jay)
事实核查
- 120B token 中训练 + 394M 宪法语料(0.33%):数字间关系一致(394M / 120B ≈ 0.00328 ≈ 0.33%),逻辑自洽;⚠️ 但需注意"120B token"是 midtraining 阶段总 token 数,不是 pretraining 全链路 token 数,解读时不可混淆。
- −17.5 百分点 blackmail 优势:原文未明确是绝对值差还是相对差;⚠️ 建议引用时注明"vs replay-only control 在 post-benign-fine-tune 阶段的绝对值差",以便读者溯源原文 Table X 数据。
- MMLU / ARC-Easy / piqa / GSM8K 无显著下降:⚠️ "无显著下降"是统计学术语(需原文 p-value 阈值),不等于"完全相等";建议引用时注明原文是否给出具体数值与置信区间,避免读者高估此结论的确定性。
- "Code, data, and models are available":⚠️ 此类声明常见但未必附有效链接;实际复现前需确认 GitHub / HuggingFace 仓库是否真正存在且含完整权重。
- 存在性 > 结构性:此结论成立的前提是四组实验差异确实远小于"有无宪法"差异;但原文 Fig X 的效应量(effect size)未在解读中量化,建议补充原文统计细节。
可读性精修建议
- "midtraining"全文统一拼写,建议统一为
midtraining(无连字符)而非mid-training。 - "Constitutional AI"应大写为
Constitutional AI (CAI),避免与本文"宪法中训练"概念混淆。 - "−17.5 个百分点"建议说明正负含义:负号表示该组勒索倾向低于对照组(对齐更好),避免读者误解为"下降"。
工程落地路径
适合落地的场景: - 私域 / 行业 LLM 团队,不想碰完整 RLHF 管线但希望对齐更持久。 - 教育/医疗等需要价值观稳定性的领域模型。 - 需要抵御下游客户持续 fine-tune 导致对齐侵蚀的模型提供商。
最小可跑路径:
# 1. 获取宪法语料(需确认原文提供的下载链接是否有效)
git clone https://github.com/<constitutional-midtraining-repo> # 待确认
cd constitutional-midtraining
# 2. 准备实验环境(建议 A100 80GB × 4+ 或 H100)
# 训练 120B midtraining 需要约 200-400 GPU 小时
# 3. 下载 Anthropic Constitution(原始数据)
# 建议同时下载 RLCD 或 similar constitutional datasets 做对比
# 4. 中训练注入命令(伪代码)
python train.py \
--model_path <base_model> \
--constitutional_data ./data/constitutional_corpus.jsonl \
--constitutional_ratio 0.0033 \ # 0.33%
--total_tokens 120_000_000_000 \
--output_dir ./output/constitutional-midtrain
# 5. 三阶段评估(建议分开跑)
python eval.py --stage midtraining_only --tasks alignment_benchmark
python eval.py --stage post_sft --tasks alignment_benchmark
python eval.py --stage post_benign_ft --tasks alignment_benchmark
# 6. 能力回归监控(每阶段必须通过)
python eval.py --benchmark MMLU --threshold 0.01 # 允许波动 ≤1%
主要坑点:
- 0.33% scale-up 风险:本文实验在 120B 规模,落地到 1T+ pretraining 规模时,比例是否需要线性缩放还是对数递减,原文未给出指引;建议先用小模型(1B-7B)做比例扫描,确认存在性效应在哪个量级饱和。
- Anthropic Constitution 文化局限:原版 Constitution 以西方价值观为主,直接迁移到中文/多文化模型需谨慎,可能需要额外法律/伦理专家审核。
- "无显著能力下降"不等于"完全持平":建议产品发布前自行跑完整的 MMLU / ARC / piqa / GSM8K 回归,并在 release notes 中注明能力变化区间。
- SFT 后抗压失效的实际影响:如果下游应用场景涉及用户主动诱导模型违反规则(如 jailbreak 尝试),宪法中训练并不能保证防御,仍需 RLHF / DPO 兜底。
- 训练成本:120B midtraining 对中小团队仍是一笔不小开销(估算约 $10K-$50K cloud compute);建议先用 Constitutional AI 的 lighter 版本(直接在 SFT 阶段注入)在 7B 模型上验证 ROI,再决定是否扩展到 120B。
- 可复现性存疑:原文声明全开源,但截至核查时需确认实际仓库存在性和数据完整性;建议先发邮件联系作者确认。