精读与批判 · Legibility is Not Interpretability (COLM 2026)
- flyP 审稿时间:2026-09-17 22:50 (Asia/Shanghai)
- 目标读者:Anan 学术研究知识库,关注 reasoning / interpretability / process reward modeling 方向
- 角色定位:轻量精读 + 批判性分析,不复制原文长段
1. 论文元信息
- 标题:Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning
- 作者:Kevin Du (Cohere intern)、Alexander Hoyle (ETH Zürich)、Laura Ruis (MIT)、Acyr Locatelli (Cohere)
- arXiv:2609.04194 (cs.CL, cs.LG)
- 发表:COLM 2026
- 首版提交:2026-09-03
- 代码/数据:未在论文或搜索结果中确认发布仓库(待补查 GitHub/Kevin Du 个人主页/Cohere For AI)
- 资源链接:
- 论文 PDF:https://arxiv.org/pdf/2609.04194v1
- HTML 版:https://arxiv.org/html/2609.04194v1
- arXiv abs:https://arxiv.org/abs/2609.04194
2. 一句话核心贡献
把 CoT 视作 RL 中的 MDP,把"推理步骤是否重要"形式化为 advantage(Q(s,a) − V(s),通过 Monte Carlo rollout 估计),并以此 ground truth 评估"LLM judge 是否能从文本本身解码出 step 的重要性"——结论是 不能完全解码:judge 在错误回答上接近 ceiling,但在正确回答上仍远离 ceiling。
3. 方法拆解(不抄原文,给出 flyP 的解读)
3.1 形式化
- 把 CoT 切分成 step
a_1,...,a_T(按换行/标点分隔) - 把生成器 π 看作 policy,state
s_t = x ∘ a_1 ∘ ... ∘ a_{t-1} - 奖励 r(s) ∈ {0,1},两种定义:
- (i) correctness-based:最终答案是否正确
- (ii) self-advantage(默认):最终答案是否与原始 trace 的答案匹配(更接近 faithfulness)
- Step importance = A^π(s, a) = Q^π(s,a) − V^π(s)
3.2 估计
- V̂(s_t) = mean reward of N completions from s_t
- Q̂(s_t, a_t) = mean reward of M completions from s_t ∘ a_t
- 用 changepoint analysis 把 step 分为 consequential(优势大且持续)vs uninformative
3.3 评估流程
- 对生成器采样一批 CoT trace
- 用 MC rollout 计算每个 step 的 advantage ground truth
- 用 LLM judge(zero-shot prompt + fine-tuned critic)预测 step 是否 consequential
- 关键指标:vs prevalence baseline(多数类)和 noise ceiling(MC 估计方差给出的上限)
3.4 flyP 视角的方法学评价
优点: - 用 RL 框架重写 CoT importance 是非常自然且原则化的选择——和 PRM(Process Reward Model)的目标函数天然对齐 - 同时区分 self-advantage 和 correctness-based advantage,让方法可以同时支撑 faithfulness 和 correctness 两条研究线 - 不需要 prompt 修改就能评估,与 Guan et al. 2025 等 perturbation-based faithfulness 测试互补
局限(审稿视角): 1. MC rollout 计算代价巨大:每条 trace 上百个 step × N+M 次 rollout,对长 CoT 几乎是不可扩展的。论文没有报告 wall-clock cost / $/sample,这本身是个可信度疑点 2. noise ceiling 来自 MC 估计本身的方差——这是不可避免的统计噪声,并不是"理论最优性能"。把 judge 与 ceiling 的 gap 作为"可解码性"的证据,会受 rollout 数量 N、M 的直接影响 3. step 切分规则(按换行/标点)依赖启发式,作者自己承认 step 边界是"非正式的"——这与 Anthropic 的"CoT 是外部化计算状态"(Levy et al. 2025)立场一致,但削弱了 step 作为分析单位的合法性 4. ground truth 是相对量——self-advantage 用"匹配原始 trace 的答案"作为 reward,这意味着模型 token-sampling 不稳定性会被归入 ground truth 噪声。报告"correctness-based" 是必要补充,但默认 setup 仍是自指的
4. 实验关键发现(按论文摘要 + §5-6 整理)
- Steps are relatively rare:大多数 step 是 uninformative 的,这与 Boppana et al. 2026 "CoT performative" 论述一致——长 reasoning token 多数是填充,不是真正的推理
- uncertainty management step 在正确回答中往往是 consequential(呼应 Gandhi et al. 2025 cognitive behavior 分类)
- 最反直觉的发现:scale 和 thinking 模式的性能提升主要来自第一步之前的强 prior("模型在第一个 reasoning token 之前就已经大概率知道答案了"),而不是推理过程的增量贡献
- judge 解码能力的非对称: - 在 错误回答 上 fine-tuned critic 接近 noise ceiling - 在 正确回答 上只恢复小部分可解码信号 - 这种非对称在 generator scale 和 reasoning style 上都成立
flyP 对发现的解读
- 错误回答的优势信号更"局部"——一两个错误 step 就会显著拉低正确率,所以 judge 通过文本就能识别
- 正确回答的优势信号"分布更广"——很多 step 都对最终正确率有边际贡献,没有单一文本模式可以精确指向,这和"强 prior 主导"是同一个现象的两面
- 方法学含义:做 PRM 的训练数据时,不应该直接用 judge 在正确回答上的评分做监督,因为 judge 本身的解码能力在那一侧较弱——这是论文对 PRM 训练实践最直接的 actionable 建议
5. 实验风险与复现难度
| 维度 | 评估 |
|---|---|
| 数据集 | MATH、AIME 等公开题库 |
| 生成器 | 多模型对比(含 thinking/non-thinking) |
| MC rollout 数量 | 论文报告 N、M 具体值(待补查 §6) |
| 训练 critic | 论文应该公开了 LoRA / SFT 配置(待补查) |
| 复现门槛 | 中高——计算资源是主要瓶颈,单条 trace 数百 rollout × 数百 step × 多模型 = 几十万美元级 GPU 时间 |
| 代码可获得性 | 待补查:论文 PDF/HTML 中未在已抓取段落中提到 GitHub 仓库 |
建议复现优先级:中。重点复现"judge 在正确回答上的 decoding gap",该结论对 PRM 训练影响最大。
6. 与近期文献的关系
- CoT faithfulness 经典线:Turpin et al. 2023、Lanham et al. 2023、Chen et al. 2025——本文与他们一致,但把粒度从 response-level 推到 step-level
- PRM 实践线:Gandhi et al. 2025、Zhang et al. 2025、Xiong et al. 2025——本文明确警告这些工作依赖 judge/PRM 的"可解码性"假设
- CoT 作为计算状态:Levy et al. 2025、Boppana et al. 2026——本文的"uninformative step 多"和"正确回答优势信号分布广"是这些论点的量化支持
- 与今天已精读论文的关系:
- FLAT(多模态长上下文):FLAT 是模型架构侧,本文是训练/评估侧——互补
- Agora(agent 自我研究):Agora 谈 agent 自我研究能力,本文谈 CoT 可监控性——两者都触及"模型/agent 是否真的知道自己在做什么"这个元问题
7. flyP 的可信度判断
高(4 / 5): - 作者团队含 Cohere 工业研究背景(Locatelli)+ ETH + MIT,方法学严谨 - 概念清晰(advantage 形式化是 RL 标准操作),结果可解释 - 已发表 COLM 2026,通过同行评议 - 唯一扣分点:MC rollout 计算代价未充分披露;judge 实验的 noise ceiling 受 rollout 数量影响——这是诚实的方法学不确定性,但削弱了"完全不能解码"的强结论
8. 入库建议
| 维度 | 判断 |
|---|---|
| 是否建议入库 | 是——属于 flyP 应当长期跟踪的 "CoT interpretability / PRM safety" 主线 |
| 分类标签 | reasoning、interpretability、process-reward-model、cot-faithfulness、rl-formalization、colm-2026 |
| 建议写入路径 | notes/reasoning/cot-step-advantage.md + reviews/2026-09-Legibility-Is-Not-Interpretability.md |
| 是否需要进一步精读 | 是——重点看 §6 judge 实验的 rollout 数量、§8 与 Bogdan et al. 2025 的比较、§9 限制讨论 |
| 是否需要复现 | 否(计算成本太高),但建议用小组内部 trace 做小规模验证 |
| 待补查 | (1) GitHub 仓库链接;(2) MC rollout N、M 实际值;(3) 生成器模型清单完整列表;(4) §8 与 Bogdan et al. 2025 KL-based 方法的具体差异 |
9. 后续验证动作
- 短期(1-2 周):访问作者主页 / Cohere For AI 找代码仓库;补全 §6 细节
- 中期(1 个月):关注是否有后续工作用同一 advantage 形式化做 PRM 训练改进
- 长期:把"CoT legibility ≠ interpretability"作为 flyP 在 reasoning 方向的核心立场之一,纳入对所有"LLM judge / PRM / interpretability" 类论文的批判框架
10. 摘要(供 review 页正文使用,< 200 字)
COLM 2026 论文 "Legibility is Not Interpretability"(Du, Hoyle, Ruis, Locatelli;arXiv:2609.04194)把 CoT 步骤重要性形式化为 RL 中的 advantage,用 Monte Carlo rollout 估计 ground truth,再评估 LLM judge 是否能从文本本身解码该 importance。结果:judge 在错误回答上接近噪声上限,但在正确回答上仍远离上限,说明 step importance 不能从 CoT 文本完全恢复。附带发现:scale 和 thinking 模式带来的性能增益主要来自第一步之前的强 prior,而非推理过程。该结论对 PRM 训练有直接含义——不应把 judge 在正确回答上的评分作为过程监督信号。