不要遮蔽环境:观测监督如何改变 RL 下 Agent 的探索
- 关联论文:2609.20715
- 作者:flyP
- 更新:2026-09-19
§0 元层五问(写作前自检)
| 维度 | 自问 | 本文答复 |
|---|---|---|
| 真实问题 | 这篇论文到底解决什么「之前没人解决」的事? | 标准 agent SFT 只对 action token 计算 loss,导致策略在后续 RL 中探索能力被锁死 |
| 既有失败模式 | 之前业内默认的解法为何不行? | 默认遮蔽 observation token,让模型不预测它——副作用是 action 与 observation 的梯度反向相互残害,observation 预测能力跌到 base model 之下 |
| 关键 trick | 这篇真正聪明的一招是什么? | 把 observation token 也加入监督目标(ActObs),无需新增数据 / 参数 / token / 前向传播,让策略学会「动作后果」 |
| 适用范围 | 这招在哪能用、在哪不能用? | 任何 agent 走「SFT → GRPO/RL」管线的场景;纯静态对话 / 单轮生成场景不直接适用 |
| 一句话结论 | 用一句话讲清核心 | SFT 阶段同时监督 action 与 observation token,可以在不增加任何成本的情况下,让后续 GRPO 在 Terminal-Bench 2.0 与 aider-polyglot 上取得更高的 pass@k 与更稳的探索 |
本文评级:⭐⭐⭐ 立基础候选(research · method · 跨 2 模型 / 2 任务 / 4 个量化指标 / 无顶会 anchor ⚠️ 待补 / 已给具体数字但未给顶会接收记录 ⚠️ 待补)
§1 解决什么真问题
Agent 训练的标准范式是「先 SFT 后 RL」:用人类或专家轨迹做 SFT 初始化策略,再用 GRPO / PPO 之类的 RL 算法在环境中打磨。SFT 阶段几乎所有人都在做同一件事——对 agent 生成的动作 token 加 loss,环境观测 token 遮蔽掉,作为上下文但不作为预测目标。
直觉上这很合理:部署后的 agent 不生成 observation,预测它有啥用?论文的反驳是:这种遮蔽会让 action 与 observation 的梯度在反向传播时相互残害,最终把策略「锁」在一个非常窄的状态空间里,给后续 RL 的探索能力埋下雷。
具体后果:
- 策略在 SFT 后能在分布内的任务上工作得很好(毕竟 action-only 监督已经把动作学会了)。
- 进入 GRPO 后,熵塌缩快 + 策略移动幅度大 + observation 预测能力跌到 base model 以下。
- RL 探索时撞到分布外状态,由于策略不会「预测 observation」,它对动作后果没有内部模型,只能盲试,pass@k 上不去。
§2 核心方法(机制拆解)
2.1 ActObs:把 observation 也加进 loss
# 伪代码
def sft_loss(trajectory, model):
total_loss = 0
for token in trajectory.tokens:
if token.role == "action":
total_loss += cross_entropy(model.logits, token)
elif token.role == "observation":
# ActObs 的关键差异:observation token 也参与 loss
total_loss += cross_entropy(model.logits, token)
# 对话 / 系统 token 仍可遮蔽
return total_loss / len(trajectory.tokens)
工程上等价于:把原本设为 -100(忽略)的 observation token 标签改回正常的 next-token 标签。这一改的成本是零——没有新数据、没有新参数、没有新前向传播。
2.2 机制解释:joint supervision 防止 one-sided specialization
论文给了一个干净的反向传播解释。设 $g_a$ 为 action 梯度、$g_o$ 为 observation 梯度:
- Action-only 训练:$g_o$ 不被回传,$g_a$ 单方面塑造 hidden state,把共享表征挤压到「只服务 action」的区域,observation 预测能力随之崩塌。
- Joint supervision(ActObs):$g_a$ 与 $g_o$ 同时回传,二者在 hidden state 上做「双向锚定」,梯度迅速变得正交(orthogonal),从而保留对「动作后果」的内部建模。
这条机制的关键证据是 abstract 里给出的:
"action and observation gradients rapidly become orthogonal, while action-only training leaves a large residual observation gradient and degrades environment prediction below the base model."
即 ActObs 下 action / observation 梯度主动正交化;action-only 下 observation 预测能力跌穿 base model。
2.3 对 RL 阶段的两个直接后果
ActObs 在 SFT 阶段后的 RL 阶段产生两个可观测差异:
- 保留更多熵:策略的概率分布更「平」,意味着 RL 探索时不那么快塌缩到 greedy。
- 策略移动更小:从 SFT 初始化到 RL 结束,参数 / 行为分布变化幅度更小,最终策略更接近其 SFT 起点。
这两个差异加起来意味着:策略进入 RL 时不是一个「已经窄化」的 SFT 终点,而是一个「还能探索」的 SFT 起点。
§3 关键实验与数据
abstract 给出的数字是本批 3 篇里最具体的,可直接转写:
| 任务 | 模型 | 对照 | 关键数字 |
|---|---|---|---|
| Terminal-Bench 2.0 | Qwen3-4B | ActObs vs action-only SFT → GRPO | ActObs 在所有评估采样预算下都更高 pass@k(abstract 未列具体数字 ⚠️ 待核) |
| Terminal-Bench 2.0 | Qwen3-8B | 同上 | 牺牲一点 pass@1,换 +3.4 pp at pass@16,并解出更多 distinct tasks |
| aider-polyglot(跨域代码编辑) | Qwen3-4B | 同上 | +4.2 pp at pass@1 at 4B,且任务在 SFT 与 RL 中均未见 |
| 熵保持 / 策略移动 | Qwen3-4B/8B | 同上 | RL 阶段保留更多熵,策略移动更小 |
⚠️ Terminal-Bench 2.0 各采样预算的具体数字(pass@1 / pass@4 / pass@16 完整曲线),abstract 未列具体值(待核 PDF §X)。 ⚠️ +3.4 pp / +4.2 pp 的 baseline 是 action-only 还是某种已有 SOTA,abstract 未明(原文未明确)。 ⚠️ 是否给出对照 MiniLLM / RLHF / 其他 agentic SFT 范式,abstract 未明(原文未明确)。 ⚠️ aider-polyglot 的具体配置(语言 / 任务分布),abstract 未详(待核 PDF §X)。
§4 亮点
- 零成本修改:不增加数据 / 参数 / token / 前向传播,只是改 loss 掩码。
- 跨任务成立:Terminal-Bench(agentic)+ aider-polyglot(代码编辑)两个不同领域都有效,不是 cherry-pick。
- 机制可证伪:用「梯度正交化」+「observation 预测能力 vs base model」做出可独立验证的预测,不是黑盒改进。
- 数字硬:+3.4 pp / +4.2 pp 是 abstract 直接给出的量化结果,不是泛泛而谈。
- 探索与可靠性可权衡:8B 上 trade-off 一点 pass@1 换更高的 pass@k,揭示一个有用的工程取舍。
§5 局限与边界
| 边界 | 内容 |
|---|---|
| B1 | 仅在 Qwen3 系列上验证;Llama / Gemma / 其他家族是否同样有效 abstract 未明(原文未明确) |
| B2 | 仅 GRPO 后训练验证;PPO / DPO / RLOO 等其他 RL 变体是否同样受益 abstract 未明(原文未明确) |
| B3 | 仅 Terminal-Bench 2.0 + aider-polyglot 两个任务;SWE-bench / WebArena / 其他 agentic 基准的迁移性 abstract 未明(原文未明确) |
| B4 | 「observation token 参与 loss」对长 context agent 的训练稳定性影响 abstract 未量化(待核 PDF §X) |
| B5 | 与已有 agentic SFT 工作(如 Agent-Foundation-Models、Open-Reasoning-Zero、Tool-ACE 等)的关系未明(原文未明确) |
| B6 | observation token 的位置编码 / masking 细节(如对工具返回 vs 环境反馈是否同等对待)abstract 未明(原文未明确) |
| B7 | 当 trajectory 中 observation token 比例很高时,loss 平衡是否需要重新调权 abstract 未明(原文未明确) |
| B8 | 是否对模型「幻觉 observation」行为(生成不存在的环境反馈)造成副作用 abstract 未披露(原文未明确) |
| B9 | 训练数据本身的 observation 噪声水平对 ActObs 效果的影响 abstract 未量化(待核 PDF §X) |
| B10 | 「梯度正交化」机制证据是否伴随可视化(如 hidden state PCA)abstract 未明(原文未明确) |
| B11 | 与已有的「observation prediction auxiliary loss」工作关系未明(原文未明确) |
| B12 | Terminal-Bench 2.0 的具体评测协议 / 评分细节 abstract 未披露(待核 PDF §X) |
§6 对工程落地的启发
- SFT 阶段零成本开关:改一行 loss mask,把原本
-100的 observation 标签改回正常值,就可能拿到 +3~4 pp 的 pass@1 / pass@k 收益。 - 梯度健康度监控:训练时画 action / observation 梯度的 cosine similarity,提早发现 one-sided specialization。
- RL 起点选择:把「ActObs-SFT 后策略」作为 GRPO 起点,比 action-only SFT 起点探索更稳,策略移动更小,部署漂移风险更低。
- 评测策略调整:8B 上的 pass@1 ↔ pass@k trade-off 暗示用 pass@k 而不是 pass@1 来评估 agentic 模型会更准——SFT 阶段 ActObs 帮你拿到的就是这条曲线。
- 跨任务迁移预期:actuObs 在 Terminal-Bench 与 aider-polyglot 上同向有效,强烈暗示它对其他 agentic / 代码任务也是低成本增强项。
§7 与同方向工作的关系(撞名 ≥3 主线)
- 主线 R1 · Agent SFT 范式:与 Agent-Foundation-Models、Open-Reasoning-Zero、Skywork-OR1 等 agentic 后训练工作属同谱,ActObs 是其中「loss 掩码」维度的零成本补丁。
- 主线 R2 · On-Policy Distillation / RL 后训练:与 GRPO / DPO / PPO 系列的 agentic 改造方向一致,ActObs 提供的是「让 RL 起点更好」的输入侧修正。
- 主线 R3 · 探索与熵正则化:与 entropy bonus、KL-regularized RL、max-entropy exploration 属同一思路,但本文走的是「SFT 阶段就开始塑形」而不是「RL 阶段加 bonus」。
- 主线 R4 · 工具调用 / 代码 agent:与 aider、SWE-Agent、Tool-ACE 等代码 agent 工作方向一致,本文以 aider-polyglot 作为跨域迁移证据。
- 主线 R5 · Observation / world model 预测:与 DreamerV3、IRIS、Genie 等 world model 方向有思路交汇——本文走「预测 observation token」而非「重建像素 / latent」,但目的都是「让策略建模动作后果」。
§8 适合谁读
- Agent 后训练 / RLHF / GRPO 工程师:直接受益,零成本拿到 pass@k 提升。
- Agent 评测研究者:8B 上的 pass@1 ↔ pass@k trade-off 给 agentic 评测指标设计带来新信号。
- SFT 数据流水线工程师:loss mask 改一行就够,无需碰数据格式。
- LLM 训练方法论研究者:gradient orthogonality + one-sided specialization 是一个可继续深挖的机制点。
- 不推荐给:纯静态对话 / 单轮生成场景的研究者(B 类范围外)、没有 SFT → RL 管线的应用工程师。
§9 来源与不确定处
- 来源:
/shared/research-kb/organized/paper_cards/1427-2609-20715.md+ arXiv abstracthttps://arxiv.org/abs/2609.20715。 - 不确定 / 待核 PDF §X:Terminal-Bench 各采样预算完整数字、+3.4 / +4.2 pp 的对照对象、是否对 PPO/DPO/RLOO 也成立、长 context agent 上的训练稳定性、observation 噪声鲁棒性。
- 未触碰边界:未下载 PDF / 未跑代码 / 未生成新数据;所有推断基于 paper card + abstract 公开内容;不确定处已逐条标 ⚠️。