不要遮蔽环境:观测监督如何改变 RL 下 Agent 的探索

  • 关联论文:2609.20715
  • 作者:flyP
  • 更新:2026-09-19

§0 元层五问(写作前自检)

维度 自问 本文答复
真实问题 这篇论文到底解决什么「之前没人解决」的事? 标准 agent SFT 只对 action token 计算 loss,导致策略在后续 RL 中探索能力被锁死
既有失败模式 之前业内默认的解法为何不行? 默认遮蔽 observation token,让模型不预测它——副作用是 action 与 observation 的梯度反向相互残害,observation 预测能力跌到 base model 之下
关键 trick 这篇真正聪明的一招是什么? 把 observation token 也加入监督目标(ActObs),无需新增数据 / 参数 / token / 前向传播,让策略学会「动作后果」
适用范围 这招在哪能用、在哪不能用? 任何 agent 走「SFT → GRPO/RL」管线的场景;纯静态对话 / 单轮生成场景不直接适用
一句话结论 用一句话讲清核心 SFT 阶段同时监督 action 与 observation token,可以在不增加任何成本的情况下,让后续 GRPO 在 Terminal-Bench 2.0 与 aider-polyglot 上取得更高的 pass@k 与更稳的探索

本文评级:⭐⭐⭐ 立基础候选(research · method · 跨 2 模型 / 2 任务 / 4 个量化指标 / 无顶会 anchor ⚠️ 待补 / 已给具体数字但未给顶会接收记录 ⚠️ 待补)

§1 解决什么真问题

Agent 训练的标准范式是「先 SFT 后 RL」:用人类或专家轨迹做 SFT 初始化策略,再用 GRPO / PPO 之类的 RL 算法在环境中打磨。SFT 阶段几乎所有人都在做同一件事——对 agent 生成的动作 token 加 loss,环境观测 token 遮蔽掉,作为上下文但不作为预测目标

直觉上这很合理:部署后的 agent 不生成 observation,预测它有啥用?论文的反驳是:这种遮蔽会让 action 与 observation 的梯度在反向传播时相互残害,最终把策略「锁」在一个非常窄的状态空间里,给后续 RL 的探索能力埋下雷。

具体后果:

  1. 策略在 SFT 后能在分布内的任务上工作得很好(毕竟 action-only 监督已经把动作学会了)。
  2. 进入 GRPO 后,熵塌缩快 + 策略移动幅度大 + observation 预测能力跌到 base model 以下
  3. RL 探索时撞到分布外状态,由于策略不会「预测 observation」,它对动作后果没有内部模型,只能盲试,pass@k 上不去。

§2 核心方法(机制拆解)

2.1 ActObs:把 observation 也加进 loss

# 伪代码
def sft_loss(trajectory, model):
    total_loss = 0
    for token in trajectory.tokens:
        if token.role == "action":
            total_loss += cross_entropy(model.logits, token)
        elif token.role == "observation":
            # ActObs 的关键差异:observation token 也参与 loss
            total_loss += cross_entropy(model.logits, token)
        # 对话 / 系统 token 仍可遮蔽
    return total_loss / len(trajectory.tokens)

工程上等价于:把原本设为 -100(忽略)的 observation token 标签改回正常的 next-token 标签。这一改的成本是零——没有新数据、没有新参数、没有新前向传播。

2.2 机制解释:joint supervision 防止 one-sided specialization

论文给了一个干净的反向传播解释。设 $g_a$ 为 action 梯度、$g_o$ 为 observation 梯度:

  • Action-only 训练:$g_o$ 不被回传,$g_a$ 单方面塑造 hidden state,把共享表征挤压到「只服务 action」的区域,observation 预测能力随之崩塌
  • Joint supervision(ActObs):$g_a$ 与 $g_o$ 同时回传,二者在 hidden state 上做「双向锚定」,梯度迅速变得正交(orthogonal),从而保留对「动作后果」的内部建模。

这条机制的关键证据是 abstract 里给出的:

"action and observation gradients rapidly become orthogonal, while action-only training leaves a large residual observation gradient and degrades environment prediction below the base model."

即 ActObs 下 action / observation 梯度主动正交化;action-only 下 observation 预测能力跌穿 base model。

2.3 对 RL 阶段的两个直接后果

ActObs 在 SFT 阶段后的 RL 阶段产生两个可观测差异:

  1. 保留更多熵:策略的概率分布更「平」,意味着 RL 探索时不那么快塌缩到 greedy。
  2. 策略移动更小:从 SFT 初始化到 RL 结束,参数 / 行为分布变化幅度更小,最终策略更接近其 SFT 起点

这两个差异加起来意味着:策略进入 RL 时不是一个「已经窄化」的 SFT 终点,而是一个「还能探索」的 SFT 起点。

§3 关键实验与数据

abstract 给出的数字是本批 3 篇里最具体的,可直接转写:

任务 模型 对照 关键数字
Terminal-Bench 2.0 Qwen3-4B ActObs vs action-only SFT → GRPO ActObs 在所有评估采样预算下都更高 pass@k(abstract 未列具体数字 ⚠️ 待核)
Terminal-Bench 2.0 Qwen3-8B 同上 牺牲一点 pass@1,换 +3.4 pp at pass@16,并解出更多 distinct tasks
aider-polyglot(跨域代码编辑) Qwen3-4B 同上 +4.2 pp at pass@1 at 4B,且任务在 SFT 与 RL 中均未见
熵保持 / 策略移动 Qwen3-4B/8B 同上 RL 阶段保留更多熵,策略移动更小

⚠️ Terminal-Bench 2.0 各采样预算的具体数字(pass@1 / pass@4 / pass@16 完整曲线),abstract 未列具体值(待核 PDF §X)。 ⚠️ +3.4 pp / +4.2 pp 的 baseline 是 action-only 还是某种已有 SOTA,abstract 未明(原文未明确)。 ⚠️ 是否给出对照 MiniLLM / RLHF / 其他 agentic SFT 范式,abstract 未明(原文未明确)。 ⚠️ aider-polyglot 的具体配置(语言 / 任务分布),abstract 未详(待核 PDF §X)。

§4 亮点

  1. 零成本修改:不增加数据 / 参数 / token / 前向传播,只是改 loss 掩码。
  2. 跨任务成立:Terminal-Bench(agentic)+ aider-polyglot(代码编辑)两个不同领域都有效,不是 cherry-pick。
  3. 机制可证伪:用「梯度正交化」+「observation 预测能力 vs base model」做出可独立验证的预测,不是黑盒改进。
  4. 数字硬:+3.4 pp / +4.2 pp 是 abstract 直接给出的量化结果,不是泛泛而谈。
  5. 探索与可靠性可权衡:8B 上 trade-off 一点 pass@1 换更高的 pass@k,揭示一个有用的工程取舍。

§5 局限与边界

边界 内容
B1 仅在 Qwen3 系列上验证;Llama / Gemma / 其他家族是否同样有效 abstract 未明(原文未明确)
B2 仅 GRPO 后训练验证;PPO / DPO / RLOO 等其他 RL 变体是否同样受益 abstract 未明(原文未明确)
B3 仅 Terminal-Bench 2.0 + aider-polyglot 两个任务;SWE-bench / WebArena / 其他 agentic 基准的迁移性 abstract 未明(原文未明确)
B4 「observation token 参与 loss」对长 context agent 的训练稳定性影响 abstract 未量化(待核 PDF §X)
B5 与已有 agentic SFT 工作(如 Agent-Foundation-Models、Open-Reasoning-Zero、Tool-ACE 等)的关系未明(原文未明确)
B6 observation token 的位置编码 / masking 细节(如对工具返回 vs 环境反馈是否同等对待)abstract 未明(原文未明确)
B7 当 trajectory 中 observation token 比例很高时,loss 平衡是否需要重新调权 abstract 未明(原文未明确)
B8 是否对模型「幻觉 observation」行为(生成不存在的环境反馈)造成副作用 abstract 未披露(原文未明确)
B9 训练数据本身的 observation 噪声水平对 ActObs 效果的影响 abstract 未量化(待核 PDF §X)
B10 「梯度正交化」机制证据是否伴随可视化(如 hidden state PCA)abstract 未明(原文未明确)
B11 与已有的「observation prediction auxiliary loss」工作关系未明(原文未明确)
B12 Terminal-Bench 2.0 的具体评测协议 / 评分细节 abstract 未披露(待核 PDF §X)

§6 对工程落地的启发

  1. SFT 阶段零成本开关:改一行 loss mask,把原本 -100 的 observation 标签改回正常值,就可能拿到 +3~4 pp 的 pass@1 / pass@k 收益。
  2. 梯度健康度监控:训练时画 action / observation 梯度的 cosine similarity,提早发现 one-sided specialization。
  3. RL 起点选择:把「ActObs-SFT 后策略」作为 GRPO 起点,比 action-only SFT 起点探索更稳,策略移动更小,部署漂移风险更低。
  4. 评测策略调整:8B 上的 pass@1 ↔ pass@k trade-off 暗示用 pass@k 而不是 pass@1 来评估 agentic 模型会更准——SFT 阶段 ActObs 帮你拿到的就是这条曲线。
  5. 跨任务迁移预期:actuObs 在 Terminal-Bench 与 aider-polyglot 上同向有效,强烈暗示它对其他 agentic / 代码任务也是低成本增强项。

§7 与同方向工作的关系(撞名 ≥3 主线)

  • 主线 R1 · Agent SFT 范式:与 Agent-Foundation-Models、Open-Reasoning-Zero、Skywork-OR1 等 agentic 后训练工作属同谱,ActObs 是其中「loss 掩码」维度的零成本补丁。
  • 主线 R2 · On-Policy Distillation / RL 后训练:与 GRPO / DPO / PPO 系列的 agentic 改造方向一致,ActObs 提供的是「让 RL 起点更好」的输入侧修正。
  • 主线 R3 · 探索与熵正则化:与 entropy bonus、KL-regularized RL、max-entropy exploration 属同一思路,但本文走的是「SFT 阶段就开始塑形」而不是「RL 阶段加 bonus」。
  • 主线 R4 · 工具调用 / 代码 agent:与 aider、SWE-Agent、Tool-ACE 等代码 agent 工作方向一致,本文以 aider-polyglot 作为跨域迁移证据。
  • 主线 R5 · Observation / world model 预测:与 DreamerV3、IRIS、Genie 等 world model 方向有思路交汇——本文走「预测 observation token」而非「重建像素 / latent」,但目的都是「让策略建模动作后果」。

§8 适合谁读

  • Agent 后训练 / RLHF / GRPO 工程师:直接受益,零成本拿到 pass@k 提升。
  • Agent 评测研究者:8B 上的 pass@1 ↔ pass@k trade-off 给 agentic 评测指标设计带来新信号。
  • SFT 数据流水线工程师:loss mask 改一行就够,无需碰数据格式。
  • LLM 训练方法论研究者:gradient orthogonality + one-sided specialization 是一个可继续深挖的机制点。
  • 不推荐给:纯静态对话 / 单轮生成场景的研究者(B 类范围外)、没有 SFT → RL 管线的应用工程师。

§9 来源与不确定处

  • 来源/shared/research-kb/organized/paper_cards/1427-2609-20715.md + arXiv abstract https://arxiv.org/abs/2609.20715
  • 不确定 / 待核 PDF §X:Terminal-Bench 各采样预算完整数字、+3.4 / +4.2 pp 的对照对象、是否对 PPO/DPO/RLOO 也成立、长 context agent 上的训练稳定性、observation 噪声鲁棒性。
  • 未触碰边界:未下载 PDF / 未跑代码 / 未生成新数据;所有推断基于 paper card + abstract 公开内容;不确定处已逐条标 ⚠️。