• 日期:2026-10-05(Asia/Shanghai)
  • 轮次:R2
  • arXiv 链接:https://arxiv.org/abs/2609.09134
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-10-05_R2_onpolicy-harness-correction_short-video-script.md

1. 标题与观众

  • 标题:协同进化反 hook · on-policy 修正救场
  • 目标观众:AI 工程师 + 技术产品经理
  • 一句话核心观点:在已进化 Harness 上做全轨迹模仿 SFT 会让弱模型倒退 4-30 分,on-policy 修正才能救场。

3. 45-90 秒口播稿

你以为是双重增益:先进化 Harness,再用专家轨迹微调弱模型。结果论文在 7 个企业 Agent 任务上证明,这条叠加路径让弱模型在已进化 Harness 上性能倒退 4 到 30 分,Qwen3-Coder 和 Gemma 4 全军覆没。

原因不是模仿没用,而是模仿破坏 model-harness fit:弱模型学了专家的规划策略,但 Harness 是为它原生风格进化的,新风格与 Harness 不兼容。

解法不是放弃 SFT,而是切换到 on-policy 专家修正:让弱模型在已进化 Harness 上跑自己的 rollout,元层 MLE Agent 自动定位失败的那一轮,只让专家重写那一轮,保留弱模型原生分布。

行动建议:在你下次设计私有化弱模型 + Harness 进化路线时,先跑一份 on-policy 局部修正的最小实验,把「全轨迹模仿 SFT」替换掉,看是否真能避开 4 到 30 分的回归区间。

4. 镜头分镜

  • 镜头 1(0-5s):时长 5s,屏幕文字「协同进化 ≠ 简单叠加 · 4-30 分反 hook」,画面元素为黑底红色标题卡 + 论文 arXiv 编号 2609.09134 + first author Zhou Yu,运动方式为标题从中央放大定格。
  • 镜头 2(5-15s):时长 10s,屏幕文字「已进化 Harness + 全轨迹模仿 SFT」,画面元素为流程图:左 = Harness 进化 → 右 = 专家全轨迹 → 下 = 弱模型 SFT,运动方式为箭头依次点亮,最后结果区显示「-4 到 -30 分」红字闪烁。
  • 镜头 3(15-25s):时长 10s,屏幕文字「模仿既传知识又破坏 model-harness fit」,画面元素为证据卡双栏:左 = 正面效应(知识传递 + scaffold 使用率上升),右 = 负面效应(规划风格错配 + Harness 不兼容),运动方式为左右两栏同时淡入,负面栏加红色边框。
  • 镜头 4(25-40s):时长 15s,屏幕文字「on-policy 专家修正流水线 · 5 步」,画面元素为流程图:① 弱模型 rollout → ② 元层 MLE Agent 定位失败轮 → ③ 专家仅重写失败轮 → ④ 拼回 SFT 数据 → ⑤ 弱模型微调,运动方式为编号步骤逐个高亮,失败轮那一格加黄色脉冲。
  • 镜头 5(40-55s):时长 15s,屏幕文字「实证:7 任务 × Qwen3-Coder + Gemma 4」,画面元素为证据卡:任务数 7、弱模型 2、回归区间 4-30 分、提升对照 3 个(原始 Harness 全轨迹模仿 + 已进化 Harness on-policy 修正),运动方式为数字滚动到固定位置,右下角小字「实证仅 7 个企业 Agent 任务 + 2 个弱模型 · 不外推」。
  • 镜头 6(55-65s):时长 10s,屏幕文字「撞名风险字幕层」,画面元素为风险卡 4 行:① on-policy 修正 ≠ DPO ≠ RLHF ≠ Online RL · ② Harness 进化方法 ≠ OPRO/TextGrad/GEPA 单一选定 · ③ model-harness fit ≠ 模型对齐 ≠ 蒸馏 · ④ 2609.09134 ≠ R1 10-05 X-Tree(2609.32993),运动方式为四行依次淡入,末行加橙色警示底色。
  • 镜头 7(65-75s):时长 10s,屏幕文字「行动清单:跑一份 on-policy 局部修正最小实验」,画面元素为行动清单 3 条:① 用 1 个内部任务 + 50 条弱模型 rollout · ② 人工或 LLM-as-judge 标失败轮 · ③ 专家仅修失败轮 + 对比基线,运动方式为三条逐条亮起,末条加绿色对勾。
  • 镜头 8(75-85s):时长 10s,屏幕文字「协同进化 = Harness + 模型联合设计」,画面元素为收尾卡:核心结论一行 + 论文 arXiv 2609.09134 + first author Zhou Yu + 诚实标注一行(摘要未给具体百分比 + 失败定位黑箱 + 专家成本未量化 + Harness 进化方法未明示),运动方式为结论居中放大,诚实标注小字下方淡入。