日期与轮次:2026-07-25 R3 arxiv 链接:https://arxiv.org/abs/2607.21557 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-25_R3_openforgerl-harness-native-rl-train-deploy-bridge-short-video-script.md
1. 标题与观众
标题:OF · proxy 解耦 harness 与RL 目标观众:Agent 训练基础设施工程师 / RL 训练栈开发者 / Agent harness 维护者 / Agent 训练-部署对齐研究者 / OpenClaw · Codex · Claude Code 二次开发团队 / veRL · OpenRLHF · TRL 等开源 RL 训练栈贡献者 一句话核心观点:OpenForgeRL 用一个轻量 proxy 把 Claude Code / Codex / OpenClaw 等 harness 内的 LLM 调用重定向到标准推理请求 + Kubernetes per-rollout 容器化 + 轨迹可重放,让任意 harness × 任意环境 × 任意 RL 栈端到端训练,OpenForgeClaw ClawEval pass³ 31.7 / pass@3 55.9、OpenForgeGUI OSWorld-Verified 37.7。
3. 45-90 秒口播稿
现代 Agent 不再是孤立 LLM,而是被 Claude Code / Codex / OpenClaw 这类多进程、有状态、带工具的 harness 包着。但 veRL / OpenRLHF / TRL 这些标准 RL 栈只能表达单次推理调用,无法原生处理 harness 的多轮状态、工具 side effect、进程隔离。
OpenForgeRL 的切入点是:不动训练栈,也不重写 harness,只在中间插一个轻量 proxy。Harness 默认指向 OpenAI / Anthropic 兼容 endpoint,proxy 把请求+响应落盘成可重放轨迹,对训练栈就是另一个普通推理服务。
每次 rollout 拉起一个独立 Kubernetes 容器,装着目标 harness 和目标环境。训练节点和 rollout 资源解耦,长尾 GUI 任务和高吞吐代码任务可以混部。同一份轨迹,既能跑 PPO / GRPO,也能做 off-policy RL 和 rejection sampling。
效果上,OpenForgeClaw 在 ClawEval 拿到 pass³ 31.7 / pass@3 55.9,QwenClawBench 33.7;OpenForgeGUI 在 OSWorld-Verified 37.7 / Online-Mind2Web 63.0 / WebVoyager 72.3。但论文也承认:不同 harness 可学性差异巨大,error recovery 这类「做错了怎么救」的能力,经 RL 仍未显著提升。
今天能带走的:用 proxy 解耦训练栈与 harness,比改造 trainer 或改 harness 都便宜 —— 但 proxy 拦截开销 + rollout wall-clock 抖动 + latency 与 determinism 影响原文未明确披露,工程落地细节待社区验证。
4. 镜头分镜
scene-1 hero · 标题卡(8s)
- 时长:8s
- 屏幕文字:
OF · proxy 解耦 harness 与 RL(主标题 11 字) - 画面元素:深色背景 + 主标题大字居中 + 副标题小字 "arXiv 2607.21557 v1 · OpenForgeRL"
- 运动方式:主标题从下往上滑入,副标题淡入
scene-2 judgment · 三个判断点(8s)
- 时长:8s
- 屏幕文字:卡片一「proxy 解耦训练栈与 harness」/ 卡片二「K8s per-rollout 容器隔离」/ 卡片三「轨迹可重放通用 PPO/GRPO」
- 画面元素:三张判断卡横向排列,卡片边框亮起依次高亮
- 运动方式:三卡淡入 + 当前卡边框脉冲放大
scene-3 evidence · 数字证据卡(8s)
- 时长:8s
- 屏幕文字:
31.755.933.737.763.072.3 - 画面元素:6 个数字圆环并排,圆环底色 = 主分类 cs.AI + cs.CL 配色(深蓝 + 青)
- 运动方式:数字从中心放大弹出,后五个依次延时 0.4s 出现
scene-4 architecture · 三件套架构图(8s)
- 时长:8s
- 屏幕文字:
harness → proxy(落盘轨迹)→ K8s per-rollout pod → 标准 RL 栈(veRL) - 画面元素:四节点横向流程图,箭头连接,proxy 节点高亮 + 落盘轨迹图标
- 运动方式:流程图从左向右绘制,箭头依次点亮
scene-5 risk · 风险卡三件套(8s)
- 时长:8s
- 屏幕文字:
- 主行
GitHub 实测+ 副行W7 0 命中(W7) - 主行
主分类 cs.X+ 副行cs.AI+CL(W11) - 主行
数字 6 件 verbatim+ 副行实验论文路径(W4) - 画面元素:三张风险卡竖排,每卡主行大字 + 副行小字双行排版,边框警示色
- 运动方式:三卡依次滑入,每张停顿 2.5s
scene-6 architecture-comparison · 训练栈解耦对比(8s)
- 时长:8s
- 屏幕文字:表头
harness 适配 / 训练栈改造 / 通用性,行改 trainer 多 ✗ ✗/改 harness 多 ✗ ✗/proxy 解耦(OF)少 ✓ ✓ - 画面元素:2×4 网格表,OF 行用主色高亮
- 运动方式:表格行依次出现,OF 行最后高亮 + 边框脉冲
scene-7 closing · 落版卡(8s)
- 时长:8s
- 屏幕文字:
OF = train-deploy bridge · proxy 解耦层·与 weight-level persistence / image-space waypoint 完全不同视角·proxy 拦截开销 + 单次 rollout wall-clock 抖动 + proxy 引入 latency 与 determinism 影响原文未明确披露 · 工程落地细节待社区验证 - 画面元素:落版卡 + 行动清单点(用 proxy 解耦训练栈与 harness)
- 运动方式:行动点逐条打勾,字幕层最后一行小字 disclaimer 淡入