flyP 精读与批判 · 2026-07-28 15:50
0. 本场为什么挑这两篇
arXiv:2607.24731Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation(tom 7-28 0840 radar #1 candidate,HF Daily 7-28 头条 15 votes,直接对应 SANA-Video 2.0 / Self Gradient Forcing / DMD2 / Score Distillation 流派——视频生成训练策略主轴 1)arXiv:2607.24720The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation(tom 7-28 0840 radar #2 candidate,12 votes,直接对应 v33 §1 主线 4「智能体与多模态」+ 主线 6「物理 AI」交叉点)
两篇共享"on-policy / on-policy distillation"主线(标题都出现 on-policy),是 diffusion 与 agentic 训练策略的同源新工作。
1. arXiv:2607.24731 · Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
1.1 元信息
- 标识:arXiv:2607.24731,2026-07-26 发布
- 链接:https://arxiv.org/abs/2607.24731
- HF Daily 票数:15▲(HF Daily 7-28 头条区;与 v33 6 件 fresh 横向对比 = 高于 SDM 18▲ 但单日单时点未跨日累计)
- 主分类:systems(HF tag = systems;从 flyP 视角看 = multimodal 训练侧 + diffusion 范式邻接)
- 来源文件:
/shared/research-kb/inbox/tom/_candidates/2026-07-28-agent-rag-longcontext-candidates.json中id=07575a9c206d - paper_cards 状态:未建(最新 615-2607-18142 是 7-28 09:55 落地)
1.2 核心贡献(摘要级判断)
- 指出 OPD 范式下 CFG 组合预测的「branch-level under-identification」:在 classifier-free guidance (CFG) 默认开启的现代 diffusion 系统里,On-Policy Distillation (OPD) 学生采样轨迹去问教师,沿用 velocity matching 直接匹配教师和学生的 guided velocities;但正负分支误差在 guided prediction 里可以互相补偿 → objective 在分支级未被识别(branch-level under-identification)
- 两类反例的对照分析:① 共享 noise schedule / sampler 时,naive matching 仍然有效;② 不共享时(即 student 的 CFG trajectory 显著偏离 teacher),naive matching 直接失败
- 提出的修正:在 on-policy diffusion distillation 下,需要 branch-aware objective(正负分支分别匹配,不能直接匹配复合 guided velocity)—— 这与 DMD2 / Diff-Instruct / Score Distillation 的隐含假设直接碰撞
- 核心论点:CFG 是现代 diffusion 系统的默认组件,OPD 不应假设 CFG 关闭;把"guided velocity 当单一目标"是当前主流 OPD 实现的隐含错误
1.3 方法拆解(摘要级)
- 方法核心:把 OPD 的 teacher-student velocity matching 目标在 CFG 空间分解为「unconditional branch + conditional branch」两条独立目标,分别计算 loss,再用原始 CFG 公式合成;等价于把匹配误差分配到每个分支
- 对应训练阶段:扩散模型 distillation 中 student 学习 teacher 分布;on-policy = student 当前采样轨迹,不是预先 offline 采的
- 关键工程难点:① trajectory 采样 cost(每步 student 都要重采样)→ on-policy 本来就贵;② branch-aware matching 的 loss 数值稳定性(正负分支可能 one-hot 不平衡)→ 需要 weighted loss;③ 与 reward feedback / DPO 类对齐训练的兼容性 → 待验
1.4 实验可信度(摘要级判断)
- 优势:15 votes(HF Daily 单日高票)+ 反例式论证对范式纠错有强说服力;与 DMD2、Diff-Instruct、SDXL-Lightning、Turbo 系列在工业蒸馏流水线上有强应用对接
- 风险: ① 数值稳定性:branch-aware loss 在正负分支高度相关(CFG 权重低)时可能梯度消失 ② 未给 vs DMD2 / Diff-Instruct 的 head-to-head benchmark —— 论文摘要只说"naive matching 失败",但实际加速 / 收敛步数 / FID 改进幅度未量化(待精读实验节) ③ CFG 权重扫描不充分:摘要只给"两类反例"二元对照,CFG 权重连续扫描的稳定性未给 ④ 复现性:GitHub 链接未在摘要给出 → 待精读引言末尾 / 实验节
1.5 与 flyP 已有 critical-read 闭环的关联
- 视频生成训练策略主轴 1(v33 §2.39.92 + §2.39.x):SANA-Video 2.0(5B/14B Hybrid Linear-Softmax 3:1 + Sol-Engine 3.58× + VBench 84.30)使用 Sol-Engine distillation + Self Gradient Forcing(2607.20368 长视频外推);OPD-CFG 修正直接关系到 SANA-Video 2.0 蒸馏阶段的训练稳定性——如果 SANA-Video 2.0 Sol-Engine 用的是 naive guided velocity matching,那在 CFG 关闭时没问题,CFG 开启时可能与本论文反例 #2 同源失败
- 主线 1 统一多模态生成 + 主线 2 长视频:diffusion 蒸馏是 7-28 主战场增量的「训练侧基础设施」;与 Scaling Native Multimodal Pre-Training (2607.22043,今天 0955 已精读) 形成"原生预训练 scaling" + "蒸馏范式修正" 二联
- §3.3 反方新增候选:①「guided velocity matching 在 CFG 开启时是 under-identified」= 主线 1 + 主线 2 的训练侧新反方;② 与 v33 §3.3 #45 Sol-Engine 蒸馏 head-to-head 缺 → 可触发 §3.3 #57「视频生成 distillation 范式未统一」反方
1.6 复现难度与建议路径
- 复现难度:中-高(需要 diffusion 训练栈 + branch-aware loss 实现 + 多次 trajectory 采样)
- 建议路径: ① 最小复现:在 SD 1.5 / SDXL 上跑 10K 步蒸馏,naive guided matching vs branch-aware matching 的 FID / CLIP 对比 ② 生产复现:对接 SANA-Video 2.0 Sol-Engine,看 14B 模型 CFG 权重扫描下 distillation stability ③ 代码:先看论文 GitHub(摘要未给 → 待精读 5. Implementation Details)
- 建议入库:B+ 旁证(立标级需补 vs DMD2 / Diff-Instruct head-to-head benchmark;当前只有范式判断 + 反例论证)
- 建议写入路径:
/shared/research-kb/organized/paper_cards/618-2607-24731.md+ v34 §2.39.x 蒸馏范式段位 + v34 §3.3 反方 #57 候选
1.7 短审稿结论
- 核心贡献:识别 OPD + CFG 范式的 branch-level under-identification,提出 branch-aware matching 修正,对当前 SANA-Video 2.0 / DMD2 / SDXL-Lightning / Turbo 系列蒸馏流水线有直接工业价值
- 主要问题:① 与 SOTA OPD 方法的 head-to-head 报数未给;② CFG 权重扫描的连续稳定性未给;③ GitHub 链接未在摘要可见
- 可信度:中-高(反例式论证对范式纠错有强说服力,但工业落地证据需要补 benchmark)
- 是否建议入库:是,B+ 旁证级 v34 §2.39.x 候选(与 SANA-Video 2.0 立标级、Self Gradient Forcing 立标级形成"训练策略三联"补全)
- 后续验证动作:① 精读实验节,找 DMD2 / Diff-Instruct / SDXL-Lightning head-to-head;② 找 GitHub 代码;③ 联系 SANA-Video 2.0 团队看 Sol-Engine 是否已采用 branch-aware;④ 跟踪 HF Daily 跨日累计
2. arXiv:2607.24720 · Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via On-Policy Agentic Distillation
2.1 元信息
- 标识:arXiv:2607.24720,2026-07-26 发布
- 链接:https://arxiv.org/abs/2607.24720
- HF Daily 票数:12▲(HF Daily 7-28 #2 candidate,agent + systems 标签)
- 主分类:agent(主) + multimodal(副 · 物理约束邻接)
- 来源文件:
/shared/research-kb/inbox/tom/_candidates/2026-07-28-agent-rag-longcontext-candidates.json中id=f675773f5e97 - paper_cards 状态:未建
2.2 核心贡献(摘要级判断)
- 三阶段系统性拆解 long-horizon planning 的训练路径: ① Pre-training 阶段:探究 planning ability 的 data format / distribution / quality;通过 CoT state transition modeling 构建显式 world model ② Post-training 阶段(Single-teacher OPD):单教师 on-policy agentic distillation ③ Post-training 阶段(Multi-teacher OPD):多教师 on-policy agentic distillation
- 提供 unified & controlled multi-turn environment:在受控环境(vs Internet 不可控 opaque 数据)下系统研究 long-horizon planning
- 核心论点:foundation model agents 的 long-horizon planning 能力必须分阶段讨论;混在一起训练 → 无法识别能力从哪里来
2.3 方法拆解(摘要级)
- 环境设计:unified controlled multi-turn environment,物理约束 + 多回合 → 与 v33 §1 主线 6 物理 AI 强邻接
- 三阶段训练 pipeline:
- 阶段 1:pre-training data = CoT state transition + world model construction(这是把"显式世界模型"作为数据格式——与 LeCun JEPA + v33 §6 AMI Labs 路线对话)
- 阶段 2:single-teacher OPD(on-policy = student 当前 trajectory 采样)
- 阶段 3:multi-teacher OPD(多个教师集成 → 知识融合 vs 误差抵消)
- 关键创新点:把"long-horizon planning" 显式解耦为 data format × trajectory sampling × teacher count 三维度;每个维度独立研究 → 解决现有 opaque Internet data 训练不可分析问题
2.4 实验可信度(摘要级判断)
- 优势:12 votes(HF Daily 单日高票)+ 三阶段解耦的范式价值 + 与 LeCun AMI Labs 世界模型路线同向 + 与 AREX 7-28 头条(agent 主 multimodal 副 142▲)形成 "multi-turn long-horizon + 工具调用" 邻接
- 风险: ① controlled environment vs 真实长链 agent 任务的迁移性:unified controlled = 不一定能泛化到 AgentRx(7-25 已精读 multimodal clinical 真实复诊) / O-VAD(7-28 已精读 工业质检) / AREX(7-28 142▲) 等真实长链 ② multi-teacher OPD 误差分析:多个教师集成时权重分配、误差传播未给 ③ pre-training data = CoT state transition 的 cost:显式构造 world model 比隐式 learning 贵 N 倍 ④ 未给 vs OpenAI Operator / Anthropic Computer Use / Anthropic Managed Agents(v33 §6 升级)的 head-to-head ⑤ 未给 vs v33 主线 4 智能体(ReOPD 7-26 2250 已精读 · O-VAD · VSTAT · ABot-N1 · ABot-World-0 LongForcing · LongVideoAgent · SeerRepo · Anchor-Align)的同向对比
2.5 与 flyP 已有 critical-read 闭环的关联
- 主线 4 智能体与多模态(v33 §1 + flyP 7-26 2250 ReOPD B 级精读):ReOPD 是 prefix-replay distillation + 大模型 agentic 工具调用;Multi-Turn Long-Horizon Planning 是 ReOPD 的"上游训练三阶段拆解"补全——ReOPD 关注 post-training 一段,Multi-Turn 补全 pre-training + post-training 两段
- 主线 6 物理 AI + §6 行业 LeCun AMI Labs(v33 §6 已收资本 + 路线):本论文"CoT state transition 显式 world model" + 物理约束环境 = LeCun AMI Labs 世界模型路线在受控环境下的训练实现路径
- §3.3 反方新增候选:①「multi-teacher OPD 误差传播」= 主线 4 反方 #58 候选;②「controlled environment vs 真实长链迁移」= #59 候选
2.6 复现难度与建议路径
- 复现难度:高(需要 controlled environment + 多阶段训练 + multi-teacher 集成 + agentic trajectory 采集)
- 建议路径: ① 最小复现:用 ALFWorld / ScienceWorld 等现成 controlled multi-turn 环境跑 single-teacher OPD,看 vs SFT / DPO 提升 ② 生产复现:对接 ReOPD prefix-replay(7-26 2250 已精读)看 pre-training CoT + post-training single-teacher 的 full pipeline 提升 ③ 代码:先看论文 GitHub(摘要未给)
- 建议入库:B+ 旁证(立标级需补 vs Operator / Computer Use head-to-head + 真实长链迁移性;当前只有范式判断 + 三阶段解构)
- 建议写入路径:
/shared/research-kb/organized/paper_cards/619-2607-24720.md+ v34 §2.39.x agent 主线 + v34 §3.3 反方 #58-#59 候选
2.7 短审稿结论
- 核心贡献:把 long-horizon planning 系统拆为 pre-training + single-teacher OPD + multi-teacher OPD 三阶段,提供 unified controlled environment 作为研究沙盒,对 v33 主线 4 智能体与多模态 + 主线 6 物理 AI 是「上游训练基础设施」补全
- 主要问题:① controlled environment 迁移性未证;② multi-teacher OPD 误差分析未给;③ vs Operator / Computer Use / Managed Agents / ReOPD 的 head-to-head 缺;④ GitHub 链接未在摘要可见
- 可信度:中-高(三阶段解耦对范式分析价值大;与 ReOPD / LeCun JEPA 同向;但工业落地证据需补)
- 是否建议入库:是,B+ 旁证级 v34 §2.39.x 候选(与 ReOPD 旁证级、LongVideoAgent / SeerRepo 形成"agent 训练策略三联")
- 后续验证动作:① 精读实验节,找 multi-teacher vs single-teacher 报数;② 找 GitHub 代码 / ALFWorld / ScienceWorld 复现;③ 跟踪 AREX + AgentRx + O-VAD 在真实长链迁移上的对应数据;④ 跨日累计票数跟踪(vs SDM 累计 78▲ / SANA-Video 2.0 累计 97▲)
3. 双稿对位判断
| 维度 | Rethinking CFG in OPD(2607.24731) | Multi-Turn Long-Horizon Planning(2607.24720) |
|---|---|---|
| 共享主线 | on-policy distillation | on-policy distillation |
| 主分类 | systems(diffusion 蒸馏侧) | agent(多回合长链 + 物理约束) |
| HF Daily 票数 | 15▲ | 12▲ |
| 范式判断 | branch-level under-identification 修正 | 三阶段解耦 pre + post-training |
| 与 v33 主线关联 | 主线 1 统一多模态生成 + 主线 2 长视频(训练侧 SANA-Video 2.0 / SGF 邻接) | 主线 4 智能体 + 主线 6 物理 AI(ReOPD / LeCun JEPA 邻接) |
| 工业对接 | Sol-Engine / DMD2 / Diff-Instruct / SDXL-Lightning / Turbo | Operator / Computer Use / Managed Agents / ReOPD |
| 复现难度 | 中-高 | 高 |
| 立标评级建议 | B+ 旁证(待补 head-to-head) | B+ 旁证(待补 controlled→真实迁移) |
| 反方新增 | §3.3 #57「视频生成 distillation 范式未统一」 | §3.3 #58「multi-teacher OPD 误差传播」+ #59「controlled env 迁移性」 |
4. 短审稿结论(对外摘要)
- arXiv:2607.24731 Rethinking CFG in OPD:识别 OPD + CFG 范式的 branch-level under-identification,提出 branch-aware matching 修正,对 SANA-Video 2.0 / DMD2 / SDXL-Lightning 蒸馏流水线有直接工业价值。
- arXiv:2607.24720 Multi-Turn Long-Horizon Planning:把 long-horizon planning 系统拆为 pre-training + single/multi-teacher OPD 三阶段,提供 unified controlled environment,对 v33 主线 4 智能体 + 主线 6 物理 AI 是「上游训练基础设施」补全。
- CFG-OPD:① vs DMD2 / Diff-Instruct head-to-head 缺;② CFG 权重扫描连续性未给;③ GitHub 链接未明
- Multi-Turn:① controlled env → 真实长链迁移未证;② multi-teacher 误差分析缺;③ vs Operator / Computer Use / ReOPD head-to-head 缺
5. 与今日 0955 dual critical read 的差异化
- 0955 已做:Scaling Native Multimodal (2607.22043) + O-VAD (2607.18142) — 主线 1 训练范式 + 主线 7 工业质检
- 1550 本轮:OPD-CFG (2607.24731) + Multi-Turn Long-Horizon (2607.24720) — 训练范式 on-policy distillation 二联
- 互补关系:0955 的"native multimodal pre-training scaling"是 pre-training 阶段;1550 的"on-policy distillation"是 post-training 阶段;形成 v33 主线 1 + 主线 4 + 主线 6 的「训练全链路」三联
6. 建议写入路径与建议
/shared/research-kb/inbox/flyp/2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read.md(本稿 · 已落地)/shared/research-kb/organized/paper_cards/618-2607-24731.md(建议 · 等 LLM 接手落标)/shared/research-kb/organized/paper_cards/619-2607-24720.md(建议 · 等 LLM 接手落标)- v34 §2.39.x 训练策略段位新增 2 件旁证候选 + §3.3 反方 #57-#59 候选
- 不写 GitHub(按 7-10 稳定运行约束)