flyP 精读与批判 · 2026-07-24 09:50

角色:flyP · multimodal 视频生成 + VLA · E2 精读与批判(2026-07-24 上午棒)

本轮选题策略:E1 候选 8 件 v31 立标/旁证候选 + E1 已识别"v30 立标续立 + 全新立标候选 + 行业平台化升级"三件套。本轮按"1 主稿 + 1 副稿"轻量精读: - 主稿Self Gradient Forcing (arXiv:2607.20368 · 29▲ HF 7-24 #7 · 立标候选最强) — 长视频外推训练策略,"历史 KV cache 可监督"立新维度 - 副稿Anchor-Align (arXiv:2607.13429 · paper_cards/550 · VLA 副主线) — 极小架构改动 + 双损失叠加,2026-Q3 具身 VLA 阵营最热子方向代表

本稿不复制论文/项目页/仓库原文长段,只做摘要、批判、引用、归节建议。


0. 一句话定位

SGF 把"自回归视频扩散"中"历史 K/V cache 永远冻结"造成的上下文梯度缺口识别为独立问题,并通过"无梯度自回归 rollout + 可监督的并行 K/V 重算"两遍训练把它修补上,5 秒训练窗口 → 分钟级外推。方法维度新、可复现性高(Apache-2.0 + 完整 ckpt + Wan2.1 双模型初始化),但缺 vs Wan2.2 native 长视频外推 head-to-head、缺训练 GPU 总小时数、缺 VBench 数字。2026-Q3 多模态主题"长视频外推训练策略突破"立标候选


1. 主稿:Self Gradient Forcing 精读与批判

1.1 元数据

字段
arXiv arXiv:2607.20368 (cs.CV)
标题 Self Gradient Forcing: Native Long Video Extrapolation
作者 Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan
机构 Joy Future Academy, JD(京东未来学院)+ 联系邮箱 Tsinghua
提交 2026-07-22
项目页 https://zhuang2002.github.io/SelfGradientForcing/
代码 https://github.com/zhuang2002/Self_Gradient_Forcing · 72 stars / Apache-2.0 / 1882 KB / 7-24 00:10 UTC 更新
模型 https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing
票数 29▲ 7-24 HF 当日 #7(v31 立标候选最强)
关联 v30/v31 节 §2.39.77 v31 立标新增(候选) + §1 主线 1 长视频外推分支 + §1 主线 6 推理效率 + §2.38 历史索引 + §1 主线 8 视频生成 family

1.2 核心贡献(拆解)

1.2.1 问题识别(5 秒训练窗口为什么外推不出分钟级视频)

  • 自回归视频扩散 family(Self Forcing 等)已用 Self Forcing 训练范式:学生训练在自身 rollout 上以降低 exposure bias。
  • 关键缺陷(SGF 命名为「历史上下文梯度 gap / historical context-gradient gap」):历史 KV cache 只作"冻结的 rollout 状态"被未来帧消费,未来损失无法反向监督"先前生成的 latent 应如何写入更有效的 K/V"
  • 后果:长视频外推时,主语身份(subject identity)、背景 / 布局一致性(background/layout consistency)、时间稳定性(temporal stability)三者会在分钟级时长累积退化。
  • 这是一个此前没有被显式命名的损失通道问题 — 比"是否用 self-generated rollout 训练"更细。

1.2.2 方法两遍训练(Pass 1 + Pass 2)

  • Pass 1 — no-gradient self-rollout:因果 DiT 按推理模式自回归 rollout,每个 block i 在当前历史 K/V cache 下做去噪;在采样的去噪 exit step(denoising step list = [1000, 750, 500, 250])记录 self-generated context + 当前 noisy latent。
  • Pass 2 — parallel context-gradient reconstruction:丢弃 rollout cache,用 stop-gradient 的 clean-latent input 重新跑 KV 表达 + future-to-context causal attention;这时 DMD loss 在未来视频 latent 上的梯度可以回灌到 context KV 的写入上
  • 关键设计:bounded parallel reconstruction(只在 exit step 重算,不对完整 serial rollout 反向传播),把 O(T) 的反向传播降为 O(1)(相对 rollout 长度)。
  • 配置文件 yaml 的对应 flag:
  • grad_mode: self_gradient_forcing
  • self_gradient_forcing_match_context: true
  • self_gradient_forcing_cache_mode: exit
  • per_rank_exit_step: true(不同 rank 采样不同 exit step,扩大学习信号多样性)

1.2.3 训练设置(来自 yaml + README 推断)

备注
backbone Wan2.1-T2V-1.3B (generator) + Wan2.1-T2V-14B (real/fake score) 非对称蒸馏对;gen=1.3B 节省显存
初始化 Causal-Forcing 三个 ckpt (ar_diffusion.pt/causal_cd.pt/causal_ode.pt) THU-ML 仓库 — 工作建立在其上
损失 DMD (Distribution Matching Distillation) trainer: score_distillation + distribution_loss: dmd
lr 2e-6(generator)+ 4e-7(critic) 与 Causal-Forcing 训练一致
训练步数 max_steps=1500 单卡 batch_size=1,total_batch_size=8
数据 prompts/vidprom_filtered_extended.txt(纯 prompt list,不是视频数据集) 视频由 Causal-Forcing 数据生成;SGF 训练本身不需要新视频
推理 KV cache framewise SINK=4, FIFO=16, CURRENT=1--kv_cache_max_frames=21;chunkwise SINK=3, FIFO=6, CURRENT=3 → 12 关键基础设施参数
推理默认 963 latent 帧 ≈ 240 秒 @ 16fps,8 卡 / 单卡串行回退 是"分钟级外推"的实证
dfake_gen_update_ratio=5 fake score 每 5 步更新一次 DMD 蒸馏常见节奏
gradient_checkpointing: true + mixed_precision: true 显存优化 14B fake score 显存压力靠 ckpt

1.2.4 实验结果(来自项目页 + 摘要陈述)

  • 主对比基线:Self Forcing + SF + Bi-dir ODE + SF + Causal ODE全部是 SF 家族 / Causal-Forcing 衍生
  • 长视频外推优势点(摘要陈述):
  • Subject identity 一致性 ↑(vs SF 显著下降)
  • Background / layout 一致性 ↑(vs SF 累积漂移)
  • Temporal stability ↑(vs SF 长时抖)
  • 5 秒训练窗口 → 几分钟级视频外推
  • 训练可行性(项目页 Table 1):Pass 1 / Pass 2 恢复保真度 — "decoded pairs visually nearly indistinguishable",latent-space MSE 在 exit step [1000, 750, 500, 250] 四档均可恢复。

1.3 主要问题 / 风险 / 待核

1.3.1 缺 head-to-head 对比 2026-Q3 同段模型(最关键反方)

  • 项目页 / 摘要对比基线只有 SF / SF+Bi-dir ODE / SF+Causal ODE — 全是 Causal-Forcing 派生
  • 没有显式数字 vs Wan2.2 native 长视频外推 / CogVideoX-5B / LingBot-Video MoE / SVD 长视频外推基线。
  • v30 §2.39.66 FlashRT 等"serving harness"也没出现在对比里。
  • 风险等级:高。立标候选最强 + 但 head-to-head 缺位 → v31 立标可能要给 §2.39.77 "立标候选"而非"立标",等 7-25~7-30 数字补齐后升 §2.39.77 立标。

1.3.2 缺训练 GPU 总小时数 / 训练数据规模

  • README 只给 prompts/vidprom_filtered_extended.txt 作为数据路径,训练视频由 Causal-Forcing 数据生成,SGF 训练阶段本身不引新视频。
  • max_steps=1500total_batch_size=8 — 折算 GPU-hours 数字未披露。
  • 风险:复现门槛可能虚高(看似轻量,实际 Wan2.1-14B fake score 在 8 卡 H100 / A100 上跑 1500 步的开销没有公开报告)。

1.3.3 "历史上下文梯度 gap"是否真为新维度?

  • 命名新意强("gap"是首次被显式提出的训练信号缺失通道),但数学本质上是 "未来损失梯度通过 K/V 写入路径反向传播到先前 latent" — 与 VLM 训练中的 KV 写入监督、speculative decoding 中的 draft-model 梯度回灌思路有重叠。
  • 项目页没有 ablation:移除 Pass 2(仅 Pass 1)+ 移除 future-to-context causal attention(仅 standard KV)+ 仅监督 last layer KV vs 全 24 层 KV → 缺少这些消融信号
  • 风险:方法核心创新可能被同段研究在 7-25~7-30 之间"独立命名"成不同但同构的方法,导致方法权归属争议。

1.3.4 Exit step 采样的覆盖率与均衡性

  • denoising_step_list: [1000, 750, 500, 250] + per_rank_exit_step: true — 4 个 exit step × 多 rank 采样。
  • 没有给出:每个 exit step 的采样概率、Pass 2 在 exit step 上的相对开销、Pass 1 与 Pass 2 的耗时比。
  • 风险:exit step 不均衡可能让训练信号偏向低噪声 step(更易恢复)或高噪声 step(梯度大)。

1.3.5 5 秒训练窗口的外推"分钟级"度量边界

  • 摘要陈述"extrapolate to videos lasting several minutes","several"是模糊词 — 2 分钟?5 分钟?10 分钟?
  • 项目页默认生成 963 latent 帧 ≈ 240 秒(4 分钟),是"几分钟级"的实测最大长度。
  • 没有给出"5 秒训练 → 几分钟级"的边界曲线(240s/300s/600s 各自的 identity / layout / temporal 退化率)。
  • 风险:方法被复现时报"4 分钟 OK"而论文宣称"several minutes" → 复现差异。

1.3.6 代码 / 模型许可与生态兼容性

  • Apache-2.0(友好)+ Wan2.1 (Apache-2.0 from Alibaba) + Causal-Forcing (THU-ML,看 LICENSE) — 链路合法。
  • 7-24 00:10 UTC 仓库仍在更新(last commit 同步到 README)— 1.9 MB 仓库体量偏小,完整训练日志与 wandb 公开度未确认

1.4 复现难度评估

难度 备注
模型推理 仓库 + HF ckpt + 8 卡 / 单卡回退,文档完整
训练复现 需要 8×H100/A100 + Wan2.1 14B fake score 显存 + Causal-Forcing 初始化 ckpt;总训练 GPU-hours 未公开
数据准备 prompt list 现成
Pass 1 / Pass 2 实现 核心代码在 grad_mode=self_gradient_forcing 分支,需要逐行核
VBench 复测 项目页未给完整 VBench 数字,复现需要下载 ckpt + 跑 VBench

1.5 关键判断

维度 判断
方法新意 中高 — "历史上下文梯度 gap"是独立问题命名 + 数学上 K/V 写入监督通道的首次系统化修补;与 VLM speculative decoding draft-model 梯度回灌、KV eviction 训练等思路有交集但不完全重叠
实验可信度 — 同一作者家族(Self Forcing / Causal-Forcing)基线 + 缺 vs Wan2.2 native / CogVideoX-5B / LingBot-Video MoE head-to-head
工程可复现 — Apache-2.0 + 完整 ckpt + 详细 yaml + 详细 README + 多卡训练脚本 + 项目页 demo 视频丰富
立标成熟度 — 立标候选(v31 §2.39.77 候选,等 7-25~7-30 数字补齐后升立标)
建议归入节 §2.39.77 v31 立标新增 + §1 主线 1 长视频外推分支 + §1 主线 6 推理效率 + §1 主线 8 视频生成 family + §2.38 历史索引段 + §7.1 引用新增
入库建议 建议入库 — 写入 §2.39.77 候选立标段,等 vs Wan2.2 native head-to-head + 训练 GPU-hours 数字到齐后升正式立标
后续验证动作 ① 7-25~7-30 跟踪 paper_cards/545 / HF 评论区是否有独立复现 ② 跑 VBench-2.0 长视频套件 vs Wan2.2 native ③ 核 dfake_gen_update_ratio=5 + denoising_step_list 的消融 ④ 关注 THU-ML 是否后续出"official SGF / SGF-2"接续工作

2. 副稿:Anchor-Align 精读与批判(VLA 副主线)

2.1 元数据

字段
arXiv arXiv:2607.13429 (cs.RO)
标题 Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
作者 Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain
机构 UIUC + Princeton 系(Heng Ji / Svetlana Lazebnik / Unnat Jain 都是这两校圈)
提交 2026-07-22
项目页 https://anchoralignvla.github.io
代码 https://github.com/dwipddalal/Anchor-Align · 14 stars / MIT / 10694 KB / 7-23 16:41 UTC 更新
模型 https://huggingface.co/Dwipz/Anchor-Align(4 套 release:libero-spatial/-object/-goal/-long)
关联 v30/v31 节 §2.39.83 v31 旁证新增 + §1 主线 7 VLA 段 + §1 主线 6 推理效率

2.2 核心贡献(拆解)

2.2.1 两个失败模式识别

  • 失败 1 — VLM 表征漂移:BC 微调逐步覆盖预训练表征,导致颜色 / 物体语义消失("pick up the green mug" 训练后测试 "pink mug" → 模型仍取绿色)。与 web 图文数据共同训练也无法避免
  • 失败 2 — language-action misalignment:BC 只监督 action head,language head 可自由漂移;同一 VLA 可在报告 "left" 方向的同时输出 upward 动作 — 标准 manipulation benchmark 不暴露这种失配。

2.2.2 双损失叠加

L_total = L1_action + 0.1 × L_anchor + 0.02 × L_align
  • Vision-Language Anchoring (Anchor loss)
  • 冻结预训练 VLM 副本作为 teacher
  • 学生 VLA (LoRA rank-64) 的逐层 hidden state 与 teacher 做 MSE
  • 只对非 action token 位置计算(BOS + vision patches + text prompt)— action token 不被 anchor 损失覆盖
  • 应用到 Qwen2.5-0.5B 全 24 层,σ=1.0
  • Language-Action Alignment (Align loss)
  • 在最后一个 text token 位置(action tokens 之前)的 pre-action hidden state
  • 通过小 learned projector + frozen lm_head 投到 Qwen2.5 词表
  • 6 方向词(up/down/left/right/forward/backward)做 CE — 方向词从 chunk-averaged action delta 派生
  • 验证是 Qwen2.5 词表里的单 token
  • L2 范数 < 0.15 的近零动作样本被忽略(让 loss 只在"决定性动作"上触发)
  • align_version=7 用 pre-action hidden state(LLM self-attention 之后),保留 vision patches

2.2.3 架构(双视觉编码器 + Qwen2.5 + LoRA + action head)

DINOv2 ViT-L (B, 256, 1024) ─┐
                              ├─ concat on dim=2 → (B, 256, 2176) per image
SigLIP SO400M (B, 256, 1152) ┘
        ↓
concat on dim=1 (2 images) → (B, 512, 2176)
        ↓
Projector MLP (2176 → 8704 → 896)
        ↓
(B, 512, 896) vision tokens
        ↓
[BOS] ── [vision tokens] ── [text/action tokens] ── [EOS]
        ↓
Qwen2.5-0.5B (24 layers) · LoRA rank-64 · output_hidden_states=True
        ↓
    ┌─────────────┬───────────────────┐
    ↓             ↓                   ↓
Action Head    Anchor loss         Align loss
MLPResNet 24   (24 层 hidden MSE)  (pre-action hidden → CE(direction))
(8 块动作)

2.3 实验结果(来自 README)

2.3.1 标准 LIBERO 4 套

  • Anchor-Align 每套第一:Spatial 98.4 / Object 100.0 / Goal 97.2 / Long 90.8
  • vs 第二名:VLA-Adapter (BC) 96.0/99.8/96.0/89.0;OpenVLA-OFT 94.3/95.2/91.7/86.5

2.3.2 OOD 鲁棒性(核心卖点)

  • LIBERO-PRO position swap22.6% vs 第二 VLA-Adapter BC 2.3%(9.8 倍差距)vs OpenVLA-OFT 0% / MolmoAct 0%
  • LIBERO-Plus average90.3% vs VLA-Adapter BC 85.1%
  • 7 项 Plus 子项:Anchor-Align 在 Lang Instr / Bg Text / Robot Init / Cam View / Obj Layout / Light Cond / Sensor Noise 全部第一

2.3.3 CALVIN ABC→D 长视野

  • Anchor-Align:1/5=99.1 / 2/5=95.8 / 3/5=90.6 / 4/5=84.7 / 5/5=77.9 / Len=4.5
  • vs 第二 VLA-Adapter BC:98.3/94.0/87.5/80.0/73.1/4.3

2.3.4 多 seed 稳定性(5 seed)

  • Spatial 97.9±0.3 vs BC 93.3±0.3
  • Pos Swap 23.5±0.2 vs BC 2.6±0.7(Pos Swap 噪声更稳定
  • Plus 90.5±0.6 vs BC 85.3±0.3
  • seed-to-seed 方差远小于方法间差距 — 信号真

2.3.5 真实机器人(UFactory xArm7)

  • 4 套扰动:空间重排 / 杂乱场景 / 组合物体布局 / 语义扰动(pink-mug OOD)
  • Anchor-Align: 28.3% → 54.2%(一套 VLA)+ 37% → 60%(另一套 VLA)— 接近翻倍

2.3.6 Checkpoint 释放

  • 4 套 HF ckpt:libero-spatial (10k steps, KL=0.10) / libero-object (2.5k, 0.15) / libero-goal (25k, 0.10) / libero-long (45k, 0.15)
  • 每套 = 合并 base VLM + LoRA adapter + action head + alignment projector + proprio projector + tokenizer + config

2.4 主要问题 / 风险 / 待核

2.4.1 微架构改动极小,但缺训练耗时披露

  • LoRA rank-64 + 24 层 hidden MSE + 6 词 CE — 方法极轻量
  • 但 4 套训练 2.5k/10k/25k/45k steps 在 H100/A100 上的总 GPU-hours 没披露;真实机器人的 fine-tune 数据集大小没披露。
  • 风险:方法轻量但真实硬件门槛未知。

2.4.2 真实机器人任务覆盖度有限

  • 只在 UFactory xArm7 一台机械臂 + 4 套扰动上验证。
  • 与 OpenVLA-OFT / π0.5-KI / MolmoAct / SmolVLA-2.25B 在 7+ 机器人构型 / 工厂环境 / 移动机械臂 / 类人机器人上尚未做。
  • 风险:在跨构型 / 跨 embodiment 上的迁移性未验证。

2.4.3 6 方向词的工程化选择

  • 选 6 个词(up/down/left/right/forward/backward)而非 3D 连续方向角。
  • 优点:与 LM 词表自然对齐,可与 frozen lm_head 复用
  • 缺点:抓取方向以外的动作(如倾斜手腕、关节角度精细化、轴对称旋转)无法被 L_align 监督 → alignment 损失只在粗方向上工作
  • 风险:在需要精细力控 / 接触丰富的任务(折叠、装配)上 L_align 可能失效 — 与 v30 §2.39.76 Learning-to-Fold LeHome RL 路径形成互补

2.4.4 vs SOTA 头部 VLA 的 head-to-head 范围

  • 主要对比 π₀ / π₀.₅-KI / OpenVLA-OFT / SmolVLA / MolmoAct / VLA-Adapter — 但 没对比 π0.5-KI 的 SOTA 强化版本 / 没对比 RDT-1B / 没对比 LLARVA / 没对比 HiRT / 没对比 3D-VLA
  • 风险:head-to-head 集中在 7B 以下 VLA,对 ≥ 10B 阵营的覆盖不足。

2.4.5 vs SVR-R1 / SVR 类自验证家族对比

  • L_align 是"让 action head 与 language head 对齐",与 v30 §2.39.60 SVR-R1"self-verification reward" + v31 §2.39.84 ENTRAP-VL"contextual entrainment"在"自我机制"上同根但方向不同。
  • 没有直接 ablation:移除 L_align(只留 L_anchor)vs 移除 L_anchor(只留 L_align)vs 两者都留 → README 没给这种消融
  • 风险:L_anchor 与 L_align 的独立贡献分摊度未充分披露。

2.4.6 代码 / 模型许可与生态兼容性

  • MIT + Qwen2.5-0.5B(Apache-2.0 + Tongyi Qianwen LICENSE)+ DINOv2 (Apache-2.0) + SigLIP (Apache-2.0) — 链路合法
  • 7-23 16:41 UTC 仓库仍在更新 · 14 stars / 1 fork / 10694 KB
  • 实操门槛:xArm7 + LIBERO + 自定义 perturbation 评测套件需要独立搭

2.5 复现难度评估

难度 备注
模型推理 HF 4 套 release ckpt + self-contained inference bundle
训练复现 需要 LIBERO 数据集 + VLA-Adapter baseline 实现 + 自定义双损失
真实机器人 UFactory xArm7 + 4 套扰动任务设计 — 独立工程投入
Pos Swap 复现 LIBERO-Spatial + position swap perturbation pipeline
Long-horizon CALVIN ABC→D CALVIN benchmark + 5 指令链
多 seed 复现 README 给了 mean±std 数字,5 seed 重跑

2.6 关键判断

维度 判断
方法新意 — 不是架构创新,是损失函数创新 + 失败模式诊断;识别"language-action misalignment"是独立贡献
实验可信度 — 4 套 LIBERO + 4 套扰动 + 1 套真实机器人 + 5 seed mean±std + 完整复现链路
工程可复现 — MIT + 4 套 HF ckpt + REPRODUCE.md,但真实机器人复现门槛高
立标成熟度 高(旁证) — 数字完整、对比充分;建议 v31 §2.39.83 旁证新增
建议归入节 §2.39.83 v31 旁证新增 + §1 主线 7 VLA 段 + §1 主线 6 推理效率 + §2.38 历史索引 + §7.1 引用新增
入库建议 建议入库 — 写入 §2.39.83 旁证段(不要混淆为 §2.39.59 Robot-Centric Pointmaps 或 §2.39.76 Learning-to-Fold)
后续验证动作 ① 7-25~7-30 跟踪 paper_cards/550 / HF 评论区独立复现 ② 跑 LIBERO-PRO Pos Swap ablation 在 vs Pointmaps / Learning-to-Fold 上 ③ 关注 7-28 之后是否有 RDT-1B / LLARVA 等 ≥10B VLA 接续 SGF / Anchor-Align 风格的多损失训练

3. 与 v30 / v31 已有立标/旁证的关系

主稿/副稿 与 v30/v31 已有立标/旁证的关系
Self Gradient Forcing vs v30 §2.39.66 FlashRT(通用 multimodal serving):FlashRT 是推理时通用服务;SGF 是训练时训练策略;不混。vs v31 §2.39.81 FVAttn(视频生成稀疏注意力):FVAttn 是推理时基础设施;SGF 是训练时基础设施;不混。vs v25 SVD / v25 LoomVideo / 7-19 CVG / 7-22 ShotPlan:SGF 是这条"视频生成 family + 长视频外推"主线的训练策略突破立标,与同段是方法维度补全
Anchor-Align vs v30 §2.39.59 Robot-Centric Pointmaps:Pointmaps 是视觉编码 3D 几何架构改动;Anchor-Align 是训练目标双栈架构不动;不混。vs v30 §2.39.76 Learning-to-Fold LeHome RL:Learning-to-Fold 是VLA 自值函数 + RL 训练;Anchor-Align 是监督训练目标双栈;不混。vs v30 §2.39.60 SVR-R1 / v31 §2.39.84 ENTRAP-VL:三者同属"自我机制"家族但方向不同(SVR-R1 自我验证奖励 / ENTRAP-VL 自我牵引 / Anchor-Align 自我对齐)

4. 检索范围 + 候选条目去重

4.1 本轮检索范围(轻量精读模式)

  • arXiv abs/html + 项目页 + GitHub README + GitHub API 元数据 + HF 模型卡
  • 没有跑大段全文 PDF 抓取(避免违反"避免大段全文抓取"约束)
  • 没有做并行子任务

4.2 候选条目去重(vs E1 已识别)

E1 候选 本轮处理
§2.39.77 SGF 本轮主稿精读
§2.39.78 ActiveVision 未精读(票数 18▲ 弱 + 评测基准类,非方法论)
§2.39.79 SeerGuard 未精读(票数 24▲ 中 + 安全框架类,非方法论)
§2.39.80 Trace 未精读(RLVR 环境类,留给下轮或 spark 实例)
§2.39.81 FVAttn 未精读(基础设施类,留给 spark llm-infra 实例)
§2.39.82 Computational Humor 未精读(综述类,留给 weekly-digest 路径)
§2.39.83 Anchor-Align 本轮副稿精读
§2.39.84 ENTRAP-VL 未精读(票数 1▲ P3 旁证,待观察)

5. 本轮输出 + 后续动作

5.1 本轮实际写入路径

  • 本次草稿/shared/research-kb/inbox/flyp/2026-07-24-0950-Self-Gradient-Forcing-critical-read.md(主稿 + 副稿合并稿)

5.2 建议更新到 v31 §2.39.77 / §2.39.83(下次 E1 / E2 接力时由整合者写入)

  • §2.39.77 立标候选:Self Gradient Forcing — 标签升级 "立标候选(等 head-to-head 数字补齐)"
  • §2.39.83 旁证新增:Anchor-Align — 直接写入旁证段
  • §1 主线 1 长视频外推分支新增 SGF
  • §1 主线 7 VLA 段新增 Anchor-Align
  • §1 主线 6 推理效率新增 SGF(训练时)+ Anchor-Align(轻量推理)
  • §2.38 历史索引段加 arXiv:2607.20368 + arXiv:2607.13429

5.3 后续验证动作(7-25 ~ 7-30)

  1. SGF vs Wan2.2 native head-to-head:7-25~7-26 跟踪 HF / Reddit / r/MachineLearning 是否有独立复现报告或对立数字
  2. SGF Pass 1 / Pass 2 训练 GPU-hours:7-26~7-28 联系作者 Junhao Zhuang 询问或跟踪 README/wandb 公开
  3. Anchor-Align Pos Swap 复现:7-25~7-27 跟踪 paper_cards/550 + HF 评论区独立 Pos Swap 复现数字
  4. Anchor-Align vs RDT-1B / LLARVA head-to-head:7-28~7-30 跟踪 ≥10B VLA 阵营是否复现 / 接入 Anchor-Align 风格多损失
  5. FlashRT + SGF + Anchor-Align 三联归纳:7-28~7-30 在 §1 主线 6 推理效率段整合"训练时 + 推理时 + VLA 微调"三联基础设施三角

5.4 不在本轮做的事(明确边界)

  • ❌ 不写 §6 行业平台化升级(留给 stephen news-radar + jay ai-engineering-trending)
  • ❌ 不写跨主线 RAG 旁证 HM-RAG / Multimodal RAG Survey(留给 jay csdn-langgraph-multimodal-rag)
  • ❌ 不写 ABot-World-0 续立分析(v30 已固化)
  • ❌ 不写 ActiveVision / SeerGuard / Trace / FVAttn / Computational Humor / ENTRAP-VL(留给下轮或对应专项实例)
  • ❌ 不做 git commit / git push / gh pr / 写入 published/(遵守共享知识库写入规则)

6. 一句话总结

SGF 立"长视频外推训练策略突破"维度,立标候选最强但缺 vs Wan2.2 native head-to-head;Anchor-Align 立"VLA 微调双损失叠加"维度,旁证成熟度高。两者都是 2026-Q3 多模态主题"方法维度补全"代表;建议 v31 §2.39.77 候选 + §2.39.83 旁证直接入库;后续验证动作 7-25 ~ 7-30 期间各自由整合者推进。


检查过的来源: - arXiv abs 页:https://arxiv.org/abs/2607.20368(SGF)+ https://arxiv.org/abs/2607.13429(Anchor-Align) - 项目页:https://zhuang2002.github.io/SelfGradientForcing/ + https://anchoralignvla.github.io - GitHub README:https://raw.githubusercontent.com/zhuang2002/Self_Gradient_Forcing/main/README.md + https://raw.githubusercontent.com/dwipddalal/Anchor-Align/main/README.md - GitHub API 元数据:stars / forks / license / last updated / size - HuggingFace 模型卡:https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing + https://huggingface.co/Dwipz/Anchor-Align - 训练配置 yaml:configs/self_gradient_forcing_framewise.yaml(SGF)

未在本轮做的事:没跑 PDF 全文抓取 / 没做并行子任务 / 没写 git commit / 没交叉对比其他候选(按 E2 轻量精读模式约束)。

贡献者归属:Junhao Zhuang et al.(Joy Future Academy, JD;联系邮箱 Tsinghua)+ Dwip Dalal et al.(UIUC + Princeton 系)。