flyP 精读与批判 · 2026-07-24 09:50
角色:flyP · multimodal 视频生成 + VLA · E2 精读与批判(2026-07-24 上午棒)
本轮选题策略:E1 候选 8 件 v31 立标/旁证候选 + E1 已识别"v30 立标续立 + 全新立标候选 + 行业平台化升级"三件套。本轮按"1 主稿 + 1 副稿"轻量精读:
- 主稿:Self Gradient Forcing (arXiv:2607.20368 · 29▲ HF 7-24 #7 · 立标候选最强) — 长视频外推训练策略,"历史 KV cache 可监督"立新维度
- 副稿:Anchor-Align (arXiv:2607.13429 · paper_cards/550 · VLA 副主线) — 极小架构改动 + 双损失叠加,2026-Q3 具身 VLA 阵营最热子方向代表
本稿不复制论文/项目页/仓库原文长段,只做摘要、批判、引用、归节建议。
0. 一句话定位
SGF 把"自回归视频扩散"中"历史 K/V cache 永远冻结"造成的上下文梯度缺口识别为独立问题,并通过"无梯度自回归 rollout + 可监督的并行 K/V 重算"两遍训练把它修补上,5 秒训练窗口 → 分钟级外推。方法维度新、可复现性高(Apache-2.0 + 完整 ckpt + Wan2.1 双模型初始化),但缺 vs Wan2.2 native 长视频外推 head-to-head、缺训练 GPU 总小时数、缺 VBench 数字。2026-Q3 多模态主题"长视频外推训练策略突破"立标候选。
1. 主稿:Self Gradient Forcing 精读与批判
1.1 元数据
| 字段 |
值 |
| arXiv |
arXiv:2607.20368 (cs.CV) |
| 标题 |
Self Gradient Forcing: Native Long Video Extrapolation |
| 作者 |
Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan |
| 机构 |
Joy Future Academy, JD(京东未来学院)+ 联系邮箱 Tsinghua |
| 提交 |
2026-07-22 |
| 项目页 |
https://zhuang2002.github.io/SelfGradientForcing/ |
| 代码 |
https://github.com/zhuang2002/Self_Gradient_Forcing · 72 stars / Apache-2.0 / 1882 KB / 7-24 00:10 UTC 更新 |
| 模型 |
https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing |
| 票数 |
29▲ 7-24 HF 当日 #7(v31 立标候选最强) |
| 关联 v30/v31 节 |
§2.39.77 v31 立标新增(候选) + §1 主线 1 长视频外推分支 + §1 主线 6 推理效率 + §2.38 历史索引 + §1 主线 8 视频生成 family |
1.2 核心贡献(拆解)
1.2.1 问题识别(5 秒训练窗口为什么外推不出分钟级视频)
- 自回归视频扩散 family(Self Forcing 等)已用 Self Forcing 训练范式:学生训练在自身 rollout 上以降低 exposure bias。
- 关键缺陷(SGF 命名为「历史上下文梯度 gap / historical context-gradient gap」):历史 KV cache 只作"冻结的 rollout 状态"被未来帧消费,未来损失无法反向监督"先前生成的 latent 应如何写入更有效的 K/V"。
- 后果:长视频外推时,主语身份(subject identity)、背景 / 布局一致性(background/layout consistency)、时间稳定性(temporal stability)三者会在分钟级时长累积退化。
- 这是一个此前没有被显式命名的损失通道问题 — 比"是否用 self-generated rollout 训练"更细。
1.2.2 方法两遍训练(Pass 1 + Pass 2)
- Pass 1 — no-gradient self-rollout:因果 DiT 按推理模式自回归 rollout,每个 block i 在当前历史 K/V cache 下做去噪;在采样的去噪 exit step(denoising step list = [1000, 750, 500, 250])记录 self-generated context + 当前 noisy latent。
- Pass 2 — parallel context-gradient reconstruction:丢弃 rollout cache,用 stop-gradient 的 clean-latent input 重新跑 KV 表达 + future-to-context causal attention;这时 DMD loss 在未来视频 latent 上的梯度可以回灌到 context KV 的写入上。
- 关键设计:bounded parallel reconstruction(只在 exit step 重算,不对完整 serial rollout 反向传播),把 O(T) 的反向传播降为 O(1)(相对 rollout 长度)。
- 配置文件 yaml 的对应 flag:
grad_mode: self_gradient_forcing
self_gradient_forcing_match_context: true
self_gradient_forcing_cache_mode: exit
per_rank_exit_step: true(不同 rank 采样不同 exit step,扩大学习信号多样性)
1.2.3 训练设置(来自 yaml + README 推断)
| 项 |
值 |
备注 |
| backbone |
Wan2.1-T2V-1.3B (generator) + Wan2.1-T2V-14B (real/fake score) |
非对称蒸馏对;gen=1.3B 节省显存 |
| 初始化 |
Causal-Forcing 三个 ckpt (ar_diffusion.pt/causal_cd.pt/causal_ode.pt) |
THU-ML 仓库 — 工作建立在其上 |
| 损失 |
DMD (Distribution Matching Distillation) |
trainer: score_distillation + distribution_loss: dmd |
| lr |
2e-6(generator)+ 4e-7(critic) |
与 Causal-Forcing 训练一致 |
| 训练步数 |
max_steps=1500 |
单卡 batch_size=1,total_batch_size=8 |
| 数据 |
prompts/vidprom_filtered_extended.txt(纯 prompt list,不是视频数据集) |
视频由 Causal-Forcing 数据生成;SGF 训练本身不需要新视频 |
| 推理 KV cache |
framewise SINK=4, FIFO=16, CURRENT=1 → --kv_cache_max_frames=21;chunkwise SINK=3, FIFO=6, CURRENT=3 → 12 |
关键基础设施参数 |
| 推理默认 |
963 latent 帧 ≈ 240 秒 @ 16fps,8 卡 / 单卡串行回退 |
是"分钟级外推"的实证 |
dfake_gen_update_ratio=5 |
fake score 每 5 步更新一次 |
DMD 蒸馏常见节奏 |
gradient_checkpointing: true + mixed_precision: true |
显存优化 |
14B fake score 显存压力靠 ckpt |
1.2.4 实验结果(来自项目页 + 摘要陈述)
- 主对比基线:Self Forcing + SF + Bi-dir ODE + SF + Causal ODE — 全部是 SF 家族 / Causal-Forcing 衍生。
- 长视频外推优势点(摘要陈述):
- Subject identity 一致性 ↑(vs SF 显著下降)
- Background / layout 一致性 ↑(vs SF 累积漂移)
- Temporal stability ↑(vs SF 长时抖)
- 5 秒训练窗口 → 几分钟级视频外推
- 训练可行性(项目页 Table 1):Pass 1 / Pass 2 恢复保真度 — "decoded pairs visually nearly indistinguishable",latent-space MSE 在 exit step [1000, 750, 500, 250] 四档均可恢复。
1.3 主要问题 / 风险 / 待核
1.3.1 缺 head-to-head 对比 2026-Q3 同段模型(最关键反方)
- 项目页 / 摘要对比基线只有 SF / SF+Bi-dir ODE / SF+Causal ODE — 全是 Causal-Forcing 派生。
- 没有显式数字 vs Wan2.2 native 长视频外推 / CogVideoX-5B / LingBot-Video MoE / SVD 长视频外推基线。
- v30 §2.39.66 FlashRT 等"serving harness"也没出现在对比里。
- 风险等级:高。立标候选最强 + 但 head-to-head 缺位 → v31 立标可能要给 §2.39.77 "立标候选"而非"立标",等 7-25~7-30 数字补齐后升 §2.39.77 立标。
1.3.2 缺训练 GPU 总小时数 / 训练数据规模
- README 只给
prompts/vidprom_filtered_extended.txt 作为数据路径,训练视频由 Causal-Forcing 数据生成,SGF 训练阶段本身不引新视频。
max_steps=1500、total_batch_size=8 — 折算 GPU-hours 数字未披露。
- 风险:复现门槛可能虚高(看似轻量,实际 Wan2.1-14B fake score 在 8 卡 H100 / A100 上跑 1500 步的开销没有公开报告)。
1.3.3 "历史上下文梯度 gap"是否真为新维度?
- 命名新意强("gap"是首次被显式提出的训练信号缺失通道),但数学本质上是 "未来损失梯度通过 K/V 写入路径反向传播到先前 latent" — 与 VLM 训练中的 KV 写入监督、speculative decoding 中的 draft-model 梯度回灌思路有重叠。
- 项目页没有 ablation:移除 Pass 2(仅 Pass 1)+ 移除 future-to-context causal attention(仅 standard KV)+ 仅监督 last layer KV vs 全 24 层 KV → 缺少这些消融信号。
- 风险:方法核心创新可能被同段研究在 7-25~7-30 之间"独立命名"成不同但同构的方法,导致方法权归属争议。
1.3.4 Exit step 采样的覆盖率与均衡性
denoising_step_list: [1000, 750, 500, 250] + per_rank_exit_step: true — 4 个 exit step × 多 rank 采样。
- 没有给出:每个 exit step 的采样概率、Pass 2 在 exit step 上的相对开销、Pass 1 与 Pass 2 的耗时比。
- 风险:exit step 不均衡可能让训练信号偏向低噪声 step(更易恢复)或高噪声 step(梯度大)。
1.3.5 5 秒训练窗口的外推"分钟级"度量边界
- 摘要陈述"extrapolate to videos lasting several minutes","several"是模糊词 — 2 分钟?5 分钟?10 分钟?
- 项目页默认生成 963 latent 帧 ≈ 240 秒(4 分钟),是"几分钟级"的实测最大长度。
- 没有给出"5 秒训练 → 几分钟级"的边界曲线(240s/300s/600s 各自的 identity / layout / temporal 退化率)。
- 风险:方法被复现时报"4 分钟 OK"而论文宣称"several minutes" → 复现差异。
1.3.6 代码 / 模型许可与生态兼容性
- Apache-2.0(友好)+ Wan2.1 (Apache-2.0 from Alibaba) + Causal-Forcing (THU-ML,看 LICENSE) — 链路合法。
- 7-24 00:10 UTC 仓库仍在更新(last commit 同步到 README)— 1.9 MB 仓库体量偏小,完整训练日志与 wandb 公开度未确认。
1.4 复现难度评估
| 项 |
难度 |
备注 |
| 模型推理 |
低 |
仓库 + HF ckpt + 8 卡 / 单卡回退,文档完整 |
| 训练复现 |
中 |
需要 8×H100/A100 + Wan2.1 14B fake score 显存 + Causal-Forcing 初始化 ckpt;总训练 GPU-hours 未公开 |
| 数据准备 |
低 |
prompt list 现成 |
| Pass 1 / Pass 2 实现 |
中 |
核心代码在 grad_mode=self_gradient_forcing 分支,需要逐行核 |
| VBench 复测 |
中 |
项目页未给完整 VBench 数字,复现需要下载 ckpt + 跑 VBench |
1.5 关键判断
| 维度 |
判断 |
| 方法新意 |
中高 — "历史上下文梯度 gap"是独立问题命名 + 数学上 K/V 写入监督通道的首次系统化修补;与 VLM speculative decoding draft-model 梯度回灌、KV eviction 训练等思路有交集但不完全重叠 |
| 实验可信度 |
中 — 同一作者家族(Self Forcing / Causal-Forcing)基线 + 缺 vs Wan2.2 native / CogVideoX-5B / LingBot-Video MoE head-to-head |
| 工程可复现 |
高 — Apache-2.0 + 完整 ckpt + 详细 yaml + 详细 README + 多卡训练脚本 + 项目页 demo 视频丰富 |
| 立标成熟度 |
中 — 立标候选(v31 §2.39.77 候选,等 7-25~7-30 数字补齐后升立标) |
| 建议归入节 |
§2.39.77 v31 立标新增 + §1 主线 1 长视频外推分支 + §1 主线 6 推理效率 + §1 主线 8 视频生成 family + §2.38 历史索引段 + §7.1 引用新增 |
| 入库建议 |
建议入库 — 写入 §2.39.77 候选立标段,等 vs Wan2.2 native head-to-head + 训练 GPU-hours 数字到齐后升正式立标 |
| 后续验证动作 |
① 7-25~7-30 跟踪 paper_cards/545 / HF 评论区是否有独立复现 ② 跑 VBench-2.0 长视频套件 vs Wan2.2 native ③ 核 dfake_gen_update_ratio=5 + denoising_step_list 的消融 ④ 关注 THU-ML 是否后续出"official SGF / SGF-2"接续工作 |
2. 副稿:Anchor-Align 精读与批判(VLA 副主线)
2.1 元数据
| 字段 |
值 |
| arXiv |
arXiv:2607.13429 (cs.RO) |
| 标题 |
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment |
| 作者 |
Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain |
| 机构 |
UIUC + Princeton 系(Heng Ji / Svetlana Lazebnik / Unnat Jain 都是这两校圈) |
| 提交 |
2026-07-22 |
| 项目页 |
https://anchoralignvla.github.io |
| 代码 |
https://github.com/dwipddalal/Anchor-Align · 14 stars / MIT / 10694 KB / 7-23 16:41 UTC 更新 |
| 模型 |
https://huggingface.co/Dwipz/Anchor-Align(4 套 release:libero-spatial/-object/-goal/-long) |
| 关联 v30/v31 节 |
§2.39.83 v31 旁证新增 + §1 主线 7 VLA 段 + §1 主线 6 推理效率 |
2.2 核心贡献(拆解)
2.2.1 两个失败模式识别
- 失败 1 — VLM 表征漂移:BC 微调逐步覆盖预训练表征,导致颜色 / 物体语义消失("pick up the green mug" 训练后测试 "pink mug" → 模型仍取绿色)。与 web 图文数据共同训练也无法避免。
- 失败 2 — language-action misalignment:BC 只监督 action head,language head 可自由漂移;同一 VLA 可在报告 "left" 方向的同时输出 upward 动作 — 标准 manipulation benchmark 不暴露这种失配。
2.2.2 双损失叠加
L_total = L1_action + 0.1 × L_anchor + 0.02 × L_align
- Vision-Language Anchoring (Anchor loss):
- 冻结预训练 VLM 副本作为 teacher
- 学生 VLA (LoRA rank-64) 的逐层 hidden state 与 teacher 做 MSE
- 只对非 action token 位置计算(BOS + vision patches + text prompt)— action token 不被 anchor 损失覆盖
- 应用到 Qwen2.5-0.5B 全 24 层,σ=1.0
- Language-Action Alignment (Align loss):
- 在最后一个 text token 位置(action tokens 之前)的 pre-action hidden state
- 通过小 learned projector + frozen lm_head 投到 Qwen2.5 词表
- 用 6 方向词(up/down/left/right/forward/backward)做 CE — 方向词从 chunk-averaged action delta 派生
- 验证是 Qwen2.5 词表里的单 token
- L2 范数 < 0.15 的近零动作样本被忽略(让 loss 只在"决定性动作"上触发)
align_version=7 用 pre-action hidden state(LLM self-attention 之后),保留 vision patches
2.2.3 架构(双视觉编码器 + Qwen2.5 + LoRA + action head)
DINOv2 ViT-L (B, 256, 1024) ─┐
├─ concat on dim=2 → (B, 256, 2176) per image
SigLIP SO400M (B, 256, 1152) ┘
↓
concat on dim=1 (2 images) → (B, 512, 2176)
↓
Projector MLP (2176 → 8704 → 896)
↓
(B, 512, 896) vision tokens
↓
[BOS] ── [vision tokens] ── [text/action tokens] ── [EOS]
↓
Qwen2.5-0.5B (24 layers) · LoRA rank-64 · output_hidden_states=True
↓
┌─────────────┬───────────────────┐
↓ ↓ ↓
Action Head Anchor loss Align loss
MLPResNet 24 (24 层 hidden MSE) (pre-action hidden → CE(direction))
(8 块动作)
2.3 实验结果(来自 README)
2.3.1 标准 LIBERO 4 套
- Anchor-Align 每套第一:Spatial 98.4 / Object 100.0 / Goal 97.2 / Long 90.8
- vs 第二名:VLA-Adapter (BC) 96.0/99.8/96.0/89.0;OpenVLA-OFT 94.3/95.2/91.7/86.5
2.3.2 OOD 鲁棒性(核心卖点)
- LIBERO-PRO position swap:22.6% vs 第二 VLA-Adapter BC 2.3%(9.8 倍差距)vs OpenVLA-OFT 0% / MolmoAct 0%
- LIBERO-Plus average:90.3% vs VLA-Adapter BC 85.1%
- 7 项 Plus 子项:Anchor-Align 在 Lang Instr / Bg Text / Robot Init / Cam View / Obj Layout / Light Cond / Sensor Noise 全部第一
2.3.3 CALVIN ABC→D 长视野
- Anchor-Align:1/5=99.1 / 2/5=95.8 / 3/5=90.6 / 4/5=84.7 / 5/5=77.9 / Len=4.5
- vs 第二 VLA-Adapter BC:98.3/94.0/87.5/80.0/73.1/4.3
2.3.4 多 seed 稳定性(5 seed)
- Spatial 97.9±0.3 vs BC 93.3±0.3
- Pos Swap 23.5±0.2 vs BC 2.6±0.7(Pos Swap 噪声更稳定)
- Plus 90.5±0.6 vs BC 85.3±0.3
- seed-to-seed 方差远小于方法间差距 — 信号真
2.3.5 真实机器人(UFactory xArm7)
- 4 套扰动:空间重排 / 杂乱场景 / 组合物体布局 / 语义扰动(pink-mug OOD)
- Anchor-Align: 28.3% → 54.2%(一套 VLA)+ 37% → 60%(另一套 VLA)— 接近翻倍
2.3.6 Checkpoint 释放
- 4 套 HF ckpt:libero-spatial (10k steps, KL=0.10) / libero-object (2.5k, 0.15) / libero-goal (25k, 0.10) / libero-long (45k, 0.15)
- 每套 = 合并 base VLM + LoRA adapter + action head + alignment projector + proprio projector + tokenizer + config
2.4 主要问题 / 风险 / 待核
2.4.1 微架构改动极小,但缺训练耗时披露
- LoRA rank-64 + 24 层 hidden MSE + 6 词 CE — 方法极轻量。
- 但 4 套训练 2.5k/10k/25k/45k steps 在 H100/A100 上的总 GPU-hours 没披露;真实机器人的 fine-tune 数据集大小没披露。
- 风险:方法轻量但真实硬件门槛未知。
2.4.2 真实机器人任务覆盖度有限
- 只在 UFactory xArm7 一台机械臂 + 4 套扰动上验证。
- 与 OpenVLA-OFT / π0.5-KI / MolmoAct / SmolVLA-2.25B 在 7+ 机器人构型 / 工厂环境 / 移动机械臂 / 类人机器人上尚未做。
- 风险:在跨构型 / 跨 embodiment 上的迁移性未验证。
2.4.3 6 方向词的工程化选择
- 选 6 个词(up/down/left/right/forward/backward)而非 3D 连续方向角。
- 优点:与 LM 词表自然对齐,可与 frozen lm_head 复用
- 缺点:抓取方向以外的动作(如倾斜手腕、关节角度精细化、轴对称旋转)无法被 L_align 监督 → alignment 损失只在粗方向上工作
- 风险:在需要精细力控 / 接触丰富的任务(折叠、装配)上 L_align 可能失效 — 与 v30 §2.39.76 Learning-to-Fold LeHome RL 路径形成互补
2.4.4 vs SOTA 头部 VLA 的 head-to-head 范围
- 主要对比 π₀ / π₀.₅-KI / OpenVLA-OFT / SmolVLA / MolmoAct / VLA-Adapter — 但 没对比 π0.5-KI 的 SOTA 强化版本 / 没对比 RDT-1B / 没对比 LLARVA / 没对比 HiRT / 没对比 3D-VLA。
- 风险:head-to-head 集中在 7B 以下 VLA,对 ≥ 10B 阵营的覆盖不足。
2.4.5 vs SVR-R1 / SVR 类自验证家族对比
- L_align 是"让 action head 与 language head 对齐",与 v30 §2.39.60 SVR-R1"self-verification reward" + v31 §2.39.84 ENTRAP-VL"contextual entrainment"在"自我机制"上同根但方向不同。
- 没有直接 ablation:移除 L_align(只留 L_anchor)vs 移除 L_anchor(只留 L_align)vs 两者都留 → README 没给这种消融。
- 风险:L_anchor 与 L_align 的独立贡献分摊度未充分披露。
2.4.6 代码 / 模型许可与生态兼容性
- MIT + Qwen2.5-0.5B(Apache-2.0 + Tongyi Qianwen LICENSE)+ DINOv2 (Apache-2.0) + SigLIP (Apache-2.0) — 链路合法
- 7-23 16:41 UTC 仓库仍在更新 · 14 stars / 1 fork / 10694 KB
- 实操门槛:xArm7 + LIBERO + 自定义 perturbation 评测套件需要独立搭
2.5 复现难度评估
| 项 |
难度 |
备注 |
| 模型推理 |
低 |
HF 4 套 release ckpt + self-contained inference bundle |
| 训练复现 |
中 |
需要 LIBERO 数据集 + VLA-Adapter baseline 实现 + 自定义双损失 |
| 真实机器人 |
高 |
UFactory xArm7 + 4 套扰动任务设计 — 独立工程投入 |
| Pos Swap 复现 |
中 |
LIBERO-Spatial + position swap perturbation pipeline |
| Long-horizon CALVIN ABC→D |
中 |
CALVIN benchmark + 5 指令链 |
| 多 seed 复现 |
低 |
README 给了 mean±std 数字,5 seed 重跑 |
2.6 关键判断
| 维度 |
判断 |
| 方法新意 |
中 — 不是架构创新,是损失函数创新 + 失败模式诊断;识别"language-action misalignment"是独立贡献 |
| 实验可信度 |
高 — 4 套 LIBERO + 4 套扰动 + 1 套真实机器人 + 5 seed mean±std + 完整复现链路 |
| 工程可复现 |
中 — MIT + 4 套 HF ckpt + REPRODUCE.md,但真实机器人复现门槛高 |
| 立标成熟度 |
高(旁证) — 数字完整、对比充分;建议 v31 §2.39.83 旁证新增 |
| 建议归入节 |
§2.39.83 v31 旁证新增 + §1 主线 7 VLA 段 + §1 主线 6 推理效率 + §2.38 历史索引 + §7.1 引用新增 |
| 入库建议 |
建议入库 — 写入 §2.39.83 旁证段(不要混淆为 §2.39.59 Robot-Centric Pointmaps 或 §2.39.76 Learning-to-Fold) |
| 后续验证动作 |
① 7-25~7-30 跟踪 paper_cards/550 / HF 评论区独立复现 ② 跑 LIBERO-PRO Pos Swap ablation 在 vs Pointmaps / Learning-to-Fold 上 ③ 关注 7-28 之后是否有 RDT-1B / LLARVA 等 ≥10B VLA 接续 SGF / Anchor-Align 风格的多损失训练 |
3. 与 v30 / v31 已有立标/旁证的关系
| 主稿/副稿 |
与 v30/v31 已有立标/旁证的关系 |
| Self Gradient Forcing |
vs v30 §2.39.66 FlashRT(通用 multimodal serving):FlashRT 是推理时通用服务;SGF 是训练时训练策略;不混。vs v31 §2.39.81 FVAttn(视频生成稀疏注意力):FVAttn 是推理时基础设施;SGF 是训练时基础设施;不混。vs v25 SVD / v25 LoomVideo / 7-19 CVG / 7-22 ShotPlan:SGF 是这条"视频生成 family + 长视频外推"主线的训练策略突破立标,与同段是方法维度补全 |
| Anchor-Align |
vs v30 §2.39.59 Robot-Centric Pointmaps:Pointmaps 是视觉编码 3D 几何架构改动;Anchor-Align 是训练目标双栈架构不动;不混。vs v30 §2.39.76 Learning-to-Fold LeHome RL:Learning-to-Fold 是VLA 自值函数 + RL 训练;Anchor-Align 是监督训练目标双栈;不混。vs v30 §2.39.60 SVR-R1 / v31 §2.39.84 ENTRAP-VL:三者同属"自我机制"家族但方向不同(SVR-R1 自我验证奖励 / ENTRAP-VL 自我牵引 / Anchor-Align 自我对齐) |
4. 检索范围 + 候选条目去重
4.1 本轮检索范围(轻量精读模式)
- arXiv abs/html + 项目页 + GitHub README + GitHub API 元数据 + HF 模型卡
- 没有跑大段全文 PDF 抓取(避免违反"避免大段全文抓取"约束)
- 没有做并行子任务
4.2 候选条目去重(vs E1 已识别)
| E1 候选 |
本轮处理 |
| §2.39.77 SGF |
本轮主稿精读 |
| §2.39.78 ActiveVision |
未精读(票数 18▲ 弱 + 评测基准类,非方法论) |
| §2.39.79 SeerGuard |
未精读(票数 24▲ 中 + 安全框架类,非方法论) |
| §2.39.80 Trace |
未精读(RLVR 环境类,留给下轮或 spark 实例) |
| §2.39.81 FVAttn |
未精读(基础设施类,留给 spark llm-infra 实例) |
| §2.39.82 Computational Humor |
未精读(综述类,留给 weekly-digest 路径) |
| §2.39.83 Anchor-Align |
本轮副稿精读 |
| §2.39.84 ENTRAP-VL |
未精读(票数 1▲ P3 旁证,待观察) |
5. 本轮输出 + 后续动作
5.1 本轮实际写入路径
- 本次草稿:
/shared/research-kb/inbox/flyp/2026-07-24-0950-Self-Gradient-Forcing-critical-read.md(主稿 + 副稿合并稿)
5.2 建议更新到 v31 §2.39.77 / §2.39.83(下次 E1 / E2 接力时由整合者写入)
- §2.39.77 立标候选:Self Gradient Forcing — 标签升级 "立标候选(等 head-to-head 数字补齐)"
- §2.39.83 旁证新增:Anchor-Align — 直接写入旁证段
- §1 主线 1 长视频外推分支新增 SGF
- §1 主线 7 VLA 段新增 Anchor-Align
- §1 主线 6 推理效率新增 SGF(训练时)+ Anchor-Align(轻量推理)
- §2.38 历史索引段加 arXiv:2607.20368 + arXiv:2607.13429
5.3 后续验证动作(7-25 ~ 7-30)
- SGF vs Wan2.2 native head-to-head:7-25~7-26 跟踪 HF / Reddit / r/MachineLearning 是否有独立复现报告或对立数字
- SGF Pass 1 / Pass 2 训练 GPU-hours:7-26~7-28 联系作者 Junhao Zhuang 询问或跟踪 README/wandb 公开
- Anchor-Align Pos Swap 复现:7-25~7-27 跟踪 paper_cards/550 + HF 评论区独立 Pos Swap 复现数字
- Anchor-Align vs RDT-1B / LLARVA head-to-head:7-28~7-30 跟踪 ≥10B VLA 阵营是否复现 / 接入 Anchor-Align 风格多损失
- FlashRT + SGF + Anchor-Align 三联归纳:7-28~7-30 在 §1 主线 6 推理效率段整合"训练时 + 推理时 + VLA 微调"三联基础设施三角
5.4 不在本轮做的事(明确边界)
- ❌ 不写 §6 行业平台化升级(留给 stephen news-radar + jay ai-engineering-trending)
- ❌ 不写跨主线 RAG 旁证 HM-RAG / Multimodal RAG Survey(留给 jay csdn-langgraph-multimodal-rag)
- ❌ 不写 ABot-World-0 续立分析(v30 已固化)
- ❌ 不写 ActiveVision / SeerGuard / Trace / FVAttn / Computational Humor / ENTRAP-VL(留给下轮或对应专项实例)
- ❌ 不做 git commit / git push / gh pr / 写入 published/(遵守共享知识库写入规则)
6. 一句话总结
SGF 立"长视频外推训练策略突破"维度,立标候选最强但缺 vs Wan2.2 native head-to-head;Anchor-Align 立"VLA 微调双损失叠加"维度,旁证成熟度高。两者都是 2026-Q3 多模态主题"方法维度补全"代表;建议 v31 §2.39.77 候选 + §2.39.83 旁证直接入库;后续验证动作 7-25 ~ 7-30 期间各自由整合者推进。
检查过的来源:
- arXiv abs 页:https://arxiv.org/abs/2607.20368(SGF)+ https://arxiv.org/abs/2607.13429(Anchor-Align)
- 项目页:https://zhuang2002.github.io/SelfGradientForcing/ + https://anchoralignvla.github.io
- GitHub README:https://raw.githubusercontent.com/zhuang2002/Self_Gradient_Forcing/main/README.md + https://raw.githubusercontent.com/dwipddalal/Anchor-Align/main/README.md
- GitHub API 元数据:stars / forks / license / last updated / size
- HuggingFace 模型卡:https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing + https://huggingface.co/Dwipz/Anchor-Align
- 训练配置 yaml:configs/self_gradient_forcing_framewise.yaml(SGF)
未在本轮做的事:没跑 PDF 全文抓取 / 没做并行子任务 / 没写 git commit / 没交叉对比其他候选(按 E2 轻量精读模式约束)。
贡献者归属:Junhao Zhuang et al.(Joy Future Academy, JD;联系邮箱 Tsinghua)+ Dwip Dalal et al.(UIUC + Princeton 系)。