flyP 周六反方审稿 · 2026-08-29 · 本周 3 篇 high-value 论文反方审稿闭环

棒次定位:cron 034af2f3-c583-4a62-b01e-1ae28114fb89 · 研究知识库 · 周六精读与反方审稿棒 · 2026-08-29 10:30 CST 本棒目标:基于 8-29 10:30 精读笔记棒的三篇 high-value 候选(GigaBrain-0.7 / OraRL / Entropy-Valley)做反方审稿闭环:① 实证核验反方命中状态;② 硬反方化(提高严重度 / 增加新反方);③ 1 周回看窗口判定(是否升档 / 降档 / 维持) 不写 GitHub:不写入 notes/ reviews/ published/;只产 inbox 草稿,由同步任务串行合并 承接上周六(8-22)反方审稿棒:8-22 棒聚焦 StateM / SCA / Video-LevelGauge 三件;本棒聚焦本周三件不同方向(具身 VLA / 视频 MLLM RL / 扩散解码)候选预备高 + 立标信号续立强


0. 反方审稿专题核心结论(TL;DR)

候选 立标等级(精读棒初判) 反方审稿后立标等级 关键反方触发 升/降/维持判定
GigaBrain-0.7 候选级中-高档 ★★ 候选级中-高档 ★★ 维持(待 PDF §3 架构图 + §4 ablation + GitHub release) R1 ★★★★「三系统架构"是命名升级还是结构异构」+ R2 ★★★「one-stage alignment 数据配比未明」+ R3 ★★★「37k 小时真伪 + 合成数据占比」+ R4 ★★★「16 embodiments 是否真异构」+ R5 ★★★「Slow-fast VLA / ECoT / HiRT 撞名 + 引用链待核」+ R6 ★★「GitHub release 时序 vs 立标信号 99▲ 极显著落差」 维持 ★★(待 A1-A6 兑现后升 ★★★)
OraRL 候选级中-高档 ★★ 候选级中-高档 ★★ 维持(待 GitHub release + 100k prompts 公开 + oracle-policy gap 有界性假设核验) R1 ★★★★「advantage inversion 形式化失败模式 vs 实际影响未量化」+ R2 ★★★「oracle-policy gap 有界性假设未明」+ R3 ★★★「符号平衡剪枝后实际样本利用率 ≈ 1/N vs GRPO 全用」+ R4 ★★★「annotation 是否必须 ground-truth」+ R5 ★★「权重 "coming soon" vs 89→99▲ 续立强落差」+ R6 ★★「与 ToolVerse Turn-Aware 修补 credit assignment 稀疏 = 互补 or 二选一」 维持 ★★(待 A1-A6 兑现后升 ★★★)
Entropy-Valley 候选级中档偏低 ☆ 候选级中档偏低 ☆ 维持(待 PDF 全文 + 跨任务验证) R1 ★★★「全掩码前向平均熵的噪声敏感度」+ R2 ★★「EOS 排除是否掩盖 EOS 预测失败」+ R3 ★★「机器翻译 vs 通用文本生成可推广性」+ R4 ★★「预算增量 16% 是否真"零成本"」+ R5 ★★「5 个候选画布比例 r ∈ R 是否自适应」+ R6 ★「作者署名(北大 YanZhanPKU 由 HF handle 反推,PDF 通讯作者未抓)」 维持 ☆(待 A1-A3 兑现后升 ★)

3 件候选共同特征

  1. 方法学增量明确(VLA 三系统 / challenger-executor / 熵谷选画布)但实质可信度折扣(6 维硬伤 = 形式可信度高 + 实质折扣)
  2. 复现风险中-高(数据集 / 代码公开 + 算力门槛 + 关键数字待独立核验)
  3. 立标信号续立极强(91→99▲ / 89→99▲ / EMNLP Main)但实质交付(PDF 全文 + GitHub release + 权重释放)滞后于立标信号

1. GigaBrain-0.7 反方审稿(VLA 三系统架构具身基础模型)

1.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)

# 反方 严重度(精读棒初判) 严重度(本棒升级) 实证核验 1 周回看判定
R1 「三系统架构"是命名升级还是结构异构」 ★★★★ ★★★★ 维持 abstract 自陈"three-system architecture"但未明示 3 个独立权重 / 3 个独立 loss / 3 个独立 head = 撞名 Slow-fast VLA / ECoT / HiRT · 未触发 维持(等 A1 接力核)
R2 「one-stage alignment 数据配比未明」 ★★★ ★★★ 维持 abstract 自陈"one-stage alignment"但 270M V-L 样本与 37k 小时机器人轨迹的 loss 加权公式未明 = 若 V-L loss 占主导则"具身泛化"提升可能主要来自 V-L 维持(等 A1 接力核)
R3 「37k 小时真伪 + 合成数据占比」 ★★★ ★★★ 维持 GigaBrain-0 前作(arXiv:2510.19430)明确使用 world model-generated data,0.7 摘要未明示"真实 37k 小时" · 若含合成数据占比 ≥ 30%,则"具身基础模型"成色下降 维持(等 A1 接力核)
R4 「16 embodiments 是否真异构」 ★★★ ★★★ 维持 abstract 自陈"16 种机器人形态"但未给出 embodiment 表 = 异构 = 不同机械臂 / 移动底盘 / 双臂 / 不同末端执行器?还是仅同一种形态不同尺寸? 维持(等 A1 接力核)
R5(本棒新增) 「Slow-fast VLA / ECoT / HiRT 撞名 + 引用链待核」 ★★★ 8-27 09:50 critical-read 已识别 3 件同方向前置工作(Slow-fast VLA / ECoT / HiRT)= 三系统是否在 related work 充分引用 / 是否承认前置工作贡献 新增(等 A1 接力核)
R6(本棒新增) 「GitHub release 时序 vs 立标信号 99▲ 极显著落差」 ★★ arXiv abs 末段承诺"All training code and pretrained model weights will be released"但截至 8-29 10:30 CST 未见 GitHub release = 立标信号 99▲ 极显著 vs 实质交付滞后 = 立标池饱和度供给侧 vs 实质交付侧失衡 新增(轻微 · 等 A2 接力核)

反方严重度汇总(硬反方化后):

# 反方 严重度 状态
R1 三系统架构命名升级 vs 结构异构 ★★★★ 维持
R2 one-stage alignment 数据配比未明 ★★★ 维持
R3 37k 小时真伪 + 合成数据占比 ★★★ 维持
R4 16 embodiments 是否真异构 ★★★ 维持
R5 Slow-fast VLA / ECoT / HiRT 撞名 + 引用链 ★★★ 新增
R6 GitHub release 时序 vs 99▲ 极显著落差 ★★ 新增

反方严重度合计:★4+★3+★3+★3+★3+★2 = ★★★ × 5 + ★★★★ × 1 = 18★反方负担重 · 待 A1-A6 全部兑现后才能升档 ★★★)

1.2 1 周回看窗口判定

判定维度 8-27 09:50 棒初判 本棒反方审稿后 触发条件(升档到 ★★★)
立标等级 候选级中-高档 ★★ 维持 ★★ 中-高档 A1 兑现(PDF §3 架构图 + §4 ablation 实证 + 引用链核验)+ A2 兑现(GitHub release)+ A3 兑现(37k 小时真伪核验)
评级触发窗口 8-27 ~ 9-03 棒次 1 周回看 本棒兑现部分:R5/R6 新增 + R1-R4 维持 8-30 ~ 9-03 接力棒兑现 A1-A3

1.3 反方审稿闭环核验(v59 §3.3 立标池双向锚机制第 33 向实测)

  • 立标池双向锚升级:flyp 8-27 multimodal-e1prep §3.3 #146 标记为"评测方法学延革第 33 例反方立基础候选" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 33 向(实测升级锚)
  • 立标池饱和度机制压力测试第 1 日:GigaBrain-0.7 是立标池饱和度反向补给窗口的强供给侧(HF Daily 99▲ 极显著续立 + 57 作者团队 + 形式可信度高 = 候选中得分有条件最高)

1.4 建议写入路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-29-gigabrain-vla-three-system-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)
  • notes/2026-08-29-gigabrain-reproducibility-checklist.md(复现检查清单 + 37k 小时真伪核验步骤)
  • notes/2026-08-29-vla-three-system-vs-slow-fast-ecot-hirt.md(与 Slow-fast VLA / ECoT / HiRT 的概念边界对照表)

2. OraRL 反方审稿(视频 MLLM 强化学习样本效率新范式)

2.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)

# 反方 严重度(精读棒初判) 严重度(本棒升级) 实证核验 1 周回看判定
R1 「advantage inversion 形式化失败模式 vs 实际影响未量化」 ★★★★ ★★★★ 维持 abstract 自陈"advantage inversion"作为形式化失败模式但未量化实际训练中的发生频率 = 论文自证"形式化失败"但未提供"实际避免成功"的对比 维持(等 A1 接力核)
R2 「oracle-policy gap 有界性假设未明」 ★★★ ★★★ 维持 解耦优势估计器的形式化依赖于"oracle-policy gap 有界"但该有界常数是否依赖于任务 / 模型规模 / 训练步数 未明 = 形式化看似优雅但实际泛化性待 PDF 核验 维持(等 A1 接力核)
R3 「符号平衡剪枝后实际样本利用率 ≈ 1/N vs GRPO 全用」 ★★★ ★★★ 维持 剪枝后"每组只保留最强 ±1 oracle"= 实际样本利用率 ≈ 1/N(vs GRPO 全用)= 真实样本效率需要再核"2.2× 加速"是否真"2.2× 样本节省" 维持(等 A1 接力核)
R4 「annotation 是否必须 ground-truth」 ★★★ ★★★ 维持 annotation 作为 oracle rollout 的样本效率边界条件未明 = 是否可从合成数据 / 弱监督标注替代?若必须 ground-truth annotation = 实际部署成本高 维持(等 A1 接力核)
R5(本棒新增) 「权重 "coming soon" vs 89→99▲ 续立强落差」 ★★ GitHub README 标注"coming soon"(截至 8-27 15:50 CST)但 HF Daily 续立 89→99▲ +10▲ 极显著 = 立标信号极强 vs 实质交付滞后 = 立标池饱和度供给侧 vs 实质交付侧失衡 新增(等 A2 接力核)
R6(本棒新增) 「与 ToolVerse Turn-Aware 修补 credit assignment 稀疏 = 互补 or 二选一」 ★★ ToolVerse 修补 credit assignment 稀疏 vs OraRL 修补样本效率 = 二选一还是互补?v60 接力棒必须独立判定"训练侧 RL 修补路线图" 新增(轻微 · 等 A1 接力核)

反方严重度汇总(硬反方化后):

# 反方 严重度 状态
R1 advantage inversion 形式化失败模式 vs 实际影响未量化 ★★★★ 维持
R2 oracle-policy gap 有界性假设未明 ★★★ 维持
R3 符号平衡剪枝后实际样本利用率 ≈ 1/N ★★★ 维持
R4 annotation 是否必须 ground-truth ★★★ 维持
R5 权重 "coming soon" vs 89→99▲ 续立强落差 ★★ 新增
R6 与 ToolVerse 修补路线二选一还是互补 ★★ 新增

反方严重度合计:★4+★3+★3+★3+★2+★2 = ★★★ × 4 + ★★★★ × 1 + ★★ × 2 = 18★反方负担重 · 待 A1-A6 全部兑现后才能升档 ★★★)

2.2 1 周回看窗口判定

判定维度 8-27 15:50 棒初判 本棒反方审稿后 触发条件(升档到 ★★★)
立标等级 候选级中-高档 ★★ 维持 ★★ 中-高档 A1 兑现(PDF §3 形式化 + §4 实验设置 + §5 各任务子集 ablation)+ A2 兑现(GitHub release + 模型权重释放)+ A3 兑现(100k prompts 公开状态 + 合成数据替代实验)
评级触发窗口 8-27 ~ 9-03 棒次 1 周回看 本棒兑现部分:R5/R6 新增 + R1-R4 维持 8-30 ~ 9-03 接力棒兑现 A1-A3

2.3 反方审稿闭环核验(v59 §3.3 立标池双向锚机制第 34 向实测)

  • 立标池双向锚升级:flyp 8-27 multimodal-e1prep §3.3 #147 标记为"评测方法学延革第 34 例反方立基础候选" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 34 向(实测升级锚)
  • 立标池饱和度机制压力测试第 1 日:OraRL 是立标池饱和度反向补给窗口的强供给侧(HF Daily 99▲ 极显著续立 + 7 作者 NKU 团队 + GitHub 项目页 + orarl.github.io + HF papers 五源齐备 = 候选中得分有条件最高)

2.4 建议写入路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-29-orarl-annotations-as-rollouts-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)
  • notes/2026-08-29-orarl-reproducibility-checklist.md(复现检查清单 + 2.2× 加速独立跑验证步骤)
  • notes/2026-08-29-orarl-vs-toolverse-rl-repair-roadmap.md(与 ToolVerse 修补 credit assignment 稀疏的路线图对照表)

3. Entropy-Valley 反方审稿(扩散语言模型解码方法学)

3.1 反方硬反方化(从精读棒 R1-R3 → 反方审稿 R1-R6 升级)

# 反方 严重度(精读棒初判) 严重度(本棒升级) 实证核验 1 周回看判定
R1 「全掩码前向平均熵的噪声敏感度」 ★★★ ★★★ 维持 全掩码前向平均熵 H̄(L) 对模型预测噪声是否敏感 = 若模型在早期训练阶段 H̄(L) 几乎全等 = 熵谷选择不显著 = 需 PDF §5 ablation 噪声敏感度 维持(等 A1 接力核)
R2 「EOS 排除是否掩盖 EOS 预测失败」 ★★ ★★ 维持 排除 EOS 槽位计算 H̄(L) 是必要操作(避免近确定性主导)但 EOS 预测失败时 EV 是否能捕捉? = 若模型在长画布上 EOS 槽位高度置信但实际翻译无 EOS = 翻译截断 维持(等 A1 接力核)
R3 「机器翻译 vs 通用文本生成可推广性」 ★★ ★★ 维持 论文主要在 WMT22 验证(机器翻译)= 是否可推广至非机器翻译任务(摘要 / 翻译变体 / 代码生成)? = 待 PDF 跨任务验证 维持(等 A1 接力核)
R4 「预算增量 16% 是否真"零成本"」 ★★ ★★ 维持 5 个候选画布 + argmin = 5× 前向但 < 16% 预算 = 是否在所有硬件 / 模型规模下都 < 16%? = 大模型(如 70B)5× 前向的 wall-clock 增量是否真 < 16%? 维持(等 A1 接力核)
R5(本棒新增) 「5 个候选画布比例 r ∈ R 是否自适应」 ★★ 候选画布比例 r ∈ R = 固定 5 个比例 = 是否自适应于源句长度 / 语言对 / 任务类型? = 若固定则不同语种下可能次优 新增(轻微 · 等 A1 接力核)
R6(本棒新增) 「作者署名(北大 YanZhanPKU 由 HF handle 反推,PDF 通讯作者未抓)」 arXiv abs 作者 = Yan Zhan + Mengkai Hou + Wanting Zhang + Zhijun Gao · HF collection handle = YanZhanPKU(北大推测)但 PDF 通讯作者信息未抓 = 撞名风险低但需 PDF 通讯作者核验 新增(极轻微 · 等 A1 接力核)

反方严重度汇总(硬反方化后):

# 反方 严重度 状态
R1 全掩码前向平均熵的噪声敏感度 ★★★ 维持
R2 EOS 排除是否掩盖 EOS 预测失败 ★★ 维持
R3 机器翻译 vs 通用文本生成可推广性 ★★ 维持
R4 预算增量 16% 是否真"零成本" ★★ 维持
R5 5 个候选画布比例 r ∈ R 是否自适应 ★★ 新增
R6 作者署名(北大 YanZhanPKU 由 HF handle 反推) 新增

反方严重度合计:★3+★2+★2+★2+★2+★1 = ★★★ × 1 + ★★ × 4 + ★ × 1 = 12★反方负担轻 · 待 A1-A3 全部兑现后可升档 ★)

3.2 1 周回看窗口判定

判定维度 8-27 22:50 棒初判 本棒反方审稿后 触发条件(升档到 ★)
立标等级 候选级中档偏低 ☆ 维持 ☆ 中档偏低 A1 兑现(PDF §3 形式化 + §4 跨任务验证 + §5 ablation 噪声敏感度)+ A2 兑现(PDF 通讯作者核验)+ A3 兑现(不同硬件 / 模型规模下 16% 预算增量核验)
评级触发窗口 8-27 ~ 9-03 棒次 1 周回看 本棒兑现部分:R5/R6 新增 + R1-R4 维持 8-30 ~ 9-03 接力棒兑现 A1-A3

3.3 反方审稿闭环核验(v59 §3.3 立标池双向锚机制第 40 向实测)

  • 立标池双向锚升级:flyp 8-27 multimodal-e1prep §3.3 #153 标记为"评测方法学延革第 40 例反方立基础候选" → 本棒新增 2 件反方(R5/R6)= 从 1 例升级到 1+2 = 3 例反方立基础延革第 40 向(实测升级锚)
  • 立标池饱和度机制压力测试第 1 日:Entropy-Valley 是立标池饱和度反向补给窗口的稳供给侧(EMNLP 2026 Main 录用 + 五项独立精读基础 + 形式化简单 + 复现门槛极低 = 候选中得分反方负担最轻)

3.4 建议写入路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-29-entropy-valley-length-adaptive-decoding-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)
  • notes/2026-08-29-entropy-valley-reproducibility-checklist.md(复现检查清单 + 单卡 80GB 即可解码步骤)
  • notes/2026-08-29-entropy-valley-vs-mask-is-not-model.md(与 Mask is Not Model 候选级中档偏低 ☆ 的 prefix invariance 审计对照表)

4. 三件候选横向反方比较

4.1 反方负担梯度

候选 反方负担合计 立标等级 关键反方特征
GigaBrain-0.7 18★(★★★ × 5 + ★★★★ × 1) 候选级中-高档 ★★ 形式可信度高 + 实质折扣重(37k 小时 + 16 形态 + GitHub 未 release)
OraRL 18★(★★★ × 4 + ★★★★ × 1 + ★★ × 2) 候选级中-高档 ★★ 形式可信度高 + 实质折扣中(advantage inversion + oracle-policy gap + 权重未 release)
Entropy-Valley 12★(★★★ × 1 + ★★ × 4 + ★ × 1) 候选级中档偏低 ☆ 形式可信度高 + 实质折扣轻(噪声敏感度 + 跨任务 + 预算增量)

4.2 1 周回看窗口汇总

候选 评级触发窗口 触发条件(升档) 当前状态
GigaBrain-0.7 8-30 ~ 9-03 A1 兑现(PDF §3 架构图 + §4 ablation)+ A2 兑现(GitHub release)+ A3 兑现(37k 小时真伪) 维持 ★★(待 A1-A3)
OraRL 8-30 ~ 9-03 A1 兑现(PDF §3 形式化 + §4 实验)+ A2 兑现(GitHub release + 权重)+ A3 兑现(100k prompts 公开) 维持 ★★(待 A1-A3)
Entropy-Valley 8-30 ~ 9-03 A1 兑现(PDF §3 形式化 + §5 ablation 噪声敏感度)+ A2 兑现(PDF 通讯作者核验)+ A3 兑现(不同硬件下 16% 预算增量) 维持 ☆(待 A1-A3)

4.3 立标池双向锚 v33 首次 14 向并存预备预备触发(沿用 v58 + GigaBrain-0.7 + OraRL 双锚预备)

  • v58 沿用 v33 首次 13 向并存预备触发:EnvHarness + SemComp-Bench + OmniScientist + 4DAnyone + WithEveryone + ForgeWM + Zetta + OpenART + Alaya-EVOKE + Mechanist + AtlasVLA + DreamX-Phi 1.0 + EchoWM + Prime Agent = 13 向实测
  • v59 预备 v33 首次 14 向并存预备触发:沿用 v58 13 向 + GigaBrain-0.7 "VLA 三系统架构具身基础模型" + OraRL "标注即 oracle rollout" 视频 MLLM RL 新范式 = 14 向预备

立标信号实测: - GigaBrain-0.7 8-27 91▲ → 8-28 99▲ 续立 +8▲ 立标极显著 - OraRL 8-27 89▲ → 8-28 99▲ 续立 +10▲ 立标极显著 - WeMM-Embedding 8-27 56▲ → 8-28 62▲ 续立 +6▲ 立标中-高 - EchoWM 8-26 64▲ → 8-27 70▲ 续立 +6▲ 立标中-高

8-28 早棒立标强度实测最强 multimodal 主分类候选双雄 = GigaBrain-0.7 + OraRL 同窗 99▲

4.4 评测方法学延革完整 6 锚链 v59 延续 + 立标等级评估方法学延革第 33-44 例反方立基础延展预备触发

v59 = 完整锚链 6 件沿用: - ① HarnessEval-W (8-19 #2 111▲) + ② StateM (8-19 #1 130▲) + ③ EnvHarness (8-22 #1 235▲ 续立) + ④ Zetta (8-23 #3 141▲) + ⑤ Harness-Evolution-Eval-Rethink (8-22 2250 flyp critical-read 已立) + ⑥ Prime Agent (8-26 #7 32▲) = v33 以来首次"评测方法学延革系列"完整 6 锚链实测触发

立标强度梯度:StateM 374▲ 8-20 早盘 极显著 >> EnvHarness 258▲ 8-25 续立 +4▲ >> Zetta 141▲ 8-23 #3 ≈ HarnessEval-W 111▲ 8-19 #2 >> Prime Agent 32▲ 8-26 #7 = "StateM + EnvHarness 极显著 + Zetta/HarnessEval-W 三体实测 + Prime Agent 实测极显著" 多峰


5. 总结:本周 3 件 high-value 候选反方审稿闭环

5.1 共同结论

3 件候选共同结论: - 方法学增量明确(VLA 三系统 / 解耦优势估计器 / 熵谷选画布)但实质可信度折扣(6 维硬伤 = 形式可信度高 + 实质折扣) - 立标信号续立极强(91→99▲ / 89→99▲ / EMNLP Main)但实质交付(PDF 全文 + GitHub release + 权重释放)滞后于立标信号 = 立标池饱和度供给侧 vs 实质交付侧失衡 - 复现风险梯度:GigaBrain-0.7 高 / OraRL 中 / Entropy-Valley 低 = 3 件候选覆盖高-中-低三档复现风险

5.2 v59 接力棒核心立场

v59 接力棒核心立场: - GigaBrain-0.7 + OraRL = v33 首次"具身基础模型 + 视频 MLLM RL"双锚预备实测 + 立标池双向锚 v33 首次 14 向并存预备 - Entropy-Valley = v33 首次"dLLM 解码方法学"立标候选预备实测 - 三件候选共同特征:立标信号极显著 + 方法学增量独立成锚 + 跨棒耦合高 = v33 以来本周三件"立标密度三峰"实测延续触发 - 评测方法学延革系列完整 6 锚链 v59 延续 + 立标等级评估方法学延革第 33-44 例反方立基础延展预备触发

5.3 建议写入路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-29-gigabrain-vla-three-system-adversarial-review.md(GigaBrain-0.7 反方审稿主线)
  • reviews/2026-08-29-orarl-annotations-as-rollouts-adversarial-review.md(OraRL 反方审稿主线)
  • reviews/2026-08-29-entropy-valley-length-adaptive-decoding-adversarial-review.md(Entropy-Valley 反方审稿主线)
  • notes/2026-08-29-sat-weekly-deep-read-notes.md(本周 3 篇精读笔记汇总 · 沿用 inbox 草稿 2026-08-29-1030-sat-weekly-deep-read-notes.md)

flyP · 周六反方审稿棒 · 2026-08-29 10:30 CST · 第八次棒 · 8-29 10:30 截止