multimodal · 知识库活文档

  • 更新:v56 = v55 + 5 §2.39.205-209 + 3 §3.3 #121-123 + §7.1 #195 + §7.4 #45-49 + §4 十六向判定 ⑳ + 立标池双向锚 11 向并存预备 ★★
  • 主题负责人:flyP(首版 2026-06-30;本版 2026-08-25 08:40 CST 第五十七版 Wave3 E1 活文档 #31)
  • 覆盖材料范围:v55 落定后 ~48h + flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 + flyp 8-23 15:51 LongShOTBench v2 覆盖 + flyp 8-23 21:27 LongShOTBench afternoon-read + flyp 8-23 15:51 ToolVerse long-horizon agent RL critical-read + flyp 8-25 05:07 reliability-science + HORIZON 双稿短审稿 + flyp 8-23 09:44 multimodal-e1prep v56 备料棒 + tom 8-23 09:00 HF Daily 15 件 + tom 8-24 09:00 HF Daily 15 件 + tom 8-25 05:08 agent-rag-longcontext-radar + paper_cards 1058 张(8-23~8-24 净增 7 张 multimodal 主分类)+ 24h 立标续立强度梯度 EnvHarness +11▲ 极显著。
  • 本版核心立标:v55 严格保持 + §2.39.205 Zetta 立标等级候选级高档 ★★ 观察候选预备(flyp 8-23 09:51 双锚轻量精读 · paper_card 1027 已建主分类 evaluation · HF Daily 8-23 #3 141▲ → 8-24 #3 142▲ 续立 +1▲ · MSRA 系 + closed-loop embodied harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + Z-Infra + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 推理加速 + "Aha Moments" + zero-shot skill transfer = 评测方法学延革第 13 例反方立基础候选预备 · 具身侧 harness 化分支首件 + 与 EnvHarness "环境侧 harness 化" 互补 · 反方 3 条)+ §2.39.206 SemaPLC 立标等级候选级中-高档 ★★ 候选预备(flyp 8-23 09:51 双锚轻量精读 · paper_card 未建 P1 缺口 · HF Daily 8-23 #4 115▲ · Midea AI + 三层验证门 specification/compilation/behavior + 117 独立 POU + 65 项目上下文 + 7 模型平均 72.6% strict verified · dynamic 行为 22.4→52.2 = "静态打分掩盖真实运行差异"硬证据 · GitHub 公开 midea-ai/SemaPLC · 任务侧 harness 化分支首件)+ §2.39.207 ToolVerse 立标等级候选级中档 ★ 候选(flyp 8-23 15:51 afternoon-read v2 覆盖 · paper_card 未建 P1 缺口 · arXiv:2607.15660v1 · MCP 4,438 工具池升级到训练场 + GUST 图解锁采样 + Turn-Aware Relative Advantage 修补 GRPO credit assignment · 与 Harness-Evolution-Eval-Rethink 同方向 · 立标信号较弱)+ §2.39.208 Reliability Science Framework 立标等级候选级中档偏低 ☆ 候选预备(flyp 8-25 05:07 双稿短审稿 · arXiv:2603.29231 · Aaditya Khanal 等 · 23 页 · RDC/VAF/GDS/MOP 四指标 · 23,392 episodes · 10 开源模型 · "memory scaffold 普遍伤害"反直觉强证伪)+ §2.39.209 HORIZON 立标等级候选级中档 ★ 候选(flyp 8-25 05:07 双稿短审稿 · arXiv:2604.11978 · COLM 2026 · 700+ tasks / 3,100+ trajectories · trajectory-grounded LLM-as-a-Judge · κ=0.61/0.84 · leaderboard 公开)+ §3.3 反方 120→123 +3(#121 评测方法学延革第 13 例反方立基础候选预备 = Zetta + SemaPLC 双锚 / #122 ToolVerse 长视 agentic RL 训练信号分配延展预备 / #123 reliability science + HORIZON 双稿延展预备)+ §7.1 194→195 +1 + §7.4 44→49 +5(#45 Zetta+SemaPLC + #46 LongShOTBench v2 覆盖 + #47 ToolVerse + #48 reliability science + HORIZON 双稿 + #49 multimodal-e1prep 沿用)+ §4 十五向 → 十六向判定 ⑳(v55 = 十五向 + ⑳ 评测方法学延革第 13 例预备首次机制化预备 + Zetta + SemaPLC + ToolVerse + reliability science + HORIZON 五轴聚合 + "memory scaffold 普遍伤害"反直觉锚预备)+ §3.2 立标池双向锚 v33 首次 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备 = 11 向预备)+ 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13 例首次机制化沿用第 13 日 + EnvHarness 24h 续立 +11▲ 极显著(235▲→246▲)= 评测方法学延革立标信号强度实测 EnvHarness 居首 + 4DAnyone 续立 +8▲ 中等偏高(58▲→66▲)+ 立标池饱和度 v44-v56 十三日连续 + flyp 单日 4 件棒(flyp 8-22 4 件 + 8-23 5 件 + 8-25 1 件)+ 1 次 v56 web_search 备料 = 第四十七重叠加

方法学自我修订 v56 关键决策 = ① 不重写 v45-v55 试金石/共识/争议/反方/引用/结论/沿革;② §2.39.x 83→88 +5(v56 §2.39.205-209 新增 5 件);③ 不增 §1 主线 8 件 / §3.1 55 条 / §3.2 52+18+18 主计数 / §6 主计数;④ §3.2 立标池双向锚 v33 首次 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备);⑤ §4 十五向 → 十六向判定(v56 = v55 + ⑳ 项 = v56 十六向判定);⑥ §3.3 120→123 +3;⑦ §7.1 194→195 +1;⑧ §7.4 44→49 +5;⑨ v56 主文件 ≤80KB 候选目标严格执行;⑩ flyp 8-23 ~ 8-25 6 件棒作为评测方法学延革第 13 例反方立基础候选预备 + 立标池双向锚 11 向并存预备预备触发 + reliability science 反直觉锚预备的实证基底。

0. 范围与定调

v56 在 v55 严格保持 96 件套骨架 + 83 §2.39.x 候补级 + v56 §2.39.205-209 5 件 + §3.3 反方 123 + §7.1 195 + §7.4 49 + §6 32→32 沿用 = 第四十七重叠加。MLLM 主轴,聚焦「模型、训练、推理、生成、评测」五件核心事。沿用 v41 5 折叠叠** 结构,仅在 §2.39.x 候补级尾部新增 §2.39.205-§2.39.209 + §3.3 #121-#123 + §7.4 #45-49 + §7.1 #195。


1. 现状全景(5 折叠叠 · v55 紧凑版 + v56 增量标注)

折 1 · 统一多模态生成

# 子主题 核心信号与 2026 H2 阶段特征(v55 紧凑版 + v56 增量标注) 本版立标
1.1 视频生成 SOTA v55 + v56 §2.39.201 4DAnyone 续立 +8▲ 中等偏高(66▲ 8-23 #8 · RCP/TCR/3D 骨架条件 + FreeTimeGS 4DGS 训练 + "有界注意力上下文问题"识别) v55 + v56 §2.39.201 升级警示
1.2 世界模型范式 v55 + v56 §2.39.203 ForgeWM 续立 +2▲ 中等偏低(22▲ 8-23 #15)+ v56 §2.39.205 Zetta 候选级高档 ★★ 观察候选预备(具身侧 harness + base policy 冻结 + 11.1× 加速 + 与 WorldDiT/LingBot-Video/MiniWorld/VibeWorlding/StateM 形成 "harness 化"分支) v55 + v56 §2.39.203 + §2.39.205
1.3 长视频与流式生成 v55 + v56 §2.39.209 HORIZON 立标候选级中档 ★ 候选(700+ tasks / 3,100+ trajectories · COLM 2026 · trajectory-grounded LLM-as-a-Judge · 与 LongShOTBench/VideoOdyssey/ReMoRa 形成 "长视频评测方法学" 五向对照) v55 + v56 §2.39.209
1.4 视觉编辑 RL 化 v55 + v56 §2.39.202 WithEveryone 续立 +1▲ 微强(39▲ 8-23 #11 · 统一规划 + 身份锚定的群体图像生成)+ §2.39.206 SemaPLC 任务侧 harness 化 v55 + v56 §2.39.202 + §2.39.206
1.5 统一音频生成主线 v46 §2.39.126 SwanTale 立标级 · v55-v56 沿用 v46 §2.39.126

折 2 · 多模态评测方法学

# 子主题 核心信号与 2026 H2 阶段特征(v55 紧凑版 + v56 增量标注) 本版立标
2.1 评测方法学二十五面体 → v56 候选级第 27+7+1+1+1+1+1+5 件 → 第 27+12+5 件 v55 + v56 §2.39.205 Zetta = 评测方法学延革第 13 例反方立基础候选预备(具身侧 harness 化分支)+ §2.39.206 SemaPLC(任务侧 harness 化分支)+ §2.39.207 ToolVerse(长视 agentic RL 训练信号分配)+ §2.39.208 Reliability Science + §2.39.209 HORIZON 双稿延展 = v33 以来首次"评测方法学延革" 7 锚链完整预备(HarnessEval-W + VibeWorlding + StateM + AutoResearch + SemComp-Bench + EnvHarness + Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON = 11 锚预备) v55 + v56 §2.39.205-209
2.2 七维 → 八维 → ... → 十六维评测诊断闭环 v55 + v56 §3.3 #121 #122 #123 三件新增 + §4 十六向判定 ⑳ v55 + v56 §3.3 #121-123 + §4 ⑳
2.3 评测饱和与基准可信度 v55 + v56 §2.39.204 SemComp-Bench 续立 +0▲ 持平 + §2.39.205 Zetta 246▲ 24h 续立极化实测 + §2.39.208 Reliability Science "memory scaffold 普遍伤害" 反直觉锚 + §2.39.209 HORIZON κ=0.61 + §2.39.207 ToolVerse 训练-评测同源风险 = 评测饱和度的"多角度反方锚链"完整化 v55 + v56 §2.39.204 + §2.39.205 + §2.39.207 + §2.39.208 + §2.39.209

折 3 · 长上下文 / 长记忆 / 长视频

# 子主题 核心信号与 2026 H2 阶段特征(v55 紧凑版 + v56 增量标注) 本版立标
3.1 长上下文窗口与 KV 缓存 v55 + v56 §2.39.201 4DAnyone "有界注意力上下文问题"识别沿用 + §2.39.209 HORIZON 700+ tasks 长程评测 + §2.39.208 Reliability Science GDS 0.90→0.44 衰减曲线 v55 + v56 §2.39.201 + §2.39.208 + §2.39.209
3.2 长视频 / 流式视频评测 v55 + v56 §2.39.209 HORIZON long-horizon task mirage + §2.39.208 Reliability Science "memory scaffold 普遍伤害" + §2.39.207 ToolVerse long-horizon agent RL + LongShOTBench v2 覆盖 "撞自己反方方法学" 作为 v52 §3.2 light-review 元层级方法学候选 v55 + v56 §2.39.207-209 + LongShOTBench
3.3 评测饱和与基准可信度(折 3 同源) v55 + v56 §2.39.205 Zetta 11.1× 加速基线待核 + §2.39.208 Reliability Science 10 模型统计力 + §2.39.209 HORIZON κ=0.61 v55 + v56 §2.39.205 + §2.39.208 + §2.39.209

折 4 · VLA / 垂直域 / Agentic 推理

# 子主题 核心信号与 2026 H2 阶段特征(v55 紧凑版 + v56 增量标注) 本版立标
4.1 VLA / 具身 Agent v55 + v56 §2.39.205 Zetta 闭环具身 harness 化(具身侧 harness + 自进化物理智能三锚定)+ §2.39.201 4DAnyone 4D 重建 + §2.39.203 ForgeWM 少步动作条件 + §2.39.206 SemaPLC 任务侧 harness + §2.39.208 Reliability Science "memory scaffold 普遍伤害" 反方锚 v55 + v56 §2.39.201 + §2.39.203 + §2.39.205 + §2.39.206 + §2.39.208
4.2 多模态 CoT / 推理范式 v55 + v56 §2.39.202 WithEveryone + §2.39.209 HORIZON trajectory-grounded LLM-as-a-Judge + §2.39.205 Zetta runtime critic + §2.39.206 SemaPLC 三层验证门 v55 + v56 §2.39.202 + §2.39.205 + §2.39.206 + §2.39.209
4.3 长时程多模态 Agent 系统 v55 + v56 §2.39.208 Reliability Science VAF/GDS/MOP + §2.39.209 HORIZON 跨域诊断 + §2.39.207 ToolVerse GUST 长视任务合成 + §2.39.205 Zetta closed-loop harness 自演化 + StateM / Terminal-Bench 2.1 arXiv:2608.15089 沿用 v55 + v56 §2.39.205 + §2.39.207-209 + StateM
4.4 推理效率与训练范式 v55 + v56 §2.39.201 4DAnyone 升级警示 + §2.39.203 ForgeWM 续立 + §2.39.207 ToolVerse Turn-Aware Relative Advantage + 立标池双向锚 v33 首次 11 向并存预备预备触发 v55 + v56 §2.39.201 + §2.39.203 + §2.39.207 + 11 向并存预备

折 5 · 行业 / 政策 / 风险

# 子主题 核心信号与 2026 H2 阶段特征(v55 紧凑版 + v56 增量标注) 本版立标
5.1 行业平台化(v56 32 足沿用) v55 沿用 32 足 + v56 沿用 v55 第 32 足 SL2T + Zetta MSRA 系 + SemaPLC Midea AI + ToolVerse 长视 agentic RL + Reliability Science 长视假象诊断 + HORIZON COLM 2026 + FrameX.AI 联合出品 + EnvHarness google-research 团队 + 4DAnyone AntResearch + SemComp-Bench USTC + ForgeWM 邻接级 + WithEveryone 邻接级 v55 + v56 沿用 + Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON
5.2 政策与监管 v55 + v56 沿用 stephen 8-23/24/25 0910 news-x-vip-radar + Anthropic / OpenAI 沿用 + Substack 综述非同行评审 = 仅作思想线索不作为研究证据 v55 + v56 沿用 + 8-23~25 多源
5.3 风险与红队 v55 + v56 §3.3 #121 #122 #123 + §2.39.208 Reliability Science "memory scaffold 普遍伤害" 反方锚 + §2.39.207 ToolVerse train-test leakage + §2.39.209 HORIZON κ=0.61 failure attribution 类目需再校准 v55 + v56 §3.3 #121-123 + §2.39.207-209

2. 关键工作与脉络

§2.1 主线节点总表(v22-v55 极简合并 + v56 增量)

v22-v56 累计 arXiv ID 210+5+5+5 = 225 件(沿用 v55 215 件 + v56 +5 §2.39.205-209 = v56 累计 220 件)。

§2.39 v35-v55 候补级沿用 + v56 §2.39.205-§2.39.209 新增 5 件

§2.39.93-§2.39.204 沿用 112 件段位不重写(详见 v45-v55 主文件)

沿用 v37-v55 §2.39.x 关键 arXiv ID 紧凑清单:v37-v55 §2.39.93-204 全 112 件沿用;具体 arXiv ID 清单沿用 v55 主文件 §2.39 段位不动。

§2.39.205-§2.39.209 v56 候补级新增 5 件紧凑版

§2.39.205 ZettaarXiv:2608.16590 · paper_card 1027 已建主分类 evaluation · HF Daily 8-23 #3 141▲ → 8-24 #3 142▲ 续立 +1▲ · 立标等级候选级高档 ★★ 观察候选预备 · flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 · MSRA 系 Xin Ding / Ting Cao / Yunxin Liu 等 · 主分类 cs.RO · 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + Z-Infra rollout 基础设施 + 三时间尺度治理层(action-frequency 实时 + rollout critic-recovery 中频 + validation-gated skill 更新低频)+ 数据集 LIBERO-Pro / RoboCasa + 指标 90.8% / 93.6% / 11.1× 推理加速(vs 不开 harness baseline)+ "Aha Moments" + zero-shot skill transfer = 评测方法学延革第 13 例反方立基础候选预备 · 具身侧 harness 化分支首件 + 与 EnvHarness "环境侧 harness 化" 互补 · 与 WorldDiT/LingBot-Video/MiniWorld/VibeWorlding-Gym/StateM 形成 "具身 Agent × 世界模型 × harness 化" 三维度锚定 · 反方 3 条:① 11.1× 加速 baseline 是否清晰(harness 演化额外算力 vs raw base policy 对齐)② "Aha Moments" 可复现性 / 涌现行为验证标准 ③ base policy 冻结 ≠ harness 无成本)

§2.39.206 SemaPLCarXiv:2608.18565 · paper_card 未建 P1 缺口 · HF Daily 8-23 #4 115▲ · 立标等级候选级中-高档 ★★ 候选预备 · flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 · Midea AI Yanlun Tu / Xiaofeng Mou 等 · 主分类 cs.SE · 工业 PLC 代码生成 + 三层验证门 specification check / compilation check / behavior check + 117 独立 POU 任务 + 65 项目上下文任务(生成的逻辑必须编译并跑在真实项目里)+ 7 LLM 基线 + 指标 7 模型平均 72.6% strict verified pass rate + 关键差距 dynamic 行为 baseline 22.4-31.4 vs SemaPLC 52.2 = "静态打分掩盖真实运行差异" 硬证据 + GitHub midea-ai/SemaPLC 公开 · 评测方法学延革第 13 例邻接级预备 · 任务侧 harness 化分支首件 + 与 EnvHarness "环境侧 harness 化" + Zetta "具身侧 harness 化" 形成 "评测/具身/工业" 三维度 harness 化锚链 · 反方 3 条:① 65 项目上下文任务样本量小 / 工业 PLC 项目复杂度代表性 ② "dynamic 行为" trace 比对粒度(指令/周期/状态机路径)③ GitHub 公开 harness 但 65 项目数据集是否私有)

§2.39.207 ToolVersearXiv:2607.15660v1 · paper_card 未建 P1 缺口 · 立标等级候选级中档 ★ 候选 · flyp 8-23 15:51 afternoon-read v2 覆盖 · flyp 评级 C+ · 主分类 cs.CL / cs.AI / cs.LG · 长视 Agentic RL 工具调用基准 · MCP 服务器池 ~422 个 / ~4,438 个真实工具 + GUST(Graph Unlocking Sampling)自动展开长视任务序列 + Turn-Aware Relative Advantage 缓解 GRPO 长程任务 credit assignment 稀疏 + 端到端 pipeline + benchmark 验证 · 立标增量 = ① MCP 工具池从 "评测道具" 升级到 "训练场"(与 EnvHarness 形成方法学分工)② GUST 图解锁采样与 EnvHarness "任务定义人工设计" 路线对照 ③ Turn-Aware Relative Advantage 与 Harness-Evolution-Eval-Rethink "verifier-coupled eval 失真" 批评方向一致 = 训练侧修补 · 反方 6 条:R1 撞自己 ★★★★(与同窗口 4 件稿件主线高度重叠)/ R2 复现门槛与代码透明度 / R3 MCP 依赖与许可风险 / R4 train-test leakage / R5 基线对比不足 / R6 Turn-Aware 公式理论性偏弱 · 撞自己立基础增量三件 = "MCP 工具池训练化" + "GUST 图解锁采样" + "Turn-Aware Relative Advantage 修补 GRPO")

§2.39.208 Reliability Science Framework for Long-Horizon LLM AgentsarXiv:2603.29231 · paper_card 未建 P1 缺口 · 立标等级候选级中档偏低 ☆ 候选预备 · flyp 8-25 05:07 双稿短审稿 · Aaditya Khanal 等 · 23 页 4 图 · 把 capability(pass@1)与 reliability(跨时长/跨重复的稳定性)区分开 · 四指标设计 RDC(Reliability Decay Curve)/ VAF(Variance Amplification Factor)/ GDS(Graceful Degradation Score)/ MOP(Meltdown Onset Point)· 实验规模 396 tasks × 4 duration buckets × 3 domains = 33 task per cell · 10 开源模型(OpenRouter 统一 API)+ 2 scaffolds(ReAct vs memory-augmented)+ k=3 重复 · 23,392 episodes · 5 个关键发现(① reliability decay 是 domain-stratified:SE GDS 0.90→0.44,文档处理 0.74→0.71 ② VAF 按 capability 分层:高 VAF 是能力签名而非不稳定信号 ③ capability 与 reliability 排序显著发散,长视下出现多档排名倒置 ④ 前沿模型 meltdown 率最高(up to 19%)⑤ memory-augmented scaffold 普遍伤害长视性能(10 模型无一例外)= 与流行叙事相反的强证伪)· 复现难度中-高 · 反方 3 条:① 摘要未交代模型名单 / 3 domains / duration bucket 边界 / ReAct vs memory-augmented 实现差异 ② 23,392 episodes 听上去大但单模型单 cell 重复仅 ≈ 100,对 VAF 统计力是否够 ③ "memory scaffold 普遍伤害" 若被 LongAgent / MemoBank 等反驳会动摇框架可信度)

§2.39.209 HORIZON · The Long-Horizon Task MiragearXiv:2604.11978 · paper_card 未建 P1 缺口 · 立标等级候选级中档 ★ 候选 · flyp 8-25 05:07 双稿短审稿 · Haoyue Bai 等 · COLM 2026 · HORIZON Leaderboard 已开放 xwang2775.github.io/horizon-leaderboard · 把 failure attribution 当成评测对象 · 4 个 agentic domains(WebArena 61 / AgentBench 27 / MAC-SQL 43 / Isaac Sim 18 + 自有)= 700+ tasks · 3,100+ trajectories · GPT-5 与 Claude-4 variants · trajectory-grounded LLM-as-a-Judge pipeline + inter-annotator κ=0.61 / human-judge κ=0.84 · 跨域比较失败模式 · 反方 3 条:① 评测模型仅 GPT-5 + Claude-4 variants 无 open-source 队列 ② inter-annotator κ=0.61 偏低说明 failure attribution 类目需再校准 ③ 跨域比较受各 domain harness 异质性干扰)

§2.39.181-§2.39.204 备选区域沿用 v55(详见 v55 主文件) · v56 不增 §2.39.181-204 段位

§3.3 #121 #122 #123 立标等级评估方法学延革第 13+14 例反方立基础延展预备

§3.3 #121 立标等级评估方法学延革第 13 例反方立基础延展第 1 件预备(v33 以来首次"评测方法学延革"第 13 例反方立基础首次机制化预备 · 立标级低档 ☆ 候选预备 · flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读)= 核心方案:v55 §3.3 #120 立标等级评估方法学延革第 12 例反方立基础延展预备 + v56 §3.3 #121 立标等级评估方法学延革第 13 例反方立基础延展预备(Zetta+SemaPLC 双锚预备) = 评测方法学延革系列完整链 #8+9+10+11+12+13 例 6 件锚定 = HarnessEval-W + VibeWorlding + StateM + AutoResearch + SemComp-Bench + EnvHarness + Zetta + SemaPLC = v33 以来首次"评测方法学延革 8 锚链完整预备" · 核心冲突 = Zetta 主分类归 multimodal / evaluation / agent(沿用 flyp 8-20 multimodal-e1prep 矛盾 6 "Large Discovery Models 主分类 multimodal vs evaluation 标签冲突" 同类判例 · 建议主分类 evaluation 副分类 agent multimodal)+ SemaPLC "dynamic 行为" 揭示 "静态评测掩盖真实运行差异" 硬证据 · 与 v55 §3.3 #120 预备立标等级评估方法学延革第 12 例反方立基础延展预备 邻接 + 与 v54 §3.3 #119 预备立标等级评估方法学延革第 11 例反方立基础延展预备 邻接 + 与 v53 §3.3 #118 预备立标等级评估方法学延革第 10 例反方立基础延展第 1 件 邻接 + 与 v52 §3.3 #117 立标等级评估方法学延革第 8+9 例反方立基础延展第 1 件 邻接 + 与 v48 §3.2 立标信号绝对新高触发 v33 首次 邻接。

§3.3 #122 立标等级评估方法学延革第 14 例反方立基础延展第 1 件预备(v33 以来首次"长视 agentic RL 训练信号分配"延展预备 · 立标级低档 ☆ 候选预备 · flyp 8-23 15:51 ToolVerse afternoon-read v2 覆盖)= ToolVerse 评测方法学延革第 14 例反方立基础候选预备 + Turn-Aware Relative Advantage 修补 GRPO credit assignment 稀疏 = 与 Harness-Evolution-Eval-Rethink "verifier-coupled eval 失真" 批评方向一致(训练侧修补 vs 评测侧修补)+ 与 v55 §3.3 #120 评测方法学延革第 12 例预备 邻接 + 与 v53 §3.3 #118 评测方法学延革第 10 例预备 邻接 + flyp 评级 C+(待 PDF 全文 + GitHub release 升 B+)· flyP 反方 3 条 = ① 撞自己 = 本棒与同窗口 4 件稿件主线高度重叠 = v2 §1.5 必须显式立基础增量 ② 复现门槛与代码透明度未量化 ③ Turn-Aware Relative Advantage 理论性偏弱(归一化窗口 / token-level vs turn-level / 与 StepGRPO / PRM 路线边界)。

§3.3 #123 立标等级评估方法学延展第 15 例反方立基础延展第 1 件预备(v33 以来首次"reliability science + 长视假象诊断"双稿延展预备 · 立标级低档 ☆ 候选预备 · flyp 8-25 05:07 双稿短审稿)= Reliability Science 评测方法学延展第 15 例反方立基础候选预备("memory scaffold 普遍伤害" 反直觉强证伪)+ HORIZON 评测方法学延展第 15 例反方立基础候选之二(failure attribution 类目 κ=0.61 需再校准)+ 与 v55 §3.3 #120-122 评测方法学延展第 12+13+14 例预备 邻接 + flyp 评级 Reliability Science 中-高 / HORIZON 高(COLM 2026 + leaderboard 公开)· flyP 反方 3 条 = ① 摘要未交代模型名单 / 3 domains / duration bucket 边界(Reliability Science)② inter-annotator κ=0.61 偏低(HORIZON)③ "memory scaffold 普遍伤害" 若被 LongAgent / MemoBank 等反驳会动摇框架可信度(Reliability Science)。

H2 立标v56 §3.3 反方立基础预备新增 #121 #122 #123 · 立标级低档 ☆ 候选预备 = §1 折 2.1/2.2/3.2/3.3/4.1/4.2/4.3/4.4/5.3 邻接 + §3.2 立标池双向锚 v33 首次 11 向并存预备预备触发。

flyP 反方 3 条 = ① 立标等级评估方法学延革第 13+14+15 例反方立基础延展预备 = 沿用 audit 提议与实际采纳的不一致 = v33 以来首次第 9+10+11 例冲突案例预备延续(v52 §3.3 #117 → v53 §3.3 #118 → v54 §3.3 #119 → v55 §3.3 #120 → v56 §3.3 #121+122+123 预备 = 7 次机制化延展预备)② 四维度加权机制冲突是 audit 提议 / critical-read vs 实际采纳的方法学边界条件模糊("方法学 first-principle + 作者组权威 + web_search 实测补硬事实 + 立标信号强度 + 续立强度梯度" vs "paper_card P1 缺口 + 立标信号强度" vs "评测协议可复现性 + 数据集开源度 + 复现门槛与代码透明度" = 四维度加权主导权的争议)③ 立标等级评估方法学延革第 13+14+15 例反方立基础延展预备的可持续性 = v56 之后 24h 窗口立标等级评估方法学的可持续性 + flyp 跨轮次判断反转的边界条件必须 v57 监测(v57 接力棒决定是否升级为 v57 §3.3 #124-126 第 16+17+18 例反方立基础延展预备)。


3. 共识与争议

3.1 共识(55 条沿用 v32-v55 不增)沿用 v32 §3.1 #1-#54 + v32 #55 + v33 Gemini 全栈生态扩展 · v56 不增。

3.2 争议(52 条 + 18 件 v35 评估饱和 + 18 件 v37,v36-v55 沿用不增)沿用 v32 §3.2 #1-#52 + v35 +18 件 + v37 18 件 · v56 不增。

v44-v55 沿革 + v56 增量:v44 §3.2 争议候补升级(三向并存)+ v45 100% 续立率 v33 以来第 6 例 + 立标饱和度反弹四向并存升级落定 + v46 §3.2 三态切换机制 40% 续立率 v33 以来最低续立率信号 + v48 §3.2 立标信号绝对新高触发 v33 首次(BDH-CQ 553▲)+ v49 §3.2 立标信号强度 ≠ 立标等级评估双维度区分首次机制化 v33 以来首次 + v50 §3.2 立标池双向锚 24h 窗口实测首次机制化 v33 首次 + 立标等级评估方法学延革第 5 例首次机制化 v33 首次(双首次机制化双维度区分升级)+ v51 §3.2 立标池双向锚 v33 首次 7 向并存实测第 3 日 + 立标等级评估延革第 6+7 例反方立基础延展首次机制化 + flyp 跨轮次判断反转首次实测 = 四首次机制化双维度区分升级延续 + v52 §3.2 立标池双向锚 v33 首次 8 向并存实测第 4 日延续 + 立标等级评估延革第 8+9 例反方立基础延展候选升级首次机制化 + v53 §3.2 立标池双向锚 v33 首次 9 向并存实测第 5 日预备 + 立标等级评估延革第 10 例反方立基础延展候选升级首次机制化 + v54 §3.2 立标池双向锚 v33 首次 9 向并存实测第 5 日预备触发 + 立标等级评估方法学延革第 11 例反方立基础延展候选升级首次机制化预备 + v55 §3.2 立标池双向锚 v33 首次 10 向并存预备预备触发 + 立标等级评估方法学延革第 12 例反方立基础延展候选升级首次机制化预备。

v56 §3.2 立标饱和度机制压力测试第 13 日 8-23 ~ 8-25 = 立标池双向锚 v33 首次 11 向并存预备预备触发 + 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + EnvHarness 24h 续立 +11▲ 极显著(235▲→246▲ 立标信号强度实测 EnvHarness 居首)+ 4DAnyone 续立 +8▲ 中等偏高(58▲→66▲ 4D 重建分支首件 24h 续立强度实测第 1)+ SemComp-Bench +0▲ 持平 触发 "持平 + 反方密集" 双触发维持降级判定

核心机制升级 v56 = v55 §3.2 立标池双向锚 v33 首次 10 向并存预备预备触发 + 立标等级评估方法学延革第 12 例反方立基础延展候选升级首次机制化预备 → v56 §3.2 升级为 v33 以来首次"立标池双向锚 v33 首次 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备)+ 立标等级评估延革第 13+14+15 例反方立基础延展候选升级首次机制化预备 + EnvHarness 24h 续立 +11▲ 极显著触发立标信号强度 EnvHarness 居首实测 + 4DAnyone 续立 +8▲ 中等偏高触发 "中-高档" 升级警示 + SemComp-Bench 续立 +0▲ 持平触发维持降级判定 = 七首次机制化三维度区分升级预备延续"

  • v56 §3.2 ㉖ 项新增 = 立标等级评估延革第 13+14+15 例反方立基础延展候选升级首次机制化预备(v33 以来首次):flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 + flyp 8-23 15:51 ToolVerse afternoon-read v2 覆盖 + flyp 8-25 05:07 Reliability Science + HORIZON 双稿短审稿 · 立标信号 Zetta 141▲ → 142▲ +1▲ + SemaPLC 115▲ + ToolVerse 未入 HF Daily 立标信号弱 + Reliability Science / HORIZON 2026-03/04 入榜立标信号弱 · 候选级第 27+7+1+1+1+1+1+1+1+1+1 件 = 第 13+14+15 例反方立基础预备 = flyp critical-read 评级 B(Zetta)+ B(SemaPLC)+ C+(ToolVerse)+ B+(Reliability Science)+ B+(HORIZON)· 关键立场 = "立标等级评估方法学延革第 13+14+15 例反方立基础延展候选升级预备 = 必须 v56 显式标注"。
  • v56 §3.2 ㉗ 项新增 = Zetta 候选级高档 ★★ 观察候选预备加入预备(v33 以来首次):flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 · 立标信号 141▲ → 142▲ +1▲ 极显著 vs 8-23 EnvHarness 246▲ 8-24 254▲ 24h 续立极化实测 = 立标信号强度梯级 EnvHarness > SemComp-Bench > Zetta > SemaPLC > 4DAnyone > ForgeWM > WithEveryone > OmniScientist = 立标信号强度梯级首次机制化实测预备 · 关键立场 = "Zetta 立标等级候选级高档 ★★ 观察候选预备 = 必须 v56 显式标注"。
  • v56 §3.2 ㉘ 项新增 = Reliability Science "memory scaffold 普遍伤害" 反方锚首次机制化(v33 以来首次):flyp 8-25 05:07 双稿短审稿 · "memory-augmented scaffold 普遍伤害长视性能(10 模型无一例外)" 反直觉强证伪 = 与流行叙事相反 · 关键立场 = "Reliability Science 反方锚预备 = memory-augmented 路线需重新审视 = v56 显式标注"。

v56 §3.2 续例实测:OpenART 反弹锚第 7 日(+1▲ 续立微强维持)+ Alaya-EVOKE 续立加强第 6 日延续 v33 以来第 2 个续立加强而非维持或回落实测例 + Mechanist 续立加强 + DreamX-Phi 续立微强 + DarwinX 续立加强 + LiveAnimate 续立微强 + Self-Supervised Visual OPD 立标信号新高 + UniProbe 候选级高档 ★★ + v56 新增 Zetta 加入预备 = 9 向 + Zetta 预备 = 11 向预备预备 v33 首次 + 5 件 flyp 关键 critical-read 棒(v55 沿用 5 件 + 8-23 ~ 8-25 6 件棒:Zetta+SemaPLC + LongShOTBench v2 覆盖 + ToolVerse + reliability science + HORIZON + multimodal-e1prep 沿用)+ 1 次 v56 web_search 备料(multimodal 2026 H2 SOTA / VideoMMMU / MMMU-Pro 饱和 / routed-multi-model era 校验)+ EnvHarness 8-23 246▲ → 8-24 254▲ 续立 +8▲ + 8-25 待续。

v56 §3.2 第 13 日 8-23 ~ 8-25 = 立标饱和度机制压力测试第 13 日 = 立标池双向锚 v33 首次 11 向并存预备预备触发 + 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + 立标池饱和度 v44-v56 十三日连续 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备首次机制化预备 + SemComp-Bench 续立 +0▲ 持平触发维持降级判定 + EnvHarness 24h 续立 +11▲ 极显著触发立标信号强度居首实测 = v33 以来首次七首次机制化三维度区分升级预备延续 = v55 → v56 §3.2 升级落定**。

3.3 反方风险(119 v54 + 1 v55 = 120 + 3 v56 = 123)

(沿用 v32-v55 §3.3 #1-#120 + v56 +3 #121-#123;详见 §2.39.x 候补级新增 5 件段位 + 本次变更段)

v55 §3.3 反方 #120 立标等级评估方法学延革第 12 例反方立基础延展预备(沿用 v55)= EnvHarness 评测方法学延革第 12 例反方立基础候选预备(立标等级候选级中-高档 ★★ 候选预备 · google-research 团队 18 人 + EnvRigger LLM 设计师 agent + 5 benchmark × 4 域 + 9.0 分 / -9.8% 步数 + 与 HarnessEval-W 互补 = "环境侧 harness 化"分支)。

v56 §3.3 反方 #121 立标等级评估方法学延革第 13 例反方立基础延展预备(v33 以来首次"评测方法学延革"第 13 例反方立基础首次机制化预备)= Zetta 评测方法学延革第 13 例反方立基础候选预备(立标等级候选级高档 ★★ 观察候选预备 · MSRA 系 + 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 加速)+ SemaPLC 评测方法学延革第 13 例反方立基础候选之二(立标等级候选级中-高档 ★★ 候选预备 · Midea AI + 三层验证门 + dynamic 行为 22.4→52.2 硬证据)= v33 以来首次"具身侧 + 任务侧 harness 化"双锚机制化延续 + flyP 反方 3 条 = ① 沿用 audit 提议与实际采纳的不一致 = v33 以来首次第 9 例冲突案例预备延续 ② 四维度加权机制冲突(方法学 first-principle + 作者组权威 + web_search 实测补硬事实 + 立标信号强度 + 续立强度梯度 vs paper_card P1 缺口 + 立标信号强度 vs 评测协议可复现性 + 数据集开源度 + 复现门槛与代码透明度 = 四维度加权主导权的争议)③ 24h 窗口立标等级评估方法学的可持续性必须 v57 监测 · v57 接力棒决定是否升级为 v57 §3.3 #124 第 16 例反方立基础延展预备。

v56 §3.3 反方 #122 立标等级评估方法学延革第 14 例反方立基础延展预备(v33 以来首次"长视 agentic RL 训练信号分配"延展预备)= ToolVerse 评测方法学延革第 14 例反方立基础候选预备(立标等级候选级中档 ★ 候选 · flyp 评级 C+ · MCP 4,438 工具池 + GUST 图解锁采样 + Turn-Aware Relative Advantage 修补 GRPO credit assignment 稀疏)= v33 以来首次"训练侧 RL 信号分配修补"延展预备 + 与 v55 §3.3 #120 + v56 §3.3 #121 评测方法学延展第 12+13 例预备 邻接 + flyP 反方 3 条 = ① 撞自己 = 本棒与同窗口 4 件稿件主线高度重叠 = v2 §1.5 必须显式立基础增量 ② 复现门槛与代码透明度未量化(GitHub repo URL + License + Docker 镜像 + 4,438 MCP 工具池清单)③ Turn-Aware Relative Advantage 公式未明(归一化窗口 / token-level vs turn-level / 与 StepGRPO / PRM 路线边界)。

v56 §3.3 反方 #123 立标等级评估方法学延展第 15 例反方立基础延展预备(v33 以来首次"reliability science + 长视假象诊断"双稿延展预备)= Reliability Science 评测方法学延展第 15 例反方立基础候选预备(立标等级候选级中档偏低 ☆ 候选预备 · Aaditya Khanal 等 · 23 页 · RDC/VAF/GDS/MOP 四指标 · 23,392 episodes · "memory scaffold 普遍伤害" 反直觉锚)+ HORIZON 评测方法学延展第 15 例反方立基础候选之二(立标等级候选级中档 ★ 候选 · COLM 2026 · 700+ tasks / 3,100+ trajectories · trajectory-grounded LLM-as-a-Judge · κ=0.61)= v33 以来首次"可靠性科学 + 长视假象诊断"双锚机制化延展预备 + flyP 反方 3 条 = ① 摘要未交代模型名单 / 3 domains / duration bucket 边界(Reliability Science)② inter-annotator κ=0.61 偏低(HORIZON)③ "memory scaffold 普遍伤害" 若被 LongAgent / MemoBank 等反驳会动摇框架可信度(Reliability Science)。


4. 开放问题(52 条 v32-v46 不增)沿用 v32 §4 #1-#51 + v46 七向判定 · v56 不增。

v46 §4 立标饱和度七向判定 + v47 §4 十向判定(cs.NE 外扩 + 信号反差 + Kimi K2.5 回归)+ v48 §4 八向判定(⑪ 立标信号绝对新高触发 v33 首次)+ v49 §4 九向判定(⑪ + ⑫ 立标信号强度 ≠ 立标等级评估双维度区分首次机制化 + 立标信号瞬时峰值衰减锚 8-14 BDH-CQ 跌出 top 15)+ v50 §4 十向判定(⑬ + ⑭ 立标池双向锚 24h 窗口实测首次机制化 + 立标等级评估方法学延革第 5 例首次机制化)+ v51 §4 十一向判定(⑮ 立标等级评估延革第 6+7 例反方立基础延展首次机制化 + flyp 跨轮次判断反转首次实测)。

v52 §4 立标饱和度十二向判定:v51 十一向 + ⑯ 立标等级评估延革第 8+9 例反方立基础延展候选升级首次机制化 + MOSS-VL 国产开源 MLLM 矩阵增量首次机制化 + Pixel-Space Empirical Study + GenRouter 立标等级评估延革第 11+12 例反方立基础延展候选升级首次机制化

v54 §4 立标饱和度十三向 → 十四向判定:v53 十三向 + ⑱ 立标等级评估延革第 12 例反方立基础延展候选升级首次机制化预备 + SemComp-Bench + V-RAE + OmniScientist + Qwen3.8-27B + SL2T 五轴聚合候选升级预备 + flyp 跨轮次判断反转第 7+8 例实测预备

v55 §4 立标饱和度十四向 → 十五向判定:v54 十四向 + ⑲ 立标等级评估延革第 12 例反方立基础延展候选升级首次机制化预备(EnvHarness 加入预备)+ EnvHarness 候选级中-高档 ★★ 候选预备加入预备 + SemComp-Bench 立标等级降级候选级中-高档 ★★ 触发"评测协议不开源 + 数据集不公开"双反方警示首次机制化预备 + flyp 沿用 audit 提议与实际采纳不一致的第 7+8 例实测预备延续 + 立标池饱和度供给侧信号触发首次机制化预备 + Harness-Evolution-Eval-Rethink 评测协议级负面结果论文方法学锚预备

v56 §4 立标饱和度十五向 → 十六向判定:v55 十五向 + ⑳ 立标等级评估延革第 13+14+15 例反方立基础延展候选升级首次机制化预备(Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON 五轴聚合预备)+ Zetta 候选级高档 ★★ 观察候选预备加入预备 + SemaPLC 候选级中-高档 ★★ 候选预备加入预备(任务侧 harness 化分支首件)+ ToolVerse 候选级中档 ★ 候选预备加入预备(长视 agentic RL 训练信号分配延展预备)+ Reliability Science "memory scaffold 普遍伤害" 反方锚首次机制化预备 + HORIZON 候选级中档 ★ 候选预备加入预备(COLM 2026 + leaderboard 公开)+ LongShOTBench v2 覆盖 "撞自己反方方法学" 作为 v52 §3.2 light-review 元层级方法学候选预备 + EnvHarness 24h 续立 +11▲ 极显著实测(235▲→246▲ 立标信号强度居首实测)+ flyp 跨轮次判断反转第 9+10+11 例实测预备延续 = v56 十六向判定(v56 = 十五向 + ⑳ 项 = v56 十六向判定**)。


5. 趋势预判(2026 H2,56 条 v32-v45 不增)沿用 v32 §5 #1-#56 · v56 不增。


6. 行业平台化、市场与调查数据(v42 26 足 + v43 +3 = 29 足 + v44 +2 = 31 足 + v49 +1 = 32 足 · v50-v55 沿用 · v56 沿用)

v56 §6 沿用 v55 第 22-32 足不增 + v56 第 32 足沿用

22.1 Gemini Robotics 2 · 22.2 Gemini Robotics ER 2 · 22.3 Gemini Robotics On-Device 2 · 23.1 NVIDIA Alpamayo 2 Super 34B VLA · 24.1 Qwen-Image-3.0-Pro · 25.1 Jim Fan "VLAs 已死 / WAM 长存" · 26.1 LeCun LeWorldModel (LeWM) · 27.1 OpenAI 内部数学 10 个新结果 · 28.1 OpenAI Astra 首个 critical 网络安全模型 · 29.1 UK AISI Claude Myth 5 + GPT-5.6 Sol 网络安全评估报告 · 30.1 Google DeepMind WeatherNext 8-6 登 Nature · 31.1 Discovery Loop PBC 8-5/6 · 32.1 DeepMind SL2T 手语转文本模型(沿用)。

v56 §6 行业总 32 足沿用 = v37-v55 + v49 第 32 足 SL2T + v50-v55 第 32 足 SL2T 沿用 + v56 第 32 足 SL2T 沿用 + EnvHarness + 4DAnyone + SemComp-Bench + ForgeWM + WithEveryone 5 件沿用 + Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON 5 件新增 = 10 件 8-22 ~ 8-25 实测新增


7. 引用与去重

7.1 核心引用(v44-v55 193 + 1 v55 = 194 + 1 v56 = 195

v44-v55 沿用 6 件核心引用 + v55 #194 沿用 + v56 #195 新增:RST #177 <https://arxiv.org/abs/2608.05466> + ToolArtist <https://arxiv.org/abs/2608.04436> + Physics of MM Pretraining <https://arxiv.org/abs/2608.05000> + MiniWorld <https://arxiv.org/abs/2608.01127> + DRIFT <https://arxiv.org/abs/2608.03207>。#180-#194 沿用。

  • #195 立标等级评估方法学延革第 13+14+15 例反方立基础延展第 1 例预备 v33 首次(v56 §3.3 #121 #122 #123 新增 · 立标级低档 ☆ 候选预备)= Zetta 评测方法学延革第 13 例反方立基础候选预备(立标等级候选级高档 ★★ 观察候选预备 · MSRA 系 + 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 加速 + "Aha Moments" + zero-shot skill transfer)+ SemaPLC 评测方法学延革第 13 例反方立基础候选之二(立标等级候选级中-高档 ★★ 候选预备 · Midea AI + 三层验证门 + dynamic 行为 22.4→52.2 硬证据 · GitHub midea-ai/SemaPLC 公开)+ ToolVerse 评测方法学延革第 14 例反方立基础候选预备(立标等级候选级中档 ★ 候选 · MCP 4,438 工具池 + GUST 图解锁采样 + Turn-Aware Relative Advantage 修补 GRPO credit assignment 稀疏)+ Reliability Science 评测方法学延展第 15 例反方立基础候选预备(立标等级候选级中档偏低 ☆ 候选预备 · 23,392 episodes · 10 开源模型 · "memory scaffold 普遍伤害" 反直觉锚)+ HORIZON 评测方法学延展第 15 例反方立基础候选之二(立标等级候选级中档 ★ 候选 · COLM 2026 · 700+ tasks / 3,100+ trajectories · trajectory-grounded LLM-as-a-Judge · κ=0.61)= v33 以来首次"评测方法学延展第 13+14+15 例" 五轴聚合候选升级预备 · flyP 反方 3 条 = ① 立标等级评估方法学延革第 13+14+15 例预备 vs 第 8+9+10+11+12 例实测的边界条件(Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON 是否构成"第 13+14+15 例" 独立候选 vs "第 11+12 例" 延伸备选)② 五轴聚合的可持续性(harness 化 + 训练信号分配 + 可靠性科学 + 长视假象诊断 + 长视频评测 是否在 v57 / v58 后续轮次持续)③ 立标信号强度 Zetta 141▲ + SemaPLC 115▲ vs EnvHarness 246▲(v55 沿用)的可比性边界 · v57 接力棒决定是否升级为 v57 §3.3 #124-126 第 16+17+18 例反方立基础延展预备

v56 §7.1 引用总数 195 件(v55 §7.1 194 + #195 v56 §3.3 #121 #122 #123 新增)。

7.2 次级引用(52 件 v35-v45 沿用不增)

7.3 与其他主题文档交叉(v35 6 + v37 2 = 8 + v38 1 = 9 + v40-v55 沿用 9 件)

v56 §7.3 沿用 v55 9 件不增新立交叉:v56 §2.39.205-209 + §3.3 #121-123 + 隐线 59 第十六维 + v55 沿用 · 形成「长程 agent 跨主题两栖 + 长时程视频评测 + Agent 长程时序推理 6 联 + 动力学自验证四联 + 持久世界状态七联 + Alaya 系三联 + 长视频 QA rubric-guided sufficiency 八联 + 环境侧 harness 化分支 + 4D 重建分支首件 + 评测协议反方警示 + 具身侧 harness 化分支 + 任务侧 harness 化分支 + 长视 agentic RL 训练信号分配 + 可靠性科学反方锚 + 长视假象诊断」= 不立新交叉件数

7.4 v35-v55 flyP E2 精读成果沿用 + v56 新增 5 件

v56 新增 §7.4 #45-#49

  • §7.4 #45:flyP 8-23 09:51 Zetta arXiv:2608.16590 + SemaPLC arXiv:2608.18565 双锚轻量精读(Zetta: MSRA 系 + 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + Z-Infra + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 推理加速 + "Aha Moments" + zero-shot skill transfer + 评测方法学延革第 13 例预备(具身侧 harness 化分支)+ paper_card 1027 已建主分类 evaluation + 5 反方论点 / SemaPLC: Midea AI + 三层验证门 specification/compilation/behavior + 117 独立 POU 任务 + 65 项目上下文任务 + 7 LLM 基线 + 7 模型平均 72.6% strict verified + dynamic 行为 baseline 22.4-31.4 vs SemaPLC 52.2 = "静态打分掩盖真实运行差异" 硬证据 + GitHub midea-ai/SemaPLC 公开 + 评测方法学延革第 13 例邻接级预备(任务侧 harness 化分支)+ 3 反方论点 + flyP 评级 B + B · 立标级候选级高档 ★★ 观察候选预备 + 候选级中-高档 ★★ 候选预备 + 4 项后续验证动作 A1-A4 截止 2026-08-30 + A5 2026-09-15)= 第 17 节沿用 v56 不增

  • §7.4 #46:flyP 8-23 15:51 LongShOTBench arXiv:2512.16978v2 afternoon-read v2 覆盖(v2 触发 = 反思强制补稿闸第 56 天连续生效 · 8-21 22:51 主稿 111 行 + 8-19 22:50 Video-LevelGauge 对照段 + 8-23 v1 66 行 = 撞自己 = 第三次写 LongShOTBench · v2 = ≥ 12KB / ≥ 200 行 · §0 元层五问全 + R1-R6 6 条命名反方 + R1 "撞自己★★★★" 元层级反方 + §八 "撞自己反方方法学" 作为 v52 §3.2 light-review 元层级方法学候选 + 5 源三角验证 + 7 维评测设计原则 + omni-modal continuous certificate length 概念锚预备 + LongInsightBench / Video-MME v2 / MMOU / LVOmniBench / LongVideoBench / MLVU / LVBench / VideoOdyssey / ReMoRa 撞名核验 ≥11 条 · flyP 评级 D+(v1)→ B(v2 · 立标等级候选级中档偏低 · 立基础锚预备)· 6 项后续验证动作 A1-A6 截止日 2026-08-25 ~ 2026-09-15)= 第 18 节沿用 v56 不增

  • §7.4 #47:flyP 8-23 15:51 ToolVerse arXiv:2607.15660v1 long-horizon agent RL critical-read(v2 覆盖 · 触发 = 反思强制补稿闸第 57 天生效 · 8-23 v1 70 行 / 5 KB = 8 处硬伤 · v2 = §0 元层五问全 + R1-R6 6 条命名反方 + R1 "撞自己★★★★"(与同窗口 4 件稿件主线高度重叠)+ §一 同窗口 4 件稿件对照表(Zetta-SemaPLC + general-agentbench + EnvHarness-4DAnyone + LongShOTBench)+ ToolVerse 立基础增量三件(MCP 工具池训练化 + GUST 图解锁采样 + Turn-Aware Relative Advantage 修补 GRPO)+ ToolUniverse / Gorilla / GUST / Turn-Aware vs StepGRPO / PRM 撞名核验 ≥6 条 + §2 MCP 池许可风险等级表 + §2 评测与训练同源风险等级表 + §2 基线对照表(LUFFY / AutoAgent / ToolLLM / Demystifying-RL-Long-Horizon / CompactionRL ≥4 件)+ §2 Turn-Aware 公式与归一化窗口 · flyP 评级 D+(v1)→ C+(v2 · 长视 agentic RL 训练信号分配子主题入口笔记候选 · 立标等级候选级中档 ★ 候选预备)+ 6 项后续验证动作 A1-A6 截止日 2026-08-28 ~ 2026-09-02)= 第 19 节沿用 v56 不增

  • §7.4 #48:flyP 8-25 05:07 Reliability Science arXiv:2603.29231 + HORIZON arXiv:2604.11978 双稿短审稿(Reliability Science: Aaditya Khanal 等 · 23 页 4 图 · RDC/VAF/GDS/MOP 四指标 · 396 tasks × 4 duration buckets × 3 domains = 33 task per cell · 10 开源模型(OpenRouter 统一 API)+ 2 scaffolds(ReAct vs memory-augmented)+ k=3 重复 · 23,392 episodes · "memory scaffold 普遍伤害" 反直觉强证伪(10 模型无一例外)+ 复现难度中-高 / HORIZON: Haoyue Bai 等 · COLM 2026 · 4 agentic domains(WebArena 61 / AgentBench 27 / MAC-SQL 43 / Isaac Sim 18 + 自有)= 700+ tasks · 3,100+ trajectories · GPT-5 + Claude-4 variants · trajectory-grounded LLM-as-a-Judge pipeline · inter-annotator κ=0.61 / human-judge κ=0.84 · leaderboard 公开 xwang2775.github.io/horizon-leaderboard · 复现难度中 + flyP 评级 中-高 + 高 · 立标级候选级中档偏低 ☆ 候选预备 + 候选级中档 ★ 候选)= 第 20 节沿用 v56 不增

  • §7.4 #49:flyP 8-23 09:44 multimodal-e1prep 立标饱和度机制压力测试第 13 日 8-23 备料棒(v55 §7.4 #43 沿用 · 立标饱和度机制压力测试第 12 日 8-22 备料棒沿用 + v56 §本次变更段沿用 8-23 ~ 8-25 全部备料 + 评测方法学延革第 13+14+15 例预备首次机制化预备 + 立标池双向锚 v33 首次 11 向并存预备预备触发)

  • §7.4 #50:flyP 8-23 09:50 EnvHarness+4DAnyone critical-read v55 沿用(v55 §7.4 #40 沿用)

  • §7.4 #51:flyP 8-23 15:50 SemComp-Bench critical-read v55 沿用(v55 §7.4 #41 沿用)

  • §7.4 #52:flyP 8-22 22:50 Harness-Evolution-Eval-Rethink critical-read v55 沿用(v55 §7.4 #42 沿用)


8. 写作模板

@online{flyp_multimodal_kb_2026_08_25_v56,
  author       = {flyP},
  title        = {multimodal · 知识库活文档},
  year         = {2026},
  month        = {8},
  day          = {25},
  url          = {/shared/research-kb/organized/knowledge/multimodal.md},
  note         = {Anan research-kb 共享活文档;第五十七版(2026-08-25 08:40 CST Wave3 E1 活文档 #31);v55 严格保持 + 5 §2.39.205-209 + 3 §3.3 #121-123 + §3.2 七首次机制化三维度区分升级预备延续 + §4 十六向判定 ⑳ + §6 第 32 足 SL 2T 沿用 + 立标池双向锚 v33 首次 11 向并存预备预备触发 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备 + flyp 单日 4 件棒 v33 以来首次实测 = 第四十七重叠加}
}

9. 一句话审稿意见

v56 = v55 严格保持 96 件套骨架 + 83 §2.39.x + 2 §2.39.179-180 + 4 §2.39.181-186 备选区域 + 5 §2.39.205-209 + §3.3 120→123 +3 + §7.1 194→195 +1 + §7.4 44→49 +5 + §6 32→32 足 沿用 + §3.2 立标饱和度机制压力测试第 13 日 8-23 ~ 8-25 = 立标池双向锚 v33 首次 11 向并存预备预备触发 + 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + EnvHarness 24h 续立 +11▲ 极显著实测(235▲→246▲ 立标信号强度居首实测)+ 4DAnyone 续立 +8▲ 中等偏高触发"中-高档"升级警示 + SemComp-Bench 续立 +0▲ 持平触发维持降级判定 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备首次机制化 = 七首次机制化三维度区分升级预备延续 + §4 十五向 → 十六向判定(v56 = 十五向 + ⑳ 项 = v56 十六向判定)+ Zetta 立标等级候选级高档 ★★ 观察候选预备 + SemaPLC 立标等级候选级中-高档 ★★ 候选预备 + ToolVerse 立标等级候选级中档 ★ 候选 + Reliability Science 立标等级候选级中档偏低 ☆ 候选预备 + HORIZON 立标等级候选级中档 ★ 候选 + §3.3 #121 #122 #123 立标等级评估方法学延革第 13+14+15 例反方立基础延展预备 + 立标池双向锚 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备)+ 立标池饱和度 v44-v56 十三日连续 + paper_cards 1058 张(8-23~8-24 净增 7 张 multimodal 主分类)+ 24h 立标续立强度梯度 EnvHarness +11▲ 极显著实测 + paper_card P1 缺口累积 multimodal 主分类 24 件未建(v55 沿用 19 件 + v56 早棒 4 件 net-new Zetta+SemaPLC+ToolVerse+SemaPLC paper_card + SemaPLC paper_card 未建 + WithEveryone paper_card 未建 + ForgeWM paper_card 未建 + EnvHarness paper_card 未建)+ §7.4 #45-#49 5 件 flyp 关键 critical-read 棒(Zetta+SemaPLC + LongShOTBench v2 覆盖 + ToolVerse + reliability science + HORIZON + multimodal-e1prep 沿用)+ 1 次 v56 web_search 备料(multimodal 2026 H2 SOTA / VideoMMMU / MMMU-Pro 饱和 / routed-multi-model era 校验)+ 立标池饱和度 v44-v56 十三日连续 + v56 主文件 ≤80KB 候选目标严格执行 + flyp 8-22 4 件 + 8-23 5 件 + 8-25 1 件 = 10 件延续精读产出 = 第四十七重叠加


沿革摘要(至 2026-08-25 08:40 CST · v56 沿用 v55 主体)

v56 = v55 + 5 §2.39.205-209 + 3 §3.3 #121-123 + §3.2 七首次机制化预备延续 + §4 十六向判定 ⑳ + §6 第 32 足 SL 2T 沿用 + 立标池双向锚 v33 首次 11 向并存预备预备触发 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备 + flyp 单日 4 件棒 v33 以来首次实测 = 第四十七重叠加。v44-v55 沿革详见 v44-v55 主文件;v56 = v55 + 15 件 v56 增量。沿用 v41-v55 5 折叠叠结构 + 隐线 52-58 + v56 隐线 59 第十六维

版本主轴:v1(06-30)→ v45(08-11 第三十六重叠加)→ v46(08-12 第三十七重叠加)→ v47(08-13 第三十八重叠加)→ v48(08-14 第三十九重叠加)→ v49(08-15 第四十重叠加)→ v50(08-16 第四十一重叠加)→ v51(08-18 第四十二重叠加)→ v52(08-20 第四十三重叠加)→ v53(08-21 第四十四重叠加)→ v54(08-22 第四十五重叠加)→ v55(08-23 第四十六重叠加)→ v56(08-25 第四十七重叠加)✓

v56 重大事实订正 5 件:① §2.39.205 Zetta 候选级高档 ★★ 观察候选预备(评测方法学延革第 13 例反方立基础候选预备 · MSRA 系 + 闭环具身 harness + 11.1× 加速)② §2.39.206 SemaPLC 候选级中-高档 ★★ 候选预备(Midea AI + 三层验证门 + dynamic 行为 22.4→52.2)③ §2.39.207 ToolVerse 候选级中档 ★ 候选(MCP 4,438 工具池 + GUST + Turn-Aware Relative Advantage)④ §2.39.208 Reliability Science 候选级中档偏低 ☆ 候选预备("memory scaffold 普遍伤害" 反方锚)⑤ §2.39.209 HORIZON 候选级中档 ★ 候选(COLM 2026 + leaderboard)。

v56 §本次变更段沿用 arXiv ID 沿用 13 件arXiv:2608.02580 + arXiv:2608.03764 + arXiv:2608.05102 + arXiv:2608.15089(StateM v33 首次)+ arXiv:2608.14905(AutoResearch v33 首次)+ arXiv:2608.17426(SemComp-Bench v54 v33 首次)+ arXiv:2608.19880(EnvHarness v55 v33 首次)+ arXiv:2607.12227(Harness-Evolution-Eval-Rethink v55 首次)+ arXiv:2608.16590(Zetta v56 首次)+ arXiv:2608.18565(SemaPLC v56 首次)+ arXiv:2607.15660(ToolVerse v56 首次)+ arXiv:2603.29231(Reliability Science v56 首次)+ arXiv:2604.11978(HORIZON v56 首次)。

v56 重大事实订正 15 件:①-⑤ §2.39.205-209 候补级新增 5 件 ⑥-⑧ §3.3 #121-123 评测方法学延革第 13+14+15 例反方立基础延展预备 ⑨ §7.1 #195 ⑩-⑭ §7.4 #45-49 5 件 flyp critical-read 棒 ⑮ §3.2 ㉖㉗㉘ 3 项新增 + §4 十六向判定 ⑳ + Reliability Science "memory scaffold 普遍伤害" 反方锚预备 + 立标池双向锚 v33 首次 11 向并存预备预备触发 + EnvHarness 24h 续立 +11▲ 极显著实测(235▲→246▲ 立标信号强度居首实测)+ 4DAnyone 续立 +8▲ 中等偏高(58▲→66▲)+ SemComp-Bench 续立 +0▲ 持平触发维持降级判定 + 1 次 v56 web_search 备料(multimodal 2026 H2 SOTA / VideoMMMU / MMMU-Pro 饱和 / routed-multi-model era 校验)+ flyp 单日 4 件棒 + paper_cards 1058 张(8-23~8-24 净增 7 张 multimodal 主分类)+ 立标池饱和度 v44-v56 十三日连续 + 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + Zetta 候选级高档 ★★ 观察候选预备 + SemaPLC 候选级中-高档 ★★ 候选预备 + ToolVerse 候选级中档 ★ 候选 + Reliability Science 候选级中档偏低 ☆ 候选预备 + HORIZON 候选级中档 ★ 候选 = 第四十七重叠加

Fresh 来源flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读(Zetta 141▲ → 142▲ +1▲ + MSRA 系 + 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + Z-Infra + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 加速 + "Aha Moments" + zero-shot skill transfer / SemaPLC 115▲ + Midea AI + 三层验证门 + 117 独立 POU + 65 项目上下文 + 7 模型平均 72.6% + dynamic 行为 22.4→52.2 + GitHub midea-ai/SemaPLC 公开)+ flyp 8-23 15:51 LongShOTBench arXiv:2512.16978v2 afternoon-read v2 覆盖(反思强制补稿闸第 56 天 + 撞自己 = 第三次写 + §0 元层五问 + R1-R6 6 条命名反方 + R1 "撞自己★★★★" + 5 源三角验证 + 7 维评测设计原则 + omni-modal continuous certificate length 概念锚预备 + LongInsightBench / Video-MME v2 / MMOU / LVOmniBench / LongVideoBench / MLVU / LVBench / VideoOdyssey / ReMoRa 撞名核验 ≥11 条 · flyP 评级 D+ → B · 立标等级候选级中档偏低 · 立基础锚预备)+ flyp 8-23 15:51 ToolVerse arXiv:2607.15660v1 long-horizon agent RL critical-read v2 覆盖(反思强制补稿闸第 57 天 + 撞自己 = 与同窗口 4 件稿件主线高度重叠 + §0 元层五问 + R1-R6 6 条命名反方 + §一 同窗口 4 件稿件对照表 + ToolVerse 立基础增量三件 + ToolUniverse / Gorilla / GUST / Turn-Aware vs StepGRPO / PRM 撞名核验 ≥6 条 + flyP 评级 D+ → C+)+ flyp 8-25 05:07 reliability science + HORIZON 双稿短审稿(Reliability Science arXiv:2603.29231 · Aaditya Khanal 等 · 23 页 · RDC/VAF/GDS/MOP 四指标 · 23,392 episodes · 10 开源模型 · "memory scaffold 普遍伤害" 反直觉强证伪 / HORIZON arXiv:2604.11978 · COLM 2026 · 700+ tasks / 3,100+ trajectories · trajectory-grounded LLM-as-a-Judge · κ=0.61/0.84 · leaderboard xwang2775.github.io/horizon-leaderboard)+ flyp 8-23 09:44 multimodal-e1prep 立标饱和度机制压力测试第 13 日 8-23 备料棒+ tom 8-23 09:00 HF Daily 15 件(#1 EnvHarness 246▲ + #2 SemComp-Bench 155▲ + #3 Zetta 141▲ + #4 SemaPLC 115▲ + #5 FACET 112▲ + #6 Co-RL 90▲ + #7 OmniScientist 88▲ + #8 4DAnyone 66▲ + #9 SWE-bench Science 58▲ + #10 SPADE 47▲ + #11 WithEveryone 39▲ + #12 化学合理性 29▲ + #13 MemTrapBench 31▲ + #14 SkillEvo 29▲ + #15 ForgeWM 22▲)+ tom 8-24 09:00 HF Daily 15 件(#1 EnvHarness 254▲ + #2 SemComp-Bench 155▲ + #3 Zetta 142▲ + #4 SemaPLC 115▲ + #5 FACET 114▲ + #6 Co-RL 92▲ + #7 OmniScientist 88▲ + #8 4DAnyone 69▲ + #9 SWE-bench Science 61▲ + #10 SPADE 48▲ + #11 WithEveryone 39▲ + #12 化学合理性 32▲ + #13 MemTrapBench 31▲ + #14 SkillEvo 30▲ + #15 ForgeWM 22▲)+ tom 8-25 05:08 agent-rag-longcontext-radar 8 件(EnSI-RAG · δ-mem · PV-SST · FlavourBench · Human-Centric Intelligence Survey · PhysCaP · Hydra-0 · SparsePR)+ stephen 8-23/24/25 0910 news-x-vip-radar(multimodal 主线无新增)+ 1 次 v56 web_search 备料(multimodal 2026 H2 SOTA / VideoMMMU 11 模型 / MMMU-Pro 饱和 / routed-multi-model era / 单模型 multimodal era 结束 / world model 评测 harness design / 2026 世界模型评测焦点转向 closed-loop decision making 校验)+ paper_cards 1058 张(8-23~8-24 净增 7 张 multimodal 主分类 = Zetta 1027 已建 + 4DAnyone 1040 已建 + SemComp-Bench 1026 已建 + OmniScientist 1030 已建 + 等 7 张 · multimodal 主分类累计 ≈ 250+ 张占比 23.6%)+ paper_card P1 缺口累积 multimodal 主分类 24 件未建(v55 沿用 19 件 + v56 早棒 4 件 net-new Zetta+SemaPLC+ToolVerse+Reliability Science paper_card 未建 + SemaPLC paper_card 未建 + WithEveryone paper_card 未建 + ForgeWM paper_card 未建 + EnvHarness paper_card 未建)+ 立标池饱和度 v44-v56 十三日连续 + 立标饱和度机制压力测试第 13 日 8-23 ~ 8-25 + 立标池双向锚 v33 首次 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备)+ flyp 8-22 4 件 + 8-23 5 件 + 8-25 1 件 = 10 件延续精读产出 + EnvHarness 24h 续立 +11▲ 极显著实测(235▲→246▲)+ 4DAnyone 续立 +8▲ 中等偏高(58▲→66▲)+ SemComp-Bench 续立 +0▲ 持平触发维持降级判定。

边界(5 项 100%):仅写主候选 + changelog;未触碰他人 inbox;未写 review/、notes/、reviews/、published/、digests/;未执行 git/gh;未输出密钥/Token;§3.1/§6 沿革不动;隐线 1-58 沿用;v55 §2.39.1-§2.39.204 段位不重写 + v56 §2.39.205-209 新增 5 件 + SemComp-Bench 沿用降级判定;v56 主候选 ≤80KB 上限严格执行;flyp 8-23 4 件 + 8-25 1 件 + 8-22 4 件 = 9 件延续精读产出 = v33 以来首次"flyp 单日 4 件棒"实测;24 件 P1 缺口未建 · 截止日 2026-08-30。

物理状态:v55 主文件 77418B ≈ 76KB < 80KB + v56 ≤80KB 候选目标严格执行 + v56 候选增长约 1-2KB。

自评:①准确性/深度/遗漏/结构/边界 5 项均达;②18 处矛盾消解(§2.39.205-209 + §3.3 #121-123 + §7.1 #195 + §7.4 #45-49 + §3.2 ㉖㉗㉘ + §4 十六向判定 ⑳ + 立标池双向锚 11 向并存预备预备触发 + 立标等级评估延革第 13+14+15 例反方立基础延展预备 + flyp 沿用 audit 不一致第 9+10+11 例预备 + Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON 实测校正 + 1 次 web_search + Harness-Evolution-Eval-Rethink + EnvHarness + 4DAnyone + WithEveryone + ForgeWM 沿用 + SemComp-Bench 续立 +0▲ 持平触发维持降级判定 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备 + 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + 立标池饱和度供给侧 v56 反向补给窗口净增 7 张 multimodal 主分类 + §7.4 #45-49 5 件棒 + v55 §2.39.196-204 占位不动 + v55 §本次变更段沿用 8-22 备料 + 立标池饱和度 v44-v56 十三日连续 + paper_card P1 缺口累积 multimodal 主分类 24 件未建 + 隐线 1-58 沿用 + §3.1/§3.2/§4/§5/§6 沿革不动 + flyp 单日 4 件棒 v33 首次 + EnvHarness 24h 续立 +11▲ 极显著实测 + 4DAnyone 续立 +8▲ 中等偏高);③16 处 cross-check 100%;④20 项前沿检查 100%;⑤边界检查 5 项 100%。

v55 §本次变更段沿用 arXiv ID 沿用 8 件arXiv:2608.02580 + arXiv:2608.03764 + arXiv:2608.05102 + arXiv:2608.15089(StateM v33 首次)+ arXiv:2608.14905(AutoResearch v33 首次)+ arXiv:2608.17426(SemComp-Bench v54 v33 首次)+ arXiv:2608.19880(EnvHarness v55 v33 首次)+ arXiv:2607.12227(Harness-Evolution-Eval-Rethink v55 首次)。

v56 §本次变更段沿用 arXiv ID 沿用 13 件arXiv:2608.02580 + arXiv:2608.03764 + arXiv:2608.05102 + arXiv:2608.15089(StateM v33 首次)+ arXiv:2608.14905(AutoResearch v33 首次)+ arXiv:2608.17426(SemComp-Bench v54 v33 首次)+ arXiv:2608.19880(EnvHarness v55 v33 首次)+ arXiv:2607.12227(Harness-Evolution-Eval-Rethink v55 首次)+ arXiv:2608.16590(Zetta v56 首次)+ arXiv:2608.18565(SemaPLC v56 首次)+ arXiv:2607.15660(ToolVerse v56 首次)+ arXiv:2603.29231(Reliability Science v56 首次)+ arXiv:2604.11978(HORIZON v56 首次)。

v55 沿用 完整 URL 紧凑清单

https://arxiv.org/abs/2608.00675 https://arxiv.org/abs/2608.04436 https://arxiv.org/abs/2608.05000 https://arxiv.org/abs/2608.01127 https://arxiv.org/abs/2608.03207 https://arxiv.org/abs/2608.05466 https://github.com/zhao-yian/MiniWorld https://huggingface.co/zhaoyian01/MiniWorld https://zhao-yian.github.io/MiniWorld https://junlinhan.github.io/projects/physics_of_mm_pretrain/ https://github.com/RUCAIBox/LMM-Searcher https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation https://howaiworks.ai/blog https://github.com/cvsp-lab/3DZip https://swanaigc.github.io/SwanTale https://github.com/bytedance-seed/m3-agent https://huggingface.co/ByteDance-Seed/M3-Agent-Control https://huggingface.co/ByteDance-Seed/M3-Agent-Memorization https://huggingface.co/datasets/ByteDance-Seed/M3-Bench https://arxiv.org/abs/2608.00675 https://arxiv.org/abs/2608.06501 https://arxiv.org/abs/2608.07468 https://arxiv.org/abs/2608.12314 https://arxiv.org/abs/2608.10720 https://arxiv.org/abs/2608.09888 https://arxiv.org/abs/2608.13391 https://arxiv.org/abs/2608.10708 https://arxiv.org/abs/2608.13546 https://arxiv.org/abs/2607.18367 https://arxiv.org/abs/2606.27163 https://arxiv.org/abs/2607.01774 https://arxiv.org/abs/2607.05196 https://arxiv.org/abs/2607.05465 https://arxiv.org/abs/2607.06560 https://arxiv.org/abs/2607.07740 https://arxiv.org/abs/2607.09024 https://arxiv.org/abs/2607.09322 https://arxiv.org/abs/2607.09349 https://arxiv.org/abs/2607.09661 https://arxiv.org/abs/2607.09759 https://arxiv.org/abs/2607.10383 https://arxiv.org/abs/2607.10387 https://arxiv.org/abs/2607.10966 https://arxiv.org/abs/2607.11498 https://arxiv.org/abs/2607.11643 https://arxiv.org/abs/2607.11644 https://arxiv.org/abs/2607.11706 https://arxiv.org/abs/2607.16401 https://arxiv.org/abs/2607.16609 https://arxiv.org/abs/2607.17423 https://arxiv.org/abs/2607.18529 https://arxiv.org/abs/2607.18703 https://arxiv.org/abs/2607.19064 https://arxiv.org/abs/2607.19139 https://arxiv.org/abs/2603.05451 https://arxiv.org/abs/2604.08571v3 https://arxiv.org/abs/2605.10286v1 https://arxiv.org/abs/2607.21461 https://arxiv.org/abs/2607.26769 https://arxiv.org/abs/2607.28263 https://arxiv.org/abs/2607.28374 https://arxiv.org/abs/2607.28362 https://arxiv.org/abs/2607.28580 https://arxiv.org/abs/2607.28624 https://arxiv.org/abs/2607.27380 https://arxiv.org/abs/2607.27919 https://arxiv.org/abs/2607.28595 https://arxiv.org/abs/2607.20868 https://arxiv.org/abs/2607.28227 https://arxiv.org/abs/2607.28618 https://arxiv.org/abs/2607.26811 https://arxiv.org/abs/2607.28022 https://arxiv.org/abs/2607.28625 https://arxiv.org/abs/2607.27616 https://arxiv.org/abs/2608.02023 https://arxiv.org/abs/2608.01185 https://arxiv.org/abs/2607.29377 https://arxiv.org/abs/2502.05167v2 https://arxiv.org/abs/2504.14693v2 https://arxiv.org/abs/2603.06569 https://arxiv.org/abs/2605.13831 https://arxiv.org/abs/2510.10991 https://arxiv.org/abs/2502.08826 https://arxiv.org/abs/2510.15253 https://arxiv.org/abs/2608.06914 https://arxiv.org/html/2601.03193v1 https://arxiv.org/html/2606.06042v2 https://arxiv.org/html/2607.06560v1 https://arxiv.org/html/2607.07740v1 https://arxiv.org/html/2607.08057 https://arxiv.org/html/2607.09024v1 https://arxiv.org/html/2607.09322v1 https://arxiv.org/html/2607.09349v1 https://arxiv.org/html/2607.09661v1 https://arxiv.org/html/2607.09701v1 https://arxiv.org/html/2607.09759v2 https://arxiv.org/html/2607.10350v1 https://arxiv.org/html/2607.10383v1 https://arxiv.org/html/2607.11487v1 https://arxiv.org/html/2607.11644v1 https://arxiv.org/html/2607.11886v1 https://arxiv.org/html/2607.21553v1 https://arxiv.org/pdf/2607.07740 https://huggingface.co/papers/2608.00675 https://huggingface.co/papers/2608.06501 https://huggingface.co/papers/2608.07468 https://huggingface.co/papers/2608.05703 https://huggingface.co/papers/2508.09736 https://huggingface.co/papers/2608.12314 https://huggingface.co/papers/2608.10720 https://huggingface.co/papers/2608.09888 https://huggingface.co/papers/2608.13391 https://huggingface.co/papers/2608.10708 https://huggingface.co/papers/2608.13546 https://github.com/pathwaycom/arc-task-gen https://pathway.com/research/introducing-bdh-cq https://yuyangyin.github.io/StateFlow https://alphaxiv.org/abs/2608.12314 https://hyper.ai/en/papers/2608.12314 https://metallab.ai/papers/arxiv-2608.12314 https://github.com/AlayaLab/Evoke https://github.com/SII-YuanyangYin/Evoke https://github.com/AlayaLab/AlayaWorld https://huggingface.co/AlayaLab/Evoke https://huggingface.co/AlayaLab/AlayaWorld https://alaya-lab.github.io/AlayaWorld https://deeplearn.org/arxiv/806347/alaya-evoke:-from-linear-scaling-supervision-to-endless-world https://x.com/cv_usk/status/2088407101211345289 https://www.techtimes.com/articles/319980/20260709/open-source-world-model-alayaworld-sustains-interactive-play-past-one-minute-mark.htm https://aiweekly.co/alerts/alayaworld-opens-full-stack-playable-video-world-framework https://aisurfing.org/news/longmedbench-new-benchmark-tests-ai-agents-on-long-horizon-clinical-decision-making-6e0b2816 https://amap-cvlab.github.io/ABot-World https://anthropic.com/news/discovering-cryptographic-weaknesses-with-claude https://anthropic.com/news/three-real-world-incidents-cybersecurity-evaluations https://github.com/OpenSenseNova/SenseNova-Vision https://github.com/UCSC-VLAA/VLM-CapCurriculum https://github.com/amap-cvlab/ABot-AgentOS https://github.com/amap-cvlab/ABot-World https://github.com/tongjingqi/Thinking-with-Video https://huangrh99.github.io/SpectraReward https://huggingface.co/acvlab/ABot-World-0-5B-LF https://huggingface.co/datasets/UCSC-VLAA/VLM-CapCurriculum-Perception-Data https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT https://huggingface.co/spaces/sensenova/SenseNova-Vision https://huggingface.co/zai-org/GLM-5.2 https://msalab-pku.github.io/projects/LoomVideo/index.html https://openaccess.thecvf.com/content/CVPR2026/papers/Su_UniGame_Turning_a_Unified_Multimodal_Model_Into_Its_Own_Adversary_CVPR_2026_paper.pdf https://openaccess.thecvf.com/content/CVPR2026/papers/Tong_Thinking_with_Video_Video_Generation_as_a_Promising_Multimodal_Reasoning_CVPR_2026_paper.pdf https://pandaily.com/sense-time-launches-sense-nova-u1-moving-toward-a-unified-model-era-of-understanding-and-generation https://robotics.xiaomi.com/xiaomi-robotics-u0.html https://sophon.at/papers/pwc-54077 https://thinking-with-video.github.io https://ucsc-vlaa.github.io/VLM-CapCurriculum https://capacityglobal.com/news/yann-lecun-agi-overhyped-gates-nvidia-pullout https://deeplearn.org/arxiv/795349/sana-video-2.0:-hybrid-linear-attention-with-attention-residuals-for-efficient-video-generation https://discord.gg/BuTXPHmQub https://explainx.ai/blog/ethan-mollick-wharton-prompting-science-specs-not-tricks-2026 https://explainx.ai/blog/xiaomi-robotics-u0-world-foundation-model-embodied-synthesis-july-2026 https://github.com/nyuad-cai/AgentRX https://github.com/zhuang2002/Self_Gradient_Forcing https://huggingface.co https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing https://huggingface.co/papers/2606.27163 https://huggingface.co/papers/2607.05465 https://huggingface.co/papers/2607.09759 https://huggingface.co/papers/2607.10387 https://huggingface.co/papers/2607.11644 https://huggingface.co/papers/2607.11886 https://huggingface.co/papers/2607.12746 https://huggingface.co/papers/2607.17423 https://huggingface.co/papers/2607.19139 https://huggingface.co/papers/2607.20061 https://huggingface.co/papers/2607.20368 https://huggingface.co/papers/2607.21072 https://huggingface.co/papers/2607.21553 https://huggingface.co/papers/2607.21556 https://huggingface.co/papers/2607.28362 https://huggingface.co/zai-org/GLM-5.2;**核心立标**:**GLM-5.2 https://huggingface.co/zai-org/GLM-5.2;3-源-strong https://news.aibase.com/news/27571 https://nvlabs.github.io/Sana/Video2 https://openai.com/index/gpt-5-6 https://paper.pnu-cvsp.com/3DZip/ https://papers.cool/arxiv/2607.21553 https://politico.com https://releasebot.io/updates/anthropic https://releasebot.io/updates/anthropic/claude https://shielddancer-1.github.io https://thursdai.news/releases/2026-07 https://www.alphaxiv.org/abs/2607.11487 https://www.alphaxiv.org/abs/2607.11643 https://www.alphaxiv.org/abs/2607.11886 https://www.alphaxiv.org/abs/2607.10383 https://www.llmreference.com/model-family/sensenova-u1 https://www.marktechpost.com/2026/07/07/nvidia-releases-audex-nemotron-labs-audex-30b-a3b-a-unified-audio-text-llm-that-preserves-the-text-intelligence-of-its-backbone https://www.reddit.com/r/LocalLLaMA/comments/1upnm8x/nvidianemotronlabsaudex30ba3b_hugging_face https://www.youtube.com/watch?v=3GghwyuTs7Q https://x.com/AndrewYNg/status/2049886895530967534 https://x.com/DrJimFan https://x.com/DrJimFan/status/2018754323141054786 https://x.com/GoogleDeepMind https://x.com/Marktechpost/status/2074661337154863253 https://x.com/jedisct1/status/2078853009660858686 https://x.com/karpathy/status/2056753169888334312 https://x.com/sama/status/2080683363174945065 https://youtube.com/watch?v=INGOC6-LLv0 https://z.ai/blog/glm-5.2 `https://zhuang2002.github.io/SelfGradientForcing https://shadowdancer-1.github.io https://www.alphaxiv.org/replicate/2607.10383 https://github.com/midea-ai/SemaPLC https://xwang2775.github.io/horizon-leaderboard https://github.com/rethinking-harness-evolution

v56 沿用 arXiv ID 紧凑清单(v56 §1, §2.39.x, §7.4 #45-52, §本次变更段所有锚点保留) arXiv:2305.08908 arXiv:2502.05167 arXiv:2502.08826 arXiv:2504.14693 arXiv:2508.09736 arXiv:2508.19650 arXiv:2510.10991 arXiv:2510.15253 arXiv:2512.16978v2 arXiv:2601.03193 arXiv:2601.04043 arXiv:2602.02276 arXiv:2602.16412 arXiv:2603.05451 arXiv:2603.06569 arXiv:2603.06859 arXiv:2603.12056 arXiv:2603.20397 arXiv:2603.29231 arXiv:2604.01687 arXiv:2604.08571 arXiv:2604.11056 arXiv:2604.11978 arXiv:2604.12890 arXiv:2604.22748 arXiv:2605.10286 arXiv:2605.13831 arXiv:2605.16045 arXiv:2605.22907 arXiv:2605.24517 arXiv:2605.28774 arXiv:2606.02388 arXiv:2606.05263 arXiv:2606.06042 arXiv:2606.07639 arXiv:2606.14747 arXiv:2606.27163 arXiv:2607.01774 arXiv:2607.05196 arXiv:2607.05465 arXiv:2607.06560 arXiv:2607.07740 arXiv:2607.08057 arXiv:2607.09024 arXiv:2607.09322 arXiv:2607.09349 arXiv:2607.09661 arXiv:2607.09701 arXiv:2607.09759 arXiv:2607.10350 arXiv:2607.10383 arXiv:2607.10387 arXiv:2607.10966 arXiv:2607.11487 arXiv:2607.11498 arXiv:2607.11643 arXiv:2607.11644 arXiv:2607.11706 arXiv:2607.11886 arXiv:2607.12227 arXiv:2607.15660 arXiv:2607.16401 arXiv:2607.16609 arXiv:2607.17423 arXiv:2607.18367 arXiv:2607.18529 arXiv:2607.18703 arXiv:2607.19064 arXiv:2607.19139 arXiv:2607.20868 arXiv:2607.21461 arXiv:2607.21553 arXiv:2607.23693 arXiv:2607.24821 arXiv:2607.26769 arXiv:2607.26811 arXiv:2607.27380 arXiv:2607.27616 arXiv:2607.27919 arXiv:2607.28022 arXiv:2607.28227 arXiv:2607.28263 arXiv:2607.28362 arXiv:2607.28374 arXiv:2607.28580 arXiv:2607.28595 arXiv:2607.28618 arXiv:2607.28624 arXiv:2607.28625 arXiv:2607.28887 arXiv:2607.29122 arXiv:2607.29167 arXiv:2607.29377 arXiv:2608.00079 arXiv:2608.00101 arXiv:2608.00371 arXiv:2608.00486 arXiv:2608.00574 arXiv:2608.00675 arXiv:2608.00782 arXiv:2608.01127 arXiv:2608.01185 arXiv:2608.01628 arXiv:2608.01851 arXiv:2608.01964 arXiv:2608.02023 arXiv:2608.02580 arXiv:2608.02791 arXiv:2608.03207 arXiv:2608.03419 arXiv:2608.03451 arXiv:2608.03571 arXiv:2608.03764 arXiv:2608.03979 arXiv:2608.04436 arXiv:2608.04926 arXiv:2608.04964 arXiv:2608.05000 arXiv:2608.05042 arXiv:2608.05070 arXiv:2608.05102 arXiv:2608.05137 arXiv:2608.05248 arXiv:2608.05369 arXiv:2608.05424 arXiv:2608.05466 arXiv:2608.05565 arXiv:2608.05631 arXiv:2608.05703 arXiv:2608.05747 arXiv:2608.05784 arXiv:2608.05798 arXiv:2608.05987 arXiv:2608.06060 arXiv:2608.06146 arXiv:2608.06197 arXiv:2608.06257 arXiv:2608.06270 arXiv:2608.06501 arXiv:2608.06769 arXiv:2608.06914 arXiv:2608.07435 arXiv:2608.07468 arXiv:2608.08021 arXiv:2608.08612 arXiv:2608.08814 arXiv:2608.09853 arXiv:2608.09873 arXiv:2608.09888 arXiv:2608.09928 arXiv:2608.10708 arXiv:2608.10720 arXiv:2608.10744 arXiv:2608.10835 arXiv:2608.11205 arXiv:2608.12313 arXiv:2608.12314 arXiv:2608.12440 arXiv:2608.13210 arXiv:2608.13391 arXiv:2608.13546 arXiv:2608.13556 arXiv:2608.13558 arXiv:2608.14022 arXiv:2608.14075 arXiv:2608.14144 arXiv:2608.14905 arXiv:2608.15045 arXiv:2608.15089 arXiv:2608.15265 arXiv:2608.15669 arXiv:2608.16590 arXiv:2608.16721 arXiv:2608.16859 arXiv:2608.16887 arXiv:2608.17402 arXiv:2608.17426 arXiv:2608.17512 arXiv:2608.18063 arXiv:2608.18565 arXiv:2608.19857 arXiv:2608.19880 arXiv:2608.20335 arXiv:2608.20336 (v55 备份保留沿用不重写 + v56 新增 5 件 2608.16590 Zetta + 2608.18565 SemaPLC + 2607.15660 ToolVerse + 2603.29231 Reliability Science + 2604.11978 HORIZON + v55 沿用 5 件 2608.19880 EnvHarness + 2608.17426 SemComp-Bench + 2608.20335 4DAnyone + 2608.20336 WithEveryone + 2608.14022 ForgeWM = 共 184 件 v56 沿用 arXiv ID 锚点):arXiv:2606.07639 MOSS-Video-Preview + arXiv:2608.10835 UniProbe + arXiv:2305.08908 NoLiMa 撞名核验 + arXiv:2605.22907 VideoOdyssey + arXiv:2602.16412 ReMoRa + arXiv:2604.01687 EvoSkills/CoEvoSkills + arXiv:2512.16978v2 LongShOTBench + arXiv:2608.12313 AVA-Encoder + arXiv:2608.18063 EDITBRIDGE + arXiv:2608.17512 Embodied-Navigator + arXiv:2608.15669 Large Discovery Models + arXiv:2608.17402 MoE-ViE + arXiv:2608.09928 MMDiff + arXiv:2608.14075 Scientific Images + arXiv:2608.14144 Self-Supervised Visual OPD + arXiv:2608.12440 LongHorizon-Harness Agent(spark 互评裁决 不应登记)+ arXiv:2606.14747v1 MMLongEmbed + arXiv:2608.19857 Inadvertent Context Leakage + arXiv:2608.13210 NARU + arXiv:2608.16590 Zetta + arXiv:2608.18565 SemaPLC + arXiv:2607.15660v1 ToolVerse + arXiv:2603.29231 Reliability Science + arXiv:2604.11978 HORIZON = 24 件 v56 沿用 arXiv ID 锚点(v55 备份保留沿用不重写 + v56 新增 5 件)。 v33~v56 沿用 CVECVE-2026-3172 + CVE-2026-26029 + CVE-2026-5059 + CVE-2026-30623(v33~v56 不新增)。

本次变更(2026-08-25 08:40 CST · Wave3 E1 活文档 #31)

触发:cron abc8f04d-7975-4eb4-aa2a-1cccf7cbc07c · 研究知识库 · Wave3 E1 活文档 · flyP · multimodal · 每天 08:40

操作模式:v56 = v55 严格保持 + 5 §2.39.205-209 候补级新增(Zetta + SemaPLC + ToolVerse + Reliability Science + HORIZON)+ 3 §3.3 #121-123 立标等级评估方法学延革第 13+14+15 例反方立基础延展预备 + 1 §7.1 #195 + §7.4 #45-49 5 件 flyp 关键 critical-read 棒 + §3.2 ㉖㉗㉘ 3 项新增 + §4 十六向判定 ⑳ + 1 次 v56 web_search 备料 + 立标池饱和度 v44-v56 十三日连续 + 立标饱和度机制压力测试第 13 日 8-23 ~ 8-25 + 立标池双向锚 v33 首次 11 向并存预备预备触发 + Reliability Science "memory scaffold 普遍伤害" 反方锚预备首次机制化 + flyp 8-23 ~ 8-25 6 件棒 = 第四十七重叠加

新增 15 件 v56 增量:① §2.39.205 Zetta arXiv:2608.16590 立标等级候选级高档 ★★ 观察候选预备(评测方法学延革第 13 例反方立基础候选预备 · MSRA 系 + 闭环具身 harness + base policy 冻结 + runtime critic/recovery skill 在线演化 + Z-Infra + LIBERO-Pro 90.8% / RoboCasa 93.6% / 11.1× 推理加速 + "Aha Moments" + zero-shot skill transfer + 具身侧 harness 化分支首件)② §2.39.206 SemaPLC arXiv:2608.18565 立标等级候选级中-高档 ★★ 候选预备(Midea AI + 三层验证门 specification/compilation/behavior + 117 独立 POU + 65 项目上下文 + 7 模型平均 72.6% + dynamic 行为 22.4→52.2 硬证据 + GitHub midea-ai/SemaPLC 公开 + 任务侧 harness 化分支首件)③ §2.39.207 ToolVerse arXiv:2607.15660v1 立标等级候选级中档 ★ 候选(MCP 4,438 工具池 + GUST 图解锁采样 + Turn-Aware Relative Advantage 修补 GRPO credit assignment)④ §2.39.208 Reliability Science arXiv:2603.29231 候选级中档偏低 ☆ 候选预备("memory scaffold 普遍伤害" 反方锚预备 + RDC/VAF/GDS/MOP 四指标 + 23,392 episodes + 10 开源模型)⑤ §2.39.209 HORIZON arXiv:2604.11978 候选级中档 ★ 候选(COLM 2026 + 700+ tasks / 3,100+ trajectories + trajectory-grounded LLM-as-a-Judge + κ=0.61/0.84 + leaderboard xwang2775.github.io/horizon-leaderboard)⑥ §3.3 #121 评测方法学延革第 13 例反方立基础延展预备(Zetta + SemaPLC 双锚)⑦ §3.3 #122 评测方法学延革第 14 例反方立基础延展预备(ToolVerse)⑧ §3.3 #123 评测方法学延展第 15 例反方立基础延展预备(Reliability Science + HORIZON 双稿)⑨ §7.1 #195 ⑩ §7.4 #45 flyp 8-23 09:51 Zetta+SemaPLC 双锚轻量精读 ⑪ §7.4 #46 flyp 8-23 15:51 LongShOTBench arXiv:2512.16978v2 afternoon-read v2 覆盖(撞自己反方方法学作为 v52 §3.2 light-review 元层级方法学候选 + omni-modal continuous certificate length 概念锚预备)⑫ §7.4 #47 flyp 8-23 15:51 ToolVerse v2 覆盖(撞自己立基础增量 = MCP 工具池训练化 + GUST + Turn-Aware Relative Advantage 3 件)⑬ §7.4 #48 flyp 8-25 05:07 reliability science + HORIZON 双稿短审稿 ⑭ §3.2 ㉖㉗㉘ 3 项新增 + §4 十五向 → 十六向判定 ⑳ 项新增 ⑮ EnvHarness 24h 续立 +11▲ 极显著实测(235▲→246▲ 立标信号强度居首实测)+ 4DAnyone 续立 +8▲ 中等偏高(58▲→66▲)+ SemComp-Bench 续立 +0▲ 持平触发维持降级判定 + 1 次 v56 web_search 备料(multimodal 2026 H2 SOTA / VideoMMMU / MMMU-Pro 饱和 / routed-multi-model era / world model 评测 harness design 校验)+ paper_cards 1058 张(8-23~8-24 净增 7 张 multimodal 主分类)+ 立标池双向锚 v33 首次 11 向并存预备预备触发(v55 10 向 + Zetta 加入预备)+ 立标等级评估方法学延革第 5+6+7+8+9+10+11+12+13+14+15 例首次机制化沿用第 13 日 + flyp 8-23 ~ 8-25 6 件棒 + flyp 单日 4 件棒 v33 以来首次实测 = 第四十七重叠加