2026-09-19 周六精读 · 本周高价值候选结构化阅读笔记(flyP)

角色:flyP · 2026-09-19(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 任务范围:从 9-13 ~ 9-19 本周候选中选 2-3 篇做结构化阅读笔记 + 反方审稿 + 复现风险分析 底本/shared/research-kb/inbox/flyp/ 本周已落档 18 件 critical-read + 1 件 topics draft + 5 件 e1prep + 7 件 RSS 切片 + 1 件 multimodal weekly digest 轻量模式:✅ 仅 3 篇深度精读 + 0 次 web_search(沿用本周已验证精读稿)+ 0 次 web_fetch(按周六规则只做反方审稿与复现风险,不抓新外部信号)


一、候选池概览(9-13 ~ 9-19 本周)

日期 候选 主轴 形式评级 精读稿路径
9-13 09:50 WMRL · Scaling Automatic Research Agents via World Models agent C+ 2026-09-13-0950-WMRL-World-Model-RL-Research-Agents-critical-read.md
9-13 15:50 MaP-WAM · Memory-as-Plans World-Action Modeling agent+manipulation C 2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md
9-13 22:50 Φ-Bench · Frontier AI Infrastructure Benchmark llm-infra+eval C+ 2026-09-13-2250-Phi-Bench-Frontier-AI-Infrastructure-Benchmark-critical-read.md
9-14 09:50 MMProLong · Long-context VLM continued pretraining multimodal+long-ctx D+→A(v2 覆盖) 2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md
9-14 09:50 Long-Horizon Terminal-Bench agent-eval D+→A(v2 覆盖) 2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md
9-14 22:50 MultihopSpatial · 3D 空间推理 VLM multimodal+spatial D+→A(v2 覆盖) 2026-09-14-2250-MultihopSpatial-3D-spatial-reasoning-VLM-critical-read.md
9-15 09:50 Multimodal RAG Document Survey rag+multimodal D 2026-09-14-Multimodal-RAG-Document-Survey.md
9-15 09:50 WildToolBench · agentic tool use agent D 2026-09-14-WildToolBench-agentic-tooluse.md
9-15 早棒 Proactive Memory Agent agent+memory C→A(v2 619 行覆盖) 2026-09-15-proactive-memory-agent.md
9-15 早棒 ReMemR1 ICLR upgrade agent+memory C+→A(v2 486 行覆盖) 2026-09-15-rememr1-iclr-upgrade.md
9-15 15:50 Long-Horizon Agent Topics draft topics B 2026-09-15-long-horizon-agent-topics-draft.md
9-15 22:50 Model-or-Harness · Agent Failure Taxonomy agent-eval A-(161 行) ✅ 本周必读 2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md
9-16 09:50 Orthrus · Lossless Speculative Decoding critique llm-infra+dllm A-(164 行) ✅ 本周必读 2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md
9-16 15:50 MC-Search · Agentic MM-RAG Benchmark multimodal+agent-eval A 2026-09-16-1550-MC-Search-Agentic-MM-RAG-Benchmark-critical-read.md
9-16 22:50 Atria Dawn · 744B MoE agentic LLM agent+llm-infra A(206 行) ✅ 本周必读 2026-09-16-2250-Atria-Dawn-Agentic-Superintelligence-critical-read.md
9-17 09:50 FLAT · Flexible-Length Aligned Transmodal multimodal+rag C+ 2026-09-17-0950-FLAT-Flexible-Length-Aligned-Transmodal-critical-read.md
9-17 15:50 Agora · Git as Shared Memory AutoResearch agent+memory C+ 2026-09-17-1550-Agora-Git-as-Shared-Memory-Collective-AutoResearch-critical-read.md
9-17 22:50 Legibility-Is-Not-Interpretability (COLM 2026) reasoning+interpret B 2026-09-17-2250-Legibility-Is-Not-Interpretability-CoT-Step-Importance-critical-read.md
9-18 09:50 M3Exam multimodal memory multimodal+memory D 2026-09-18-m3exam-multimodal-memory.md
9-18 15:50 VST-Haven · online video LLM multimodal D 2026-09-18-vst-haven-online-video-llm.md
9-19 09:50 Zing-0.5 · playable world model multimodal+world-model C+ 2026-09-19-0950-Zing-0.5-playable-worlds-critical-read.md

主线分布: - agent 主轴:8 件(WMRL、MaP-WAM、Terminal-Bench、Proactive Memory、ReMemR1、Model-or-Harness、Agora、Atria Dawn) - agent-eval 子主轴:3 件(Model-or-Harness、MC-Search、Φ-Bench) - multimodal 主轴:6 件(MMProLong、MultihopSpatial、M3Exam、VST-Haven、FLAT、Zing-0.5) - llm-infra 主轴:2 件(Orthrus、Atria Dawn) - rag + long-ctx + memory 子主轴:4 件(Multimodal RAG Survey、Proactive Memory、ReMemR1、WildToolBench)


二、本周必读 3 篇(按反方审稿价值排序)

必读 #1 · Atria Dawn · 2026-09-16 22:50 flyP 精读

中文系 744B MoE agentic LLM(Shanghai AI Lab + Fudan)+ Verifiable Experience Pipeline + 56 人 / 769 task records 人机协作 case study + HF Daily 9-16 369▲ / 24h +252▲ 创 v33 以来新立标单日涨幅新高

为什么本周最值得反方审稿: - 方法学 + 模型 + 社会学三层贡献(§一)—— 论文同时贡献了 (a) agentic post-training 的 verification-as-first-class signal 思路、(b) 744B MoE 在 16 个 agentic benchmark 上的实测、(c) 把自家 R&D 写成社会学实验的罕见体裁。 - HF Daily +252▲ / 24h 单日涨幅创纪录(§2.3)—— 这是 v33 以来新立标候选从未出现过的票数曲线,必须做反方审稿防止"集体刷票 + 营销主导"。 - 方法学局限 + 对比基线偏差 + case study 自评(§2.4-2.5)—— 三处结构性空缺都有量化反方证据。

核心论点一句话:方法学(Verifiable Experience Pipeline)🟢 中-高 + 模型(744B MoE agentic)🟡 中 + 社会学(56/769 case study)🟢 高;case study 是最稀缺的体裁但自己评自己。

反方审稿切入点(详见 reviews 文件): 1. "中文系内战"对比基线(GLM 5.3 / KIMI K3 / Qwen 3.8 / DeepSeek V4 Pro)的可推广性扣分 2. 缺 ablation(4 元组 vs 2 元组 vs 1 元组) 3. case study 是 retrospective estimate 不是 prospective counterfactual 4. 缺 cost / latency 数字(744B MoE 长链路 agent loop 的真实成本) 5. 评估污染风险(AutomationBench / BFCL v4 / CyberGym 训练数据是否去污染) 6. +252▲ / 24h 是否真实流量(待 9-16 evening + 9-17 morning 票数核实)


必读 #2 · Model-or-Harness · 2026-09-15 22:50 flyP 精读

Scale AI 出品 · 41 类 failure mode × interaction edge × fault side · Cohen's κ = 0.76 / 0.84 · OpenClaw 已入 worked example 库

为什么本周最值得反方审稿: - 诊断抽象层的稀缺性(§核心贡献 1-3)—— 把 agent 故障从"组件内分类"升级为"interaction edge + fault side"二元轴,这是 2026 年 agent 工程界真正缺的一层抽象。 - 可执行性极强(§核心贡献 5)—— 41 类 + 修复动作(post-train / harness fix / env redesign / benchmark repair)直接可被 OpenClaw / LangChain harness 吸收。 - 方法学 bias 已自我暴露(§问题 1)—— 41 类"大多是 model-side"是归因规则的产物,不是数据结论——这是评测方法学的警钟,值得作为本周反方审稿样本

核心论点一句话:2026 年 agent 失败诊断从"叙事"走向"工程工具"的转折点;但"model-side bias"是方法学产物、缺 baseline 对照、Scale AI 商业利益相关——不应作为唯一标准直接采信。

反方审稿切入点(详见 reviews 文件): 1. "a more capable model could have avoided" 这条规则天然把 recoverable 失败推向 model-side → 需要 harness engineer 盲复现对照 2. 缺 baseline head-to-head(Cemri / Zhu / Barke / Qiao 旧 taxonomy vs 本 taxonomy,下游修复动作有效性) 3. Cohen's κ = 0.76 是 substantial 不是 strong;24% 分歧集中在 harness ↔ environment 模糊地带 4. Scale AI 出品的商业利益冲突 5. schema 是否公开决定本文从"诊断标准"降级还是保留为"营销框架" 6. 41 类对短程单步失败 / 非 coding 场景的覆盖密度待证


必读 #3 · Orthrus · 2026-09-16 09:50 flyP 精读

AIRI / Skoltech 数值方法团队(Oseledets 介入 dLLM 复核)· Orthrus(hybrid AR + diffusion 推测解码)的独立复现 · BF16 下 45% 不匹配 / FP32 下 100% / on-policy 蒸馏数据更优

为什么本周最值得反方审稿: - 唯一带反驳性复现具体数字的样本(§一)—— BF16 45% / FP32 100% / FP16 ~90% / 1,190 prompts × 12 domains 都是可验证的硬数字,不是 narrative。 - 方法学贡献可推广(§贡献 1、2、5)—— "lossless" 重新定义为可验证命题 + on-policy 蒸馏数据原则 + trajectory match rate 作为新基线指标,可以推广到 EAGLE-3 / DFlash / Mercury / SDAR 全部 dLLM 论文。 - 工程意义有限但评测规范意义大(§三)—— 反驳不否定 Orthrus 作为加速技术的价值,只否定"严格无损"的措辞。

核心论点一句话:反驳性复现论文(replication + critique),把"lossless"从口号变成可验证命题;on-policy 蒸馏是 diffusion decoder 的正确训练分布;但 FP32 端到端速度数据缺失 + 高敏感场景下游任务失败案例缺失限制了工程说服力。

反方审稿切入点(详见 reviews 文件): 1. BF16 45% 在 lm-eval-harness 任务级无系统性退化 → 反驳措辞强但工程意义弱 2. FP32 端到端速度对比缺失 → 如果 FP32 加速比崩溃,Orthrus 设计需要重新审视 3. 作者与 Nguyen et al. 的关系(合作 / 竞争 / 独立)未核实 4. 12 领域分布 + 高敏感场景(code / agentic tool trace)下游失败案例缺失 5. 代码 / 数据未公开 → 反驳价值打折扣 6. 与 EAGLE-3 / DFlash / Mercury 的横向对比缺失


三、本周候选 pool 的反方审稿结构观察

3.1 形式评级 A 区间(≥ 200 行或 v2 覆盖)

  • Atria Dawn(206 行)· agent+llm-infra
  • MultihopSpatial(404 行 v2 覆盖)· multimodal+spatial
  • Proactive Memory(619 行 v2 覆盖)· agent+memory
  • ReMemR1 ICLR upgrade(486 行 v2 覆盖)· agent+memory

3.2 形式评级 A- 区间(160-200 行单棒 critical-read)

  • Orthrus(164 行)· llm-infra+dllm ✅ 本周必读 #3
  • Model-or-Harness(161 行)· agent-eval ✅ 本周必读 #2

3.3 形式评级 B 区间(topics / 多稿集成)

  • Long-Horizon Agent Topics draft(232 行)· agent
  • Legibility-Is-Not-Interpretability(9-17 22:50)· reasoning

3.4 形式评级 C+ 区间(短审稿 + 部分 v2 覆盖)

  • WMRLMaP-WAMΦ-BenchAgoraFLATZing-0.5

3.5 形式评级 D 区间(轻量短评 / 候选入库)

  • Multimodal RAG SurveyWildToolBenchM3ExamVST-Haven

3.6 ⚠️ v2 覆盖轨迹观察

本周有 3 件触发 v2 覆盖(MMProLong、Terminal-Bench、MultihopSpatial),全部在 9-14 ~ 9-15 棒位;9-15 早棒两件(C 区间短审稿代表)proactive-memory-agent 和 rememr1-iclr-upgrade 也由 9-16、9-17 棒位兑现 v2 覆盖。本周 v2 覆盖轨迹说明:反思棒位的形式评级识别机制在持续生效,但早期短审稿样本的"撞自己 ≥ 3 件承认 + 立标候选位明文化 + §六边界声明"三件结构性空缺仍需在 9-20 周日起棒位补查。


四、本周分类标签使用频次(粗略)

  • agent 出现 ≥ 8 次(最多)
  • agent-eval 出现 3 次
  • multimodal 出现 6 次
  • llm-infra 出现 2 次
  • rag 出现 2 次
  • long-context 出现 2 次
  • memory 出现 4 次
  • world-model 出现 1 次(Zing-0.5)
  • reasoning 出现 1 次(Legibility)
  • dllm 出现 1 次(Orthrus)

⚠️ 观察:本周 agent 主轴占比 38%(8/21 件),是 v33 以来单周 agent 主轴占比最高一周。9-19 周六棒位建议:9-20 周日起 agent.md 主分类需要新增 §Atria Dawn、§Model-or-Harness、§Orthrus 三条;agent-eval.md 需要新增 §Model-or-Harness 一条(taxonomy 索引);llm-infra.md 需要新增 §Orthrus 一条(数值精度约束);multimodal.md 需要订正 Atria Dawn 从主轴候选改为邻接级。


五、本周复现风险总览

论文 复现难度 主要风险 可信度
Atria Dawn 🟠 高 744B MoE 后训练需 100+ H100 集群;reference harness 未发布;training recipe 不开放 🟡 中-高
Model-or-Harness 🟢 低(schema 公开后可复用) schema 是否公开未确认;缺独立 baseline;商业利益冲突 ⭐⭐⭐☆☆
Orthrus 🟡 中 代码 / 数据未公开;1,190 prompts × 12 domains 需本地复现;FP32 速度对比缺 🟢 中-高
WMRL 🟠 高 RL + world model + 科研 agent 全栈 🟡 中
MaP-WAM 🟠 高 真实机器人 manipulation + memory-as-plans 训练 🟡 中
Φ-Bench 🟢 低 benchmark 公开;评测协议公开 ⭐⭐⭐⭐
MMProLong(v2 覆盖) 🟡 中 长上下文 continued pretraining 算力需求 ⭐⭐⭐⭐
Terminal-Bench(v2 覆盖) 🟢 低 benchmark 公开;harness 公开 ⭐⭐⭐⭐
MultihopSpatial(v2 覆盖) 🟢 低 benchmark + VLA 评测公开 ⭐⭐⭐⭐
Proactive Memory(v2 覆盖) 🟡 中 需要 LLM agent + memory agent 双 harness ⭐⭐⭐⭐
ReMemR1(v2 覆盖) 🟢 低 ICLR 2026 复现性已验证 ⭐⭐⭐⭐⭐
MC-Search 🟢 低 benchmark 公开;ICLR 2026 已确认 ⭐⭐⭐⭐
Agora 🟢 低 单作者提交,代码可能不开源 🟡 中
FLAT 🟡 中 multimodal + rag 跨模态训练 ⭐⭐⭐
Legibility 🟢 低 COLM 2026 接收;公开方法 ⭐⭐⭐⭐
Multimodal RAG Survey 综述,无复现问题 ⭐⭐⭐
WildToolBench 🟢 低 benchmark 公开 ⭐⭐⭐
M3Exam 🟢 低 benchmark 公开 ⭐⭐⭐
VST-Haven 🟢 低 benchmark 公开 ⭐⭐⭐
Zing-0.5 🟢 低 open weights + streaming inference;playable worlds 评测新 ⭐⭐⭐

复现风险核心结论: - 大模型权重开放 + 训练数据 / recipe 封闭(Atria Dawn、Zing-0.5)是 2026 年默认 release 模式,对学术复现而言价值有限 - 评测 / benchmark 类论文(MMProLong v2、Terminal-Bench v2、Φ-Bench、WildToolBench、VST-Haven、M3Exam、MC-Search、ReMemR1)复现性最好 - 反驳性复现类(Orthrus)价值高但代码 / 数据未公开会打折扣 - 评测方法学类(Model-or-Harness)schema 公开状态决定一切


六、本周 Substack 线索(仅 RSS 切片层)

本周 RSS 切片密度正常(每天 ~3 件),未出现 9-12 / 9-15 那种 14KB+ 长切片。Cameron Wolfe 本周 9-15 ~ 9-19 共 5 件 RSS 切片,主题集中在 agent evaluation / agentic world models / reasoning;Interconnects 本周 9-13 ~ 9-19 共 7 件 RSS 切片,主题集中在 long-horizon agents / dLLM / closed-vs-open。Substack 本周无新增大专题,继续保持 Cameron Wolfe + Interconnects 双主线。


七、建议写入路径

notes:
  - "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md"(本文件)

reviews:
  - "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md"(反方审稿 + 复现风险分析)

下游建议:
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent.md-section-Atria-Dawn-draft.md"(agent.md 主分类新增 §Atria Dawn)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent-eval.md-section-Model-or-Harness-draft.md"(agent-eval.md 新增 §Model-or-Harness taxonomy 索引)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-llm-infra.md-section-Orthrus-draft.md"(llm-infra.md 新增 §Orthrus 数值精度约束)
  - "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal.md-classification-fix-Atria-Dawn.md"(multimodal.md 订正 Atria Dawn 分类)

不在本任务范围:
  - 不写 /shared/research-kb/review/ 或 /shared/research-kb/published/
  - 不执行 git commit / git push / gh pr

八、待人工确认的问题

  1. Atria Dawn HF Daily 票数 9-16 evening / 9-17 morning 是否续立? —— 决定 +252▲ / 24h 是真实流量还是短时冲顶的关键
  2. Atria Dawn GitHub 仓库内容:是否包含 reference harness、trajectory sample、training recipe 的最小复现指引?
  3. Atria Dawn 跨语种对比:是否会在 v2 附录中加入 Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4 对比?
  4. Model-or-Harness schema 是否公开:决定本文从"诊断标准"降级还是保留为"营销框架"
  5. Model-or-Harness 会议接收信号:NeurIPS 2026 workshop / ICLR 2027 / ACL 2027 / ICML 2027 workshop 任一信号
  6. Orthrus 作者与 Nguyen et al. 的关系:合作 / 竞争 / 独立?独立性的措辞需要重新审视
  7. Orthrus 代码 / 1,190 prompt 集是否公开:决定反驳价值的可持续性
  8. Model-or-Harness 41 类完整清单:摘要级提了但未给完整 schema;待补查完整 41 类清单以做 KB 索引页

九、写在最后

本周(9-13 ~ 9-19)是 v33 以来agent 主轴占比单周最高的一周(38%),也是复现风险结构变化最显著的一周——大模型权重开放 + 训练数据 / recipe 封闭成为默认模式,对学术复现价值形成系统性约束。本周必读 3 篇(Atria Dawn / Model-or-Harness / Orthrus)恰好覆盖了 agent 主轴 / agent-eval 子主轴 / llm-infra+dllm 子主轴三个互不重叠的关键节点,且每篇都有清晰的反方审稿切入点——这是 9-19 周六棒位选这 3 篇做反方审稿的核心理由。

下周(9-20 ~ 9-26)建议主轴: - agent 主轴:继续追踪 Atria Dawn 票数 + v2 修订;启动 Model-or-Harness schema 公开状态确认 + 独立 replication 预备 - llm-infra+dllm 子主轴:横向套 trajectory match rate 到 EAGLE-3 / DFlash / Mercury / SDAR - multimodal 主轴:订正 Atria Dawn 分类;新增 §Zing-0.5 playable worlds - agent-eval 子主轴:Model-or-Harness taxonomy 索引页 + 41 类完整清单


flyP · 2026-09-19 10:30 CST · 周六精读与反方审稿棒 · 第 N 期 · 共享知识库 flyP 实例