2026-09-19 周六精读 · 本周高价值候选结构化阅读笔记(flyP)
角色:flyP · 2026-09-19(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 任务范围:从 9-13 ~ 9-19 本周候选中选 2-3 篇做结构化阅读笔记 + 反方审稿 + 复现风险分析 底本:
/shared/research-kb/inbox/flyp/本周已落档 18 件 critical-read + 1 件 topics draft + 5 件 e1prep + 7 件 RSS 切片 + 1 件 multimodal weekly digest 轻量模式:✅ 仅 3 篇深度精读 + 0 次 web_search(沿用本周已验证精读稿)+ 0 次 web_fetch(按周六规则只做反方审稿与复现风险,不抓新外部信号)
一、候选池概览(9-13 ~ 9-19 本周)
| 日期 | 候选 | 主轴 | 形式评级 | 精读稿路径 |
|---|---|---|---|---|
| 9-13 09:50 | WMRL · Scaling Automatic Research Agents via World Models | agent | C+ | 2026-09-13-0950-WMRL-World-Model-RL-Research-Agents-critical-read.md |
| 9-13 15:50 | MaP-WAM · Memory-as-Plans World-Action Modeling | agent+manipulation | C | 2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md |
| 9-13 22:50 | Φ-Bench · Frontier AI Infrastructure Benchmark | llm-infra+eval | C+ | 2026-09-13-2250-Phi-Bench-Frontier-AI-Infrastructure-Benchmark-critical-read.md |
| 9-14 09:50 | MMProLong · Long-context VLM continued pretraining | multimodal+long-ctx | D+→A(v2 覆盖) | 2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md |
| 9-14 09:50 | Long-Horizon Terminal-Bench | agent-eval | D+→A(v2 覆盖) | 2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md |
| 9-14 22:50 | MultihopSpatial · 3D 空间推理 VLM | multimodal+spatial | D+→A(v2 覆盖) | 2026-09-14-2250-MultihopSpatial-3D-spatial-reasoning-VLM-critical-read.md |
| 9-15 09:50 | Multimodal RAG Document Survey | rag+multimodal | D | 2026-09-14-Multimodal-RAG-Document-Survey.md |
| 9-15 09:50 | WildToolBench · agentic tool use | agent | D | 2026-09-14-WildToolBench-agentic-tooluse.md |
| 9-15 早棒 | Proactive Memory Agent | agent+memory | C→A(v2 619 行覆盖) | 2026-09-15-proactive-memory-agent.md |
| 9-15 早棒 | ReMemR1 ICLR upgrade | agent+memory | C+→A(v2 486 行覆盖) | 2026-09-15-rememr1-iclr-upgrade.md |
| 9-15 15:50 | Long-Horizon Agent Topics draft | topics | B | 2026-09-15-long-horizon-agent-topics-draft.md |
| 9-15 22:50 | Model-or-Harness · Agent Failure Taxonomy | agent-eval | A-(161 行) ✅ 本周必读 | 2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md |
| 9-16 09:50 | Orthrus · Lossless Speculative Decoding critique | llm-infra+dllm | A-(164 行) ✅ 本周必读 | 2026-09-16-0950-Orthrus-Lossless-Speculative-Decoding-Numerical-Precision-critical-read.md |
| 9-16 15:50 | MC-Search · Agentic MM-RAG Benchmark | multimodal+agent-eval | A | 2026-09-16-1550-MC-Search-Agentic-MM-RAG-Benchmark-critical-read.md |
| 9-16 22:50 | Atria Dawn · 744B MoE agentic LLM | agent+llm-infra | A(206 行) ✅ 本周必读 | 2026-09-16-2250-Atria-Dawn-Agentic-Superintelligence-critical-read.md |
| 9-17 09:50 | FLAT · Flexible-Length Aligned Transmodal | multimodal+rag | C+ | 2026-09-17-0950-FLAT-Flexible-Length-Aligned-Transmodal-critical-read.md |
| 9-17 15:50 | Agora · Git as Shared Memory AutoResearch | agent+memory | C+ | 2026-09-17-1550-Agora-Git-as-Shared-Memory-Collective-AutoResearch-critical-read.md |
| 9-17 22:50 | Legibility-Is-Not-Interpretability (COLM 2026) | reasoning+interpret | B | 2026-09-17-2250-Legibility-Is-Not-Interpretability-CoT-Step-Importance-critical-read.md |
| 9-18 09:50 | M3Exam multimodal memory | multimodal+memory | D | 2026-09-18-m3exam-multimodal-memory.md |
| 9-18 15:50 | VST-Haven · online video LLM | multimodal | D | 2026-09-18-vst-haven-online-video-llm.md |
| 9-19 09:50 | Zing-0.5 · playable world model | multimodal+world-model | C+ | 2026-09-19-0950-Zing-0.5-playable-worlds-critical-read.md |
主线分布: - agent 主轴:8 件(WMRL、MaP-WAM、Terminal-Bench、Proactive Memory、ReMemR1、Model-or-Harness、Agora、Atria Dawn) - agent-eval 子主轴:3 件(Model-or-Harness、MC-Search、Φ-Bench) - multimodal 主轴:6 件(MMProLong、MultihopSpatial、M3Exam、VST-Haven、FLAT、Zing-0.5) - llm-infra 主轴:2 件(Orthrus、Atria Dawn) - rag + long-ctx + memory 子主轴:4 件(Multimodal RAG Survey、Proactive Memory、ReMemR1、WildToolBench)
二、本周必读 3 篇(按反方审稿价值排序)
必读 #1 · Atria Dawn · 2026-09-16 22:50 flyP 精读
中文系 744B MoE agentic LLM(Shanghai AI Lab + Fudan)+ Verifiable Experience Pipeline + 56 人 / 769 task records 人机协作 case study + HF Daily 9-16 369▲ / 24h +252▲ 创 v33 以来新立标单日涨幅新高
为什么本周最值得反方审稿: - 方法学 + 模型 + 社会学三层贡献(§一)—— 论文同时贡献了 (a) agentic post-training 的 verification-as-first-class signal 思路、(b) 744B MoE 在 16 个 agentic benchmark 上的实测、(c) 把自家 R&D 写成社会学实验的罕见体裁。 - HF Daily +252▲ / 24h 单日涨幅创纪录(§2.3)—— 这是 v33 以来新立标候选从未出现过的票数曲线,必须做反方审稿防止"集体刷票 + 营销主导"。 - 方法学局限 + 对比基线偏差 + case study 自评(§2.4-2.5)—— 三处结构性空缺都有量化反方证据。
核心论点一句话:方法学(Verifiable Experience Pipeline)🟢 中-高 + 模型(744B MoE agentic)🟡 中 + 社会学(56/769 case study)🟢 高;case study 是最稀缺的体裁但自己评自己。
反方审稿切入点(详见 reviews 文件): 1. "中文系内战"对比基线(GLM 5.3 / KIMI K3 / Qwen 3.8 / DeepSeek V4 Pro)的可推广性扣分 2. 缺 ablation(4 元组 vs 2 元组 vs 1 元组) 3. case study 是 retrospective estimate 不是 prospective counterfactual 4. 缺 cost / latency 数字(744B MoE 长链路 agent loop 的真实成本) 5. 评估污染风险(AutomationBench / BFCL v4 / CyberGym 训练数据是否去污染) 6. +252▲ / 24h 是否真实流量(待 9-16 evening + 9-17 morning 票数核实)
必读 #2 · Model-or-Harness · 2026-09-15 22:50 flyP 精读
Scale AI 出品 · 41 类 failure mode × interaction edge × fault side · Cohen's κ = 0.76 / 0.84 · OpenClaw 已入 worked example 库
为什么本周最值得反方审稿: - 诊断抽象层的稀缺性(§核心贡献 1-3)—— 把 agent 故障从"组件内分类"升级为"interaction edge + fault side"二元轴,这是 2026 年 agent 工程界真正缺的一层抽象。 - 可执行性极强(§核心贡献 5)—— 41 类 + 修复动作(post-train / harness fix / env redesign / benchmark repair)直接可被 OpenClaw / LangChain harness 吸收。 - 方法学 bias 已自我暴露(§问题 1)—— 41 类"大多是 model-side"是归因规则的产物,不是数据结论——这是评测方法学的警钟,值得作为本周反方审稿样本。
核心论点一句话:2026 年 agent 失败诊断从"叙事"走向"工程工具"的转折点;但"model-side bias"是方法学产物、缺 baseline 对照、Scale AI 商业利益相关——不应作为唯一标准直接采信。
反方审稿切入点(详见 reviews 文件): 1. "a more capable model could have avoided" 这条规则天然把 recoverable 失败推向 model-side → 需要 harness engineer 盲复现对照 2. 缺 baseline head-to-head(Cemri / Zhu / Barke / Qiao 旧 taxonomy vs 本 taxonomy,下游修复动作有效性) 3. Cohen's κ = 0.76 是 substantial 不是 strong;24% 分歧集中在 harness ↔ environment 模糊地带 4. Scale AI 出品的商业利益冲突 5. schema 是否公开决定本文从"诊断标准"降级还是保留为"营销框架" 6. 41 类对短程单步失败 / 非 coding 场景的覆盖密度待证
必读 #3 · Orthrus · 2026-09-16 09:50 flyP 精读
AIRI / Skoltech 数值方法团队(Oseledets 介入 dLLM 复核)· Orthrus(hybrid AR + diffusion 推测解码)的独立复现 · BF16 下 45% 不匹配 / FP32 下 100% / on-policy 蒸馏数据更优
为什么本周最值得反方审稿: - 唯一带反驳性复现具体数字的样本(§一)—— BF16 45% / FP32 100% / FP16 ~90% / 1,190 prompts × 12 domains 都是可验证的硬数字,不是 narrative。 - 方法学贡献可推广(§贡献 1、2、5)—— "lossless" 重新定义为可验证命题 + on-policy 蒸馏数据原则 + trajectory match rate 作为新基线指标,可以推广到 EAGLE-3 / DFlash / Mercury / SDAR 全部 dLLM 论文。 - 工程意义有限但评测规范意义大(§三)—— 反驳不否定 Orthrus 作为加速技术的价值,只否定"严格无损"的措辞。
核心论点一句话:反驳性复现论文(replication + critique),把"lossless"从口号变成可验证命题;on-policy 蒸馏是 diffusion decoder 的正确训练分布;但 FP32 端到端速度数据缺失 + 高敏感场景下游任务失败案例缺失限制了工程说服力。
反方审稿切入点(详见 reviews 文件): 1. BF16 45% 在 lm-eval-harness 任务级无系统性退化 → 反驳措辞强但工程意义弱 2. FP32 端到端速度对比缺失 → 如果 FP32 加速比崩溃,Orthrus 设计需要重新审视 3. 作者与 Nguyen et al. 的关系(合作 / 竞争 / 独立)未核实 4. 12 领域分布 + 高敏感场景(code / agentic tool trace)下游失败案例缺失 5. 代码 / 数据未公开 → 反驳价值打折扣 6. 与 EAGLE-3 / DFlash / Mercury 的横向对比缺失
三、本周候选 pool 的反方审稿结构观察
3.1 形式评级 A 区间(≥ 200 行或 v2 覆盖)
- Atria Dawn(206 行)· agent+llm-infra
- MultihopSpatial(404 行 v2 覆盖)· multimodal+spatial
- Proactive Memory(619 行 v2 覆盖)· agent+memory
- ReMemR1 ICLR upgrade(486 行 v2 覆盖)· agent+memory
3.2 形式评级 A- 区间(160-200 行单棒 critical-read)
- Orthrus(164 行)· llm-infra+dllm ✅ 本周必读 #3
- Model-or-Harness(161 行)· agent-eval ✅ 本周必读 #2
3.3 形式评级 B 区间(topics / 多稿集成)
- Long-Horizon Agent Topics draft(232 行)· agent
- Legibility-Is-Not-Interpretability(9-17 22:50)· reasoning
3.4 形式评级 C+ 区间(短审稿 + 部分 v2 覆盖)
- WMRL、MaP-WAM、Φ-Bench、Agora、FLAT、Zing-0.5
3.5 形式评级 D 区间(轻量短评 / 候选入库)
- Multimodal RAG Survey、WildToolBench、M3Exam、VST-Haven
3.6 ⚠️ v2 覆盖轨迹观察
本周有 3 件触发 v2 覆盖(MMProLong、Terminal-Bench、MultihopSpatial),全部在 9-14 ~ 9-15 棒位;9-15 早棒两件(C 区间短审稿代表)proactive-memory-agent 和 rememr1-iclr-upgrade 也由 9-16、9-17 棒位兑现 v2 覆盖。本周 v2 覆盖轨迹说明:反思棒位的形式评级识别机制在持续生效,但早期短审稿样本的"撞自己 ≥ 3 件承认 + 立标候选位明文化 + §六边界声明"三件结构性空缺仍需在 9-20 周日起棒位补查。
四、本周分类标签使用频次(粗略)
agent出现 ≥ 8 次(最多)agent-eval出现 3 次multimodal出现 6 次llm-infra出现 2 次rag出现 2 次long-context出现 2 次memory出现 4 次world-model出现 1 次(Zing-0.5)reasoning出现 1 次(Legibility)dllm出现 1 次(Orthrus)
⚠️ 观察:本周 agent 主轴占比 38%(8/21 件),是 v33 以来单周 agent 主轴占比最高一周。9-19 周六棒位建议:9-20 周日起 agent.md 主分类需要新增 §Atria Dawn、§Model-or-Harness、§Orthrus 三条;agent-eval.md 需要新增 §Model-or-Harness 一条(taxonomy 索引);llm-infra.md 需要新增 §Orthrus 一条(数值精度约束);multimodal.md 需要订正 Atria Dawn 从主轴候选改为邻接级。
五、本周复现风险总览
| 论文 | 复现难度 | 主要风险 | 可信度 |
|---|---|---|---|
| Atria Dawn | 🟠 高 | 744B MoE 后训练需 100+ H100 集群;reference harness 未发布;training recipe 不开放 | 🟡 中-高 |
| Model-or-Harness | 🟢 低(schema 公开后可复用) | schema 是否公开未确认;缺独立 baseline;商业利益冲突 | ⭐⭐⭐☆☆ |
| Orthrus | 🟡 中 | 代码 / 数据未公开;1,190 prompts × 12 domains 需本地复现;FP32 速度对比缺 | 🟢 中-高 |
| WMRL | 🟠 高 | RL + world model + 科研 agent 全栈 | 🟡 中 |
| MaP-WAM | 🟠 高 | 真实机器人 manipulation + memory-as-plans 训练 | 🟡 中 |
| Φ-Bench | 🟢 低 | benchmark 公开;评测协议公开 | ⭐⭐⭐⭐ |
| MMProLong(v2 覆盖) | 🟡 中 | 长上下文 continued pretraining 算力需求 | ⭐⭐⭐⭐ |
| Terminal-Bench(v2 覆盖) | 🟢 低 | benchmark 公开;harness 公开 | ⭐⭐⭐⭐ |
| MultihopSpatial(v2 覆盖) | 🟢 低 | benchmark + VLA 评测公开 | ⭐⭐⭐⭐ |
| Proactive Memory(v2 覆盖) | 🟡 中 | 需要 LLM agent + memory agent 双 harness | ⭐⭐⭐⭐ |
| ReMemR1(v2 覆盖) | 🟢 低 | ICLR 2026 复现性已验证 | ⭐⭐⭐⭐⭐ |
| MC-Search | 🟢 低 | benchmark 公开;ICLR 2026 已确认 | ⭐⭐⭐⭐ |
| Agora | 🟢 低 | 单作者提交,代码可能不开源 | 🟡 中 |
| FLAT | 🟡 中 | multimodal + rag 跨模态训练 | ⭐⭐⭐ |
| Legibility | 🟢 低 | COLM 2026 接收;公开方法 | ⭐⭐⭐⭐ |
| Multimodal RAG Survey | — | 综述,无复现问题 | ⭐⭐⭐ |
| WildToolBench | 🟢 低 | benchmark 公开 | ⭐⭐⭐ |
| M3Exam | 🟢 低 | benchmark 公开 | ⭐⭐⭐ |
| VST-Haven | 🟢 低 | benchmark 公开 | ⭐⭐⭐ |
| Zing-0.5 | 🟢 低 | open weights + streaming inference;playable worlds 评测新 | ⭐⭐⭐ |
复现风险核心结论: - 大模型权重开放 + 训练数据 / recipe 封闭(Atria Dawn、Zing-0.5)是 2026 年默认 release 模式,对学术复现而言价值有限 - 评测 / benchmark 类论文(MMProLong v2、Terminal-Bench v2、Φ-Bench、WildToolBench、VST-Haven、M3Exam、MC-Search、ReMemR1)复现性最好 - 反驳性复现类(Orthrus)价值高但代码 / 数据未公开会打折扣 - 评测方法学类(Model-or-Harness)schema 公开状态决定一切
六、本周 Substack 线索(仅 RSS 切片层)
本周 RSS 切片密度正常(每天 ~3 件),未出现 9-12 / 9-15 那种 14KB+ 长切片。Cameron Wolfe 本周 9-15 ~ 9-19 共 5 件 RSS 切片,主题集中在 agent evaluation / agentic world models / reasoning;Interconnects 本周 9-13 ~ 9-19 共 7 件 RSS 切片,主题集中在 long-horizon agents / dLLM / closed-vs-open。Substack 本周无新增大专题,继续保持 Cameron Wolfe + Interconnects 双主线。
七、建议写入路径
notes:
- "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-notes.md"(本文件)
reviews:
- "/shared/research-kb/inbox/flyp/2026-09-19-1030-sat-weekly-deep-read-reviews.md"(反方审稿 + 复现风险分析)
下游建议:
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent.md-section-Atria-Dawn-draft.md"(agent.md 主分类新增 §Atria Dawn)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-agent-eval.md-section-Model-or-Harness-draft.md"(agent-eval.md 新增 §Model-or-Harness taxonomy 索引)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-llm-infra.md-section-Orthrus-draft.md"(llm-infra.md 新增 §Orthrus 数值精度约束)
- "/shared/research-kb/inbox/flyp/2026-09-20-0950-multimodal.md-classification-fix-Atria-Dawn.md"(multimodal.md 订正 Atria Dawn 分类)
不在本任务范围:
- 不写 /shared/research-kb/review/ 或 /shared/research-kb/published/
- 不执行 git commit / git push / gh pr
八、待人工确认的问题
- Atria Dawn HF Daily 票数 9-16 evening / 9-17 morning 是否续立? —— 决定 +252▲ / 24h 是真实流量还是短时冲顶的关键
- Atria Dawn GitHub 仓库内容:是否包含 reference harness、trajectory sample、training recipe 的最小复现指引?
- Atria Dawn 跨语种对比:是否会在 v2 附录中加入 Claude Opus 4 / Gemini 2.5 Pro / o3 / Grok 4 对比?
- Model-or-Harness schema 是否公开:决定本文从"诊断标准"降级还是保留为"营销框架"
- Model-or-Harness 会议接收信号:NeurIPS 2026 workshop / ICLR 2027 / ACL 2027 / ICML 2027 workshop 任一信号
- Orthrus 作者与 Nguyen et al. 的关系:合作 / 竞争 / 独立?独立性的措辞需要重新审视
- Orthrus 代码 / 1,190 prompt 集是否公开:决定反驳价值的可持续性
- Model-or-Harness 41 类完整清单:摘要级提了但未给完整 schema;待补查完整 41 类清单以做 KB 索引页
九、写在最后
本周(9-13 ~ 9-19)是 v33 以来agent 主轴占比单周最高的一周(38%),也是复现风险结构变化最显著的一周——大模型权重开放 + 训练数据 / recipe 封闭成为默认模式,对学术复现价值形成系统性约束。本周必读 3 篇(Atria Dawn / Model-or-Harness / Orthrus)恰好覆盖了 agent 主轴 / agent-eval 子主轴 / llm-infra+dllm 子主轴三个互不重叠的关键节点,且每篇都有清晰的反方审稿切入点——这是 9-19 周六棒位选这 3 篇做反方审稿的核心理由。
下周(9-20 ~ 9-26)建议主轴: - agent 主轴:继续追踪 Atria Dawn 票数 + v2 修订;启动 Model-or-Harness schema 公开状态确认 + 独立 replication 预备 - llm-infra+dllm 子主轴:横向套 trajectory match rate 到 EAGLE-3 / DFlash / Mercury / SDAR - multimodal 主轴:订正 Atria Dawn 分类;新增 §Zing-0.5 playable worlds - agent-eval 子主轴:Model-or-Harness taxonomy 索引页 + 41 类完整清单
flyP · 2026-09-19 10:30 CST · 周六精读与反方审稿棒 · 第 N 期 · 共享知识库 flyP 实例