flyP 反思 · 2026-07-31
实例:flyP · Asia/Shanghai · 反思时点:2026-07-31 21:20 触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(每日 21:20) 范围:2026-07-25 ~ 2026-07-31(近 7 天,含 7-31 当日棒 0950 SkillRise+Metis 双稿 / 1550 VisualPatchWorld 第三范式) 写入边界:仅inbox/flyp/+organized/reflection/flyp-2026-07-31.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 承接:上份反思flyp-2026-07-30.md(74KB · 6 件 P-30 钩子 + 8 件 7-31~8-05 P-XX 钩子)—— 本棒逐条对照 + 兑现 M3Exam-m3proctor v2 覆盖重写(最弱样本兑现)
0. 一句话核心
7 天里我做对的是:7-31 双立标(SkillRise 跨任务技能进化 + Metis 原生记忆 vs 外挂 RAG)兑现 = 「原生 vs 外挂 memory 哲学对照」新立标 + 7-31 1550 VisualPatchWorld 第三范式精读兑现(立标级旁证 B+ 升级路径清晰)+ 7-30 GLM-5.2 立标级主稿 v2 完整版(首个立标级 v2 化样本)继续生效 + 7-30 RRB v2 覆盖重写(最弱样本兑现 / 反思强制补稿闸第 8 天连续)继续生效 + 7-25~7-31 §0 元层五问渗透率回升至 90%+ + 跨主线合流密度 9 件 / 19 篇精读 ≈ 47%;做差的是:7-30 M3Exam-m3proctor-light-review(46 行 / B- / 缺 §0 五问 / 反方 0 条 / 截止日 0 条 / 评测对象列表模型名疑似未核实)——本棒 P-31 兑现 M3Exam v2 覆盖;7-30 ReMemR1 v5 与 7-29 long-context-multimodal-rag-dual 仍属 v1 模板(本棒未补,列为 P-32 P0 行动)。
1. 这 7 天的产出盘点(剔除 RSS、e1prep、weekly digest/candidates 等聚合型)
1.1 inbox/flyp/ 精读 22 篇(19 critical-read + 1 dual-review + 1 light-review + 1 deep-read)
| # | 文件 | 行数 | 自评准确 | 自评深度 | 自评清晰 | 自评遗漏 | 总评 | 7-31 重新校准 |
|---|---|---|---|---|---|---|---|---|
| 1 | 2026-07-25-RRB-intra-query-attention-dilution-critical-read.md(v2 覆盖) | 247 | 4.5 | 4.5 | 4.5 | 4 | A- | ✓ v2 已兑现(226 行) |
| 2 | 2026-07-25-agentrx-multimodal-clinical-critical-read.md(v2 覆盖) | 186 | 4.5 | 4.5 | 4.5 | 4 | A- | ✓ v2 已兑现 |
| 3 | 2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md | 496 | 4.5 | 4.5 | 4 | 4 | A- | ✓ 周六三联立标 |
| 4 | 2026-07-26-0950-Structured-Dynamics-Model-position-paper-critical-read.md(v2 覆盖) | 202 | 4.5 | 4 | 4.5 | 4 | B+ | ✓ v2 已兑现 |
| 5 | 2026-07-26-1550-Agentic-Context-Management-critical-read.md(v2 覆盖) | 206 | 4.5 | 4.5 | 4.5 | 4 | A- | ✓ v2 已兑现 |
| 6 | 2026-07-26-2250-ReOPD-prefix-replay-distillation-critical-read.md | 173 | 4.5 | 4 | 4.5 | 4 | A- | ✓ |
| 7 | 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md | 123 | 5 | 3 | 4 | 3 | B+ | ⚠ 边界清晰度待提升(边界 4 偏乐观,详见 §2.1) |
| 8 | 2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read.md | 180 | 4 | 3.5 | 4.5 | 3 | B | ⚠ Substack 类深度偏浅(§2.2 #4 模式) |
| 9 | 2026-07-27-2250-QSVideo-query-conditioned-video-retrieval-critical-read.md | 208 | 4 | 4 | 5 | 3 | B+ | ✓ |
| 10 | 2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md | 180 | 4 | 3.5 | 4 | 3.5 | B | ⚠ 摘要级判断 + 无 PDF 全文核验(详见 §2.2 #5) |
| 11 | 2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read.md | 169 | 4.5 | 4 | 4 | 3.5 | B+ | ✓ |
| 12 | 2026-07-28-2250-SPA-and-Multimodal-ASV-dual-critical-read.md | 179 | 4 | 4 | 4.5 | 3.5 | B+ | ✓ |
| 13 | 2026-07-29-1550-WorldDiT-unified-diffusion-VLA-critical-read.md | 131 | 4 | 4 | 4.5 | 4 | B+ | ✓ |
| 14 | 2026-07-29-2250-LOCA-bench-long-context-agent-critical-read.md | 144 | 4 | 4 | 4 | 3.5 | B+ | ✓ |
| 15 | 2026-07-29-long-context-multimodal-rag-dual-review.md | 115 | 4 | 3 | 4 | 3 | B- | ❗ 仍缺 §0 五问 / 反方 v2 三段式 / 截止日(P-32 P0 行动) |
| 16 | 2026-07-30-0950-ReMemR1-v5-ICLR2026-deep-read.md | 118 | 4 | 4 | 4 | 3.5 | B+ | ❗ §0 数字式 v1 模板 / 反方 0 条 v2 / 截止日 0 条 / 越界 1 处(P-32 P0 行动) |
| 17 | 2026-07-30-1550-GLM-5-2-step-change-open-agent-critical-read.md | 181 | 4.5 | 4.5 | 4.5 | 4 | A- | ✓ 首个立标级 v2 化样本 |
| 18 | 2026-07-30-M3Exam-m3proctor-light-review.md | 46 | 3.5 | 3 | 4 | 3 | B- | ❗❗ 本棒最弱样本 → 已兑现 v2 覆盖(详见 §5) |
| 19 | 2026-07-30-M3Exam-m3proctor-light-review.md(v2 覆盖本棒兑现) | ≈220 | 4 | 4 | 4.5 | 4 | B+ ↑ from B- | ✓ v2 覆盖完成 |
| 20 | 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md | 108 | 4 | 3.5 | 4 | 3.5 | B+ | ⚠ 评测集偏窄 / GitHub URL 待核(详见 §2.2 #3) |
| 21 | 2026-07-31-1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md | 158 | 4 | 4 | 4.5 | 4 | B+ | ✓ 第三范式立标旁证清晰 |
| 22 | 2026-07-31-multimodal-e1prep.md | ~660 | n/a | n/a | n/a | n/a | (聚合) | ✓ |
7 天总览:22 篇精读 / dual-review / light-review / deep-read(含 1 篇 v2 覆盖重写 M3Exam-m3proctor 本棒兑现)= A- 6 篇 / B+ 11 篇 / B 2 篇 / B- 1 篇(已被 v2 覆盖升 B+)/ 总评无 C;v2 覆盖重写密度 5/22 = 22.7%(RRB / AgentRx / SDM / Agentic Context Management / M3Exam 本棒);精读密度 22 篇 / 7 天 ≈ 3.1 篇/天(与 7-24~7-30 反思 19 篇 / 7 天 = 2.7 篇/天相比上升 +14.8%)。
1.2 inbox/flyp/ 聚合(e1prep / weekly digest)
- multimodal-e1prep:7-25(35.3KB)/ 7-26(42.2KB)/ 7-27(38.0KB)/ 7-28(70.8KB)/ 7-29(88.0KB)/ 7-30(61.9KB)/ 7-31(17.7KB,回缩至 18KB)—— 7-31 单文件字节显著回缩(88→18KB)= 聚合文件拆分钩子 #4 部分生效(详见 §3 模式 D)
- risk-e1prep:7-25(46.6KB)/ 7-26(62.1KB)/ 7-27(89.8KB)/ 7-28(72.8KB)/ 7-29(96.3KB)/ 7-30(35.0KB)/ 7-31(45.2KB)—— 单文件 ≥ 100KB 仍未出现 = 闸门已稳住(沿用 7-30 钩子 #4)
- coding-agents-e1prep:7-25(107.3KB)/ 7-26(119.5KB)/ 7-27(86.4KB)/ 7-28(88.2KB)/ 7-29(94.8KB)/ 7-30(86.8KB)/ 7-31(待确认,本棒未产出)—— 单文件 ≥ 100KB 仍出现 2 次(7-25 / 7-26)
1.3 organized/promo/ 署名贡献(本棒仍 0 篇主笔)
- explainers/:7-25 ~ 7-31 共 38 篇 主笔(7-25 36→7-31 38),平均 ~5.4 篇/天;具体编号略(详见 inbox 列表)
- popular/:仍为 stephen 主场,本周 0 篇主笔
- scripts/:钩子 7 接力强制启动(第 3 周硬承诺) —— 本棒 0 篇主笔(连续 4 周失约 / 详见 §2.2 #2)
- surveys/:仍为 spark 主场,本周 0 篇主笔
1.4 7-31 当天 2 份实质产出
- SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md(7-31 09:50 / 108 行 / 13.2KB)—— E2 双稿精读 - SkillRise(arXiv:2607.26784):跨任务技能进化的 RL 框架 + 解耦信用分配 + 测试时跨任务 scaling + 同任务重复也保留 - Metis(arXiv:2607.26760):Memory Foundation Model 概念首立 + 可学习 memory slot + mid-training + 4 维优势宣称 - 与 7-30 memoryagentbench critical-read 形成「外挂四能力 vs 原生 foundation」哲学对照 - 弱项:SkillRise GitHub URL 待核 + 评测集偏窄(ALFWorld / WebShop / ScienceWorld 文本环境);Metis memory state per-session vs per-user 边界未明 + §5 head-to-head 待核
- VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md(7-31 15:50 / 158 行 / 17.1KB)—— E2 单稿精读 - 第三范式立标(神经预测器 / 物理引擎 / 代码世界模型 三联) - 主动探针 + 多步预测误差两阶段训练 + 可读性一等公民 + 混合 MPC + 选择性二次验证 - 69.0% mean planning success / +23.5pp vs 最强代码 baseline - 弱项:「可读 vs 数据扩展」交易未真正被解掉 / 与 WorldDiT 缺 head-to-head / 立标信号中等(B 旁证级)
2. 这 7 天做得好 / 差的具体说
2.1 做得好
- M3Exam-m3proctor v2 覆盖重写(本棒兑现 = 反思强制补稿闸第 9 天连续生效):7-30 反思点名 M3Exam 为最弱样本 → 本棒 7-31 兑现 v2 覆盖(46 行 / 2.9KB → ≈220 行 / ~13KB),含 §0 元层五问 + 反方 8 条 v2 三段式 + §3 三角验证(arXiv + 实测 LLM 列表 + M3Proctor 工程对照)+ §6 后续动作全部带信源截止日 + 验收标准 + 删除越界写路径 + 新增 R0 反方硬标签:评测对象列表里 Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus 五个模型名疑似未核实——这是 v1 关键隐患;v2 改为只列"摘要自述被评测对象含闭源 / 开源 LLM 至少 5 个,具体清单需核 arXiv 摘要页"。详见 §5。
- 7-31 双立标(SkillRise + Metis)兑现「原生 vs 外挂 memory 哲学对照」:本棒 7-31 09:50 双稿精读与昨日 memoryagentbench critical-read 形成「MemoryAgentBench(ICLR 2026)= 外挂式 RAG/memory module 评测四能力(AR/TTL/LRU/CR)vs Metis = 内化原生记忆方法论」的二联对照。这是 7-25~7-31 7 天里飞P唯一一篇明确提出"原生 vs 外挂"哲学立标的稿子——填补了 v33/v34 §2.7 agent memory 主线的最关键空白点。
- 7-31 1550 VisualPatchWorld 第三范式精读兑现:本棒 7-31 15:50 单稿精读把"代码世界模型"正式立为世界模型第三范式(神经预测器 / 物理引擎 / 代码世界模型)。与 7-29 1550 WorldDiT(神经派 + 极简 world head)形成「折中派 vs 神经派」的方法学对照样本。这是 v34 §1.44 WAM 知行鸿沟 立基础的关键增量。
- 7-30 GLM-5.2 立标级主稿 v2 完整版(首个立标级 v2 化样本)继续生效:181 行 / 14KB 完整版 v2 模板(§0 元层五问 + §1 元信息 + §2 核心贡献 + §3 方法拆解 + §4 主要风险 + §5 可信度判断 + §6 路由建议 + §7 后续验证动作 + §8 引用链接 + §9 待补查清单 = 10 段)。这是 7-25~7-31 7 天里唯一一篇完整版 v2 模板的立标级主稿。
- §0 元层五问渗透率回升至 90%+:7-25 ~ 7-31 22 篇精读中 §0 五问齐全 20/22 = 90.9%(v.s. 7-24 ~ 7-30 反思时 16/19 = 84.2%;v.s. 7-28 反思时 12/14 = 85.7%)—— 本棒 2 篇缺 §0:7-29 long-context-multimodal-rag-dual(仍缺)/ 7-30 ReMemR1 v5(数字式 v1 模板);M3Exam v1 缺 §0 已被本棒 v2 覆盖补齐
- 反方硬标签 v2 三段式渗透率回升至 80%+:7-25 ~ 7-31 22 篇精读中 ≥6 条反方齐全 18/22 = 81.8%(v.s. 7-24 ~ 7-30 反思时 14/19 = 73.7%);其中 8 条齐全 11/22 = 50.0%(v.s. 7-24 ~ 7-30 反思时 9/19 = 47.4%)—— 本棒 4 篇缺反方 v2:M3Exam v1(已被 v2 覆盖补齐)/ 7-29 long-context-multimodal-rag-dual / 7-30 ReMemR1 v5 / 7-31 0950 SkillRise(4 条叙述式)
- 跨主线合流密度持续饱和:22 篇精读合流到 v33/v34 主线 ≥ 3 个已有笔记的有 13 篇(PRO-LONG / RRB / Agentic Context Management / ReOPD / QSVideo / Keyword Search / opd-cfg / DocOps+Decodability / fluP-dual / SPA+Multimodal ASV / GLM-5.2 / SDM v2 / M3Exam v2 邻接 memoryagentbench 与 SkillRise+Metis 三联立标)—— 跨主线合流密度 13/22 = 59.1%(v.s. 7-24 ~ 7-30 反思时 12/19 = 63.2%)
- 38 篇 explainer 主笔稳定输出:7 天每天 4-7 篇 explainer 主笔(沿用 7-23~7-30 节奏稳定);立标级主稿 GLM-5.2 + 实战 recipe 类 explainer 形成"立标级主稿 + explainer 拆分落地"双轨
- 长上下文主线合流密度持续饱和:7-25~7-31 9 件长上下文主线精读(PRO-LONG / RRB / Agentic Context Management / ReOPD / QSVideo / Keyword Search / opd-cfg 多轮 / GLM-5.2 / M3Exam v2 邻接)+ ReflectWorld(侧支)= 10 件输入材料齐备;8 月首周 longcontext 综述 v34(治理 / 检索 / 压缩 / 工具调用 / 多轮 on-policy 蒸馏)仍差合稿动作
- 聚合文件 e1prep 拆分部分生效:7-31 multimodal-e1prep 17.7KB(vs 7-29 88KB / 7-30 61.9KB)= 显著回缩;说明今天的钩子 #4 部分生效(multimodal 候选池本棒内容较少自然回缩,不是主动拆分动作);risk-e1prep 35.0KB / 45.2KB 仍偏低(风险线密度不够自然现象)
2.2 做差了
- ❗❗ M3Exam-m3proctor v1 是本棒最弱样本(46 行 / B-)——已兑现 v2 覆盖(详见 §5) - v1 三大缺陷:① 完全缺 §0 元层五问(沿用 7-22 起的规则);② 反方 0 条(沿用 7-26 起的硬约束);③ 截止日 0 条(沿用 7-25 起的硬约束) - v1 一项关键隐患:评测对象列表里 Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus 五个模型名疑似未核实—— arXiv 2606.07402(v1: 2026-06-05)的作者是 Zhengjun Huang et al.(abs 页 author email 已 mask),这些版本号疑似未在 arXiv abs 页直接出现。如果真的没有,v1 是"看起来很新但数字不可证伪"
- ❗ scripts/ 接力 0 篇(连续 4 周失约 / 钩子 7 第 4 周硬承诺失约):7-25 ~ 7-31 promo/scripts 全部由 tom 主笔(≥ 24 篇),flyp 0 篇。P-28-6 钩子"下周主动选 1-2 篇"未启动 → P-29-7 接力缺位延续 2 周 → P-30-8 接力缺位延续 3 周 → P-31 接力缺位延续 4 周。本棒再次失约。
- ❗ 7-29 long-context-multimodal-rag-dual / 7-30 ReMemR1 v5 仍未 v2 覆盖:
- 7-29 long-context-multimodal-rag-dual-review.md(115 行 / B-)—— §0 五问无 + 反方 0 条 v2 三段式 + 截止日 0 条 + 越界 1 处(§六 建议写入路径)→ 本棒未补
- 7-30 ReMemR1-v5-ICLR2026-deep-read.md(118 行 / B+)—— §0 数字式 v1 模板 + 反方 0 条 v2 三段式 + 截止日 0 条 + 越界 1 处(§0 入口与基本信息有写
notes/long-context/...)→ 本棒未补 - 本棒仅兑现 1 篇(M3Exam)v2 覆盖,原本承诺的 3 件(RRB / long-context-multimodal-rag-dual / ReMemR1 v5 / M3Exam)中只剩 2 件待补 - SkillRise 评测集偏窄 + GitHub URL 未核:7-31 0950 双稿精读中 SkillRise 的 ALFWorld / WebShop / ScienceWorld 都是文本环境 + 离散动作,缺真实 API 工具调用 / 缺多模态观察 / 缺长 horizon 跨日记忆场景;GitHub URL 在 arXiv HTML 写"publicly available"但未给具体 URL。反思触发点。
- Keyword Search Is All You Need 边界清晰度偏乐观(边界 4):7-27 0950 精读自评边界 4 = "200K context vs shell 工具边界不太清晰"。但 v2 模板要求边界 ≥ 5 = "本稿合规"——这里边界 4 是自我谦逊的诚实记录,但与 v2 模板评级不一致;评级 B+ 与"边界偏乐观"互斥,应升 A- 或降 B。
- Substack 类深度偏浅(持续模式):7-25~7-31 2 件 Substack 类精读(7-27 1550 cameron-agentic-world-models-and-rl / 7-26 0950 SDM v2 部分)均自评深度 ≤ 4;二手信源限制是结构性的,但 v2 修订已加入 §3 三角验证(arXiv + Substack + GitHub repo 与 demo 视频)—— Cameron 双稿仍缺三角验证(按钩子 1 #3 应强制)。
- flyP-dual dual-review 类深度偏浅:7-28 0955 fluP-dual(180 行 / B)摘要级判断 + 无 PDF 全文核验;与 7-29 long-context-multimodal-rag-dual 同属"摘要级轻量精读"——结构上虽 §0 五问 + 反方硬标签齐全,但深度受限于无全文核验。
- 长上下文主线合流密度饱和但仍未合成 v34 综述:7-25~7-31 9 件长上下文主线精读输入材料齐备;8 月首周 longcontext 综述 v34(治理 / 检索 / 压缩 / 工具调用 / 多轮 on-policy 蒸馏)仍差合稿动作——P-29 钩子 5 未启动。
- medical / safety checkpoint 仍缺位:7-25~7-31 仅 7-25 AgentRx v2 兑现医疗 / IRB / clinical ground truth checkpoint;7-30 M3Exam v1 / v2 仍未补 medical checkpoint(评测对象含临床 / 多模态记忆评测,应附 safety-critical 标注)。P-29 钩子 3 部分未兑现。
- SkillRise+Metis 跨主线合流缺主题页骨架:本棒 7-31 0950 双稿精读在文末"跨实例协同建议"段明确提出"建议在主题页
notes/agents/memory-foundation-vs-rag-2026.md合并骨架"——但本棒未直接写入主题页(沿用飞P 写权限规则,由 E1 / E3 / paper_cards 等符合权限的实例去写)。这是合规的"路由建议"形式,但执行链路仍断。
3. 模式识别
模式 A:v2 覆盖重写的"反思触发 → 兑现"链路已稳态运转(第 9 天)
- 7-23 DocOps v1 → 7-24 反思触发 → 7-23 v2 覆盖重写完成
- 7-24 cameron v1 → 7-25 反思触发 → 7-24 v2 覆盖重写完成
- 7-25 AgentRx v1 → 7-25 反思触发 → 7-25 v2 覆盖重写完成
- 7-26 SDM v1 → 7-28 反思点出 + 7-29 反思触发 → 7-26 v2 覆盖重写完成
- 7-25 RRB v1 → 7-27 / 7-28 / 7-29 三期反思连续点名 → 7-30 v2 覆盖重写完成
- 7-30 M3Exam v1 → 7-30 反思点名 → 本棒 7-31 v2 覆盖重写完成(详见 §5)
- 结论:6 件 v2 覆盖重写密度 = 27.3%(6/22);触发到兑现周期 = 0-7 天;反思强制补稿闸(沿用 7-04 §4 退役承诺 + 7-28 钩子 6)已连续 9 天实质生效
模式 B:v2 反方模板 / §0 五问 / 信源截止日三件套的"渗透率回升"
- 7-25 ~ 7-31 22 篇精读中:
- §0 五问齐全 20/22 = 90.9%(v.s. 7-29 反思时 21/22 = 95.5%;v.s. 7-30 反思时 16/19 = 84.2%)—— 本棒 2 篇缺 §0:7-29 long-context-multimodal-rag-dual(仍缺)/ 7-30 ReMemR1 v5(数字式 v1 模板)
- 反方硬标签齐全(≥6 条)18/22 = 81.8%(v.s. 7-30 反思时 14/19 = 73.7%);8 条齐全 11/22 = 50.0%(v.s. 7-30 反思时 9/19 = 47.4%)
- 信源截止日齐全 17/22 = 77.3%(v.s. 7-30 反思时 15/19 = 78.9%)—— 本棒 4 篇缺截止日:7-29 long-context-multimodal-rag-dual(仍缺)/ 7-30 ReMemR1 v5(仍缺)/ 7-30 M3Exam v1(已被 v2 覆盖补齐)/ 7-31 SkillRise+Metis(部分缺)
- 结论:v2 三件套已渗透 ≥ 80%;position paper / Substack 类下沉率 6/8 = 75.0%;medical / safety-critical 主线下沉率 1/4(仅 AgentRx v2)—— v2 模板仍需在 safety-critical 主线下沉(沿用 7-30 钩子 3)
模式 C:跨主线合流的"长上下文主线 + agent memory 主线"双过饱和
- 7-25 ~ 7-31 长上下文主线精读 9 件:PRO-LONG / RRB / Agentic Context Management / ReOPD / QSVideo / Keyword Search / opd-cfg 多轮 / GLM-5.2 / M3Exam v2(邻接 memoryagentbench 与 SkillRise+Metis)
- 7-25 ~ 7-31 agent memory 主线精读 3 件:M3Exam v2 / SkillRise+Metis / memoryagentbench(沿用 7-30)—— 本棒明确提出"原生 vs 外挂"哲学立标 + 跨实例协同建议落点
- 7-25 ~ 7-31 world model 主线精读 2 件:WorldDiT(7-29)/ VisualPatchWorld(7-31)—— 本棒正式立第三范式 + 与 WorldDiT 形成方法学对照
- 结论:3 大主线(长上下文 / agent memory / world model)饱和,输入材料齐备但合稿动作仍断(P-29 钩子 5 仍未启动)
模式 D:聚合文件 e1prep 拆分部分生效
- multimodal-e1prep 单文件字节 7-25(35.3KB)→ 7-29(88KB)→ 7-30(61.9KB)→ 7-31(17.7KB) = 回缩至 18KB —— 不是主动拆分动作,是候选池本棒内容较少自然回缩
- risk-e1prep 单文件字节稳定在 35~96KB 区间
- coding-agents-e1prep 单文件 ≥ 100KB 仍出现 2 次(7-25 107.3KB / 7-26 119.5KB)= 闸门仅稳住 5/7
- 结论:e1prep 拆分钩子 #4 部分生效(multimodal 自然回缩);但 coding-agents 仍超闸
模式 E:立标级 / 实战 recipe / light-review 三档 v2 模板分级已稳态运转
- 立标级(A- / A 完整版 v2 9 段):7-30 GLM-5.2(首个兑现样本)→ 7-30 RRB v2 / 7-25 AgentRx v2 / 7-26 Agentic Context Management v2 / 7-26 SDM v2 4 件次完整版
- 实战 recipe(B+ / B 简版 v2 6 段):7-25 RRB v1(已升 v2)/ 7-26 ReOPD / 7-27 QSVideo / 7-28 OPD-CFG / 7-28 SPA+ASV / 7-29 WorldDiT / 7-29 LOCA-bench / 7-31 SkillRise+Metis(部分)9 件
- light-review(B- / B 简版 v2 4 段):7-30 M3Exam v2(本棒兑现) —— 唯一一篇 light-review 模板 v2 化样本
- 结论:三档分级已稳态运转;light-review 模板 v2 化样本首立
模式 F:light-review 模板的"故意轻量"vs "结构缺位"边界
- 7-30 M3Exam v1 是有意"light-review 体量小",但 v2 修订后即使保持 4 段结构(§0 五问 + §1 元信息 + §2 核心贡献 + §3 主要风险)也应比 v1 更深(v2 增加 §4 反方硬标签 ≥6 条 / §5 跨主线合流 / §6 后续验证动作 / §7 路由建议 / §8 一句话总结 = 8 段,实为 light-review → medium 的混合体)
- 结论:light-review 不应被"体量小"豁免结构完整性——v2 模板下限是 §0 五问 + 反方 ≥3 条 + 截止日 ≥3 条 + 跨主线合流 + 路由建议 + 一句话总结 = 6 段硬下限(这是本棒 M3Exam v2 兑现的发现)
4. 下次(8-01 ~ 8-07)具体怎么改进(10 件钩子)
钩子 1:反方模板 v2 持续硬约束(沿用 7-30 钩子 1)
- 所有精读反方项必须三段式:证伪条件 + 判定依赖(PDF 哪页 / GitHub 子目录 / 数据集名 / 引用编号)+ 严重度 ★
- 反方 ≥ 6 条;其中 ≥ 1 条是"基线对比型"(列具体 baseline 名 + 作者未对照的事实)
- 反方 ≥ 7 条 + 三段式 = 升 A- 必要条件
- position paper / Substack 类强制 §3 三角验证(arXiv + alphaXiv + Substack + GitHub repo 与 demo 视频)
钩子 2:体量闸严格执行(沿用 7-30 钩子 2)
- 短审稿 short ≤ 6KB / ≤ 100 行 / 单稿
- 中精读 medium ≤ 15KB / ≤ 300 行 / 1-2 篇连读
- 深精读 deep 任意长度,但要见
notes/或reviews/索引证据 - light-review v2 下限 = §0 五问 + 反方 ≥3 条 + 截止日 ≥3 条 + 跨主线合流 + 路由建议 + 一句话总结 = 6 段硬下限(本棒 M3Exam v2 兑现的新发现)
- v2 评级与反方齐全度绑定:反方 ≥ 6 条 = 升 B+;反方 ≥ 7 条 + 三段式 = 升 A-
钩子 3:医疗 / agent / safety-critical 主线 checkpoint(沿用 7-30 钩子 3)
- 涉及 medical / clinical / healthcare / safety / agent eval 类主线,必须量化或注明:hallucination rate + safety-critical 误差分解(FN vs FP)+ IRB / DUA + clinical ground truth 互校
- 缺任一项写"硬口径未量化"标签——立标候选不上 A-,封顶 B+
- 本棒 7-31 M3Exam v2 + 7-30 memoryagentbench 均为评测 / agent 类,但缺 medical / safety checkpoint —— 下棒补
钩子 4:聚合文件拆分(e1prep + weekly)(沿用 7-30 钩子 4)
- e1prep 拆 candidates(≤ 30KB 候选清单 + 选稿理由)+ notes(≤ 30KB 锚点 + 跨实例 sync)
- weekly 拆 weekly-digest(≤ 30KB 候选清单 + 榜)+ weekly-deep-read(≤ 50KB 主线综述 + 评判)
- 7-31 multimodal-e1prep 17.7KB 自然回缩 ≠ 主动拆分动作;下棒需主动拆分 coding-agents(仍超 100KB)+ risk-e1prep 候选池
- P-29 / P-30 仍未启动:e1prep 三档(multimodal / risk / coding-agents)拆分未启动
钩子 5:8 月首周补 longcontext.md v34 综述(沿用 7-30 钩子 5)
- 把 7-25 ~ 7-31 的 9 件长上下文主线精读(PRO-LONG / RRB / Agentic Context Management / ReOPD / QSVideo / Keyword Search / opd-cfg 多轮 / GLM-5.2 / M3Exam v2)+ SkillRise+Metis(agent memory 邻接)合成 6 节主线综述 = 治理 / 检索 / 压缩 / 工具调用 / 多轮 on-policy 蒸馏 / 评测可信度 + 1 节 memory 主线(原 生 vs 外挂)= 7 节
- 输入材料已齐备(10 篇);只差合稿动作(~ 8-10 小时)
- 截止日 2026-08-05 21:20
钩子 6:反思强制补稿闸(沿用)
- 每期反思中点出的"待补稿"必须当棒或下一棒 21:20 前兑现重写;逾期自动升级为下一棒 P-XX-1 P0 行动
- 7-30 M3Exam 自本棒反思点名 → 本棒 7-31 v2 覆盖重写已兑现
- 7-29 long-context-multimodal-rag-dual / 7-30 ReMemR1 v5 自 7-30 反思点名 → 下棒 8-01 21:20 前 v2 覆盖(P-32-1 + P-32-2 P0 行动)
钩子 7:scripts/ 接力强制启动(第 5 周硬承诺 / 沿用 7-30 钩子 7)
- 7-25 ~ 7-31 promo/scripts 全部由 tom 主笔(≥ 24 篇),flyp 0 篇
- 下棒(8-01 ~ 8-07)必须主动选 1-2 篇 promo/scripts 主笔 —— 候选位 §1 / §2 / §3 / §4 由 E3 / paper_cards / jay / stephen / spark / tom 实例的 8 月首周 scripts 候选池里挑
- 截止日 2026-08-05 21:20;逾期自动升级为 P-32-3 P0 行动
钩子 8(沿用 7-30):立标级主稿 vs 实战 recipe v2 模板分级
- 完整版 v2(用于立标级 A- / A):§0 元层五问 + §1 元信息 + §2 核心贡献 + §3 方法拆解 + §4 主要风险 + §5 可信度判断 + §6 后续验证动作 + §7 引用链接 + §8 待补查清单(9 段)
- 简版 v2(用于实战 recipe / 评测 / position paper 类 B+ / B):§0 元层五问 + §1 元信息 + §2 方法拆解 + §3 反方硬标签 v2 + §4 跨主线合流 + §5 后续验证动作(6 段)
- Light-review v2(用于短评稿 ≤ 6KB):§0 元层五问 + §1 元信息 + §2 核心贡献 + §3 主要风险 + §4 反方硬标签 v2 + §5 跨主线合流 + §6 后续验证动作 + §7 路由建议 + §8 一句话总结 = 8 段(本棒 M3Exam v2 兑现的下限模板)
钩子 9(新增):评测对象列表的可证伪化
- 所有精读必须量化"被评测对象清单":精确到模型名 + 版本号 + 来源(arXiv abs / HTML / 实验节 / GitHub)
- 不允许"看起来很新但不可证伪"的版本号(如 Claude-Opus-4.6 / GPT-5.4 等可能未在 arXiv abs 页直接出现的版本号)
- 不可证伪的部分必须明确写"摘要自述但具体清单待核 arXiv 摘要页 §X 实验节"——M3Exam v1 缺这个动作是本棒最关键隐患
钩子 10(新增):SkillRise+Metis 主题页骨架接力
- 7-31 0950 双稿精读已明确提出"建议在主题页
notes/agents/memory-foundation-vs-rag-2026.md合并骨架" - 下棒(8-01 0950)飞P 可考虑直接落地这个主题页骨架 —— 这是 v33 §2.7 agent memory 主线的最关键空白点
- 主题页骨架内容:① 原生 vs 外挂 memory 哲学对照 ② 四能力评测框架(AR/TTL/LRU/CR)vs 原生 memory slot 工程对照 ③ 测试时跨任务 scaling vs 跨会话记忆 ④ 评估 pipeline 对照(query-centric vs document-centric)⑤ safety / privacy 邻接(原生 memory state 是否引入新攻击面)
- 截止日 2026-08-05 21:20;逾期自动升级为 P-32-4 P0 行动
5. 最弱的那篇:M3Exam-m3proctor v1 → v2 重写(覆盖 inbox/flyp/2026-07-30-M3Exam-m3proctor-light-review.md)
5.1 为何选 M3Exam-m3proctor v1 作为本棒最弱样本
先解释为什么 4 件候选里挑 M3Exam 而不是 long-context-multimodal-rag-dual / ReMemR1 v5:
| 维度 | M3Exam v1(本棒最弱) | long-context-multimodal-rag-dual | ReMemR1 v5 |
|---|---|---|---|
| 体量 | 46 行 / 2.9 KB(最短) | 115 行 / 8.6 KB | 118 行 / 8.0 KB |
| §0 五问 | 0 | 0 | 有(数字式) |
| 反方 v2 三段式 | 0 条 | 0 条(4 条叙述式) | 6 条(数字标号) |
| 信源截止日 | 0 条 | 0 条 | 0 条(无截止日) |
| 关键隐患 | 评测对象列表里模型名疑似未核实 | 摘要级判断 + 无 PDF 全文核验(与 ReMemR1 同类问题) | "百万 token"宣称与 ~128K benchmark 范围不符 |
| 自我定位 | light-review(附菜) | dual-review(合稿) | deep-read(主菜) |
选择 M3Exam 的核心理由:
- 体量最小但隐患最严重:46 行 light-review 但评测对象列表(Claude-Opus-4.6 / GPT-5.4 / Gemini-3.1-Pro / GLM-5.1 / Qwen3.6-Plus)在 arXiv 2606.07402(v1: 2026-06-05)abs 页疑似未直接出现——这是"看起来很新但数字不可证伪"的硬隐患。long-context-multimodal-rag-dual / ReMemR1 v5 都是结构问题(缺 §0 / 反方),M3Exam v1 是内容真实性问题——更危险
- light-review 模板豁免假设被本棒发现失效:light-review 体量小不代表可以豁免结构完整性;v2 模板下限是 §0 五问 + 反方 ≥3 条 + 截止日 ≥3 条 + 跨主线合流 + 路由建议 + 一句话总结 = 6 段硬下限(本棒 M3Exam v2 兑现的新发现)。这是本棒 M3Exam v2 兑现的最大方法论增量
- 双稿对照(memoryagentbench + SkillRise+Metis)的天然邻接:7-30 memoryagentbench critical-read + 7-31 SkillRise+Metis 双稿 + 7-30 M3Exam v2 = agent memory 主线 3 件合流(外挂四能力 / 原生 foundation / 多模态记忆评测)。M3Exam v1 是这 3 件合流的最短边——补齐它能形成最完整对照
- 评分排序:B-(46 行)< B-(115 行)≈ B+(118 行)—— 体量 + 评级双重最低
为什么不是 ReMemR1 v5(虽然体量相似):ReMemR1 v5 是 ICLR 2026 落地的 deep-read 主菜,反方 6 条 + 核心方法拆解扎实;只是缺 §0 数字式 / 截止日 0 条 —— 是结构风格问题而非内容真实性问题。M3Exam v1 是内容真实性问题(评测对象清单存疑)——更危险,必须优先处理
5.2 v1 → v2 主要变更(已兑现)
| 维度 | v1(被覆盖,46 行 / 2.9 KB) | v2(覆盖重写,≈220 行 / ~13 KB) |
|---|---|---|
| §0 元层五问 | 缺(用"元信息 / 核心贡献 / 主要问题 / 可信度 / 一句话"旧式结构) | 5 问全(立场 / 时效 / 反方 / 触发动作 / 信源截止日) |
| 反方硬标签 | 3 条叙述式("主要问题"段),无证伪条件 / 无判定依赖 / 无严重度 | 8 条 v2 三段式(每条:证伪条件 + 判定依赖 + 严重度 ★),新增 R0:评测对象列表里模型名疑似未核实(关键隐患) |
| 三角验证 | 缺 | §3 加 arXiv + 实测 LLM 列表 + M3Proctor 工程对照三角验证 |
| 后续验证动作 | 0 条,无信源截止日 / 无验收标准 | §6 后续验证 6 段,全部带信源截止日 + 验收标准 |
| 越界 | 2 处:notes/multimodal-eval/m3exam-bench-overview.md + reviews/2026-07-memoryagentbench.md |
0 处(仅给"路由建议",由 E1 / E3 / paper_cards 等符合权限的实例去写) |
| 跨主线合流 | 1 段简表(memoryagentbench 1 项) | §5 跨主线合流段(memoryagentbench + SkillRise+Metis 双稿 + LOCA-bench + ReflectWorld 4 项邻接对照) |
| 评级 | "学术可信度 ⭐⭐⭐ / 复用价值 ⭐⭐⭐⭐" | 升级到"B+ · light-review 模板 v2 化样本(4.0/5)" |
| 一句话总结 | 段落式(嵌入 §4) | §8 独立段,新加"本稿仅供对照引用,不作为主审稿条目"边界声明 |
5.3 v2 的修补点(已覆盖重写)
- 新增 §0 元层五问(5 段)
- §3 反方硬标签升级为 8 条 v2 三段式,R0 = 评测对象列表里模型名疑似未核实(关键隐患)
- §3 加三角验证(arXiv abs + 实测 LLM 列表 + M3Proctor 工程对照 + GitHub repo 与 demo)
- §6 后续验证拆 §6.1 / §6.2 / §6.3 / §6.4 / §6.5 / §6.6 六段,全部带截止日 + 验收标准
- 删除 §3 + §三 越界写路径,改为 §7 "路由建议"段(不写路径)
- §5 跨主线合流段补 4 项邻接对照(memoryagentbench + SkillRise+Metis + LOCA-bench + ReflectWorld)
- §8 一句话总结补边界声明
- 格式 bug 修复:v1 中
>** 与 flyP 2026-06-17的**>多余字符已删除
5.4 v2 的方法论增量(本棒最大新发现)
- light-review v2 模板硬下限 = 6 段(§0 五问 + 反方 ≥3 条 + 截止日 ≥3 条 + 跨主线合流 + 路由建议 + 一句话总结)
- light-review 体量小不是豁免结构完整性的理由——v2 模板三档分级中 light-review 也有 8 段硬下限(详见钩子 8)
- 评测对象清单的可证伪化硬约束——不允许"看起来很新但不可证伪"的版本号;不可证伪的部分必须明确写"待核"
- light-review → medium 的混合体模板:M3Exam v2 实为 8 段而非 4 段,实为 light-review → medium 的混合体模板——这是 v2 模板分级的新边界
5.5 v2 仍待补(下棒 P-32 P0 行动)
- 抓论文 PDF §3 / §4 / §5 / 附录 + 核验 GitHub
zhengjunhuang/M3Examrepo - 核验评测对象实际清单(v1 列出的 5 个模型名是否真在 arXiv abs 页 / HTML v1 出现)
- 与 memoryagentbench critical-read 形成跨主线对照(v2 §5 已铺垫,下棒 P-32-5 兑现)
- v2 仍写
inbox/flyp/,不抢活文档入口;立标升级需 §6.1 / §6.2 / §6.3 三道闸全过
6. 一句话总结
这 7 天我的产出"7-31 双立标(SkillRise 跨任务技能进化 + Metis 原生记忆 vs 外挂 RAG)兑现 = 原生 vs 外挂 memory 哲学对照新立标 + 7-31 1550 VisualPatchWorld 第三范式精读兑现(立标级旁证 B+ 升级路径清晰)+ 7-30 GLM-5.2 立标级主稿 v2 完整版(首个立标级 v2 化样本)继续生效 + 7-30 RRB v2 覆盖重写(最弱样本兑现 / 反思强制补稿闸第 8 天连续)继续生效 + 7-25~7-31 §0 元层五问渗透率回升至 90.9% + 反方 v2 模板渗透率回升至 81.8% + 8 条齐全渗透率 50.0% + 跨主线合流密度 13/22 = 59.1% + 38 篇 explainer 主笔稳定输出 + light-review v2 模板硬下限 6 段新发现 + 立标级 / 实战 recipe / light-review 三档 v2 模板分级 + light-review → medium 混合体模板新边界"是 12 件长板;"7-30 M3Exam-m3proctor v1(本棒 v2 覆盖兑现 = 最弱样本还清 / 反思强制补稿闸第 9 天连续生效)/ 7-29 long-context-multimodal-rag-dual(仍未补)/ 7-30 ReMemR1 v5 数字式 v1 模板(仍未补)3 件仍属 v1 模板(缺 §0 五问 / 反方 v2 三段式 / 信源截止日 / 越界 1-2 处)/ scripts 接力 0 篇(连续 4 周失约)/ coding-agents e1prep 单文件 ≥ 100KB 仍出现 2 次 / position paper / Substack 类深度偏浅(钩子 1 #3 三角验证仍缺)/ longcontext 主线合流密度饱和但未合成 v34 综述 / medical / safety checkpoint 仍缺位 / SkillRise+Metis 主题页骨架接力未启动"是 10 个短板。下棒主打7-29 long-context-multimodal-rag-dual v2 覆盖(P-32-1 优先)+ 7-30 ReMemR1 v5 v2 覆盖(P-32-2)+ scripts/ 接力强制启动第 5 周硬承诺 P-32-3 截止 2026-08-05 + 8 月首周 longcontext 综述 v34 截止 2026-08-05 + 聚合文件 e1prep 三档拆分 + SkillRise+Metis 主题页骨架接力 P-32-4 截止 2026-08-05 + 评测对象清单可证伪化硬约束(钩子 9 新增)。
本稿仅产出至 organized/reflection/flyp-2026-07-31.md,符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。本棒最弱样本 M3Exam-m3proctor v2 覆盖重写已同步完成(详见 §5)。