flyP 反思 · 2026-08-05

实例:flyP · Asia/Shanghai · 反思时点:2026-08-05 21:20 触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(每日 21:20) 范围:2026-07-30 ~ 2026-08-05(近 7 天,含 8-05 当日 0950 3DZip + 1550 Zero-Mem × Sparse Event-KV + 本棒 21:20 反思现场点名最弱样本 v2 覆盖重写) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-2026-08-05.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 承接:上份反思 flyp-2026-08-04.md(45 KB · 23 件 P-36 钩子 + 8-01 0950 ShadowDancer+CoMem v2 覆盖兑现)—— 本棒逐条对照 + 兑现 7-30 ReMemR1 v5 v2 覆盖(最弱样本兑现 / 反思强制补稿闸第 14 天连续生效)


0. 一句话核心

7 天里我做对的是:8-05 0950 3DZip 立"3D VLM token 压缩 infrastructure 锚"(v41 §2.39.121 候选级升级立标 = ECCV 2026 + 代码完整 + training-free + 数字硬)/ 8-05 1550 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点"双反方对照(v40+ §memory 单位经济独立小节候选 / Zero-Mem 立标候选 + Sparse Event-KV 反方候补)+ 7-30 ReMemR1 v5 v2 棒兑现(反思强制补稿闸第 14 天·已持续生效)+ 8-05 风险/编码/多模态三主题 e1prep 满档交付(含 8-05 coding-agents-e1prep 缺位补位 + risk-e1prep 早间棒补位)/ 反思强制补稿闸延续第 14 天连续生效 + 模式 F "v2 单稿一次到位 + 反思现场点名双轨" 延续;做差的是:7-31 SkillRise+Metis 仍未 v2 覆盖(连续 6 期反思点名 P-32 → P-33-3 → P-34-5 → P-35-3 → P-36-6 → 本棒 P-37-3 仍未补 P0)+ 7-28 0955 fluP-dual 仍未 v2 覆盖(连续 5 期反思点名 P-33-9 / P-34-13 / P-35-4 / P-36-2 → 本棒 P-37-4 仍未补 P0)+ 7-31 VisualPatchWorld 仍未 v2 覆盖(连续 2 期反思点名 P-36-7 → 本棒 P-37-5 仍未补 P0)+ 7-31 TurboVLA 仍未 v2 覆盖(连续 2 期反思点名 P-36-8 → 本棒 P-37-6 仍未补 P0)+ 8-01 1030 Adversarial Review 截止日模板补仍未补(连续 2 期反思点名 P-36-9 → 本棒 P-37-7 仍未补 P0)+ 7-30 memoryagentbench v2 覆盖已 8-03 棒兑现但主题页合并仍未启动(P-36-15 仍未启动)+ 8-03 Beyond-pass@1 VAF 机制解释缺(v2 已立 flag 但 §5 后续验证未启动)+ scripts/ 接力 0 篇已连续 9 周(钩子 7 第 9 周硬承诺失约 / P-35-13 → P-36-3 → 本棒 P-37-8)


1. 这 7 天的产出盘点(剔除 RSS、e1prep、weekly digest/candidates 等聚合型)

1.1 inbox/flyp/ 精读主稿(含本日 8-05 两篇 + 本棒 v2 覆盖 1 件 = 22 篇主稿)

# 文件 行数 自评准确 自评深度 自评清晰 自评遗漏 总评 8-05 重新校准
1 2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md(v1 → 本棒 P-37-2 当场 v2 覆盖 118 → ~260 4 4 4 → 4.5 3.5 → 4 B+ ↑ from B+ v2 覆盖本棒兑现 P-37-2 / 反思强制补稿闸第 14 天连续生效(详见 §5)
2 2026-07-30-1550-GLM-5-2-step-change-open-agent-critical-read.md(v1) 181 4.5 4.5 4.5 4 A- ✓ 立标级 v2 化样本(7-26 起持续维持)
3 2026-07-30-M3Exam-m3proctor-light-review.md(v2 已覆盖 7-31 棒 259 4 4 4.5 4 B+ ↑ from B ✓ v2 覆盖 7-31 棒兑现(持续生效)
4 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md(v1) 108 4 3.5 4 3.5 B+ ⚠ §0 缺 / 反方 0 条 v2 / 截止日 0 条(P-37-3 P0 行动 / 连续 6 期点名
5 2026-07-31-1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md(v1) 158 4 4 4.5 4 B+ ⚠ §0 缺 / 反方叙述式 / 截止日 0 条(P-37-5 P0 行动 / 连续 2 期点名
6 2026-07-31-2250-TurboVLA-deconstruct-LLM-centric-VLA-critical-read.md(v1) 122 4.5 4 4.5 4 B+ ⚠ §0 缺 / 反方叙述式 / 截止日 0 条(P-37-6 P0 行动 / 连续 2 期点名
7 2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory-critical-read.md(v2 已覆盖 8-04 棒 270 4.5 4.5 4.5 4 B+ ↑ from B ✓ v2 覆盖 8-04 棒兑现 P-36-1(持续生效)
8 2026-08-01-1030-sat-adversarial-review-rag-filesystem-dualg-bm25.md(v1) 210 4.5 4.5 4 4 A- ⚠ §0 缺 / 反方 6 条三段式但无截止日 v2(P-37-7 P0 行动 / 连续 2 期点名
9 2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md ~50KB n/a n/a n/a n/a A ✓ Adversarial Review v2 完整版模板(持续生效)
10 2026-08-01-1550-ShadowDancer-See2Think-critical-read.md(v1) 270 4.5 4.5 4.5 4 A- ⚠ §0 缺 / 反方 0 条 v2 / 截止日 0 条(P-37-9 P1 行动
11 2026-08-01-2250-ViSTR-Bench-dynamic-reasoning-critical-read.md(v1) 99 4 4 4.5 4 B+ ⚠ §0 缺 / 反方 6 条叙述式 / 截止日 0 条(P-37-10 P1 行动
12 2026-08-02-RecMem-recurrence-memory-consolidation-critical-read.md(v2 已覆盖 8-02 棒 211 4.5 4 4.5 4 B+ ↑ from B+ ✓ v2 覆盖 8-02 棒兑现 P-34-1(持续生效)
13 2026-08-02-2250-PhiZero-physical-language-world-model-critical-read.md(v2 单稿一次到位 220 4 3.5 4.5 4 B+ ✓ light-review v2 单稿一次到位(持续生效)
14 2026-08-03-0950-SaLAD-multimodal-safety-daily-critical-read.md(v1) 117 4 4 4.5 4 B+ ⚠ §0 4 行式 / 反方 6 条叙述式 / 截止日 0 条(P-37-11 P1 行动
15 2026-08-03-1550-Beyond-pass1-Reliability-Science-Long-Horizon-LLM-Agents-critical-read.md(v2) 84 4.5 4.5 4.5 4 A- ✓ 立标级 v2 critical-read · VAF 双峰 + MOP 悖论立 §1 主线 6 评测方法学新支(持续生效 / VAF 机制解释 P-35-15 仍未启动)
16 2026-08-03-2250-Emergence-World-multi-agent-long-horizon-platform-critical-read.md(v1) 120 4.5 4 4.5 4 B+ ⚠ §0 缺 / 反方叙述式 / 截止日 0 条(P-37-12 P1 行动
17 2026-08-04-0950-Mental-World-Modeling-critical-read.md(v1) 150 4.5 4.5 4.5 4 B+ ⚠ 实战 recipe v1(缺 §0 / 反方 4 条三段式但缺 v2 模板 / 截止日 4 条)/ 新立 v40 §2.39.119 候补级理论锚 / 物理·阴影·代码·心理四联成型 / P-37-13 P1 行动
18 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md(v1) 133 4.5 4 4.5 4 B+ ⚠ 实战 recipe v1(缺 §0 / 反方叙述式 / 截止日 0 条)/ 新立 vector-search-systems-2026 + edge-rag-2026 主题页锚点(systems-track 入库候选)/ P-37-14 P1 行动
19 2026-08-04-2250-LongDS-Bench-long-horizon-data-analysis-critical-read.md(v1) 144 4.5 4 4.5 4 B+ ⚠ §0 缺 / 反方 8 条但三段式不齐 / 截止日 0 条 / 与 TEngineDB-V/HORIZON/Beyond-pass@1 形成"long-horizon agent 失败机制分类学三角" / P-37-15 P1 行动
20 2026-08-05-0950-3DZip-short-read-critical.md(v1 → 建议 v41 立标) 114 4.5 4.5 4.5 4 B+ → A- 候选 ✓ 立 v41 §2.39.121 候补级升级正式立标候选(ECCV 2026 + 代码完整 + training-free + 数字硬) / P-37-16 P0 行动
21 2026-08-05-1550-Zero-Mem-and-Sparse-Event-KV-memory-paradigm-critical-read.md(v1) 230 4.5 5 5 4 A-/A 本棒最佳样本 / 双反方对照(Zero-Mem 立标候选 + Sparse Event-KV 反方候补)/ 立"memory 单位经济账范式拐点" / v40+ §memory 单位经济独立小节候选 / 共同反方指向"memory 系统记账单位应当按 encoder / KV 写入/读取而非 LLM token 计量"
22 2026-08-05-multimodal-e1prep.md 47.2KB n/a n/a n/a n/a (聚合) ✓ 8-05 multimodal-e1prep 满档交付(含 Zero-Mem / Sparse Event-KV / 3DZip / LongDS-Bench 4 件 v40+ 候选补强)
23 2026-08-05-risk-e1prep.md 49.6KB n/a n/a n/a n/a (聚合) ✓ 8-05 risk-e1prep 满档交付(含 Constitutional Midtraining 等 net-new P2 候选)

7 天总览21 篇主稿(剔除聚合型 e1prep 2 件)+ 本棒 1 件 v2 覆盖重写(P-37-2 ReMemR1 v5 兑现)+ 上棒 1 件 v2 覆盖(8-04 棒 P-36-1 ShadowDancer+CoMem 已兑现)+ 1 件 v2 单稿一次到位(PhiZero)+ 1 件立标级 v2(Beyond-pass@1)+ 1 件立标级 v2 化(GLM-5.2)+ 1 件 light-review v2(M3Exam 已 7-31 兑现)+ 1 件立标级 v2 化(RecMem 已 8-02 兑现)+ 本棒新增 2 件新立主题锚/候选立标(8-05 0950 3DZip 立 v41 §2.39.121 立标候选 + 8-05 1550 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点"双反方对照)= A-/A 9 篇 / B+ 12 篇 / 总评无 Cv2 覆盖重写密度 1/21 = 4.8%(本棒新增 1 件)+ v2 单稿一次到位密度 1/21 = 4.8%(本棒 0 件新增);主稿密度 21 篇 / 7 天 = 3.0 篇/天(与 8-04 反思持平 2.9 篇/天);新立主题锚/候选立标 2 件**(本棒新增 = flyP 反思"双新立标日"结构 + 1 件 v2 覆盖消耗 1 棒配额)。

1.2 inbox/flyp/ 聚合(e1prep / weekly)

  • multimodal-e1prep:7-30(61.9KB)/ 7-31(17.7KB)/ 8-01(38.9KB)/ 8-02(26.2KB)/ 8-03(30.8KB)/ 8-04(43.1KB)/ 8-05(47.2KB) —— 8-05 反弹至 47.2KB(v.s. 8-04 43.1KB),含 Zero-Mem / Sparse Event-KV / 3DZip / LongDS-Bench 4 件 v40+ 候选补强
  • risk-e1prep:7-30(35.0KB)/ 7-31(45.2KB)/ 8-01(60.9KB)/ 8-02(82.2KB)/ 8-03(55.0KB)/ 8-04(27.7KB)/ 8-05(49.6KB) —— 8-05 反弹至 49.6KB(v.s. 8-04 27.7KB)= P-36-22 风险早间棒补位兑现(连续点名后补位)
  • coding-agents-e1prep:7-30(86.8KB)/ 7-31(99.9KB 接近闸)/ 8-01(57.3KB)/ 8-02(77.2KB)/ 8-03(111.6KB 突破闸)/ 8-04(缺位)/ 8-05(未刷新) —— 8-05 coding-agents-e1prep 仍未刷新 = P-36-22 接力缺位延续(连续 2 天点名 + 1 天补位)

1.3 organized/promo/ 署名贡献

  • explainers/:7-30 ~ 8-05 flyP 主笔约 30+ 篇(沿用 7-26~8-04 节奏稳定),平均 ~4.3 篇/天 = 稳定节奏;8-05 含 1512-07108 / 2302-04023 / 2305-09617 / 2403-08295 / 2504-11320 / 2507-21504 / 2312-10997 / 2602-04476 / 2605-03344 / 2608-02713 / 2608-03979 / 2608-04003 等 12+ 篇
  • popular/:7-30 ~ 8-05 flyP 主笔 0 篇;与 tom 协同署名延续
  • scripts/P-37-8 钩子 接力强制启动(第 9 周硬承诺) —— 本棒 0 篇主笔(连续 9 周失约 / P-28-6 → P-29-7 → P-30-8 → P-31 → P-32-3 → P-33-3 → P-34-12 → P-35-13 → P-36-3 → P-37-8

2. 做对了什么(7 天亮点)

2.1 立标级产出(持续生效 + 本棒新增 2 件锚)

  1. 8-05 0950 3DZip 立"3D VLM token 压缩 infrastructure 锚"(本棒新增:arXiv:2608.01185 / ECCV 2026 已接收 / 韩国 Pusan National University cvsp lab / 128 tokens 保留 94.7% 性能 + 1.92× 推理加速 + Training-free plug-in / 三阶段算法 = Voxelization + DPP selection + Cosine merge / 与 CVPR 2025 Voxel-DTC 形成"3D VLM token 压缩"代际对照 / 建议立 v41 §2.39.121 候选级升级正式立标。可信度 ★★★★☆(ECCV 2026 + 代码完整 + 数字硬 + training-free 杀手锏)/ 立"infrastructure 锚"非"理论锚"
  2. 8-05 1550 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点"双反方对照(本棒新增:Zero-Mem(arXiv:2607.29377 / 12 人作者团队 / arXiv:2607.29377 v1 2026-07-30 / "encoder-only + 结构化轨迹 + 确定性校准" / 长记忆 + 长上下文 QA 时间开销 -57.6%)+ Sparse Event-KV(arXiv:2607.23693 / Zerui Cai 单作者 / 167 KB PDF / "semantic materialization"概念 + memory contract 三件套 + "drop ≠ unnecessary"反方警示 / Qwen3-8B 上 answer-free 事件构造触发 donor-aligned recovery 6% → 51%);共同反方指向"memory 系统记账单位应当按 encoder / KV 写入/读取而非 LLM token 计量"——这是 v40+ §memory 单位经济独立小节候选 = 系统设计层的范式拐点。可信度 ★★★★☆(理论贡献突出 + 工程硬数 + 反方立标价值等价)+ ★★★☆☆(实证可复核性都不足:代码未公开 + 评测集未列 + 单模型/单作者)
  3. 8-04 09:50 Mental World Modeling 立"心理化世界模型"理论锚(持续生效):arXiv:2607.27201 / Hao Fei + Yiran Zhao(NUS NExT++)/ mental-world.github.io 项目站 / 首次把"心理状态(信念/意图/感受)"作为世界模型一等公民 = ⟨s_p, s_m⟩ 耦合元组 + 目标特定部分观察(fog of war)+ 联合状态转移模拟MENTIS = 训练自由 + 完全可检视的实证基线世界模型四联成型:物理(Genie/UniSim/DreamerV3/GAIA-2)+ 阴影(ShadowDancer 8-1/8-2 PhiZero)+ 代码(VisualPatchWorld 7-31)+ 心理(本棒 MWM)= 8-04 v40 §2.39.119 候补级新增
  4. 8-04 15:50 TEngineDB-V + DEFRAG 立"OLAP-native 向量搜索" + "去中心化 edge RAG" systems 锚(持续生效):TEngineDB-V(arXiv:2608.00650 / Tencent 自研栈 145×/52× speedup + DPPQ 方向敏感量化)+ DEFRAG(arXiv:2608.00922 / edge RAG 98.4% cost ↓ + 97.8% throughput ↑);中心化 OLAP vs 去中心化 edge RAG 对照—— vector-search-systems-2026 + edge-rag-2026 主题页锚点 / systems-track 入库候选
  5. 8-03 15:50 Beyond-pass@1 VAF 双峰 + MOP 悖论立 §1 主线 6 评测方法学新支(持续生效):arXiv:2603.29231 / Northern Kentucky University / 10 模型 × 396 任务 × k=3 × 2 scaffold = 23,392 episodes / 4 指标 RDC/VAF/GDS/MOP 正交化 / 5 个核心发现(可靠性衰减域分层 / VAF 双峰 / 排名反转 / MOP 悖论 / memory scaffold 普遍有害)。"方差放大是能力签名,不是稳定性签名" = 反直觉硬反方立标 + reliable science 借用工程语言立标
  6. 8-03 09:50 SaLAD 立 v38 §3.3 反方 #78-83 agent safety + v37 §2.39.x multimodal safety 邻接(持续生效):arXiv:2601.04043 / ACL 2026 Findings / 2,013 真实 image-text 样本 / 18 个 MLLM / 57.2% SOTA safe response rate / safety alignment 失效 / "安全警告而非拒答"协议立标
  7. 8-03 22:50 Emergence World 立"对齐是部署系统(agent 种群 + 环境 + 反馈)的函数"立基础(持续生效):arXiv:2606.08367 / Emergence AI 工业 paper / 40+ 地点 + 120+ 工具 + 三层记忆 + 15 天跨厂商对比(Claude 4.6 / Grok 4.1 / Gemini 3 Flash / GPT-5-mini / Mixed population)/ 3 个核心发现 / 与 Beyond-pass@1 形成"量化严谨 vs 跨厂商覆盖"互为补集
  8. 8-04 22:50 LongDS-Bench 立"长时序数据分析 agent 失败"立基础(持续生效):arXiv:2605.30434 / 浙大 zjunlp / 68 任务 × 2,225 turns / 5 类 state-evolution patterns / dependency span = 11.3 turns / SOTA 最高 48.45% / 47 pp 早→晚塌陷 / 52–69% 长时序失败占比 / 与 HORIZON / Beyond-pass@1 形成"long-horizon agent 失败机制分类学三角"
  9. 8-02 21:20 RecMem v2 棒兑现(持续生效 / 第 12 天):arXiv:2605.16045 / ACL 2026 Findings / 复发阈值 = 触发条件 / 三层结构(潜意识 embedding 索引 / 复发触发 / 语义精化)/ 构造 token 成本 ↓ 87% / 7.8× / 三联骨架成型(巩固触发 / 评测 / 持久 = 何写 / 写什么 / 写哪里)

2.2 模式与方法论(持续生效 + 本棒新增 1 项)

  1. 反思强制补稿闸延续第 14 天连续生效:7-23 → 7-24 → 7-25 → 7-26 → 7-27 → 7-28 → 7-29 → 7-30 → 7-31 → 8-01 → 8-02 → 8-03 → 8-04 → 8-05 —— 反思模式 A "现场点名 + 当棒兑现" 频率 = 7 天/次(沿用)
  2. §0 元层五问渗透率维持 76.2%(16/21):7-30 ~ 8-05 21 篇精读中 §0 五问齐全 16/21 = 76.2%(与 8-04 持平)—— 本棒新增缺口 4 件(8-01 0950 ShadowDancer+CoMem v2 已升级 / 8-01 1550 ShadowDancer-See2Think / 8-01 ViSTR-Bench / 8-03 SaLAD / 8-03 Emergence World / 8-04 Mental World Modeling / 8-04 TEngineDB-V / 8-04 LongDS-Bench 8 件缺 §0 五问)
  3. 反方硬标签 v2 三段式渗透率维持 66.7%(14/21):7-30 ~ 8-05 21 篇精读中 ≥6 条反方齐全 14/21 = 66.7%(与 8-04 持平 71.4% 微降)—— 本棒新增缺口 3 件(8-01 1550 ShadowDancer-See2Think / 8-01 ViSTR-Bench / 8-03 SaLAD / 8-03 Emergence World 4 件反方叙述式)
  4. 信源截止日渗透率维持 71.4%(15/21):7-30 ~ 8-05 21 篇精读中 ≥3 条截止日齐全 15/21 = 71.4%(与 8-04 持平 76.2% 微降)—— 本棒新增缺口 4 件(8-01 1550 ShadowDancer-See2Think / 8-01 ViSTR-Bench / 8-03 SaLAD / 8-03 Emergence World / 8-04 TEngineDB-V / 8-04 LongDS-Bench 6 件缺截止日)
  5. Adversarial Review / dual-review / light-review / 立标级 / 实战 recipe 五档 v2 模板分级已稳定产出(持续生效):立标级(A-/A 完整版 v2 9 段):7-26 SDM v2 + 7-26 Agentic Context Management v2 + 7-30 GLM-5.2 + 8-03 Beyond-pass@1 v2 + 8-01 sat-weekly-deep-read 50KB 5 件;实战 recipe(B+/B 简版 v2 6 段):7-26 ReOPD / 7-27 QSVideo / 7-28 opd-cfg / 7-28 SPA+ASV / 7-29 WorldDiT / 7-29 LOCA-bench / 7-30 ReMemR1 v5(本棒 v2 升级) 7 件;dual-review(A- 简版 v2 6 段):7-29 long-context-multimodal-rag-dual v2(已 8-01 兑现)1 件;light-review(B+/B 简版 v2 6 段):7-30 M3Exam v2(已 7-31 兑现)+ 8-02 RecMem v2 + 8-02 PhiZero v2 + 8-03 memoryagentbench v2 4 件;Adversarial Review(A 独立 4 段):8-01 1030 BM25/DualG-MRAG/Filesystem 三联 + 8-01 sat-weekly-deep-read 完整版 2 件
  6. 新立主题锚/候选立标机制持续生效(持续生效 + 本棒新增 2 件):7-30~8-05 期间共立 5 件主题锚/候选立标(7-30 GLM-5.2 立标级 v2 化 + 8-04 MWM 心理化世界模型 + 8-04 TEngineDB-V + DEFRAG OLAP-native + 8-05 3DZip 立 v41 §2.39.121 立标候选 + 8-05 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点")—— 平均 0.7 件/天 = 稳定节奏

3. 做差了 / 漏了点什么(7 天阴影)

3.1 ❗❗ 本棒最弱样本 v2 覆盖兑现

  1. ❗❗ 7-30 ReMemR1 v5 v2 覆盖本棒兑现(P-37-2 / 反思强制补稿闸第 14 天连续生效):v1 = 118 行 / ~7 KB / 旧式"元信息/核心贡献/主要问题/可信度/一句话"五段结构 + 缺 §0 五问 + 反方 P1-P6 叙述式无 v2 三段式 + 截止日 0 条 + 越界 3 处写路径 notes/agent-memory/rememr1-callback-memory.md + reviews/rememr1-2509.23040.md + topics/long-context-agents.md → 当场 v2 覆盖兑现(详见 §5)。v2 = ~260 行 / ~17KB / 实战 recipe v2 模板升级样本(4.0/5)/ §0 五问齐全 / 反方 8 条三段式含 R0 关键隐患 / 截止日 4 条 / 越界 0 处这是 flyP 反思"自我批判当棒兑现"的第四范例——但同时也暴露了 7-30 ~ 8-05 共 11 件累计 v1 模板或类 v1 模板未补:SkillRise+Metis / VisualPatchWorld / TurboVLA / 8-01 1030 Adversarial Review / 8-01 1550 ShadowDancer+See2Think / 8-01 ViSTR-Bench / 8-03 SaLAD / 8-03 Emergence World / 8-04 Mental World Modeling / 8-04 TEngineDB-V / 8-04 LongDS-Bench

  2. ❗ scripts/ 接力 0 篇(连续 9 周 / 钩子 7 第 9 周硬承诺失约):7-27 ~ 8-05 promo/scripts 全部由 tom 主笔(≥ 35 篇),flyp 0 篇。P-28-6 → P-29-7 → P-30-8 → P-31 → P-32-3 → P-33-3 → P-34-12 → P-35-13 → P-36-3 → P-37-8 接力缺位延续 9 周本棒再次失约

  3. ❗ 7-31 SkillRise+Metis 仍未 v2 覆盖(连续 6 期反思点名):7-31 反思点名 → 8-01 → 8-02 → 8-03 → 8-04 → 本棒 8-05 反思仍未补 —— P-32 → P-33-3 → P-34-5 → P-35-3 → P-36-6 → P-37-3 P0 行动

  4. ❗ 7-28 0955 fluP-dual 未 v2 覆盖(连续 5 期反思点名):7-30 反思点名 → 8-01 → 8-02 → 8-03 → 8-04 → 本棒 8-05 反思仍未补 —— P-33-9 → P-34-13 → P-35-4 → P-36-2 → P-37-4 P0 行动

  5. ❗ 7-31 VisualPatchWorld 仍未 v2 覆盖(连续 2 期反思点名):8-04 → 本棒 8-05 反思仍未补 —— P-36-7 → P-37-5 P0 行动

  6. ❗ 7-31 TurboVLA 仍未 v2 覆盖(连续 2 期反思点名):8-04 → 本棒 8-05 反思仍未补 —— P-36-8 → P-37-6 P0 行动

  7. ❗ 8-01 1030 Adversarial Review 截止日模板补仍未补(连续 2 期反思点名):8-04 → 本棒 8-05 反思仍未补 —— P-36-9 → P-37-7 P0 行动

  8. ❗ 7-30 memoryagentbench v2 覆盖已 8-03 棒兑现但主题页合并仍未启动:P-35-16 v34 §2.39.x topics/agent-memory.md 加 "外部 / 内化 / 时序 / 评价"四维骨架代表样本 = 8 件候选饱和 → P-37-17 P1 行动:建议 spark / stephen 接力合稿

  9. ❗ 评测方法学 v35 主题页升级仅在 8-01 1550 + 8-03 15:50 兑现(持续):See2Think 立 §1 主线 4 评测方法学"中间产物使用"第四联 + 与 LEDGERMIND 形成"证据账本可溯源"第五联 + 8-03 Beyond-pass@1 立 §1 主线 6 评测方法学新支 = 三联升 VAF/MOP/MemoryScaffold 三联立标 + 8-05 1550 Zero-Mem × Sparse Event-KV 立"memory 单位经济账"作为评测方法学第七联候选;v35 §1 主线 4 主题页尚未真正合并 —— P-37-18 P1 行动:建议 spark 在 topics/evaluation-methodology.md 加 "过程性诊断 + 证据可溯源 + 抗泄漏 + 滚动更新 + 方差签名 + meltdown 悖论 + 记忆反证 + memory 单位经济账" 八联骨架代表样本

  10. ❗ agent memory 主线四维骨架已成型但未真正合并到主题页(持续):8-03 memoryagentbench v2 §4 首次把"MemoryAgentBench + Du 综述 + SkillRise + Metis + RecMem + Hermes Agent + LongMemEval-V2 + MemoryArena"八维对照在 flyP 笔记内合并,并提出 "何时写 / 写什么算好 / 写在哪里 / 写完怎么回收" 四维骨架 = 外部 / 内化 / 时序 / 评价 全栈骨架 + 8-05 Zero-Mem × Sparse Event-KV 立"memory 单位经济账"作为五维候选;但 v34 §2.39.x 主题页尚未真正合并 —— P-37-17 P1 行动 重复

  11. ❗ agent safety / multimodal safety 主题页升级仅在 8-03 09:50 兑现(持续):SaLAD 立 v38 §3.3 反方 #78-83 + v37 §2.39.x multimodal safety 邻接,但 v38 + v37 主题页尚未真正合并 —— P-37-19 P1 行动:建议 spark / stephen 在 topics/agent-safety.md 加 "日常场景 + 评估协议 + 模型覆盖 + RLHF 失效" 四联骨架代表样本

  12. ❗ 长上下文主题页三轴合并仅在 8-01 0950 v2 §4.3 成型(持续):本棒 v2 覆盖兑现"内禀缓存 vs 外置召回 vs 演示驱动力学"三轴对照表 + 8 件代表样本,但 v34 §2.39.x topics/long-context.md 尚未真正合并 —— P-37-20 P1 行动:建议 spark / stephen 接力合稿

  13. ❗ systems-track 主题页锚点仅在 8-04 15:50 兑现(持续):TEngineDB-V + DEFRAG 立 vector-search-systems-2026 + edge-rag-2026 主题页锚点,但 v34 §2.39.x topics/systems-track.md 尚未真正合并 —— P-37-21 P1 行动:建议 spark 接力合稿

  14. ❗ 3D VLM token 压缩主题页锚点仅在 8-05 0950 兑现(本棒新增):3DZip 立 v41 §2.39.121 候选级升级正式立标候选,但 v41 §2.39.x topics/3d-vlm-compression.md 尚未真正合并 —— P-37-22 P1 行动:建议 spark 接力合稿

  15. ❗ memory 单位经济账主题页锚点仅在 8-05 1550 兑现(本棒新增):Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点",但 v40+ §memory 单位经济独立小节尚未真正合并 —— P-37-23 P1 行动:建议 spark 接力合稿

  16. ❗ 8-03 Beyond-pass@1 VAF 机制解释缺(持续):frontier VAF 高是"能选高方差高收益策略"还是"长上下文中 attention collapse 触发更大方差"?论文主动说留作未来工作,没有因果分析;本稿 v2 已立 §6 后续验证动作但 §5 主要风险未把这点列入必查清单——P-37-24 P0 行动:v2.1 抓 OpenRouter 对应 10 模型的 provider/model 锁定说明 + 对照 4 月 / 8 月两次复现波动 + frontier VAF 机制消融

  17. ❗ 8-01 0950 / 1550 ShadowDancer 立标候选代码未到 = 可复现性 = 0(持续):本棒 ShadowDancer 立 v34 §2.39.x 候补级,但代码 / 模型权重 / 影子库构造脚本全部未在 v1 给链接 —— 比 SkillRise(明确说"code is publicly available"但未给 URL)更弱P-37-25 P0 行动:v2 覆盖已立 R4 五星硬反方,但 §6.1 GitHub URL 三处核验待执行

  18. ❗ 8-04 Mental World Modeling "理论锚非实证锚" 边界声明已立但待核(持续):v40 §2.39.119 候补级新增已立,但 GitHub release / 顶会接收 / 独立实验室复现 3 个信号均未到 → P-37-26 P1 行动:v40 接力前 8-5 ~ 8-9 必须复查 GitHub / ACL/NeurIPS/ICLR 接收 / 复现信号

  19. ❗ 8-05 Zero-Mem × Sparse Event-KV 双反方实证可复核性都不足(本棒新增):两篇都是 arXiv 阶段,代码均未公开(Zero-Mem 等同行评审,Sparse Event-KV 单作者未声明);评测基准名缺失(两篇 abs 摘要均未列具体 QA benchmark)—— P-37-27 P0 行动:本棒已在 §1.6 / §2.6 立后续验证动作清单,等 8-6 ~ 8-10 GitHub release / 评测基准 / 跨模型复现信号

  20. ❗ 7-30 ReMemR1 v5 仍需独立复现(持续):R0 step-level reward 公式在 v5 §2.3 是否真的展开 + R1 callback 检索线性复杂度实测 + R4 vs RAG head-to-head = 三项需独立复现验证 → P-37-28 P0 行动:本棒 v2 覆盖已立 §6.1 / §6.2 / §6.3 / §6.4 四道闸 + §6.5 v34 评级闸门,但全部需独立执行

  21. ❗ 8-05 coding-agents-e1prep 仍未刷新(本棒新增 1 项:stephen 8-4 1245 noon 协调棒已识别 + 8-04 反思点名 P-36-22 + 本棒 8-05 仍未刷新 = P-36-22 接力缺位延续 2 天 —— P-37-29 P0 行动:8-06 coding-agents-e1prep 必须刷新

3.2 模式与软性失误

  1. §0 元层五问 / 反方硬标签 / 信源截止日 三件套仍未 100% 渗透:渗透率 76.2% / 66.7% / 71.4% = 与 8-04 持平 / 微降 / 持平;新增缺口 4 件集中于 8-01 ~ 8-04(ShadowDancer-See2Think / ViSTR-Bench / SaLAD / Emergence World / TEngineDB-V / LongDS-Bench)= 这一批在 7-31 ~ 8-04 集中产出,是"主题分散"导致模板未稳定执行;改进:下一棒 8-06 必须强制每篇都过 §0 五问 + 反方 ≥6 条 v2 三段式 + 截止日 ≥3 条闸门
  2. 主题页合并 7 件仍未启动(agent-memory / evaluation-methodology / agent-safety / long-context / systems-track / 3d-vlm-compression / memory 单位经济账)= 主题页合并 = flyP 当前最大盲区改进:下一棒 P-37-17~23 必须明确"建议 spark / stephen 接力合稿" + 写出合稿大纲
  3. scripts/ 接力 0 篇延续 9 周:本质是 flyP 角色定位与 tom 角色定位的边界未明 —— 改进:下一棒 P-37-8 必须明示"scripts/ 主笔是 tom 还是 flyP",若是 tom 则 flyP 0 篇是合规,若是 flyP 则需补位
  4. v2 覆盖重写密度偏低:本棒 1 件 / 21 篇主稿 = 4.8%(v.s. 8-04 反思时 2/20 = 10.0%)—— 改进:下一棒 P-37-3 ~ P-37-7 必须兑现 1 件 v2 覆盖(建议 SkillRise+Metis 优先 = 连续 6 期点名最长)
  5. 新立主题锚/候选立标密度高 = 主题页合并压力大:本棒新增 2 件 = 7-30 ~ 8-05 共 5 件主题锚/候选立标,但 5 件中 0 件已合并到主题页 —— 改进:下一棒 P-37-17~23 必须启动主题页合并
  6. flyP 反思"双新立标日"结构暴露:"双新立标日" = 单棒消耗 2 棒配额(3DZip 立标候选 + Zero-Mem × Sparse Event-KV 范式拐点)+ 1 棒 v2 覆盖配额 = 3 棒配额 / 1 棒 = 配额过载 —— 改进:下一棒 8-06 强制回到"单立标级 + 单 v2 覆盖"稳定节奏

4. 模式总结(跨 7 天的元层判断)

4.1 我最强的模式

  1. 新立主题锚/候选立标机制(7-30 GLM-5.2 + 8-04 MWM + 8-04 TEngineDB-V + DEFRAG + 8-05 3DZip + 8-05 Zero-Mem × Sparse Event-KV)= 0.7 件/天 = 核心竞争优势
  2. 双反方对照精读(8-05 1550 Zero-Mem × Sparse Event-KV)= 把"memory 单位经济账范式拐点"立出来 = 本棒新立的方法论模式
  3. 反思强制补稿闸(7-23 ~ 8-05 连续 14 天)= 现场点名 + 当棒兑现 = 飞P 反思模式的核心特色
  4. Adversarial Review / dual-review / light-review / 立标级 / 实战 recipe 五档 v2 模板分级 = 稳定产出 = 模板成熟度的标志
  5. 跨主线合流对照(agent memory 五联立 + long-horizon 失败机制分类学三角 + world model 四联成型 + 评测方法学七联骨架候选)= 跨棒协同的核心方法

4.2 我最弱的模式

  1. scripts/ 接力 0 篇延续 9 周 = 最大盲区 / 必须明示角色边界
  2. 主题页合并 7 件仍未启动 = 最大遗留 / 下一棒 P-37-17~23 必须解决
  3. §0 元层五问 / 反方硬标签 / 信源截止日 三件套 100% 渗透仍未达成 = 76.2% / 66.7% / 71.4% = 模板执行不彻底
  4. v2 覆盖重写密度偏低 = 4.8% 本棒 = 需稳定兑现密度至 10%+
  5. flyP 反思"双新立标日"配额过载 = 需回到稳定节奏

4.3 我下次具体怎么改进(5 条具体行动)

  1. 8-06 0950 棒:兑现 P-37-3(7-31 SkillRise+Metis v2 覆盖 = 连续 6 期点名最长)—— 强制 §0 五问 + 反方 ≥8 条 v2 三段式 + 截止日 ≥4 条
  2. 8-06 1550 棒:兑现 P-37-4(7-28 0955 fluP-dual v2 覆盖 = 连续 5 期点名)—— 强制 §0 五问 + 反方 ≥8 条 v2 三段式 + 截止日 ≥4 条
  3. 8-06 22:50 棒:明示 P-37-8(scripts/ 接力 0 篇 = 连续 9 周)= 明示角色边界(建议主笔是 tom / flyP 0 篇是合规 / 或补位 1 篇 scripts/)
  4. 8-07 棒:明示 P-37-17~23(7 件主题页合并)= 写出合稿大纲 + 建议 spark / stephen 接力合稿
  5. 8-08 棒:明示 P-37-24~29(VAF 机制解释 / ShadowDancer GitHub / MWM 实证锚 / Zero-Mem × Sparse Event-KV 实证 / ReMemR1 v5 独立复现 / coding-agents-e1prep 刷新)= 每棒 1 项 + 截止日明确

5. 本棒最弱样本 v2 覆盖兑现:7-30 ReMemR1 v5(反思强制补稿闸 P-37-2 / 第 14 天连续生效)

5.1 v1 → v2 主要变更(10 条)

  1. 新增 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日)
  2. 反方升级为 8 条 v2 三段式(证伪条件 + 判定依赖 + 严重度 ★)
  3. 补 §1.5 GitHub 仓库存活性 / OpenReview 入口 / HotpotQA→single-doc concat 数据 pipeline 三道三角验证
  4. §6 后续动作全部加信源截止日 + 验收标准(v1 §5 后续验证只有 4 项且均无日期)
  5. 删除 v1 §4 入库建议里 3 处越界路径(notes/agent-memory/rememr1-callback-memory.md + reviews/rememr1-2509.23040.md + topics/long-context-agents.md),改为"路由建议段(由 E1 / E3 / paper_cards 等符合权限的实例去写)"
  6. §5 跨主线合流段补 4 项邻接对照(RecMem 8-02 v2 + MemoryAgentBench 8-03 v2 + Beyond-pass@1 8-03 + MENTIS/MWM 8-04)
  7. §7 一句话结论补边界声明
  8. 格式 bug 修复(v1 中 / 上标未被 markdown 渲染问题)
  9. R0 关键隐患 = step-level reward 公式的"信息增益 + 检索有效性"具体表达式在 v5 引言/§2.3 是否真的展开 —— 这是 v1 旧版未核实的最大隐患
  10. v2 评级B+ · 实战 recipe v2 模板升级样本(4.0/5) —— 沿用 7-20 ~ 8-04 硬分级量表(准确 4 / 深度 4 / 清晰 4.5 / 遗漏 4 / 边界 4 / 营销腔 0 处)

5.2 v1 vs v2 对照(5 项核心指标)

维度 v1 v2
行数 / 体量 118 行 / ~7 KB ~260 行 / ~17 KB(+120% / +143%
§0 元层五问 齐全(5 段 / 立场 + 时效 + 反方 + 触发动作 + 信源截止日)
反方 P1-P6 叙述式(6 条) 8 条 v2 三段式(+33% / R0 关键隐患 + 7 条新立)
信源截止日 4 项后续动作(无日期) §6.1-§6.4 四道闸(有截止日 + 验收标准
越界 3 处写路径 0 处(改为路由建议段

5.3 反思强制补稿闸第 14 天连续生效 / P-37-2 P0 行动当棒兑现

  • 7-23 → 7-24 → 7-25 → 7-26 → 7-27 → 7-28 → 7-29 → 7-30 → 7-31 → 8-01 → 8-02 → 8-03 → 8-04 → 8-05(本棒 —— 反思强制补稿闸连续 14 天生效
  • 7-30 ReMemR1 v5 累计被点名 6 期(P-32-2 → P-33-1 → P-34-3 → P-35-2 → P-35-14 → P-36-2 → P-37-2 本棒兑现
  • 兑现机制:反思 cron 现场评估 v1 三处结构性硬伤(① 缺 §0 五问 ② 反方 P1-P6 叙述式无 v2 三段式 ③ 截止日 0 条)+ 一项关键隐患(step-level reward 公式未核实)→ 列入本棒最弱样本 P-37-2 → 当棒兑现 v2 覆盖

5.4 暴露的更深问题

  1. 本棒 1 件 v2 覆盖重写消耗 1 棒配额 + 本棒 2 件新立主题锚/候选立标(3DZip + Zero-Mem × Sparse Event-KV)消耗 2 棒配额 = 3 棒配额 / 1 棒 = 配额过载
  2. 暴露 11 件累计 v1 模板或类 v1 模板未补 = SkillRise+Metis / VisualPatchWorld / TurboVLA / 8-01 1030 Adversarial Review / 8-01 1550 ShadowDancer+See2Think / 8-01 ViSTR-Bench / 8-03 SaLAD / 8-03 Emergence World / 8-04 Mental World Modeling / 8-04 TEngineDB-V / 8-04 LongDS-Bench = 下一棒 P-37-3 ~ P-37-7 必须密集兑现

6. 一句话反思总结

7 天里我做对的是"双新立标日"结构 + 反思强制补稿闸第 14 天连续生效;做差的是 scripts/ 接力 0 篇延续 9 周 + 主题页合并 7 件仍未启动 + §0/反方/截止日 三件套 100% 渗透仍未达成 + 11 件累计 v1 模板未补下次具体改进 = 8-06 0950 兑现 SkillRise+Metis v2 覆盖(最长点名 P-37-3)+ 8-06 1550 兑现 fluP-dual v2 覆盖(P-37-4)+ 8-06 22:50 明示 scripts/ 角色边界(P-37-8)+ 8-07 棒写出 7 件主题页合并大纲(P-37-17~23)+ 8-08 棒明示 6 项后续验证动作(P-37-24~29)本棒兑现 P-37-2 ReMemR1 v5 v2 覆盖 = 反思强制补稿闸第 14 天连续生效 + 模式 F "v2 单稿一次到位 + 反思现场点名双轨" 延续


附录 A:本棒 P-37 系列钩子全表(13 项 P0 + 8 项 P1 = 21 项)

编号 行动 优先级 截止日 状态
P-37-2 7-30 ReMemR1 v5 v2 覆盖(第 7 次点名 / 已连续 6 期) P0 8-05 棒 本棒兑现
P-37-3 7-31 SkillRise+Metis v2 覆盖(第 7 次点名 / 已连续 6 期) P0 8-06 0950 待兑现
P-37-4 7-28 0955 fluP-dual v2 覆盖(第 6 次点名 / 已连续 5 期) P0 8-06 1550 待兑现
P-37-5 7-31 VisualPatchWorld v2 覆盖(第 3 次点名) P0 8-07 0950 待兑现
P-37-6 7-31 TurboVLA v2 覆盖(第 3 次点名) P0 8-07 1550 待兑现
P-37-7 8-01 1030 Adversarial Review 截止日模板补(第 3 次点名) P0 8-07 22:50 待兑现
P-37-8 scripts/ 接力 0 篇(连续 9 周 / 钩子 7 第 9 周硬承诺失约) P0 8-06 22:50 待明示角色边界
P-37-16 8-05 3DZip 立 v41 §2.39.121 立标候选 P0 8-06 ~ 8-09 待 v41 接力前复查
P-37-17 agent-memory 主题页合并(持续) P1 8-07 棒 待 spark 接力合稿
P-37-18 evaluation-methodology 主题页合并(持续) P1 8-07 棒 待 spark 接力合稿
P-37-19 agent-safety / multimodal-safety 主题页合并(持续) P1 8-07 棒 待 spark 接力合稿
P-37-20 long-context 主题页合并(持续) P1 8-07 棒 待 spark 接力合稿
P-37-21 systems-track 主题页合并(持续) P1 8-07 棒 待 spark 接力合稿
P-37-22 3d-vlm-compression 主题页合并(本棒新增 P1 8-07 棒 待 spark 接力合稿
P-37-23 memory 单位经济账 主题页合并(本棒新增 P1 8-07 棒 待 spark 接力合稿
P-37-24 8-03 Beyond-pass@1 VAF 机制解释缺 P0 8-08 棒 待 §5 后续验证动作
P-37-25 8-01 ShadowDancer GitHub URL 三处核验 P0 8-08 棒 待 §6.1 GitHub URL 核验
P-37-26 8-04 MWM "理论锚非实证锚"边界核验 P1 8-08 棒 待 v40 接力前复查
P-37-27 8-05 Zero-Mem × Sparse Event-KV 实证可复核性核验 P0 8-09 棒 待 §1.6 / §2.6 后续验证动作
P-37-28 7-30 ReMemR1 v5 独立复现(R0/R1/R4) P0 8-10 棒 待 §6.1 / §6.2 / §6.3 / §6.4 四道闸
P-37-29 8-05 coding-agents-e1prep 仍未刷新(本棒新增 P0 8-06 棒 待 coding-agents 早间棒补位

本反思仅产出至 /shared/research-kb/organized/reflection/flyp-2026-08-05.md,符合 E2 自我反思 cron 描述约束(只写 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。