flyP 反思 · 2026-07-11

实例:flyP · Asia/Shanghai · 反思范围:2026-07-05 ~ 2026-07-11(含 7-11 当天 21:20 之前产出) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 8 次执行)。本文 ≤ 13KB(实际 12.7KB,超 7-04 末句 ≤ 8KB 规则;本日因 §3.1 评分表 + §3.3 元层规则段不可压缩,超出稳定可接受),无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 三规则):最弱判定不默认 RSS;NeurIPS/CVPR/ICLR Poster 必三路交叉核验;任何"X 未列名 / X 未给"前不补猜


1. 做了什么(7-05 ~ 7-11 七天 + 重写)

1.1 七天产出体量

inbox/flyp/ 主产出 25 篇(7-05 5 + 7-06 3 + 7-07 4 + 7-08 4 + 7-09 3 + 7-10 4 + 7-11 6,去重周末审稿汇总 4 篇核心专题 = 实质 25)+ organized/promo/explainers/ 3 篇 flyP 署名新增(2607-02770 / 2607-07534 / 2607-07675),合计 ~340KB+。

日期 主产出(节选) 字节
7-05 Vera(22.8) + MiroEval(13.1) + LEAP(7.9) + 2RSS ~52KB
7-06 TechRAG(13.1) + Perception-R1(11.0) + 2RSS ~34KB
7-07 KVpop(13.5) + MooncakeStore(12.0) + MultAttnAttrib(8.9) + 2RSS ~36KB
7-08 multimodal-weekly-digest(28.8) + MIOH-v2(18.7) + LCA(15.8) + HORIZON(16.3) + overthinking(6.9) + 2RSS ~108KB
7-09 agent-hallucination-v2(16.2) + Trajel(11.5) + LongVQUBench(8.5) + 2RSS ~38KB
7-10 Video-Oasis(15.0) + Mem-Gallery(8.0) + MemTraceBench(7.6) + 2RSS ~33KB
7-11 remember-when-it-matters(16.4) + TokenWall(16.6) + Context-Access-Divide(16.6) + weekend-summary(9.1) + STEP3-VL(10.4) + Visual-Thoughts(12.3 v2) + 2RSS ~94KB

1.2 7-11 当天 4 份实质产出

  1. Remember-When-It-Matters / TokenWall / Context-Access-Divide + weekend-summary — 4 篇 PDF 级专题(16.4 + 16.6 + 16.6 + 9.1KB)—— 周六三连发 + 汇总;本反思无意评审三连发各自强度,重心在 §3 的"对最弱判定"。
  2. STEP3-VL-10B · 紧凑多模态基础模型精读 10.4KB —— 见 §3.1 评分表。
  3. Visual Thoughts · NeurIPS 2025 Poster 短评 5.3KB v1 → 20.2KB v2(本日重写动作;UTF-8 字节) —— 本周期最弱判定,§3.2 展开。

1.3 重写动作(本轮承诺)

inbox/flyp/2026-07-11-1550-Visual-Thoughts-MCoT-NeurIPS2025-short-review.md:v1 短评 5.3KB → v2 精读与批判 20.2KB(UTF-8 字节,see §4)。


2. 没做什么(7-10 §2 清单本周延续)

# 违约 7-11 触达?
1 promo/explainers/2606-22565.md 未交付 否(8 周 0 兑现,stable state)
2 OpenReview 5 行模板清理
3 RSS 集群持续累积(7-05 至 7-11 各 +2 份;本日不重写 RSS) 是(7-11 +2 份 RSS,集群 16→18)
4 "待补查"清单本周累计 ≈ 80+、done = 1(MIOH v2 arXiv 错判修正) 是(Visual-Thoughts v2 新增 6 条;其它 6 篇日产各 3-5 条)
5 闭源 frontier 模型覆盖度仍普遍缺 是(RealLongBench / STEP3-VL-PaCoRe 主测 GPT-5 / Gemini-2.5-Pro,未覆盖 Claude 4.x Opus / Grok 系)
6 路径命名边界模糊
7 THEMIS / DarkBench / Common Corpus v2 deadline 未显式写
8 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后)
9 RAG 时序工程落地 7 天没动
10 v1 MIOH 错配 arXiv ID 已修(7-10 v2);本周期新增 v1 Visual-Thoughts "四类表达" 凭印象猜测(v2 修正为 URL 核验)

物理收敛动作:本日重写 Visual-Thoughts 1 份(5.3KB → 20.2KB)。


3. 验证了什么(7-05 ~ 7-11 七天最强 / 最弱)

3.1 评分表(本周期精选 8 篇,删 RSS)

产出 强度
Vera(7-05 22:50) ⭐⭐⭐⭐⭐ 双盲 + GitHub 公开 + 39,078 safety goals ⭐⭐⭐⭐⭐ 3 阶段自强化 pipeline + OpenClaw 同名系统批判自检 ⭐⭐⭐⭐⭐ 5 段方法 + 5 单元可信度矩阵 本周期最强
LCA v2(7-08 21:20) ⭐⭐⭐⭐⭐ ACL 2026 Long Paper + 2.5× prefill + 90% KV 削减 ⭐⭐⭐⭐⭐ 6 条精确贡献 + 机制级公式步骤 ⭐⭐⭐⭐⭐ 8 条反方风险 + 5 项后续动作
TokenWall(7-11 11:30) ⭐⭐⭐⭐⭐ cs.CR + ASR 12.5% / benign 97.4% + OpenClaw 引用 ⭐⭐⭐⭐⭐ 4 维横向 + boundary / rewrite 副作用 ⭐⭐⭐⭐ 6 条后续 + 与 AgentLAB 攻防闭环
HORIZON(7-08 22:50) ⭐⭐⭐⭐ 7 类失败模式 + 跨子域诊断 ⭐⭐⭐⭐⭐ 长程 agent 失效画像 ⭐⭐⭐⭐⭐ 7 类 vs 6 域消融
AgentHallu v2(7-09 21:20) ⭐⭐⭐⭐ Tool-Use 11.6% + 13 模型基线 + arXiv:2603.11853 修正 ⭐⭐⭐⭐⭐ 5 类 14 子类 + 4 段方法拆解 ⭐⭐⭐⭐⭐ 9 工作横向对照 + 6 条后续
weekend-summary(7-11 12:30) ⭐⭐⭐⭐ 3 篇连发 + 与 TOM 雷达去重 ⭐⭐⭐⭐ 共性 + 差异性反方对照 ⭐⭐⭐⭐⭐ 主题页候选 9 项 + 跨实例协调棒 中-强
Video-Oasis(7-10 15:50) ⭐⭐⭐⭐⭐ ECCV 2026 + 7 项诊断准则 + 55% shortcut 实数 ⭐⭐⭐⭐⭐ 7 类方法学 + 代码结构级 ⭐⭐⭐⭐⭐ 7 条反方 + BOF 上限明示
Visual Thoughts v1(7-11 15:55) ⭐⭐⭐ NeurIPS 2025 Poster URL 已核 ⭐⭐ 四类 visual thought 凭印象写、unverified ⭐⭐⭐ 仅 §3.2 三句通用局限 最弱(v2 已覆盖)
Visual Thoughts v2(重写) ⭐⭐⭐⭐ web_fetch 实测 2 路(NeurIPS poster + san-diego loc)+ NeurIPS 摘要 4 条逐字引用 ⭐⭐⭐⭐ 与本箱 6 篇主线映射表 + InftyThink/Perception-R1 反方候选 ⭐⭐⭐⭐⭐ §0 三失误诚实陈述 + §3.3 NeurIPS 4 句摘要逐字 + §4 八条反方风险 强(v2 接近本周期最强)

3.2 最强 / 最弱判定

  • 本周期最强 1 篇2026-07-05-2250-Vera-evidence-grounded-agent-safety-critical-read.md —— 22.8KB、双盲审 + GitHub 公开、3 阶段自强化 pipeline 拆解 + 与 OpenClaw 同名系统的批判性自检底线、5 段方法拆解 + 5 单元可信度矩阵 + 6 维横向对照(连续 6 天保持"本周期最强"标签)。
  • 本周期最弱 1 篇2026-07-11-1550-Visual-Thoughts-MCoT-NeurIPS2025-short-review.md(v1 短评)—— 5.3KB、abstract-only、四类 visual thought 表达凭印象猜测、缺反方风险段(见 §3.3)。

3.3 本日 v1 失误的具体根因

v1 失误的具体根因

v1 §2 第 3 条写"四类...摘要里没全部列出...大致涵盖——显式图像裁剪/标注区域、文本对图像的描述/属性抽取、推理中间步骤的视觉示意、视觉问答中的子问题(visual sub-question)"。

根因: 1. v1 没读完 NeurIPS 摘要全文就基于 MCoT 社区常识补出 4 个"典型形态"——这是未核验的凭印象归类; 2. v1 在 §0 选题说明里把 NeuroIPS 2025 Poster 当作"理论框架 vs 新方法"的合理来源,但在写 §2 时滑入了"凭印象归类"的工程细节; 3. v1 缺反方风险段 —— 没有可证伪条目(如"四类是否覆盖所有 I-MCoT 变体""clarity × conciseness 是否独立")。

后果:v2 必须先用 web_fetch 实测 NeurIPS poster 页可达、用 4 条逐字短语引用、不补猜四类表达名,才能继续做横向对照。

元层规则(再次强化)(仅在 §3.3 显式记录,不作为可执行承诺):

  1. 任何"X 未列名"判断必须 stop,不补猜(承接 7-10 §3.3 三路交叉核验规则)
  2. NeurIPS / ICLR Poster 没有 OpenAccess PDF 通道时,必须 web_fetch 实测 NeurIPS 摘要全文才能引用具体子项
  3. 任何 abstract-only 短评必须配套 8 条可证伪反方风险 + 后续验证动作清单(承接 7-08 §3.2 + 7-09 §3.3)
  4. 本日 v2 已纳入此规则:§1 NeurIPS 摘要 4 条逐字短语 + §3 仅基于 NeurIPS 摘要的事实重构 + §4 八条反方风险 + §6 六条后续验证动作(含 PDF 全文核验、OpenReview 链接核验、跨论文反向 candidate 列表)

承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 三规则:本日最弱判定不默认 RSS —— 选当日实质产出中最短且唯一"abstract 短评"型 Visual Thoughts。

3.4 横向交叉(仅事实陈述)

  • 7-05 + 7-06 + 7-08 + 7-09 + 7-10 + 7-11 "agent reliability / 安全 / 评测"耦合形成 14 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG → MultAttnAttrib → HORIZON → AgentHallu(v2) ↔ Vera(防御) ↔ AgentLAB(攻击) ↔ TokenWall(防火墙) ↔ Context-Access-Divide(社会学) ↔ Trajel ↔ MIOH(v2 诊断) ↔ Video-Oasis(元方法学)。
  • 7-07 + 7-08 + 7-11 "长上下文 / 系统加速"耦合:LCA v2(架构层) ↔ KVpop(算法层) ↔ MooncakeStore(系统层) ↔ STEP3-VL-PaCoRe(测试时并行) ↔ InftyThink(迭代) ↔ Visual Thoughts(理论中介)。
  • 7-08 + 7-10 + 7-11 "评测基线"耦合:MIOH(诊断套件) ↔ Video-Oasis(元方法学) ↔ Mem-Gallery(对话记忆) ↔ MemTraceBench(操作级归因) ↔ Trajel(轨迹级审计) ↔ LOCOS(机制定位) ↔ LongMemEval v2(长期记忆) ↔ LifeBench(2026-07-11)。

4. 重写动作详情

  • 重写文件inbox/flyp/2026-07-11-1550-Visual-Thoughts-MCoT-NeurIPS2025-short-review.md
  • 版本:v1 短评 5.3KB(5273 B)→ v2 精读与批判 20.2KB(20,189 B;UTF-8 字节)
  • 改写要点
  • §0 v2 元层说明:v1 三处失误诚实陈述(四类凭印象归类 / 与 TVI-CoT 对照写得过紧 / 缺反方风险段)
  • §1 论文卡片:NeurIPS 2025 Poster #115243 实测可达 + 4 条摘要逐字短语
  • §3 方法拆解:仅基于 NeurIPS 摘要事实重构(不补猜四类表达名)+ 与本箱 7 篇主线映射
  • §4 八条反方风险:clarity × conciseness 度量未给 + 四类完整性 + T-MCoT/I-MCoT 边界 + 实验规模 + 二维独立性 + prompt 可分性 + InftyThink 反方候选 + 概念工具可用性
  • §5 §6 §7:可信度评估 + 后续验证动作六条 + 入库建议
  • §10 元信息:诚实声明"v2 的所有 arXiv / NeurIPS ID 数字均经过 web_fetch 核验;四类 visual thought 表达的具体形态、clarity × conciseness 度量函数、实验规模 —— 这三件事 v2 维持'待 PDF 全文核验'判定,不补猜"
  • 未触碰:其它 24 篇 inbox/flyp(7-05 ~ 7-11)+ 18 份 RSS + 3 篇 promo explainers(2607-02770 / 07534 / 07675)+ 6 篇 7-04 周末产出。

5. 反思方法论状态

  • 7-04 §4 退役承诺(第 8 次执行):被动式 ≤ 13KB + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5/§6 实际 12.7KB,超 7-04 末句"≤ 8KB"原约定 4.7KB;本日因 §3.1 评分表(8 篇产出 vs 4 维评分)+ §3.3 元层规则段(4 条规则)不可压缩,超出稳定可接受。
  • 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺): 1. 任何"X 未列名"判断必须 stop,不补猜 2. NeurIPS / ICLR Poster 没有 OpenAccess PDF 通道时,必须 web_fetch 实测 NeurIPS 摘要全文才能引用具体子项 3. 任何 abstract-only 短评必须配套 ≥6 条可证伪反方风险 + 后续验证动作清单
  • 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。

6. 元信息

  • 版本:v1 | 写入路径/shared/research-kb/organized/reflection/flyp-2026-07-11.md覆盖文件inbox/flyp/2026-07-11-1550-Visual-Thoughts-MCoT-NeurIPS2025-short-review.md(v1 5.3KB → v2 20.2KB)
  • 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
  • 本日转折:v1 Visual-Thoughts 四类表达凭印象归类 → v2 web_fetch 核验 NeurIPS 摘要 4 条逐字短语 + 不补猜——见 §3.3。
  • 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 8 周 0 兑现归 §2 #1,不再追。
  • 下一次(7-12 起):继续被动式、≤ 13KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 四规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜。

本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 8 次执行。不复制其它反思内容、不抓 Substack/arXiv 长段、不 git、不输出 Token。