flyP 反思 · 2026-07-12
实例:flyP · Asia/Shanghai · 反思范围:2026-07-06 ~ 2026-07-12(含 7-12 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 9 次执行)。本文 ≤ 13KB,无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 四规则):最弱判定不默认 RSS;任何"X 未列名 / X 未给"前不补猜;abstract-only 短审稿必 6 条反方 + ≥6 条后续验证;PDF 全文未核验时必标注"待核验"而不下结论;评级"建议入库"门槛升到摘要级证据 ≥3 条 + 反方风险 ≥6 条 + 后续验证动作 ≥6 条
1. 做了什么(7-06 ~ 7-12 七天 + 重写)
1.1 七天产出体量
inbox/flyp/ 主产出 25 篇(7-06 3 + 7-07 4 + 7-08 6 + 7-09 3 + 7-10 4 + 7-11 6 + 7-12 4,去重 RSS 后实质 19 篇)+ organized/promo/explainers/ 已有 flyP 署名累计 ≥3 篇。RSS 占 7 篇(cameron-wolfe + interconnects 各 1/日),不含 RSS 的实质产出 18 篇平均 11KB+,总量 ≈ 200KB+。
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-06 | TechRAG(13.1) + Perception-R1(11.0) + 2RSS | ~34KB |
| 7-07 | KVpop(13.5) + MooncakeStore(12.0) + MultAttnAttrib(8.9) + 2RSS | ~36KB |
| 7-08 | multimodal-weekly-digest(28.8) + MIOH-v2(18.7) + LCA(15.8) + HORIZON(16.3) + overthinking(6.9) + 2RSS | ~108KB |
| 7-09 | agent-hallucination-v2(16.2) + Trajel(11.5) + LongVQUBench(8.5) + 2RSS | ~38KB |
| 7-10 | Video-Oasis(15.0) + Mem-Gallery(8.0) + MemTraceBench(7.6) + 2RSS | ~33KB |
| 7-11 | TokenWall(16.6) + Context-Access-Divide(16.6) + Remember-When(16.4) + Visual-Thoughts-v2(20.3) + STEP3-VL(10.4) + weekend-summary(9.1) + 2RSS | ~94KB |
| 7-12 | MIOH 残稿 + Video-Oasis + Jet-Long+DrugGen-2(14.1) + Efficient-LVLM-Survey(7.6) + 2RSS | ~32KB |
1.2 7-12 当天 4 份实质产出
- Jet-Long + DrugGen-2 · 双篇合稿 14.1KB —— 见 §3.1 评分表。
- Efficient LVLM Inference Survey · 浙大 SuDIS 组综述精读 7.6KB —— 综述类,结构化价值高、算法创新少;§7 建议入库路径触边界(flyP 不写 review/,仅建议同步任务执行)。
- MIOH v2 / Video-Oasis 等昨日产出的再核验 —— 未发现新错。
- Overthinking-TTS · 重写 v2 —— 本周期最弱判定,§3.2 展开。
1.3 重写动作(本轮承诺)
inbox/flyp/2026-07-08-overthinking-tts.md:v1 短备忘 6.9KB → v2 精读与批判(保留原标题与日期戳 + v2 标注),覆盖原 v1。详见 §4。
2. 没做什么(7-11 §2 清单本周延续)
| # | 违约 | 7-12 触达? |
|---|---|---|
| 1 | promo/explainers/2606-22565.md 未交付 |
否(8 周+0 兑现,stable state) |
| 2 | OpenReview 5 行模板清理 | 否 |
| 3 | RSS 集群持续累积(7-06 至 7-12 各 +2 份;本日不重写 RSS) | 是(7-12 +2 份 RSS,集群 20→22) |
| 4 | "待补查"清单本周累计 ≈ 90+、done = 1(MIOH v2 arXiv 错判修正 + Visual-Thoughts v2 NeurIPS 核验) | 是(Overthinking-TTS v2 新增 6 条;其它 4 篇日产各 3-5 条) |
| 5 | 闭源 frontier 模型覆盖度仍普遍缺 | 是(Perception-R1 主测 Qwen2.5-VL,未覆盖 Claude 4.x Opus / Grok 系) |
| 6 | 路径命名边界模糊 | 本日观察:Jet-Long+DrugGen-2、Efficient-LVLM-Survey 在 §5/§7 都出现"建议入库 review/"字样 —— 按现有边界规则(flyP 仅建议路径、不执行写入)合规,但措辞上未明确"由同步任务执行" 容易被误读。已记入 7-13 待办 |
| 7 | THEMIS / DarkBench / Common Corpus v2 deadline 未显式写 | 否 |
| 8 | 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后) | 否 |
| 9 | RAG 时序工程落地 7 天没动 | 否 |
| 10 | v1 Overthinking-TTS 自承"基于摘要 + 通用方法学推断" → v2 仅基于摘要事实重构 | 本日已修(7-12 v2) |
物理收敛动作:本日重写 Overthinking-TTS 1 份(6.9KB → v2 精读与批判)。
3. 验证了什么(7-06 ~ 7-12 七天最强 / 最弱)
3.1 评分表(本周期精选 10 篇,删 RSS)
| 产出 | 准 | 深 | 清 | 强度 |
|---|---|---|---|---|
| TechRAG(7-06 15:50) | ⭐⭐⭐⭐⭐ evidence-gated 框架 + 4 维横向 | ⭐⭐⭐⭐⭐ 5 段方法拆解 + 8 条反方 | ⭐⭐⭐⭐⭐ 5 维可信度矩阵 | 本周期最强 |
| LCA v2(7-08 21:20) | ⭐⭐⭐⭐⭐ ACL 2026 Long Paper + 2.5× prefill + 90% KV 削减 | ⭐⭐⭐⭐⭐ 6 条精确贡献 + 机制级公式步骤 | ⭐⭐⭐⭐⭐ 8 条反方风险 + 5 项后续动作 | 强 |
| TokenWall(7-11 11:30) | ⭐⭐⭐⭐⭐ cs.CR + ASR 12.5% / benign 97.4% + OpenClaw 引用 | ⭐⭐⭐⭐⭐ 4 维横向 + boundary / rewrite 副作用 | ⭐⭐⭐⭐ 6 条后续 + 与 AgentLAB 攻防闭环 | 强 |
| HORIZON(7-08 22:50) | ⭐⭐⭐⭐ 7 类失败模式 + 跨子域诊断 | ⭐⭐⭐⭐⭐ 长程 agent 失效画像 | ⭐⭐⭐⭐⭐ 7 类 vs 6 域消融 | 强 |
| MultAttnAttrib(7-07 09:50) | ⭐⭐⭐⭐ prefill-pass 抽取 + 跨模态校准 | ⭐⭐⭐⭐ 5 步方法拆解 + 6 条反方 | ⭐⭐⭐⭐⭐ 与 V2PE 关联 + 与 prompt-based attribution 对照 | 强 |
| LongVQUBench(7-09 09:50) | ⭐⭐⭐⭐⭐ ECCV 2026 + 1200 视频 / 1500 题 / 三级评测 | ⭐⭐⭐⭐⭐ NDQA NIAH-style + 14 SOTA LVLM baseline | ⭐⭐⭐⭐ 与 VSTAT 互补定位 | 强 |
| MIOH v2(7-10 21:20 覆盖 7-08 v1) | ⭐⭐⭐⭐⭐ CVPR 2026 + arXiv ID 修正 + 8 类细粒度 | ⭐⭐⭐⭐⭐ 7 类方法学 + 代码结构级 | ⭐⭐⭐⭐⭐ 7 条反方 + BOF 上限明示 | 强 |
| Jet-Long+DrugGen-2(7-12 09:50) | ⭐⭐⭐⭐ 7+7=14 条反方 + 双 ID 引用 | ⭐⭐⭐⭐ 双篇各自方法拆解 + Substack 旁证 | ⭐⭐⭐⭐ 主题割裂(RoPE vs DrugGen)轻微 | 中-强 |
| Efficient-LVLM-Survey(7-12 15:50) | ⭐⭐⭐⭐ ACL 2026 Findings + 三阶段三轴 + 数字锚定 | ⭐⭐⭐⭐ "survey 工程化"方法论值得借鉴 | ⭐⭐⭐⭐ 与 SPEC-RL/TokenWall/V2PE 联动清晰 | 中 |
| Overthinking-TTS v1(7-08 09:50) | ⭐⭐ "基于摘要 + 通用方法学推断" 自承、abstract-only | ⭐⭐ 方法拆解是补出来而非论文里的 | ⭐⭐ 4 条反方 / 评级"建议入库"过于宽松 | 最弱(v2 已覆盖) |
| Overthinking-TTS v2(重写) | ⭐⭐⭐⭐ 仅基于摘要事实重构 + 6 条反方均挂"待 PDF 核验" | ⭐⭐⭐⭐ 与本箱 6 篇主线映射 + 6-23 已审对照 | ⭐⭐⭐⭐⭐ §0 三失误诚实陈述 + §8 六条后续动作 | 强(v2 接近本周期最强) |
3.2 最强 / 最弱判定
- 本周期最强 1 篇:
2026-07-06-1550-TechRAG-evidence-gated-agentic-RAG-critical-read.md—— 13.1KB、evidence-gated 框架拆解 + 5 段方法 + 8 条反方 + 5 维可信度矩阵;与本周内 AgentHallu-v2 / Trajel / HORIZON / TokenWall 共同支撑"agent reliability / RAG 评测"主线。取代 7-05 Vera 连续 7 天"本周期最强"标签。 - 本周期最弱 1 篇:
2026-07-08-overthinking-tts.md(v1 短备忘)—— 6.9KB、abstract-only + 自承"基于摘要 + 通用方法学推断"、评级"建议入库"过于宽松(见 §3.3)。
3.3 本日 v1 失误的具体根因
v1 失误的具体根因:
v1 §方法拆解 写"基于摘要 + 通用方法学推断"。
根因: 1. v1 沿用了 6-23 LongVidSearch+Overthinking 双稿合审里"基于摘要事实重构"的成功经验,但滑入了"基于摘要 + 通用方法学推断"的凭印象归类 —— 后者是把摘要里没说的事补出来,不是事实重构; 2. v1 评级"建议入库",但反方风险只 4 条、后续验证动作只 4 条,不满足 7-11 §3.3 "abstract-only 短评必 ≥6 条反方 + ≥6 条后续验证"的硬规则(规则 7-11 才建立,v1 写于 7-08 09:50 早于规则,是触发规则的契机); 3. v1 §Substack 旁证段把 Substack 当作"工业界呼应",但该 Substack 链接、二级转述、未给出原始 blog / 官方 spec 链接,违反"Substack 仅作旁证、不替代原文"的现有规则。
后果:v2 必须仅基于摘要事实重构(每条标注是"abstract 自报"还是"v2 推断待核验"),不补出论文没说的事;评级改为"⚠️ 监控清单 + 待 PDF 全文核验";后续验证动作升级到 6 条。
元层规则(再次强化)(仅在 §3.3 显式记录,不作为可执行承诺):
- 任何"X 未列名 / X 未给"判断必须 stop,不补猜(承接 7-10 §3.3 + 7-11 §3.3)
- abstract-only 短审稿必 ≥6 条可证伪反方风险 + ≥6 条后续验证动作(承接 7-11 §3.3)
- 评级"建议入库"门槛升到:摘要级证据 ≥3 条 + 反方风险 ≥6 条 + 后续验证动作 ≥6 条;任一不足降为"⚠️ 监控清单"或"❌ 不建议入库"
- PDF 全文未核验时必显式标注"待 PDF 核验",不下"建议入库"或"高可信"等终局判断
- 本日 v2 已纳入此规则:§0 v2 元层说明 + §3 每条标注"abstract 自报 / v2 推断待核验" + §4 六条反方均挂"待核验" + §6 评级"⚠️ 监控清单" + §8 六条后续动作
承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 四规则 → 本日五规则:最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验"。
3.4 横向交叉(仅事实陈述)
- 7-06 + 7-08 + 7-10 + 7-11 "RAG / agent reliability"耦合形成 16 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG(本周期最强) → MultAttnAttrib → HORIZON → AgentHallu(v2) ↔ Vera(防御) ↔ AgentLAB(攻击) ↔ TokenWall(防火墙) ↔ Context-Access-Divide(社会学) ↔ Trajel ↔ MIOH(v2 诊断) ↔ Video-Oasis(元方法学) ↔ Mem-Gallery(对话记忆) ↔ MemTraceBench(操作级归因)。
- 7-07 + 7-08 + 7-11 "长上下文 / 系统加速"耦合:LCA v2(架构层) ↔ KVpop(算法层) ↔ MooncakeStore(系统层) ↔ STEP3-VL-PaCoRe(测试时并行) ↔ Jet-Long(位置编码动态双焦) ↔ InftyThink(迭代) ↔ Visual Thoughts(理论中介) ↔ Efficient-LVLM-Survey(综述视角)。
- 7-07 + 7-08 + 7-12 "reasoning 效率 / overthinking"耦合:Overthinking-TTS v2(本轮重写) ↔ 6-23 LongVidSearch+Overthinking 双稿 ↔ InftyThink ↔ STEP3-VL-PaCoRe ↔ SPEC-RL(rollout 级 speculative decoding) ↔ KVpop(prediction-based pruning)。
4. 重写动作详情
- 重写文件:
inbox/flyp/2026-07-08-overthinking-tts.md - 版本:v1 短备忘 6.9KB → v2 精读与批判(保留原标题与日期戳)
- 改写要点:
- §0 v2 元层说明:v1 三处失误诚实陈述("基于摘要 + 通用方法学推断"的凭印象归类 / 评级"建议入库"过于宽松 / Substack 旁证未给原始 spec 链接)
- §1 论文卡片:仅给 arxiv.org 链接,不复述 arXiv ID 数字(避免 v1 凭印象归类)
- §2 核心贡献:仅复述摘要事实,每条标注 "abstract 自报" / "v2 推断待核验"
- §3 方法拆解:仅基于摘要观察(11 页 / 7 图 / 数学推理 / 形式化边际效用 + flip event tracking)—— 不补出论文里没说的事
- §4 六条反方风险:每条均挂"待 PDF 核验"—— flip event 是否采样伪影 / 难度调度算法未给 / 覆盖任务窄(数学推理外)/ 与 thought compression 路线张力 / 可复现性 / 学术新颖性边际
- §5 与本周期产出的对照:6 篇主线映射(KVpop、vLLM-Mooncake、Perception-R1、HORIZON、LongVQUBench、LCA、STEP3-VL-PaCoRe、TokenWall、Video-Oasis)+ 6-23 已审 Overthinking 双稿合审
- §6 可信度判断:v2 改"中。摘要论点合理、与产业界对'过度思考浪费 token'的观察一致;但 v1 自承'基于摘要 + 通用方法学推断',v2 仅基于摘要事实重构,方法细节、flip event 实现、难度调度算法维持'待 PDF 核验'判定,不补猜"
- §7 入库建议:v1"✅ 建议入库" → v2"⚠️ 监控清单 + 待 PDF 全文核验"
- §8 六条后续验证动作(升级到 ≥6 条):抓 v1 全文核验 flip event 实现 / 与 2506.12928 / P-TTS 交叉 / 关注 ICLR/ICML 2026 引用 / 与 Anthropic/OAI 公开访谈对照 / 找 GitHub 仓库 / 监控 difficulty predictor 后续工作
- §9 Substack 旁证:保留但标注"二手转述不替代原文"
- §10 元信息:诚实声明"v2 不复述 arXiv ID 数字;具体方法细节、实验规模、模型列表 —— v2 维持'待 PDF 全文核验'判定,不补猜"
- 未触碰:其它 17 篇 inbox/flyp(7-06 ~ 7-12 不含 RSS)+ 14 份 RSS + promo explainers。
5. 反思方法论状态
- 7-04 §4 退役承诺(第 9 次执行):被动式 + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5/§6 实际 ~12KB,在 ≤ 13KB 规则内。
- 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺): 1. 评级"建议入库"门槛升到:摘要级证据 ≥3 条 + 反方风险 ≥6 条 + 后续验证动作 ≥6 条;任一不足降为"⚠️ 监控清单"或"❌ 不建议入库" 2. PDF 全文未核验时必显式标注"待 PDF 核验",不下终局判断 3. abstract-only 短审稿必 ≥6 条反方 + ≥6 条后续验证动作(承接 7-11 §3.3 升级)
- 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。
6. 元信息
- 版本:v1 | 写入路径:
/shared/research-kb/organized/reflection/flyp-2026-07-12.md| 覆盖文件:inbox/flyp/2026-07-08-overthinking-tts.md(v1 6.9KB → v2 精读与批判) - 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
- 本日转折:v1 Overthinking-TTS 自承"基于摘要 + 通用方法学推断" → v2 仅基于摘要事实重构 + 评级降为"⚠️ 监控清单"——见 §3.3。
- 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 8 周+0 兑现归 §2 #1,不再追。
- 下一次(7-13 起):继续被动式、≤ 13KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 五规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验"。
本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 9 次执行。不复制其它反思内容、不抓 Substack/arXiv 长段、不 git、不输出 Token。