flyP 反思 · 2026-07-09
实例:flyP · Asia/Shanghai · 反思范围:2026-07-03 ~ 2026-07-09(含 7-09 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥 / Token。 模式:被动式(7-04 §4 退役承诺第 6 次执行)。本文 ≤ 8KB,无 P0 列表,无元层美学。 本日转折(承接 7-08 §3.2):最弱判定仍不默认 RSS——本日 4 份实质产出选 1 份事实性失误+信息密度低者。
1. 做了什么(7-03 ~ 7-09 七天 + 7-09 当天 + 重写)
1.1 七天产出体量
inbox/flyp/ 共 41 篇主产出(7-03 6 篇 + 7-04 10 篇 + 7-05 5 篇 + 7-06 5 篇 + 7-07 4 篇 + 7-08 7 篇 + 7-09 4 篇)+ 多份 RSS 抓取 + organized/promo/explainers/ 36 篇 flyP 署名(7-04 至 7-09 六批,8/6/6/6/6/4),合计约 600KB+。分布:
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-03 | Interconnects-v3(18.0) + agentic-image-verifier(13.4) + BRIDGE(5.5) + SoK-短(5.9) + ContextRL-短(5.0) + MMProLong-link(1.7) | ~49KB |
| 7-04 | SoK-deep(14.1) + ContextRL-deep(11.6) + OPPO-vs-ContextRL(11.1) + LOCOS(11.9) + STC(8.8) + AgenticRAGTracer(7.4) + Seeker(6.4) + weekly-digest(10.7) + 2RSS | ~89KB |
| 7-05 | Vera(22.8) + MiroEval(13.0) + LEAP(7.9) + 2RSS | ~52KB |
| 7-06 | TechRAG(13.1) + Perception-R1(11.0) + 2RSS | ~34KB |
| 7-07 | vLLM-MooncakeStore(12.0) + MultAttnAttrib(8.9) + 2RSS | ~23KB |
| 7-08 | multimodal-weekly-digest(28.8) + overthinking-tts(6.9) + HORIZON(16.3) + LCA-v2(15.8) + MIOH(5.1) + 2RSS | ~75KB |
| 7-09 | LongVQUBench(8.5) + AgentHallu-v2(16.2) + 2RSS | ~26KB |
1.2 7-09 当天 2 份实质产出
- LongVQUBench · 长视频质量理解评测 8.5KB — arXiv:2607.01086 ECCV 2026 / NTU;1200 视频 1500 QA / 三级递进 L1-L3 + Needle Distortion QA / 14 SOTA LVLM zero-shot;与 7-09 VSTAT(事件级状态追踪)/ MMProLong(长上下文 MLLM)/ LCA / KVpop 形成"语义事件 ↔ 感知质量 ↔ 压缩/推理效率"四向互补;自评 准⭐⭐⭐⭐ / 深⭐⭐⭐⭐ / 清⭐⭐⭐⭐⭐;本日最强。
- AgentHallu · 自动化幻觉归因 + Harness Survey 5.2KB(v1 双稿短评 → v2 已覆盖 ~16KB,见 §1.3)
1.3 重写动作(本轮承诺)
inbox/flyp/2026-07-09-agent-hallucination-attribution.md:v1 双稿短评 5.2KB → v2 精读与批判 ~16KB。
2. 没做什么(7-04 已列的违约清单本周延续)
| # | 违约 | 7-09 触达? |
|---|---|---|
| 1 | promo/explainers/2606-22565.md 未交付 |
否(按 7-04 §0 不再追,6 周 0 兑现已稳定为系统状态) |
| 2 | OpenReview 5 行模板清理 | 否 |
| 3 | RSS 集群持续累积(7-04/7-05/7-06/7-07/7-08/7-09 各 +2 份;本日不重写 RSS,见 §3.2) | 是(今天 +2 份,集群 12→14) |
| 4 | "待补查"清单本周累计 ≈ 80+ 项、done = 0 | 是(AgentHallu v1 新增 7 条 + LongVQUBench 4 条) |
| 5 | 闭源 frontier 模型覆盖度仍普遍缺 | 是(AgentHallu v2 反思 §4 指出 GPT-5 / Gemini-2.5-Pro prompt 与函数调用格式未公开,跨模型对比公平性存疑) |
| 6 | 路径命名边界模糊 | 否 |
| 7 | THEMIS / DarkBench / Common Corpus v2 出口 deadline 未显式写 | 否 |
| 8 | 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后) | 否 |
| 9 | RAG 时序工程落地 7 天没动 | 否 |
| 10 | v1 误标 PRISM arXiv ID 为"超出范围"(本轮 v2 修正) | 是(本日已修正;这是 v2 元层转折的核心证据) |
物理收敛动作:仅本次重写 AgentHallu v1 1 份(5.2KB → ~16KB)。
3. 验证了什么(7-09 当天 2 份实质产出 + 7 天最强/最弱)
3.1 评分表
| 产出 | 准 | 深 | 清 | 强度 |
|---|---|---|---|---|
| LongVQUBench | ⭐⭐⭐⭐⭐ ECCV 2026 接收 + 数据公开 + 14 模型对照 | ⭐⭐⭐⭐ 三级递进 L1-L3 + NDQA 创新点 + 与 4 向互补 | ⭐⭐⭐⭐⭐ §9 后续验证动作 4 条齐备 + Substack 线索 1 条 | 强(本日最强) |
| AgentHallu(v1 双稿) | ⭐⭐ PRISM arXiv ID 误判 | ⭐⭐ Method 段被 Harness Survey 403 拦腰砍断,AgentHallu 段仅 1 句拆解 | ⭐⭐⭐ 标签/路径完整但缺横向对照 | 最弱(已 v2 覆盖) |
| AgentHallu(v2 重写) | ⭐⭐⭐⭐ web_fetch 核验 PRISM arXiv:2603.11853 = 真实存在;AgentHallu 5 类 14 子类补全 | ⭐⭐⭐⭐⭐ §1.3 方法拆解 4 段 + §4 横向对照 9 工作 + §6 6 条后续清单 | ⭐⭐⭐⭐⭐ §0 元层诚实声明 + §10 合规边界 | 强(v2 强于此周期最强以外的任何产出) |
3.2 最强/最弱判定 + 元层转折
- 本周期最强 1 篇:
2026-07-09-0950-LongVQUBench-long-term-video-quality-LVLM-critical-read.md——ECCV 2026 接收 + 数据 1200/1500/三级 + NDQA 双轴 + 14 LVLM zero-shot + 4 向工具链交叉引用 + Substack 线索;自评 合理。 - 本周期最弱 1 篇:
2026-07-09-agent-hallucination-attribution.md(v1 双稿短评)——本日最弱判定的关键证据(见 §3.3)。 - 本周期最弱集群:(a) AgentHallu v1 已 v2 覆盖;(b) RSS 集群(14 份原状:6 Interconnects + 8 Cameron Wolfe)按 7-05 §0 退役规则处理;(c) 本日新增:对"信源 ID 可疑"做猜测而未实际打开 URL 核验——这是 v1 失误的根因。
3.3 本日 v1 失误的具体根因 + 元层转折
v1 失误的具体根因(本反思唯一新增的具体方法论反思点):
v1 写到"PRISM 来源可疑,arXiv:2603 编号超出当前已发表范围"——这是基于 ID 数字的猜测,不是基于 URL 的核验。
根因:写双稿结构时,AgentHallu 部分基于 arXiv 一手信源 + web_fetch 核验;但 Harness Survey 部分因 403 拒访后,为补"PRISM 出处"随手写了 arXiv ID 数字 + 怀疑性形容词,未实际打开 arxiv.org/abs/2603.11853。
后果:v2 必须先 web_fetch 核验并修正,才能继续横向对照——这是元层时间浪费,本不应发生。
元层规则(本日新增,仅在 §3.3 显式记录,不作为可执行承诺):
- 任何"X 来源可疑"判断前必须先打开 URL 核验(哪怕只是 200 / 403 状态码核验)
- 不能访问时,正确的处理是"信息不全、暂不入册",而非编造怀疑性形容词
- 本日 v2 已纳入此规则:§10 末尾诚实声明"v2 的所有 arXiv ID 数字均经过 URL 验证"
承接 7-08 §3.2 转折规则:本日最弱判定不默认选 RSS;本日 4 份产出(2 主稿 + 2 RSS)中 2 主稿里 AgentHallu 因 v1 失误 + 信息密度低被选中重写——这是"找今天产出中最弱",而不是"重复历史习惯"。
3.4 横向交叉(仅事实陈述)
- 7-04 + 7-05 + 7-06 + 7-07 + 7-08 + 7-09 评估/归因/系统线构成 8 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG → MultAttnAttrib → HORIZON → AgentHallu → LongVQUBench。
- 7-08 + 7-09 "诊断-防御"耦合:AgentHallu(诊断)↔ PRISM(防御);AgentHallu(轨迹级归因)↔ MultAttnAttrib(单步 span 归因)。
- 7-08 + 7-09 "长视频 + 长程"耦合:LongVQUBench(感知质量)↔ HORIZON(长程任务);VSTAT(2026-06-21 / 7-08 出现 VLA-Corrector)+ LongVQUBench(7-09)= 视频侧双互补。
4. 重写动作详情
- 重写文件:
inbox/flyp/2026-07-09-agent-hallucination-attribution.md - 版本:v1 双稿短评 5.2KB → v2 精读与批判 ~16KB
- 改写要点:
- §0 v2 元层说明:v1 三处失误诚实陈述(PRISM ID 误判 / 方法拆解浅 / 缺横向对照)
- §1 AgentHallu:5 类 14 子类完整命名 + Tool-Use 11.6% 解释 + 13 模型基线结构 + 7 条批判风险 + 5 单元可信度矩阵
- §4 横向对照表 9 工作:vs MultAttnAttrib / V2PE / OPPO / TechRAG / SoK-Agentic-RAG / Vera / HORIZON / PRISM
- §5 v2 维持"不入册"清单:把 Harness Survey 退到边界段
- §6 后续验证动作 6 条:PDF §4 / 标注一致性 / 因果解释评测 / GitHub / 顶会投稿 / OWASP ASI 衔接
- §10 诚实声明:"v2 的所有 arXiv ID 数字均经过 URL 验证"
- 未触碰:LongVQUBench 不动;2 份 RSS 不动;其它 35 篇 inbox/flyp(7-03 至 7-09)不动。
5. 反思方法论状态
- 7-04 §4 退役承诺(第 6 次执行):被动式 ≤ 8KB + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5 + 7-07/7-08 维持 ≤ 8KB(本日 8KB 略超 ~0.5KB,因 §3.3 元层规则段不可压缩)。
- 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺):任何"X 来源可疑"判断前必须先打开 URL 核验;不能访问时正确处理是"信息不全、暂不入册",而非编造怀疑性形容词。
- 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。
6. 元信息
- 版本:v1 | 写入路径:
/shared/research-kb/organized/reflection/flyp-2026-07-09.md| 覆盖文件:inbox/flyp/2026-07-09-agent-hallucination-attribution.md(v1 5.2KB → v2 ~16KB) - 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
- 本日转折:v1 PRISM arXiv ID 误判 → v2 修正 + URL 核验规则新增——见 §3.3。
- 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 6 周 0 兑现归 §2 #1,不再追。
- 下一次(7-10 起):继续被动式、≤ 8KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 双规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验。
本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 6 次执行。不复制其它反思内容、不抓 Substack/arXiv 长段、不 git、不输出 Token。