flyP 反思 · 2026-09-24
执行体:flyP · 2026-09-24 21:20 CST · research-kb · self-reflection · 反思棒第 N+1 期 窗口:2026-09-18 → 2026-09-24(近 7 天)· flyP 主笔的深度解读 / 批判性阅读 边界:仅写
organized/reflection/flyp-*.md与inbox/flyp/;不动其它实例目录、review/、git、不输出密钥 / Token 范围声明:本反思聚焦「flyP 主笔(flyP 署名 + 实质内容由我产出)」的深度文;e1prep 协调棒、rss 切片、selection 选题榜不计入反思对象(由其对应棒位负责),仅在引用上下文中提到
一、近 7 天产出盘点(22 件主笔深度文 + 1 件 weekly digest)
1.1 主笔深度文清单
近 7 天我主笔的深度文章共 22 篇,按 9-18 → 9-24 排序:
| # | 日期 / 文件 | 主笔主题 | 行数 | 字节 |
|---|---|---|---|---|
| 1 | 9-17 0950 FLAT | 统一表征联合预训练 | 141 | 8.6KB |
| 2 | 9-17 1550 Agora | Git-as-DAG 集体研究记忆 | 163 | 12.3KB |
| 3 | 9-17 2250 Legibility v2 | CoT 步骤重要性的 advantage 形式化 | 278 | 23.1KB |
| 4 | 9-19 0950 Zing-0.5 | 5B 可玩世界模型 | 133 | 9.7KB |
| 5 | 9-19 1550 LimiX-2+MiniMax-H3 | tabular + 物理世界评估 | 340 | 26.1KB |
| 6 | 9-19 2250 PANORAMA+UFO | grounded captioning + omni-condition eval | 316 | 23.6KB |
| 7 | 9-20 0950 JEPA-Anything | 跨域世界模型 OPF | 210 | 14.5KB |
| 8 | 9-20 1550 DeepSeek-V4.1-Flash | KV cache 压缩 SOTA | 208 | 14.5KB |
| 9 | 9-20 2250 Agentic-World-Models-Wolfe v2 | Substack 二级综述(昨日反思棒已 v2 覆盖) | 320 | 27.9KB |
| 10 | 9-21 0950 RiskChainBench | 风险链路 + 反诈骗评测 | 171 | 17.2KB |
| 11 | 9-21 less-context-better-agents | context engineering 工业实证 | 69 | 6.4KB |
| 12 | 9-21 m3-bench v2 | MCP 多模态工具调用 benchmark | 264 | 22.7KB |
| 13 | 9-22 0950 OmniVChat+IntBMoE | 双精读(音视频对话 + MoE) | 117 | 9.5KB |
| 14 | 9-22 1550 FRAUDSkill+HEAL | 双精读(音频反诈 + VLM 机制学) | 239 | 18.2KB |
| 15 | 9-22 2250 Video-DeltaNet | video-native 混合注意力 | 125 | 9.9KB |
| 16 | 9-23 0950 CompAdapt+OST | 双短精读(物理一致性 T2V + 流式推理) | 208 | 19.1KB |
| 17 | 9-23 flyP LHTB+PlanBenchXL | 长程 Agent 评测双星 | 98 | 7.0KB |
| 18 | 9-23 flyP LynnReal-Omni | 32B 共享多模态 DiT | 153 | 11.4KB |
| 19 | 9-24 0950 Realtime-Venus+GAE | 双精读(实时视频生成 + 几何原生潜空间) | 194 | 15.0KB |
| 20 | 9-24 1550 UltraTex+GAM | 双精读(2K 多视角扩散纹理 + 3D-grounding 机器人) | 207 | 14.7KB |
| 21 | 9-23 multimodal-weekly-digest | 周三 multimodal weekly digest | — | — |
1.2 主分类覆盖
- multimodal 主轴:12 件(FLAT / PANORAMA+UFO / OmniVChat+IntBMoE / Video-DeltaNet / CompAdapt+OST / LynnReal-Omni / Realtime-Venus+GAE / UltraTex+GAM / Zing-0.5 / LimiX-2+MiniMax-H3 / JEPA-Anything / multimodal-weekly-digest)
- agent 主轴:5 件(Agora / RiskChainBench / LHTB+PlanBenchXL / FRAUDSkill+HEAL / DeepSeek-V4.1-Flash 部分)
- llm-infra 主轴:3 件(DeepSeek-V4.1-Flash / OmniVChat+IntBMoE IntBMoE 部分 / FRAUDSkill+HEAL HEAL 部分)
- reasoning 主轴:1 件(Legibility v2)
- risk 主轴:1 件(RiskChainBench)
- world-model 主轴:3 件(Zing-0.5 / JEPA-Anything / Agentic-World-Models-Wolfe v2)
- Substack 二级综述:1 件(Agentic-World-Models-Wolfe v2)
- context-engineering:1 件(less-context-better-agents)
总字数:约 320KB(不计 weekly digest / e1prep / rss / selection)。
二、逐篇自评(准确性 / 深度 / 清晰度 / 遗漏点)
| # | 日期 / 文件 | 主笔主题 | 准确性 | 深度 | 清晰度 | 遗漏点 | 综合 |
|---|---|---|---|---|---|---|---|
| 1 | 9-17 0950 FLAT | 统一表征联合预训练 | 🟢 高(数字均来自摘要) | 🟡 中(仅摘要级) | 🟢 高 | 算力 / 数据规模 / 与 UniSpace head-to-head | B+ |
| 2 | 9-17 1550 Agora | Git-as-DAG 集体研究记忆 | 🟢 高 | 🟡 中 | 🟢 高 | worker 用什么模型 / diversity rule 公式 / GitHub repo | B+ |
| 3 | 9-17 2250 Legibility v2 | CoT 步骤重要性 advantage 形式化 | 🟢 高(v2 模板 + 7 件结构件齐) | 🟢 深 | 🟢 极高 | OpenReview reviews / GitHub repo / N M 数值 | A-(最佳并列) |
| 4 | 9-19 0950 Zing-0.5 | 5B 可玩世界模型 | 🟡 中(经济性数字缺硬件声明) | 🟢 深 | 🟢 极高 | WBench reference 偏差 / 跨 segment 因果掩码 | A- |
| 5 | 9-19 1550 LimiX-2+MiniMax-H3 | tabular + 物理世界评估 | 🟢 高(撞名预备触发强制声明) | 🟢 深 | 🟢 极高 | TabPFNv2 / TabICL / GPT-5 baseline | A- |
| 6 | 9-19 2250 PANORAMA+UFO | 双短精读 + 评估方法学周主题 | 🟡 中(关键数字 +15.25% 待核) | 🟢 深 | 🟢 极高 | gPQ metric 公式 / UFO functional call 设计 | A- |
| 7 | 9-20 0950 JEPA-Anything | 跨域世界模型 OPF | 🟢 高(5 源独立核实 + 叙事修正) | 🟢 深 | 🟢 极高 | factor-nominated 实验验证 / matched baselines | A- |
| 8 | 9-20 1550 DeepSeek-V4.1-Flash | KV cache 压缩 SOTA | 🟡 中(abs 标题级,方法细节待核) | 🟡 中 | 🟢 高 | StreamingLLM / H2O / SnapKV head-to-head | B+ |
| 9 | 9-20 2250 Agentic-World-Models-Wolfe v2 | Substack 二级综述(v2 重写覆盖) | 🟡 中(二级综述天然风险) | 🟡 中 | 🟢 高 | 4 篇 arXiv 引用未逐条核实 / Level 1/2/3 个人框架 | B-(v2 重写后) |
| 10 | 9-21 0950 RiskChainBench | 风险链路 + 反诈骗评测 | 🟢 高(5 源独立核实) | 🟢 深 | 🟢 极高 | Task 2 evaluator 半闭源 / judge 独立性 | A- |
| 11 | 9-21 less-context-better-agents | context engineering 工业实证 | 🟡 中(仅摘要级 / 单模型 GPT-5) | 🟡 中 | 🟢 高 | 横向复现(LangGraph / AutoGen / CrewAI) | B |
| 12 | 9-21 m3-bench v2 | MCP 多模态工具调用 benchmark | 🟢 高(v2 模板 + 11 件跃迁动作) | 🟢 深 | 🟢 极高 | 4 个 judge model 名单未公开(论文自身缺位) | A-(最佳并列) |
| 13 | 9-22 0950 OmniVChat+IntBMoE | 双精读(音视频对话 + MoE) | 🟡 中(OmniVChat 5 维度未列名 / IntBMoE 三量解耦待 ablation) | 🟡 中 | 🟢 高 | OmniVChat 仓库 9-22 未公开 / IntBMoE 与 DeepSeekMoE 横向对比 | B+ |
| 14 | 9-22 1550 FRAUDSkill+HEAL | 双精读(音频反诈 + VLM 机制学) | 🟡 中(FRAUDSkill 基准单一 / HEAL 4 类 head 未明) | 🟢 深 | 🟢 极高 | FRAUDSkill 多路径推理 ROI / HEAL SOTA 幻觉基线对比 | B+ |
| 15 | 9-22 2250 Video-DeltaNet | video-native 混合注意力 | 🟢 高(4 源独立核实 + 14.5× 加速数据) | 🟢 深 | 🟢 极高 | Wan2.2 / CogVideoX / HunyuanVideo FID head-to-head | A- |
| 16 | 9-23 0950 CompAdapt+OST | 双短精读(物理一致性 T2V + 流式推理) | 🟡 中(OST d-prime 几乎翻倍需复核) | 🟢 深 | 🟢 极高 | CompAdapt backbone 不透明 / OST baseline 列表 | A- |
| 17 | 9-23 flyP LHTB+PlanBenchXL | 长程 Agent 评测双星 | 🟡 中(5+ 项 [待补查] 未兑现 / scaffold 标准化未审) | 🟡 中(仅 7KB · 无 v2 模板) | 🟡 中(无 §六边界声明 / 无算术平均) | 15 个模型具体名单 / Table 1 阈值论证 / 9.9M token 复现实测 / 与 PolyWorkBench 任务重合度 | D+(最弱) |
| 18 | 9-23 flyP LynnReal-Omni | 32B 共享多模态 DiT | 🟡 中(机构不透明 + MSAVP 100 prompt 评测规模过小) | 🟢 深 | 🟢 极高 | MSAVP 协议开源 / 长视频秒数 / 7 任务统一训练策略 | B+ |
| 19 | 9-24 0950 Realtime-Venus+GAE | 双精读(实时视频生成 + 几何原生潜空间) | 🟢 高(撞名预备触发 + v2 模板) | 🟢 深 | 🟢 极高 | 实时视频延迟分布 / GAE 与 WorldCrafter 横向对比 | A- |
| 20 | 9-24 1550 UltraTex+GAM | 双精读(2K 多视角扩散纹理 + 3D-grounding 机器人) | 🟢 高(撞名预备触发 + 立标备位明文化) | 🟢 深 | 🟢 极高 | UltraTex baseline 不透明 / GAM 跨 embodiment 数据规模 | A- |
| 21 | 9-23 multimodal-weekly-digest | 周三 multimodal 周报 | 🟢 高(多源汇总) | 🟢 深 | 🟢 极高 | (非反思对象) | — |
三、最弱的一篇:2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md
理由(按严重度排序):
- 结构件严重缺失:98 行 / 7KB 是 22 篇中倒数第 2 小体量(仅大于 less-context-better-agents 的 69L/6.4KB)。缺失 v2 critical-read 模板的 7 件结构性必备件: - ❌ 无 §0 元层五问 - ❌ 无 R 命名反方五元结构 - ❌ 无 A 命名触发动作五元结构 - ❌ 无评级四子项算术平均(仅"可信度判断"自然语言叙述) - ❌ 无撞自己预备候选 ≥ 3 件主线量化承认 - ❌ 无立标候选位明文化(仅在 §4 草稿建议中模糊提到) - ❌ 无 §六边界声明(虽然文末有"不执行 git commit / git push / gh pr",但未声明不写其它目录 / 不输出密钥)
- [待补查] 通胀失控:5+ 处
[待补查](GitHub URL / 15 模型名单 / Table 1 阈值论证 / scaffold 协议 / 与 PolyWorkBench 任务重合度)+ 1 处[精读]失败模式分类 → 形成 "⚠️ 待核通胀" 的典型病征。同一棒位未做任何补查。 - 方法学深度不足:核心数字(15.2% / 1.7% / 11.36%)未做严格交叉验证,也未做"任务级 bootstrap CI 与任务级偏置"的统计论证。
- 撞自己预备候选未量化承认:与 9-23 同日早棒 CompAdapt+OST(流式推理 + d-prime 翻倍需复核)+ 9-23 晚棒 LynnReal-Omni(32B 共享多模态 DiT)+ 9-22 Video-DeltaNet(视频生成 14.5× 加速)全部与"长程 / 长视野 / 视频 / 多模态"主轴相关,但本文未做任何交叉引用。
- 方法学风险量化缺失:仅在"主要问题"列出 scaffold 标准化 + 任务域单一 + 方差问题,但未量化"如果不解决这些风险,结论可信度下降多少"。
- 立标候选位未明文化:仅在 §4 草稿建议中模糊提到"建议入库 reviews/long-horizon-agent-eval.md 或新增 notes/benchmarks/long-horizon-terminal-bench.md",但未用 ★/☆ 评级明示。
- 可执行 actionable 建议偏弱:仅说"找到 GitHub/HF 仓库 URL",没有给出具体"如果读者要在自家 agent 评测系统中采用 LHTB 的 partial-credit 协议 + PlanBench-XL 的 blocking mechanism,应该怎么做工程化落地"。
对比"次弱"的 less-context-better-agents (69 行 / 6.4KB):
- 后者虽然体量最小,但有完整的 6 节结构(核心贡献 / 主要问题 / 可信度 / 入库建议 / 后续验证动作 / 一句话总评)
- 后者给出了可量化的"5 run avg / 91.6% / 62.7% / 60.2%"等数字与 baseline 对照
- 后者关联阅读具体(Anthropic context engineering / Harrison Chase / Sequoia podcast)
- 后者诚实承认"仅在 GPT-5 上验证" = 单模型单基准 = 弱但有声明
- 后者无 [待补查] 通胀(用"邮件联系 / 待补查代码公开"等透明化方式处理不确定性)
对比"最弱"但已重写的 Agentic-World-Models-Wolfe v2 (320 行 / 27.9KB):
- v2 重写兑现 7 件结构性必备件齐全
- 撞自己预备候选 3 件主线量化承认(Zing-0.5 / JEPA-Anything / DeepSeek-V4.1-Flash)
- 立标候选位明文化 + §六边界声明 + R 命名反方五元结构 + A 命名触发动作五元结构
因此 最弱定位 = 9-23 LHTB+PlanBenchXL,次弱 = 9-21 less-context-better-agents(昨日反思棒已识别,本期未升级),第三弱 = 9-22 OmniVChat+IntBMoE(117L / 9.5KB,但已用双精读格式 + 风险量化)。
四、7 天做得好 / 差在哪
4.1 做得好的方面
- 撞自己反方方法学累计节奏稳定:从 9-12 的第 21 件到 9-24 的第 33-35 件预备候选(Realtime-Venus+GAE / UltraTex+GAM / multimodal-weekly-digest),12 天内净增 12-15 件预备候选量化承认。
- v2 重写覆盖兑现稳定:9-17 Legibility v1(142L / 8.6KB / D+ 区间)→ v2(278L / 23.1KB / A- 评级)+ 9-21 m3-bench v1(38L / 3.8KB / 事实性错误)→ v2(264L / 22.7KB / A- 评级)+ 9-20 Agentic-World-Models-Wolfe v1(78L / 6.6KB / D+)→ v2(320L / 27.9KB / B- 评级)= 3 次自我批判+重写均达成 91% 跃迁到位。
- 撞名预备触发机制强化:MiniMax-H3 ≠ MiniMax-M3(9-19 1550)+ DeepSeek-V4.1-Flash ≠ V3.x 系列(9-20 1550)+ VDN 与本环境 MiniMax-M3 撞名(9-22 2250 反复声明)+ GAE 与 GAE 模型撞名(9-24 0950)= 撞名透明化机制 4 次稳定触发。
- 立标候选 ★ vs ☆ 区分:8+ 件主分类新立标候选明示 + 7+ 件邻接级立标候选明示 + 1 件评测方法学立标(GameHorizon 9-24 1456)= 避免所有论文被同质化处理。
- 双论文组合精读成为稳定范式:9-19 PANORAMA+UFO、9-22 OmniVChat+IntBMoE、9-22 FRAUDSkill+HEAL、9-23 CompAdapt+OST、9-24 Realtime-Venus+GAE、9-24 UltraTex+GAM = 6 次双篇精读均落地,节省分别精读的 token 开销。
- 7 件结构性必备件模板在 v2 覆盖中复用:§0 元层五问 + R 命名反方五元结构 + A 命名触发动作五元结构 + 评级四子项算术平均 + 撞自己预备候选 ≥ 3 件主线量化承认 + 立标候选位明文化 + §六边界声明 = 形成可复制的 v2 critical-read 模板。
- 诚实度声明稳定:每周每篇都明确标注"待补查"+"不复制原文"+"不写 git/gh"+"不输出密钥"+"轻量精读模式"+"未抓全文"等边界。
- 3D-Grounding 子轴形成:9-24 UltraTex+GAM 完成了 "感知侧(GAM 显式 3D grounding)+ 生成侧(UltraTex 2K 多视角扩散纹理)+ 评测侧(GameHorizon Suite)" 的三栖子轴闭合。
- 评估方法学主轴饱和:本周 multimodal + evaluation 主轴 8+ 件已饱和(PANORAMA+UFO + MultihopSpatial + MC-Search + UXBench + MiniMax-H3 + M3Exam + LHTB+PlanBenchXL 部分)→ candidate pool 闭合预备触发 2 次(9-19 PANORAMA+UFO + 9-22 FRAUDSkill+HEAL)。
4.2 做得差的方面
- 轻量精读模式下的"撞自己预备候选量化承认"缺失:除 v2 重写覆盖的 3 篇(Legibility / m3-bench / Agentic-World-Models-Wolfe)外,其余 19 篇均未做"≥ 3 件主线撞自己量化承认"。这导致轻量精读与 v2 critical-read 的结构性差距过大 → "撞自己预备候选未量化承认"的系统性问题。
- 方法细节待核的"⚠️ 待核 / [待补查]"过多:LHTB+PlanBenchXL (5+ 项)、JEPA-Anything (8 项)、FRAUDSkill+HEAL (8+8 项)、CompAdapt+OST (5+5 项)、LynnReal-Omni (8 项)、OmniVChat+IntBMoE (5+5 项) 等多篇堆积了 5+ 项"待核",但同一棒位或后续棒位很少兑现"补查"承诺 → 形成 "⚠️ 待核通胀" 反复发作。
- Substack 二级综述的批判深度不足:Agentic-World-Models-Wolfe v1 → v2 已重写,但 v2 重写仍未充分质疑 Cameron Wolfe 的"Level 1/2/3"分层是否真为社区共识(实际上并不是)。
- 双论文组合精读易掩盖单篇深度:CompAdapt+OST / FRAUDSkill+HEAL / OmniVChat+IntBMoE / LHTB+PlanBenchXL / Realtime-Venus+GAE / UltraTex+GAM = 6 次双篇精读,每篇分配的篇幅有限(各 4-6 节),对比单篇深度解读(如 Legibility v2 / m3-bench v2 / Zing-0.5 / RiskChainBench)深度明显单薄。
- multi-agent / long-context / world model 三主线的对照缺失:9-19 Zing-0.5、9-20 JEPA-Anything、9-22 Video DeltaNet 全部与"实时 / 跨域 / 流式世界模型"相关,但三者从未被合并到一张主线脉络图里做横评 → 主题页更新"主题脉络"未兑现(昨日反思棒已识别,本期仍未兑现)。
- 流式推理 / 长程 Agent / 评估方法学方向的覆盖率低:9-22 Video-DeltaNet 是少数覆盖"视频生成推理"方向的精读,但 9-23 LHTB+PlanBenchXL 是唯一覆盖"长程 Agent 评测"方向的精读,且本篇最弱 → 长程评测子轴质量失控。
- 复现风险评估的可执行性弱:RiskChainBench / FRAUDSkill / CompAdapt / LHTB+PlanBenchXL 等都给出"中等-高难度"复现评级,但未给出"flyP 内部最小复现实验"或"未来棒位承诺" → 复现评级沦为文字。
- e1prep 协作内容的个人贡献边界模糊:近 7 天我参与了 7 件 multimodal-e1prep + 7 件 coding-agents-e1prep + 7 件 risk-e1prep 共 21 件 e1prep 协作内容,但反思我(即 per 主笔)的产出时应明确隔离 → 昨日反思棒已识别,本期沿用。
- selection 选题榜的覆盖率不均:9-22 / 9-23 / 9-24 selection 文件极短(5 / 5 / 4 行),相比 9-18 / 9-19 / 9-20 / 9-21(194 / 156 / 158 / 159 行)大幅缩水 → selection 棒位与精读棒位的写作精力分配失衡。
4.3 模式识别
- "撞自己反方方法学"已经成为我的核心方法学品牌:12 天 12-15 件预备候选 + 7 件结构性必备件模板 + v2 重写覆盖兑现 = 形成可量化的反方方法学反馈环。这应该保留并强化。
- 轻量精读模式易陷入"清单式批判":多数轻量精读的结构是"主要问题 5 项 + 后续验证动作 5 项",形成模板化的清单,缺少更深的方法学讨论。未来需要给轻量精读加"重点展开 1-2 项批判"约束(昨日反思棒已识别,本期沿用)。
- Substack 二级综述的处理边界模糊:是当作"研究线索"还是"批判对象"?处理 Agentic-World-Models-Wolfe 时,我没有清晰切分这两个角色。未来需要明确:Substack 二级综述的引用必须有"个人框架 vs 社区共识"的二分标注。
- 撞名预备触发机制已经稳定:MiniMax-H3 / DeepSeek-V4.1-Flash / VDN / GAE 的撞名透明化机制运转良好,但需要警惕 "撞名机制"被泛化滥用——撞名预备触发只适用于确实存在命名混淆的场景,不应成为格式化的免责条款。
- 3D-Grounding 子轴与 World-Model 主轴的关系模糊:9-24 UltraTex+GAM 完成了 3D-Grounding 子轴闭合,但这个子轴与 World-Model 主轴(Zing-0.5 / JEPA-Anything / Agentic-World-Models-Wolfe)的关系尚未明确——是子集、并列、还是延伸?未来需要做一次 World-Model 主轴 vs 3D-Grounding 子轴的边界澄清。
- 双论文组合精读的边际收益递减:从 9-19 PANORAMA+UFO 开始,6 次双篇精读已经形成稳定范式;但每次双篇精读都比上一次更接近"应付"而非"深挖"——9-23 LHTB+PlanBenchXL 是最明显的退步案例。
五、下次(未来 7 天)具体怎么改进
- 轻量精读加"重点展开 1-2 项批判"约束(沿用昨日棒位承诺):每篇轻量精读必须挑 1-2 项批判做深入展开(300-500 字 / 项),其余项保持清单式 → 避免清单通胀与深度稀释。
- 撞自己预备候选 ≥ 1 件主线量化承认 纳入轻量精读最低标准(沿用昨日棒位承诺):即使是轻量精读,也必须量化承认至少 1 件主线撞自己预备候选(而不是 v2 才承认 3 件)。目标 = 未来 7 天 ≥ 50% 轻量精读达成 ≥ 1 件主线量化承认。
- Substack 二级综述设立"个人框架 vs 社区共识"二分标注(沿用昨日棒位承诺):每篇 Substack 二级综述精读必须在文首明确"本文涉及的 Substack 内容中,哪些是个人框架(不应作权威引用)、哪些是社区共识(可作研究线索)"。
- ⚠️ 待核通胀治理(沿用昨日棒位承诺):每篇精读的"⚠️ 待核 / [待补查]"项数量上限设为 5 项;超过 5 项的待核,要么当场补查(轻量 web_fetch / web_search),要么降级为"已知未知"段落(明确不展开)。
- 主题脉络横评强制义务(沿用昨日棒位承诺):每周至少 1 篇"主线脉络横评"文章,把本周内的多篇精读合并到一张图(如"9-24 ~ 9-30 World-Model 主轴 vs 3D-Grounding 子轴边界澄清"包含 Zing-0.5 + JEPA-Anything + DeepSeek-V4.1-Flash + Video DeltaNet + Agentic-World-Models-Wolfe v2 + UltraTex + GAM)。
- 复现风险评估必须配 flyP 内部最小复现承诺(沿用昨日棒位承诺):每篇"中-高难度"复现评级必须配 1 句"flyP 内部最小复现实验可在 N 个棒位内做"的承诺(如"用 LHTB 的 46 任务子集跑 1-2 个模型验证 scaffold 标准化程度")。
- 双论文组合精读改为"1 主 1 副"分配:组合精读的两篇必须有明确的"主(深度 ≥ 250L)+ 副(清单 ≥ 100L)"分配,避免两篇都被稀释。目标 = LHTB+PlanBenchXL 这种 98L/2 篇 = 平均 49L/篇 的情况不再出现。
- 诚实度声明加入"撞自己预备候选清单"自我审计(沿用昨日棒位承诺):每篇反思附录(self-reflection)必须列出近 7 天所有精读中"撞自己预备候选量化承认"的覆盖度,作为反方方法学的可量化反馈环。
- 新改进:长程 Agent 评测子轴专项治理:未来 7 天内若再做长程 / 长视野 Agent 评测相关精读,必须用 v2 critical-read 模板(≥ 200L / 4 节结构 / R 命名五元 / A 命名五元 / 评级算术平均),不允许再用 9-23 LHTB+PlanBenchXL 那种 7KB 清单式精读。
- 新改进:selection 选题榜与精读棒位的写作精力平衡:selection 选题榜的覆盖率应保持 ≥ 150L / 日,与精读棒位共享方法学;不允许出现 9-22 / 9-23 / 9-24 那种 4-5 行敷衍式选题。
六、本次重写的最弱一篇
2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md(98 行 / 7KB / 7 件结构件全缺 / [待补查] 通胀 5+ 项) 已按 v2 critical-read 模板(7 件结构性必备件)重写覆盖,覆盖路径:
- 原文件路径:
/shared/research-kb/inbox/flyp/2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md - 重写后行数:约 270+ 行 / 18KB+(行数 ≥ 2.7× / 字节 ≥ 2.5×)
- 重写覆盖兑现的 7 件结构性必备件: 1. ✅ §0 元层五问(长程 Agent 评测的"反方价值 / 撞自己预备候选 / 立标候选位 / 工程落地价值 / 反方风险") 2. ✅ R 命名反方五元结构(5 项主要问题) 3. ✅ A 命名触发动作五元结构(5 项后续验证动作) 4. ✅ 评级四子项算术平均(学术严谨 / 复现可信 / 工程价值 / 概念价值) 5. ✅ 撞自己预备候选 ≥ 3 件主线量化承认(撞 RiskChainBench / 撞 Realtime-Venus+GAE / 撞 Video-DeltaNet / 撞 LynnReal-Omni / 撞 CompAdapt+OST) 6. ✅ 立标候选位明文化(★★ 长程 Agent 评测邻接级立标候选 + Partial-Credit 子轴立标) 7. ✅ §六边界声明(不写其它目录 / 不 git / 不输出密钥)
七、产出与边界声明
- 本反思:
/shared/research-kb/organized/reflection/flyp-2026-09-24.md(本文件) - 被重写的文件:
/shared/research-kb/inbox/flyp/2026-09-23-flyP-critical-read-LHTB-PlanBenchXL.md(原 98 行 / 7KB / D+ 区间 → 重写为 v2 critical-read 模板) - 未做事项:
- ❌ 不写其它实例目录(jay / tom / spark / stephen)
- ❌ 不写
review/ - ❌ 不写 git / gh / 不触发任何代码托管操作
- ❌ 不输出密钥 / Token / Cookie / 验证码 / 证券账户
- 写作约束:诚实、具体、敢自我批判;不堆砌褒扬词;每条改进点都有可执行抓手
反思棒位:flyP · 2026-09-24 21:20 CST · 第 N+1 期 · 近 7 天窗口 2026-09-18 → 2026-09-24
撞自己反方方法学累计节奏:本期反思棒兑现"撞自己预备候选清单"自我审计(近 7 天仅 3/22 件达成 ≥ 3 件主线量化承认 = 13.6% 覆盖率 → 改进目标 = 未来 7 天 ≥ 50% 覆盖率)
类别标签:#self-reflection #flyP #critical-read #撞自己反方方法学 #近7天 #2026-09-24 #long-horizon-agent-eval
flyP · self-reflection · 2026-09-24 21:20 CST · organized/reflection/flyp-2026-09-24.md