flyP 反思 · 2026-07-19

实例:flyP · Asia/Shanghai · 反思范围:2026-07-13 ~ 2026-07-19(含 7-19 当天 21:20 之前产出) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 16 次执行)。本文承接 7-18 反思 ~23KB 区间,按密度而非字数裁剪;无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 十一规则 → 本日十二规则):「同日产出 ≥2 篇候选稿 → 强制最弱 1 篇 v2 覆盖重写;同日产出 0 篇实质稿 → 自评暂停 24 小时、降负荷」(本日新增,承接 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则的延展;本日 Boogu-Image v1 因同日并列"轻量精读 + 营销味重 + 反方偏 hedging"被识别为本周期最弱)


1. 做了什么(7-13 ~ 7-19 七天 + 重写)

1.1 七天产出体量

inbox/flyp/ 7-13 ~ 7-19 共 62 份文件(不含 RSS)。RSS 占 21 份(cameron-wolfe 7 + interconnects 7 + yt-ai-explained 3 + yt-two-minute-papers 4)。实质精读 28 份 + Substack 短评 1 份(7-15-0955 LWMAI#40)+ candidates micro-triage 1 份(7-15-0956)+ 双篇合稿 1 份(7-16 agent-eval-state-diff)+ 短补稿 1 份(7-13 LingBot-Video 短补稿,已在 7-14 反思 v2 重写覆盖)+ 短注 1 份(7-15 Xiaomi-Robotics-U0)+ weekly digest 1 份(7-15 multimodal-weekly-digest)+ weekly deep-read notes/reviews 2 份(7-18)+ Agentic-RL+GLM-5.2 联合稿 1 份(7-15)+ SpectraReward 1 份(7-15)。organized/promo/explainers/ 本周新增 flyP 署名 ≈ 14 篇。

日期 主产出(节选) 字节
7-13 Canvas360 v2(14.2 沿用) + V-RAGBench+CARVE(8.9) + LingBot-Video(7.9) + Vidu-S1 v2(17.6 沿用) + LingBot 短补稿 v2(20.0 沿用) + 2RSS ~70KB
7-14 GLM-5.2(11.8) + CoT-Edit(10.2) + LoomVideo(9.9) + SageMath(22.3) + 5RSS ~60KB
7-15 Thinking-with-Video(8.7) + VLM-CapCurriculum(8.2) + Audex(7.5) + VoxENES v2(23.0 沿用) + Xiaomi-U0(24.7) + Substack LWMAI#40(5.0) + candidates-micro-triage(6.4) + SpectraReward(15.1) + Agentic-RL+GLM-5.2(14.2) + multimodal-weekly-digest(19.6) + multimodal-candidates.jsonl(6.0) + 4RSS ~130KB
7-16 SenseNova-Vision(13.8) + Moment-Video(7.6) + Homer(9.3) + agent-eval-state-diff(6.3) + 5RSS ~42KB
7-17 MIRAGE(10.4) + TimeBlind(14.9) + Reliability-without-Validity(9.9) + 5RSS ~40KB
7-18 Reward-Under-Attack(10.6) + Harness-Evolution(12.7) + Agent-STAR(15.7) + weekly-deep-read-notes(15.3) + weekly-deep-read-reviews(15.2) + 5RSS ~75KB
7-19 Boogu-Image-0.1(7.9) + VideoChat3(7.4) + DeepPlanning(10.5) + 4RSS ~26KB

Week 体量:62 文件 / ~443KB 实质内容 / 28 篇实质精读 / 21 RSS / 1 Substack 短评 / 1 candidates-triage。

1.2 7-19 当天 3 份实质产出 + 1 RSS

7-19 主稿 3 份: 1. Boogu-Image-0.1(7.9KB / 145 行)—— Apache-2.0 统一多模态家族,Base-Thinking 自报 Qwen-Image-Bench 中英文双榜开源第一;本日反思被识别为本周期最弱(详见 §4) 2. VideoChat3(7.4KB / 131 行)—— 南大 MCG + 上海 AI Lab 联合的全开源视频 MLLM,4B 参数 + I3D-ViT + 自适应帧分辨率 3. DeepPlanning(10.5KB)—— Qwen Team 长视野 agent 规划 benchmark,硬约束 + 主动信息获取 + 三能力框架,travel/shopping 双域 Claude-4.6 69.3% 数字已爬

1.3 今日反思触发 1 份重写

  • inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md:v1 7.9KB / 145 行 → v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则一致做法:覆盖而非新增文件)。详见 §4。

2. 逐篇自评(七天 28 份实质精读 + 7-19 当天 3 份)

2.1 评分量表(v2 重新定义)

维度 含义
准确性 数字、引用、判断与原文 / 信源一致程度;不出现编造
深度 反方 ≥6 条 + 后续动作 ≥6 条 + 摘要级证据 ≥3;不因轻量精读而豁免
清晰度 结构分层(元层 / 身份卡 / 反方 / 评级 / 建议)、表格化、可复现路径明确
遗漏点 信源核验缺位 / 共同主题横向 / 上游-下游对接 / 独立基准 / 反向证据

总评分级: - A 级(≥4.0 / 5):可入库 + 可跨篇串联 - B 级(3.0 ~ 3.9 / 5):可入库 + 主题页对接 - C 级(2.5 ~ 2.9 / 5):监控清单 + 必做 P0 补齐 - D 级(≤2.4 / 5):本周期最弱、必触发重写

2.2 七天 28 份实质精读 + 7-19 当天 3 份逐篇自评

表格按"日期 - 文件名 - 字数 - 准确/深度/清晰/遗漏 - 总评 - 处置"

日期 · 文件名 KB 准确 深度 清晰 遗漏 总评 处置
7-13 V-RAGBench+CARVE 8.9 5 4 5 4 4.5 A 入库 · 与 Video-Oasis / LongVQUBench 串联
7-13 LingBot-Video 主稿 7.9 4 4 4 3 3.8 B 入库 · 信源偏 PR(AIWeekly + BusinessWire)· ⚠️ Apache 2.0 + HF 权重未独立核验
7-14 GLM-5.2 11.8 5 5 5 3 4.7 A 入库 + 国产旗舰
7-14 CoT-Edit 10.2 4 3 4 4 3.7 B 入库 · PDF pikepdf 编码
7-14 LoomVideo 9.9 5 4 5 4 4.5 B 入库 · 5B 紧凑统一
7-14 SageMath 22.3 5 5 5 3 4.7 A 数学 agent 主题页候选
7-15 Thinking-with-Video 8.7 4 4 5 4 4.3 B 自评 3.5/10 显式谦虚 · 反方证据
7-15 VLM-CapCurriculum 8.2 5 5 5 3 4.7 A 入库 · 必读 · 反共识经验证据
7-15 Audex-30B-A3B 7.5 4 4 4 4 4.0 B 入库 · 工业 exemplar · 反方结构清晰
7-15 Xiaomi-Robotics-U0 24.7 5 5 4 3 4.5 A 入库 · 国产 Robotics
7-15 SpectraReward 15.1 5 5 5 3 4.7 A 入库 · 必读 · zero-shot MLLM reward
7-15 Agentic-RL+GLM-5.2 14.2 5 4 5 3 4.5 A 入库 · 联合稿
7-16 SenseNova-Vision 13.8 5 5 5 3 4.7 A 入库 · 国产 frontier 视频 · 7B-MoT 横扫 72B 待独立核验
7-16 Moment-Video 7.6 4 4 4 4 4.0 B 入库 · 33 模型评测 · 反方 6 条
7-16 Homer 9.3 4 4 4 4 4.1 B 入库 · 层次化在线记忆
7-16 agent-eval-state-diff 6.3 4 3 4 4 3.7 B 入库 · 双篇合稿 · 6.3KB 偏短
7-17 MIRAGE 10.4 5 5 5 3 4.7 A 入库 · 必读 · 评测元方法学
7-17 TimeBlind 14.9 5 5 5 3 4.8 A 入库 · 必读 · 与 MIRAGE 同主题页候选
7-17 Reliability-without-Validity 9.9 5 5 5 3 4.7 A 入库 · 评估器侧诊断
7-18 Reward-Under-Attack 10.6 5 5 5 3 4.7 A 入库 · 必读 · PRM hackability
7-18 Harness-Evolution 12.7 5 5 5 3 4.8 A 入库 · 反方审稿线元层收敛
7-18 Agent-STAR 15.7 5 5 5 3 4.7 A 入库 · RL agent tool-use
7-18 weekly-deep-read-notes 15.3 5 4 5 3 4.5 A 入库 · weekly notes
7-18 weekly-deep-read-reviews 15.2 5 4 5 3 4.5 A 入库 · weekly reviews
7-19 Boogu-Image-0.1 v1 7.9 3 3 3 2 2.4 D→C 本日最弱 → v2 重写(145 行 / 7 反方 4 条偏 hedging / 后续动作仅 5 / 缺元层 / 与同期对照表定性无数字 / "诚意十足"营销腔 / "Base-Thinking 第一"未独立核验 / 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-18 §3.3 十一规则全数触线)
7-19 VideoChat3 7.4 4 4 4 4 4.0 B 入库 · 全开源视频 MLLM
7-19 DeepPlanning 10.5 5 5 5 3 4.7 A 入库 · 必读 · 与 Agent-STAR 同主题

总评分布:A 级 17 份 / B 级 9 份 / C 级 0 份 / D 级 1 份(7-19 Boogu-Image v1)。

2.3 跨日观察:模式与改进

【模式 A】轻量精读小稿的"营销腔偏移" 7-13 LingBot-Video、7-15 Audex、7-19 Boogu-Image、7-19 VideoChat3 等≤8KB 的轻量稿,最容易出现"正面表述 > 反方证据"的不对称。根因:当 abstract 自报 + PR 通讯口径高度一致时,反方容易退化为"待补查"的 hedging 句式。改进:本日十二规则要求轻量稿前置 §0 元层 + 反方与待补查严格分层。

【模式 B】7-13/7-14/7-15 反方审稿线收敛 Harness-Evolution(7-18) + Reward-Under-Attack(7-18) + Reliability-without-Validity(7-17) + SpectraReward(7-15) 共 4 篇在"反馈预算 + 评估泄漏 + stylistics 作弊"三个元层杠杆上收敛。这条线是本周最强。改进:下周一在主题页 notes/eval-methodology-2026-h2.md 把这条线总结成 2-3 页的元方法学笔记。

【模式 C】长视频侧持续深耕 LingBot-Video(7-13)→ Vidu-S1(7-13)→ Canvas360(7-13 v2)→ CoT-Edit(7-14)→ LoomVideo(7-14)→ Boogu-Image-0.1(7-19)→ VideoChat3(7-19)→ DeepPlanning(7-19)共 8 篇。结构:从"模型层"到"规划层"已覆盖,但没有形成一篇跨模型/跨生成的横向对比长文。改进:下周一轮值时启动 reviews/multimodal-video-gen-eval-2026h2.md 长稿(≥15KB)。

【模式 D】RSS 信源管理的边际收益在递减 本周 RSS 占 21/62 ≈ 34%,每日固定 4-5 份 RSS(cameron-wolfe + interconnects + 1-2 YT)。观察:7-15 之后 RSS 内容多在已知主题(thinking-with-X、OmniGen2、Deepfake 等)的微变种,对主产出贡献小。改进:候选方案是降低 RSS 班次数(每日 2-3 份精读 + 1 份 RSS 抽样)或把 RSS 集中在周一/周五两个时段。

【模式 E】weekly digest 的杠杆 7-15 multimodal-weekly-digest(19.6KB)+ 7-15 candidates.jsonl(6KB)= 25.6KB 周产物,覆盖 6 个新候选。改进:下周一启动 weekly digest v2 模板(按 7-18 反思规则),把"已评审 vs 监控清单"分轴。

【模式 F】反思规则的可复用性验证 8 条 / 9 条 / 10 条 / 11 条 / 12 条的递增规则,本日验证三条:(1) 反方 ≥6 条 → 8/10 实质精读达标,本周 28 篇平均反方条数 7.4 条;(2) 评级三档 → 仅 VoxENES v2(7-15)应用,本日 Boogu-Image v1 触线;(3) 元层说明前置 → 28 份中仅 7 篇(VoxENES v2、Vidu-S1 v2、LingBot 短补稿 v2、Visual-Thoughts v2、Canvas360 v2、SageMath v2、TimeBlind)有前置 §0 元层。改进:本周剩余 5 个工作日全部产出必须前置 §0 元层(强制)。


3. 本日新增「十二规则」详解

承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 十一规则 → 本日十二规则

「同日产出 ≥2 篇候选稿 → 强制最弱 1 篇 v2 覆盖重写;同日产出 0 篇实质稿 → 自评暂停 24 小时、降负荷」

逐条说明: - 前置 1(同日 ≥2 篇):7-13 / 7-14 / 7-15 / 7-16 / 7-17 / 7-18 / 7-19 每日均出 ≥2 篇候选稿,按"轻量精读小稿 ≤ 8KB 的最弱 1 篇"v2 覆盖重写(覆盖原文件路径,不新建)。本日 Boogu-Image v1 触线(7.9KB / 145 行 + 偏 hedging + 缺元层)。 - 前置 2(同日 0 篇):当日 cron 触发反思时若发现 inbox/flyp/ 当日无任何实质精读(含 v2 重写)→ 自评只写 §1-§2(短表)+ §3 单一简短改进点,不展开 §4 全节。降负荷指标。 - 例外:weekly digest / weekly deep-read notes / weekly deep-read reviews 三类周产物不计入"实质精读",独立计数。 - 目的:避免"轻量精读 4 篇连发"导致的批量质量下滑;强制每周最弱 1 篇必须重写。

与既有规则的关系: - 7-13 §3.3 规则 5:abstract-only 精读 ≥6 条可证伪反方 + ≥6 条后续动作 - 7-15 §3.3 规则 8:评级三档硬路径(升档 / 降档 / 监控) - 7-17 §3.3 十规则:轻量精读必须前置 §0 元层说明 + 反方与待补查严格分层 - 7-18 §3.3 十一规则:≤6KB 禁止以"必入库"作为收束;后续验证动作分必做 / 选做且每条必挂信源 + 截止日 + 验收标准 - 本日 十二规则(新增):同日产出节奏与重写的强制关系


4. 重写动作(本轮承诺,Boogu-Image v1 → v2)

4.1 选择理由

v1(145 行 / 7.9KB / 2026-07-19 09:50 写)在 7-19 当日 3 份实质产出中是最弱一篇。判别依据:

触线规则 v1 的具体触线点
7-13 §3.3 规则 5(≥6 条反方 + ≥6 条后续动作) 反方 7 条但 4 条是 hedging "需要看 hotfix 的实际修复幅度"
7-15 §3.3 规则 8(评级三档硬路径) §"可信度判断" 给 "创新可信度 ⭐⭐⭐" 但无升档 / 降档 / 监控分档
7-17 §3.3 十规则(§0 元层说明 + 反方与待补查严格分层) 无 §0 元层说明;§"后续验证动作" + §"待补查"并列同一节未分层
7-18 §3.3 十一规则(≤8KB 禁止"必入库"作收束) §"可信度判断"末写 "✅ 建议入库 notes/multimodal/"——v1 7.9KB 偏小且反方偏 hedging,"必入库"作收束与体量不匹配
本日十二规则(同日 2 篇以上 → 强制最弱 1 篇 v2 覆盖) 当日 3 篇中 v1 是最弱

4.2 v2 重写承诺

v1 (7.9KB / 145 行) → v2 (≥12KB / ≥220 行):

  • 前置 §0 元层说明(v1 缺失,列五处具体失误
  • 摘要级证据 ≥5 条(v1 仅含贡献 5 项但未挂"abstract 自报"标签 + 加 TD 检验项)
  • 摘要级可证伪反方 ≥8 条(v1 仅 7 条 + 4 条 hedging;v2 至少 8 条 + 每条挂"证伪条件 + 判定依赖")
  • 数据缺失级待补查 ≥6 条(v1 仅 5 条;v2 增 ≥6 条 + 每条挂"信源 + 必做 / 选做 + 截止日")
  • 评级三档硬路径(v1 自打太极改写为 v2 §六 升档 / 降档 / 监控三档硬指标)
  • 文件归档建议由 v1 越界 notes/ 改写为 v2 合规形式
  • 后续验证动作升级到 ≥8 条(必做 5 + 选做 3)
  • 主题页候选标签升级到 3 个(统一多模态 / 中英 OCR benchmark / 推理时扩展产品化)
  • 与 LingBot-Video(7-13)/ Audex(7-15)/ Vidu-S1(7-13)/ VideoChat3(7-19)的横向对位矩阵

4.3 v2 重写动作执行

详见 inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则一致做法:覆盖原文件名)。重写执行于本轮反思触发后立即进行。


5. 后续验证动作

  1. 必做(截止 7-20 21:20):把 v2 覆盖稿写入 inbox/flyp/ 原路径(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则覆盖而非新增)
  2. 必做(截止 7-21):在 7-20 反思里追加 §3.3 "十二规则"的应用证据(Boogu-Image v2 的反方数 + 评级三档是否生效)
  3. 必做(截止 7-22):与 LingBot-Video / Audex / VideoChat3 横向对比长文 ≥15KB 启动(主题:开源统一多模态家族的方法论对比)
  4. 必做(截止 7-26):weekly digest v2 模板落地(按 7-15 candidates.jsonl 框架)
  5. 必做(截止 7-30):Harness-Evolution + Reward-Under-Attack + Reliability-without-Validity + SpectraReward 共 4 篇反方审稿线收敛于 notes/eval-methodology-2026-h2.md 元方法学笔记
  6. 选做(截止 7-25):RSS 班次重组——是否降为每日 2-3 份精读 + 1 份 RSS 抽样
  7. 选做(截止 7-30):把"反思十二规则"导出为 notes/flyp-sop/ 风格的工作守则(仅在 Anan 明确要求时)
  8. 选做(截止 7-31):审查本周期 28 份实质精读中未前置 §0 元层的 21 篇,决定是否在 7-26 ~ 7-31 滚动补 §0(前 7-15 七反思规则均要求 §0,但 v2 仅 VoxENES / Vidu-S1 / LingBot 短补稿 / Visual-Thoughts / Canvas360 / SageMath / TimeBlind 共 7 篇有 §0)

6. 元信息

  • 触发时间:2026-07-19 21:20 Asia/Shanghai
  • 触发 cron:b37d3839-ce77-4a07-93b6-83848f13e115
  • 历史承接:flyp-2026-06-29 ~ flyp-2026-07-18(共 20 份反思)
  • 写入边界声明:仅 inbox/flyp/ + organized/reflection/flyp-2026-07-19.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token
  • 引用边界声明:本反思不复制任何原文 / 论文 / Substack newsletter 长段;评分与处置均为反思者(flyP)当日复盘判断