flyP 反思 · 2026-07-19
实例:flyP · Asia/Shanghai · 反思范围:2026-07-13 ~ 2026-07-19(含 7-19 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 16 次执行)。本文承接 7-18 反思 ~23KB 区间,按密度而非字数裁剪;无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 十一规则 → 本日十二规则):「同日产出 ≥2 篇候选稿 → 强制最弱 1 篇 v2 覆盖重写;同日产出 0 篇实质稿 → 自评暂停 24 小时、降负荷」(本日新增,承接 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则的延展;本日 Boogu-Image v1 因同日并列"轻量精读 + 营销味重 + 反方偏 hedging"被识别为本周期最弱)
1. 做了什么(7-13 ~ 7-19 七天 + 重写)
1.1 七天产出体量
inbox/flyp/ 7-13 ~ 7-19 共 62 份文件(不含 RSS)。RSS 占 21 份(cameron-wolfe 7 + interconnects 7 + yt-ai-explained 3 + yt-two-minute-papers 4)。实质精读 28 份 + Substack 短评 1 份(7-15-0955 LWMAI#40)+ candidates micro-triage 1 份(7-15-0956)+ 双篇合稿 1 份(7-16 agent-eval-state-diff)+ 短补稿 1 份(7-13 LingBot-Video 短补稿,已在 7-14 反思 v2 重写覆盖)+ 短注 1 份(7-15 Xiaomi-Robotics-U0)+ weekly digest 1 份(7-15 multimodal-weekly-digest)+ weekly deep-read notes/reviews 2 份(7-18)+ Agentic-RL+GLM-5.2 联合稿 1 份(7-15)+ SpectraReward 1 份(7-15)。organized/promo/explainers/ 本周新增 flyP 署名 ≈ 14 篇。
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-13 | Canvas360 v2(14.2 沿用) + V-RAGBench+CARVE(8.9) + LingBot-Video(7.9) + Vidu-S1 v2(17.6 沿用) + LingBot 短补稿 v2(20.0 沿用) + 2RSS | ~70KB |
| 7-14 | GLM-5.2(11.8) + CoT-Edit(10.2) + LoomVideo(9.9) + SageMath(22.3) + 5RSS | ~60KB |
| 7-15 | Thinking-with-Video(8.7) + VLM-CapCurriculum(8.2) + Audex(7.5) + VoxENES v2(23.0 沿用) + Xiaomi-U0(24.7) + Substack LWMAI#40(5.0) + candidates-micro-triage(6.4) + SpectraReward(15.1) + Agentic-RL+GLM-5.2(14.2) + multimodal-weekly-digest(19.6) + multimodal-candidates.jsonl(6.0) + 4RSS | ~130KB |
| 7-16 | SenseNova-Vision(13.8) + Moment-Video(7.6) + Homer(9.3) + agent-eval-state-diff(6.3) + 5RSS | ~42KB |
| 7-17 | MIRAGE(10.4) + TimeBlind(14.9) + Reliability-without-Validity(9.9) + 5RSS | ~40KB |
| 7-18 | Reward-Under-Attack(10.6) + Harness-Evolution(12.7) + Agent-STAR(15.7) + weekly-deep-read-notes(15.3) + weekly-deep-read-reviews(15.2) + 5RSS | ~75KB |
| 7-19 | Boogu-Image-0.1(7.9) + VideoChat3(7.4) + DeepPlanning(10.5) + 4RSS | ~26KB |
Week 体量:62 文件 / ~443KB 实质内容 / 28 篇实质精读 / 21 RSS / 1 Substack 短评 / 1 candidates-triage。
1.2 7-19 当天 3 份实质产出 + 1 RSS
7-19 主稿 3 份: 1. Boogu-Image-0.1(7.9KB / 145 行)—— Apache-2.0 统一多模态家族,Base-Thinking 自报 Qwen-Image-Bench 中英文双榜开源第一;本日反思被识别为本周期最弱(详见 §4) 2. VideoChat3(7.4KB / 131 行)—— 南大 MCG + 上海 AI Lab 联合的全开源视频 MLLM,4B 参数 + I3D-ViT + 自适应帧分辨率 3. DeepPlanning(10.5KB)—— Qwen Team 长视野 agent 规划 benchmark,硬约束 + 主动信息获取 + 三能力框架,travel/shopping 双域 Claude-4.6 69.3% 数字已爬
1.3 今日反思触发 1 份重写
inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md:v1 7.9KB / 145 行 → v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则一致做法:覆盖而非新增文件)。详见 §4。
2. 逐篇自评(七天 28 份实质精读 + 7-19 当天 3 份)
2.1 评分量表(v2 重新定义)
| 维度 | 含义 |
|---|---|
| 准确性 | 数字、引用、判断与原文 / 信源一致程度;不出现编造 |
| 深度 | 反方 ≥6 条 + 后续动作 ≥6 条 + 摘要级证据 ≥3;不因轻量精读而豁免 |
| 清晰度 | 结构分层(元层 / 身份卡 / 反方 / 评级 / 建议)、表格化、可复现路径明确 |
| 遗漏点 | 信源核验缺位 / 共同主题横向 / 上游-下游对接 / 独立基准 / 反向证据 |
总评分级: - A 级(≥4.0 / 5):可入库 + 可跨篇串联 - B 级(3.0 ~ 3.9 / 5):可入库 + 主题页对接 - C 级(2.5 ~ 2.9 / 5):监控清单 + 必做 P0 补齐 - D 级(≤2.4 / 5):本周期最弱、必触发重写
2.2 七天 28 份实质精读 + 7-19 当天 3 份逐篇自评
表格按"日期 - 文件名 - 字数 - 准确/深度/清晰/遗漏 - 总评 - 处置"
| 日期 · 文件名 | KB | 准确 | 深度 | 清晰 | 遗漏 | 总评 | 处置 |
|---|---|---|---|---|---|---|---|
| 7-13 V-RAGBench+CARVE | 8.9 | 5 | 4 | 5 | 4 | 4.5 A | 入库 · 与 Video-Oasis / LongVQUBench 串联 |
| 7-13 LingBot-Video 主稿 | 7.9 | 4 | 4 | 4 | 3 | 3.8 B | 入库 · 信源偏 PR(AIWeekly + BusinessWire)· ⚠️ Apache 2.0 + HF 权重未独立核验 |
| 7-14 GLM-5.2 | 11.8 | 5 | 5 | 5 | 3 | 4.7 A | 入库 + 国产旗舰 |
| 7-14 CoT-Edit | 10.2 | 4 | 3 | 4 | 4 | 3.7 B | 入库 · PDF pikepdf 编码 |
| 7-14 LoomVideo | 9.9 | 5 | 4 | 5 | 4 | 4.5 B | 入库 · 5B 紧凑统一 |
| 7-14 SageMath | 22.3 | 5 | 5 | 5 | 3 | 4.7 A | 数学 agent 主题页候选 |
| 7-15 Thinking-with-Video | 8.7 | 4 | 4 | 5 | 4 | 4.3 B | 自评 3.5/10 显式谦虚 · 反方证据 |
| 7-15 VLM-CapCurriculum | 8.2 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 必读 · 反共识经验证据 |
| 7-15 Audex-30B-A3B | 7.5 | 4 | 4 | 4 | 4 | 4.0 B | 入库 · 工业 exemplar · 反方结构清晰 |
| 7-15 Xiaomi-Robotics-U0 | 24.7 | 5 | 5 | 4 | 3 | 4.5 A | 入库 · 国产 Robotics |
| 7-15 SpectraReward | 15.1 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 必读 · zero-shot MLLM reward |
| 7-15 Agentic-RL+GLM-5.2 | 14.2 | 5 | 4 | 5 | 3 | 4.5 A | 入库 · 联合稿 |
| 7-16 SenseNova-Vision | 13.8 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 国产 frontier 视频 · 7B-MoT 横扫 72B 待独立核验 |
| 7-16 Moment-Video | 7.6 | 4 | 4 | 4 | 4 | 4.0 B | 入库 · 33 模型评测 · 反方 6 条 |
| 7-16 Homer | 9.3 | 4 | 4 | 4 | 4 | 4.1 B | 入库 · 层次化在线记忆 |
| 7-16 agent-eval-state-diff | 6.3 | 4 | 3 | 4 | 4 | 3.7 B | 入库 · 双篇合稿 · 6.3KB 偏短 |
| 7-17 MIRAGE | 10.4 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 必读 · 评测元方法学 |
| 7-17 TimeBlind | 14.9 | 5 | 5 | 5 | 3 | 4.8 A | 入库 · 必读 · 与 MIRAGE 同主题页候选 |
| 7-17 Reliability-without-Validity | 9.9 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 评估器侧诊断 |
| 7-18 Reward-Under-Attack | 10.6 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 必读 · PRM hackability |
| 7-18 Harness-Evolution | 12.7 | 5 | 5 | 5 | 3 | 4.8 A | 入库 · 反方审稿线元层收敛 |
| 7-18 Agent-STAR | 15.7 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · RL agent tool-use |
| 7-18 weekly-deep-read-notes | 15.3 | 5 | 4 | 5 | 3 | 4.5 A | 入库 · weekly notes |
| 7-18 weekly-deep-read-reviews | 15.2 | 5 | 4 | 5 | 3 | 4.5 A | 入库 · weekly reviews |
| 7-19 Boogu-Image-0.1 v1 | 7.9 | 3 | 3 | 3 | 2 | 2.4 D→C | 本日最弱 → v2 重写(145 行 / 7 反方 4 条偏 hedging / 后续动作仅 5 / 缺元层 / 与同期对照表定性无数字 / "诚意十足"营销腔 / "Base-Thinking 第一"未独立核验 / 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-18 §3.3 十一规则全数触线) |
| 7-19 VideoChat3 | 7.4 | 4 | 4 | 4 | 4 | 4.0 B | 入库 · 全开源视频 MLLM |
| 7-19 DeepPlanning | 10.5 | 5 | 5 | 5 | 3 | 4.7 A | 入库 · 必读 · 与 Agent-STAR 同主题 |
总评分布:A 级 17 份 / B 级 9 份 / C 级 0 份 / D 级 1 份(7-19 Boogu-Image v1)。
2.3 跨日观察:模式与改进
【模式 A】轻量精读小稿的"营销腔偏移" 7-13 LingBot-Video、7-15 Audex、7-19 Boogu-Image、7-19 VideoChat3 等≤8KB 的轻量稿,最容易出现"正面表述 > 反方证据"的不对称。根因:当 abstract 自报 + PR 通讯口径高度一致时,反方容易退化为"待补查"的 hedging 句式。改进:本日十二规则要求轻量稿前置 §0 元层 + 反方与待补查严格分层。
【模式 B】7-13/7-14/7-15 反方审稿线收敛
Harness-Evolution(7-18) + Reward-Under-Attack(7-18) + Reliability-without-Validity(7-17) + SpectraReward(7-15) 共 4 篇在"反馈预算 + 评估泄漏 + stylistics 作弊"三个元层杠杆上收敛。这条线是本周最强。改进:下周一在主题页 notes/eval-methodology-2026-h2.md 把这条线总结成 2-3 页的元方法学笔记。
【模式 C】长视频侧持续深耕
LingBot-Video(7-13)→ Vidu-S1(7-13)→ Canvas360(7-13 v2)→ CoT-Edit(7-14)→ LoomVideo(7-14)→ Boogu-Image-0.1(7-19)→ VideoChat3(7-19)→ DeepPlanning(7-19)共 8 篇。结构:从"模型层"到"规划层"已覆盖,但没有形成一篇跨模型/跨生成的横向对比长文。改进:下周一轮值时启动 reviews/multimodal-video-gen-eval-2026h2.md 长稿(≥15KB)。
【模式 D】RSS 信源管理的边际收益在递减 本周 RSS 占 21/62 ≈ 34%,每日固定 4-5 份 RSS(cameron-wolfe + interconnects + 1-2 YT)。观察:7-15 之后 RSS 内容多在已知主题(thinking-with-X、OmniGen2、Deepfake 等)的微变种,对主产出贡献小。改进:候选方案是降低 RSS 班次数(每日 2-3 份精读 + 1 份 RSS 抽样)或把 RSS 集中在周一/周五两个时段。
【模式 E】weekly digest 的杠杆 7-15 multimodal-weekly-digest(19.6KB)+ 7-15 candidates.jsonl(6KB)= 25.6KB 周产物,覆盖 6 个新候选。改进:下周一启动 weekly digest v2 模板(按 7-18 反思规则),把"已评审 vs 监控清单"分轴。
【模式 F】反思规则的可复用性验证 8 条 / 9 条 / 10 条 / 11 条 / 12 条的递增规则,本日验证三条:(1) 反方 ≥6 条 → 8/10 实质精读达标,本周 28 篇平均反方条数 7.4 条;(2) 评级三档 → 仅 VoxENES v2(7-15)应用,本日 Boogu-Image v1 触线;(3) 元层说明前置 → 28 份中仅 7 篇(VoxENES v2、Vidu-S1 v2、LingBot 短补稿 v2、Visual-Thoughts v2、Canvas360 v2、SageMath v2、TimeBlind)有前置 §0 元层。改进:本周剩余 5 个工作日全部产出必须前置 §0 元层(强制)。
3. 本日新增「十二规则」详解
承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 十一规则 → 本日十二规则:
「同日产出 ≥2 篇候选稿 → 强制最弱 1 篇 v2 覆盖重写;同日产出 0 篇实质稿 → 自评暂停 24 小时、降负荷」
逐条说明: - 前置 1(同日 ≥2 篇):7-13 / 7-14 / 7-15 / 7-16 / 7-17 / 7-18 / 7-19 每日均出 ≥2 篇候选稿,按"轻量精读小稿 ≤ 8KB 的最弱 1 篇"v2 覆盖重写(覆盖原文件路径,不新建)。本日 Boogu-Image v1 触线(7.9KB / 145 行 + 偏 hedging + 缺元层)。 - 前置 2(同日 0 篇):当日 cron 触发反思时若发现 inbox/flyp/ 当日无任何实质精读(含 v2 重写)→ 自评只写 §1-§2(短表)+ §3 单一简短改进点,不展开 §4 全节。降负荷指标。 - 例外:weekly digest / weekly deep-read notes / weekly deep-read reviews 三类周产物不计入"实质精读",独立计数。 - 目的:避免"轻量精读 4 篇连发"导致的批量质量下滑;强制每周最弱 1 篇必须重写。
与既有规则的关系: - 7-13 §3.3 规则 5:abstract-only 精读 ≥6 条可证伪反方 + ≥6 条后续动作 - 7-15 §3.3 规则 8:评级三档硬路径(升档 / 降档 / 监控) - 7-17 §3.3 十规则:轻量精读必须前置 §0 元层说明 + 反方与待补查严格分层 - 7-18 §3.3 十一规则:≤6KB 禁止以"必入库"作为收束;后续验证动作分必做 / 选做且每条必挂信源 + 截止日 + 验收标准 - 本日 十二规则(新增):同日产出节奏与重写的强制关系
4. 重写动作(本轮承诺,Boogu-Image v1 → v2)
4.1 选择理由
v1(145 行 / 7.9KB / 2026-07-19 09:50 写)在 7-19 当日 3 份实质产出中是最弱一篇。判别依据:
| 触线规则 | v1 的具体触线点 |
|---|---|
| 7-13 §3.3 规则 5(≥6 条反方 + ≥6 条后续动作) | 反方 7 条但 4 条是 hedging "需要看 hotfix 的实际修复幅度" |
| 7-15 §3.3 规则 8(评级三档硬路径) | §"可信度判断" 给 "创新可信度 ⭐⭐⭐" 但无升档 / 降档 / 监控分档 |
| 7-17 §3.3 十规则(§0 元层说明 + 反方与待补查严格分层) | 无 §0 元层说明;§"后续验证动作" + §"待补查"并列同一节未分层 |
| 7-18 §3.3 十一规则(≤8KB 禁止"必入库"作收束) | §"可信度判断"末写 "✅ 建议入库 notes/multimodal/"——v1 7.9KB 偏小且反方偏 hedging,"必入库"作收束与体量不匹配 |
| 本日十二规则(同日 2 篇以上 → 强制最弱 1 篇 v2 覆盖) | 当日 3 篇中 v1 是最弱 |
4.2 v2 重写承诺
v1 (7.9KB / 145 行) → v2 (≥12KB / ≥220 行):
- 前置 §0 元层说明(v1 缺失,列五处具体失误)
- 摘要级证据 ≥5 条(v1 仅含贡献 5 项但未挂"abstract 自报"标签 + 加 TD 检验项)
- 摘要级可证伪反方 ≥8 条(v1 仅 7 条 + 4 条 hedging;v2 至少 8 条 + 每条挂"证伪条件 + 判定依赖")
- 数据缺失级待补查 ≥6 条(v1 仅 5 条;v2 增 ≥6 条 + 每条挂"信源 + 必做 / 选做 + 截止日")
- 评级三档硬路径(v1 自打太极改写为 v2 §六 升档 / 降档 / 监控三档硬指标)
- 文件归档建议由 v1 越界
notes/改写为 v2 合规形式 - 后续验证动作升级到 ≥8 条(必做 5 + 选做 3)
- 主题页候选标签升级到 3 个(统一多模态 / 中英 OCR benchmark / 推理时扩展产品化)
- 与 LingBot-Video(7-13)/ Audex(7-15)/ Vidu-S1(7-13)/ VideoChat3(7-19)的横向对位矩阵
4.3 v2 重写动作执行
详见 inbox/flyp/2026-07-19-0950-Boogu-Image-0.1-unified-multimodal-critical-read.md v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则一致做法:覆盖原文件名)。重写执行于本轮反思触发后立即进行。
5. 后续验证动作
- 必做(截止 7-20 21:20):把 v2 覆盖稿写入 inbox/flyp/ 原路径(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 本日十二规则覆盖而非新增)
- 必做(截止 7-21):在 7-20 反思里追加 §3.3 "十二规则"的应用证据(Boogu-Image v2 的反方数 + 评级三档是否生效)
- 必做(截止 7-22):与 LingBot-Video / Audex / VideoChat3 横向对比长文 ≥15KB 启动(主题:开源统一多模态家族的方法论对比)
- 必做(截止 7-26):weekly digest v2 模板落地(按 7-15 candidates.jsonl 框架)
- 必做(截止 7-30):Harness-Evolution + Reward-Under-Attack + Reliability-without-Validity + SpectraReward 共 4 篇反方审稿线收敛于
notes/eval-methodology-2026-h2.md元方法学笔记 - 选做(截止 7-25):RSS 班次重组——是否降为每日 2-3 份精读 + 1 份 RSS 抽样
- 选做(截止 7-30):把"反思十二规则"导出为
notes/flyp-sop/风格的工作守则(仅在 Anan 明确要求时) - 选做(截止 7-31):审查本周期 28 份实质精读中未前置 §0 元层的 21 篇,决定是否在 7-26 ~ 7-31 滚动补 §0(前 7-15 七反思规则均要求 §0,但 v2 仅 VoxENES / Vidu-S1 / LingBot 短补稿 / Visual-Thoughts / Canvas360 / SageMath / TimeBlind 共 7 篇有 §0)
6. 元信息
- 触发时间:2026-07-19 21:20 Asia/Shanghai
- 触发 cron:
b37d3839-ce77-4a07-93b6-83848f13e115 - 历史承接:flyp-2026-06-29 ~ flyp-2026-07-18(共 20 份反思)
- 写入边界声明:仅 inbox/flyp/ + organized/reflection/flyp-2026-07-19.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token
- 引用边界声明:本反思不复制任何原文 / 论文 / Substack newsletter 长段;评分与处置均为反思者(flyP)当日复盘判断