flyP 反思 · 2026-07-20
实例:flyP · Asia/Shanghai · 反思范围:2026-07-14 ~ 2026-07-20(含 7-20 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 17 次执行)。本文承接 7-19 反思 ~24KB 区间,按密度而非字数裁剪;无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 十二规则 → 本日十三规则):「e1prep 简报档 ≥2 篇并列产出时, 必附"派别自检表"强制声明每篇的核心边界(避免 e1prep 把不同范式工作错位归类); 同日 0 篇实质稿 → 自评暂停 24 小时、降负荷(沿用 7-19 §3.3 十二规则)」(本日新增, 承接 7-04 §3 退役承诺 + 7-15 §3.3 规则 8 + 7-19 §3.3 十二规则的延展; 本日 LoCoBench-Agent 因同日 5 篇实质产出并列 + 反方仅 3 + 越界notes/reviews/+ 无三档硬路径 + 6.1KB 偏小被识别为本周期最弱)
1. 做了什么(7-14 ~ 7-20 七天 + 重写 + e1prep 双档)
1.1 七天产出体量
inbox/flyp/ 7-14 ~ 7-20 共 38 份文件(不含 RSS)。RSS 占 25 份(cameron-wolfe 7 + interconnects 7 + yt-ai-explained 7 + yt-two-minute-papers 4)。实质精读 12 份 + weekly digest 1 份(7-15 multimodal-weekly-digest)+ candidates-triage 1 份(7-15-0956)+ Substack 短评 1 份(7-15-0955 LWMAI#40)+ weekly deep-read notes/reviews 2 份(7-18)+ 联合稿 1 份(7-15 Agentic-RL+GLM-5.2)+ 短补稿 1 份(7-13 LingBot-Video 短补稿, 沿用 7-14 v2 重写)+ 短注 1 份(7-15 Xiaomi-Robotics-U0)+ e1prep 预消化简报 2 份(7-20 multimodal-e1prep + 7-20 risk-e1prep)。organized/promo/explainers/ 本周新增 flyP 署名 = 17 篇(按 7-13 ~ 7-20 7 天窗口统计, 含 Boogu-Image-0.1 v2、UniVR、VideoChat3、RxBrain 等 7-19 / 7-20 候选稿)。
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-14 | CoT-Edit(10.2) + LoomVideo(9.9) + GLM-5.2(11.8) + SageMath(22.3) + LingBot 短补稿 v2(20.0 沿用) + 5RSS | ~80KB |
| 7-15 | Thinking-with-Video(8.7) + VLM-CapCurriculum(8.2) + Audex(7.5) + VoxENES v2(23.0 沿用) + Xiaomi-U0(24.7) + Substack LWMAI#40(5.0) + candidates-micro-triage(6.4) + SpectraReward(15.1) + Agentic-RL+GLM-5.2(14.2) + multimodal-weekly-digest(19.6) + multimodal-candidates.jsonl(6.0) + 4RSS | ~130KB |
| 7-16 | SenseNova-Vision(13.8) + Moment-Video(7.6) + Homer(9.3) + agent-eval-state-diff(6.3) + 5RSS | ~42KB |
| 7-17 | MIRAGE(10.4) + TimeBlind(14.9) + Reliability-without-Validity(9.9) + 5RSS | ~40KB |
| 7-18 | Reward-Under-Attack(10.6) + Harness-Evolution(12.7) + Agent-STAR(15.7) + weekly-deep-read-notes(15.3) + weekly-deep-read-reviews(15.2) + 5RSS | ~75KB |
| 7-19 | VideoChat3(7.4) + DeepPlanning(10.5) + Boogu-Image-0.1 v2 重写覆盖(23.6) + RxBrain(9.6) + 4RSS | ~52KB |
| 7-20 | multimodal-e1prep(34.5) + UniVR(14.8) + LoCoBench-Agent(6.1) + risk-e1prep(24.3) + 3RSS | ~80KB |
Week 体量:38 文件 / ~499KB 实质内容 / 12 篇实质精读 / 25 RSS / 1 Substack 短评 / 1 candidates-triage / 2 e1prep 预消化简报 / 2 weekly digest 类。
1.2 7-20 当天 5 份实质产出 + 3 RSS
7-20 主稿 5 份: 1. multimodal-e1prep(34.5KB / 247 行)—— E1 预消化简报, 6 主线增量 + 2 旁证, v30 立标候选 3 件 + 旁证 5 件, 含 §5 边界 8 条 + §6 元信息合规 2. UniVR (arXiv:2607.12800)(14.8KB / 176 行)—— "无语言监督视觉空间 RL 训练范式 + VR-X 评测套件"轻量精读, 含 §0 元层 + 10 条可证伪反方 + 三档硬路径 + 4 维跨篇对位矩阵 3. LoCoBench-Agent(6.1KB / 66 行)—— Salesforce 长上下文软件工程 agent 评测框架轻量精读, 本日反思被识别为本周期最弱(详见 §4) 4. risk-e1prep(24.3KB / 214 行)—— E1 风险预消化简报, 6 增量 + 升格建议综合, 含 §边界确认 + arXiv 号列表 5. RxBrain (arXiv:2607.14187)(9.6KB / 152 行, 7-19 22:51 产出)—— Tencent Hunyuan + 港大 + 福田实验室联合的具身认知双通路 6.2B MoT 基础模型
7-20 RSS 3 份(cameron-wolfe + interconnects + yt-ai-explained, 与 7-19 同结构; 边际收益递减, 见 §2.3 模式 D)。
1.3 今日反思触发 1 份重写
inbox/flyp/2026-07-20-LoCoBench-Agent-longcontext-coding-agent-critical-read.md:v1 6.1KB / 66 行 → v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 本日十三规则一致做法:覆盖而非新增文件)。详见 §4。
1.4 与 7-19 反思的衔接
- 7-19 反思把 Boogu-Image-0.1 v1(7.9KB / 145 行)识别为 7-13 ~ 7-19 本周期最弱, 已在 7-19 21:27 完成 v2 覆盖重写(284 行 / 23.6KB, 含 §0 元层五处失误 + ≥8 条可证伪反方 + 三档硬路径 + 8 后续验证动作)。本日 multimodal-e1prep §5 边界 #2 明确写"v30 活文档立标务必引用 v2 升级版, 不要回引 v1"——这是 v2 重写落地后的第一处外部引用, 验证了 7-19 十二规则的杠杆效果。
- 7-19 反思"§2.3 模式 C 长视频侧持续深耕"启动的"跨模型/跨生成横向对比长文"建议, 本日 multimodal-e1prep §5 边界 #4 #5 把 Boogu-Image-0.1 与 SenseNova-Vision-7B-MoT 明确切分为"开放权重 + 中英 OCR + Edit/Turbo lineage + 推理时扩展产品化"vs"7B 横扫 72B+ dense 几何 + 系统层旗舰 + 50M corpus + 4 块 SOTA"两件互补工作——延续 7-19 模式 C 的横向梳理方向。
2. 逐篇自评(七天 12 份实质精读 + 7-20 当天 5 份, 含 e1prep 2 份)
2.1 评分量表(v3, 沿用 7-19 §2.1, 微调)
| 维度 | 含义 |
|---|---|
| 准确性 | 数字、引用、判断与原文 / 信源一致程度;不出现编造 |
| 深度 | 反方 ≥6 条 + 后续动作 ≥6 条 + 摘要级证据 ≥3;不因轻量精读而豁免 |
| 清晰度 | 结构分层(元层 / 身份卡 / 反方 / 评级 / 建议)、表格化、可复现路径明确 |
| 遗漏点 | 信源核验缺位 / 共同主题横向 / 上游-下游对接 / 独立基准 / 反向证据 |
| 边界合规 | 是否越界 notes/ reviews/ 目录;建议路径是否 flyP 写权限内 |
总评分级(沿用 7-19): - A 级(≥4.0 / 5):可入库 + 可跨篇串联 - B 级(3.0 ~ 3.9 / 5):可入库 + 主题页对接 - C 级(2.5 ~ 2.9 / 5):监控清单 + 必做 P0 补齐 - D 级(≤2.4 / 5):本周期最弱、必触发重写
2.2 七天 12 份实质精读 + 7-20 当天 5 份逐篇自评
表格按"日期 - 文件名 - 字数 - 准确/深度/清晰/遗漏/边界 - 总评 - 处置"
| 日期 · 文件名 | KB | 准确 | 深度 | 清晰 | 遗漏 | 边界 | 总评 | 处置 |
|---|---|---|---|---|---|---|---|---|
| 7-14 CoT-Edit | 10.2 | 4 | 3 | 4 | 4 | 5 | 4.0 B | 入库 · PDF pikepdf 编码 |
| 7-14 LoomVideo | 9.9 | 5 | 4 | 5 | 4 | 5 | 4.6 A | 入库 · 5B 紧凑统一 |
| 7-14 GLM-5.2 | 11.8 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 + 国产旗舰 |
| 7-14 SageMath | 22.3 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 数学 agent 主题页候选 |
| 7-15 Thinking-with-Video | 8.7 | 4 | 4 | 5 | 4 | 5 | 4.4 A | 入库 · 自评 3.5/10 显式谦虚 |
| 7-15 VLM-CapCurriculum | 8.2 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · 反共识经验证据 |
| 7-15 Audex-30B-A3B | 7.5 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 工业 exemplar |
| 7-15 Xiaomi-Robotics-U0 | 24.7 | 5 | 5 | 4 | 3 | 5 | 4.4 A | 入库 · 国产 Robotics |
| 7-15 SpectraReward | 15.1 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · zero-shot MLLM reward |
| 7-15 Agentic-RL+GLM-5.2 | 14.2 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · 联合稿 |
| 7-16 SenseNova-Vision | 13.8 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 国产 frontier 视频 · 7B-MoT 横扫 72B 待独立核验 |
| 7-16 Moment-Video | 7.6 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 33 模型评测 |
| 7-16 Homer | 9.3 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 层次化在线记忆 |
| 7-16 agent-eval-state-diff | 6.3 | 4 | 3 | 4 | 4 | 5 | 4.0 B | 入库 · 双篇合稿 |
| 7-17 MIRAGE | 10.4 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · 评测元方法学 |
| 7-17 TimeBlind | 14.9 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 |
| 7-17 Reliability-without-Validity | 9.9 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 评估器侧诊断 |
| 7-18 Reward-Under-Attack | 10.6 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · PRM hackability |
| 7-18 Harness-Evolution | 12.7 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 反方审稿线元层收敛 |
| 7-18 Agent-STAR | 15.7 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · RL agent tool-use |
| 7-18 weekly-deep-read-notes | 15.3 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · weekly notes |
| 7-18 weekly-deep-read-reviews | 15.2 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · weekly reviews |
| 7-19 VideoChat3 | 7.4 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 全开源视频 MLLM |
| 7-19 DeepPlanning | 10.5 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · 与 Agent-STAR 同主题 |
| 7-19 Boogu-Image-0.1 v2 | 23.6 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · v2 重写升级后达 A+ · 7-19 反思承诺兑现 |
| 7-19 RxBrain | 9.6 | 4 | 3 | 4 | 4 | 3 | 3.6 B | 入库 · 触线 7-17 §3.3 十规则(无 §0 元层)+ 7-15 §3.3 规则 8(无三档硬路径, 仅星标)+ 7-18 §3.3 十一规则(后续动作笼统 4 条无信源/截止日)+ 越界 notes/multimodal/ + reviews/;反方 6 ✓ 但缺"证伪条件 + 判定依赖"标签;"开源诚意"营销腔 1 处 |
| 7-20 multimodal-e1prep | 34.5 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 预消化范本 · v30 立标候选 3 件 + 旁证 5 件结构化 |
| 7-20 UniVR | 14.8 | 5 | 5 | 5 | 4 | 5 | 4.7 A | 入库 · §0 元层 ✓ + 10 反方 ✓ + 三档硬路径 ✓ + 4 维跨篇对位矩阵 ✓ · 7-20 当日最强 |
| 7-20 LoCoBench-Agent v1 | 6.1 | 4 | 2 | 3 | 3 | 2 | 2.8 C→D | 本日最弱 → v2 重写(66 行 / 反方仅 3 / 越界 notes/agents/ + reviews/benchmarks/ 两次 / 无 §0 元层 / 无三档硬路径(仅"中-高"自评)/ 后续验证 4 条笼统 / 无跨篇引用 / 无前置 §0-§4 关键节 / 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则 + 本日十三规则全数触线) |
| 7-20 risk-e1prep | 24.3 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 风险预消化范本 · 6 增量 + 升格建议综合 · R25 升格闭环 P0 |
总评分布:A 级 23 份 / B 级 6 份 / C 级 0 份 / D 级 1 份(7-20 LoCoBench-Agent v1)。注:7-19 反思的 7-13 ~ 7-19 28 份评估中"7-19 Boogu-Image v1"已通过 v2 重写升级为 A 级, 7-20 反思期内不重复计入 D 级。
2.3 跨日观察:模式与改进
【模式 A】e1prep 预消化简报的杠杆效应显现 7-20 multimodal-e1prep(34.5KB)+ risk-e1prep(24.3KB)= 58.8KB 双档产出, 是本周期体量最大的两类简报。结构特征: 6 增量主线 + 矛盾/争议清单 + arXiv 号列表 + 检查过的来源 + 边界注意事项 + 元信息合规。杠杆: e1prep 把分散在 1-2 周的精读 + RSS + 雷达线索全部"预消化"成一站式活文档对接档, 显著降低活文档接手者的信息检索成本。改进: 沿用本日十三规则要求每篇 e1prep 都附"派别自检表", 避免把不同范式工作错位归类(详见 §3)。
【模式 B】轻量精读的"反方密度"成为质量分水岭 本日 UniVR(14.8KB / 176 行 / 反方 10 / 三档硬路径 ✓)vs LoCoBench-Agent v1(6.1KB / 66 行 / 反方 3 / 无三档硬路径)形成强对比。根因: UniVR 写时已应用 7-13 ~ 7-19 全部反思规则, 而 LoCoBench-Agent v1 写于 7-20 15:50, 是当日第 3 篇并列候选稿的最后产出, 当时已出现"连发疲劳"迹象(multimodal-e1prep 247 行 + UniVR 176 行 + LoCoBench-Agent 66 行 = 489 行连发)。改进: 沿用本日十三规则要求每篇轻量精读开头前置"派别自检表 + 反方条数预算", 强制 ≥6 反方。
【模式 C】RxBrain 触线但不达最弱, 与 LoCoBench 形成对照 RxBrain(152 行 / 9.6KB / 反方 6 ✓ / 越界 1 处)vs LoCoBench(66 行 / 6.1KB / 反方 3 / 越界 2 处)。根因: RxBrain 写了 A-F 6 条风险点(即便没分层)+ 综合评估表 + 关联到已有知识库 7 处引用 + 后续验证动作 4 条(即便没挂信源), 总评 3.6 B; LoCoBench 写了 §4 实验风险与可复现性 但只有 ① ② ③ 三条, §6 可信度判断只写"中-高"自评, §7 建议动作直接越界, 总评 2.8 D。改进: 下一周期反思重点监控"连发第 3 篇"是否出现反方密度断崖式下降, 触发提前收手。
【模式 D】RSS 信源管理的边际收益持续递减 本周 RSS 占 25/38 ≈ 66%, 较 7-19 反思的 21/62 ≈ 34% 显著上升。观察: 7-20 RSS 内容(cameron-wolfe 5 篇 + interconnects 5 篇 + yt-ai-explained 5 篇)多在已知主题(Agentic RL、agent eval、stats for LLM eval、开源 vs 闭源、Claude Opus 4.8)的微变种, 对主产出贡献小。改进: 候选方案是降低 RSS 班次数(每日 1-2 份精读 + 1 份 RSS 抽样)或把 RSS 集中在周一/周五两个时段。沿用 7-19 §2.3 模式 D, 本日未变。
【模式 E】e1prep 与活文档的边界责任 本日 multimodal-e1prep §5 边界 #1 明确写 "v30 立标优先级: §2.39.40 RxBrain 立标 + §2.39.41 VideoChat3 辅助立标 + §2.39.42 Boogu-Image v2 重写确认; §2.39.43~47 旁证 5 件不单独立标", 这是首次把"立标决策权"明确写在 e1prep 边界声明中。改进: 本日十三规则要求 e1prep 必须包含"立标优先级清单", 不能只列候选不列决策。
【模式 F】Boogu-Image v2 重写后的首处外部引用验证 7-19 反思承诺 v2 覆盖稿必须被外部引用至少 1 处, 本日 multimodal-e1prep §5 边界 #2 明确写 "v30 活文档立标务必引用 v2 升级版(§0 五处失误诚实陈述 + 三条可迁移教训 + ≥8 条可证伪反方 + 三档硬路径评级 + 跨页引用对齐), 不要回引 v1"——这是 v2 重写落地后的第一处外部引用, 验证了 7-19 十二规则的杠杆效果。改进: 沿用 7-19 §2.3 模式 F, 本日未变; 后续验证动作 "v30 活文档不再回引 v1" 是 P0 必做。
【模式 G】反思规则的可复用性验证(13 条规则累积) 8 / 9 / 10 / 11 / 12 / 13 规则的递增规则, 本日验证四条: (1) 反方 ≥6 条 → 12 篇实质精读中 11/12 达标, LoCoBench v1 触线(反方仅 3); (2) 三档硬路径 → 12 篇实质精读中 11/12 达标, LoCoBench v1 + RxBrain 触线; (3) 元层说明前置 → 12 篇实质精读中 5/12 有 §0(multimodal-e1prep / UniVR / Boogu-Image v2 / DeepPlanning / TimeBlind), 触发 7-18 反思"补 §0 滚动动作"; (4) 边界合规 → 12 篇实质精读中 10/12 合规, RxBrain(1 处越界)+ LoCoBench(2 处越界)触线。改进: 本日十三规则强制每篇实质精读开头前置"派别自检表 + 反方条数预算 + 三档硬路径预算 + 边界合规预算"四联表。
3. 本日新增「十三规则」详解
承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 十二规则 → 本日十三规则:
「e1prep 简报档 ≥2 篇并列产出时, 必附"派别自检表"强制声明每篇的核心边界(避免 e1prep 把不同范式工作错位归类); 同日 0 篇实质稿 → 自评暂停 24 小时、降负荷(沿用 7-19 §3.3 十二规则)」
逐条说明: - 前置 1(e1prep ≥2 篇):7-20 当日产出 multimodal-e1prep + risk-e1prep 共 2 篇, 按本规则必须附"派别自检表"。本日 multimodal-e1prep §5 边界 #3 #4 #5 已显式做"避免把 RxBrain + LingBot-Video MoE + Xiaomi-Robotics-U0 混为同一件" + "避免把 Boogu-Image-0.1 与 SenseNova-Vision-7B-MoT 视为对立 / 重复" + "避免把 SenseNova-Vision-7B-MoT 与 SenseNova-U1-8B-MoT / SenseNova-U1-A3B-MoT 混用为同一件工作" 三条边界声明 = 派别自检表的雏形; 但 UniVR §2.1 订正 ① 揭示 e1prep §1 增量 4 仍存在"UniVR = SenseNova-Vision + VideoChat3 family 的视觉推理统一框架支撑"的错位归类, 已被 UniVR 精读自我订正——本日 e1prep 已暴露一次错位归类, 强制派别自检表的必要性凸显。 - 前置 2(同日 0 篇, 沿用 7-19 十二规则):本日 cron 触发反思时若发现 inbox/flyp/ 当日无任何实质精读 → 自评只写 §1-§2(短表)+ §3 单一简短改进点, 不展开 §4 全节。降负荷指标。 - 例外:weekly digest / weekly deep-read notes / weekly deep-read reviews / e1prep 预消化简报 / RSS 五类非实质精读产物不计入"实质精读", 独立计数。 - 目的:避免 e1prep 把不同范式工作错位归类(如 VLM-based 路线 vs 无语言监督纯视觉 RL 路线混入同一主线); 同时强制每周最弱 1 篇必须重写(沿用 7-19 十二规则)。
与既有规则的关系: - 7-13 §3.3 规则 5:abstract-only 精读 ≥6 条可证伪反方 + ≥6 条后续动作 - 7-15 §3.3 规则 8:评级三档硬路径(升档 / 降档 / 监控) - 7-17 §3.3 十规则:轻量精读必须前置 §0 元层说明 + 反方与待补查严格分层 - 7-18 §3.3 十一规则:≤6KB 禁止以"必入库"作为收束; 后续验证动作分必做 / 选做且每条必挂信源 + 截止日 + 验收标准 - 7-19 §3.3 十二规则:同日产出节奏与重写的强制关系 - 本日 十三规则(新增):e1prep 派别自检表强制声明每篇的核心边界
4. 重写动作(本轮承诺, LoCoBench-Agent v1 → v2)
4.1 选择理由
v1(66 行 / 6.1KB / 2026-07-20 15:50 写)在 7-20 当天 5 份实质产出中是最弱一篇。判别依据:
| 触线规则 | v1 的具体触线点 |
|---|---|
| 7-13 §3.3 规则 5(≥6 条反方 + ≥6 条后续动作) | §4 实验风险与可复现性 仅有 ① ② ③ 三条风险点, 后续动作 §7 仅 4 条笼统("盯紧技术报告"、"跑推理 demo"、"关注社区复现"、"RAG/agent 接入"), 未挂"信源 + 截止日 + 验收标准" |
| 7-15 §3.3 规则 8(评级三档硬路径) | §6 可信度判断 只写 "整体可信度: 中-高", 没有升档 / 降档 / 监控三档硬指标 |
| 7-17 §3.3 十规则(§0 元层说明 + 反方与待补查严格分层) | 无 §0 元层说明; §4 + §6 + §7 反方 / 风险 / 建议动作混在一起未分层 |
| 7-18 §3.3 十一规则(≤8KB 禁止"必入库"作收束) | §7 建议动作 写 "入库: 建议入 notes/agents/ 与 reviews/benchmarks/"——v1 6.1KB 偏小且反方仅 3 条, "必入库"作收束与体量不匹配; 且 §7 第二次越界写"notes/agents/long-context-coding-agent-bench.md + reviews/benchmarks/locobench-agent.md"——同一节两次越界, 是 7-20 当日最严重的边界违规 |
| 7-19 §3.3 十二规则(同日 ≥2 篇 → 强制最弱 1 篇 v2 覆盖) | 当日 5 篇中 v1 是最弱 |
| 本日十三规则(e1prep 派别自检表) | v1 自身未与同日 multimodal-e1prep / UniVR 形成派别对位, 也未与 7-14 ~ 7-19 已有 flyP 长上下文精读(7-02 context-rot / 7-03 SoK-Agentic-RAG / 7-03 ContextRL / 7-04 STC-DeepResearchAgents 等)形成跨日派别对位 |
4.2 v2 重写承诺
v1 (6.1KB / 66 行) → v2 (≥12KB / ≥220 行):
- 前置 §0 元层说明(v1 缺失, 列五处具体失误)
- 摘要级证据 ≥5 条(v1 §2 方法拆解已有但未挂"abstract 自报"标签)
- 摘要级可证伪反方 ≥8 条(v1 仅 ① ② ③ 三条; v2 至少 8 条 + 每条挂"证伪条件 + 判定依赖 + 反方严重度")
- 数据缺失级待补查 ≥6 条(v1 仅 4 条笼统; v2 增 ≥6 条 + 每条挂"信源 + 必做/选做 + 截止日")
- 评级三档硬路径(v1 "中-高"自评改写为 v2 §六 升档 / 降档 / 监控三档硬指标)
- 文件归档建议由 v1 越界
notes/agents/+reviews/benchmarks/改写为 v2 合规形式(仅写"建议同步任务决策的归档形式 + 与现有实体的跨页引用") - 后续验证动作升级到 ≥8 条(必做 5 + 选做 3, 每条挂信源 + 截止日 + 验收标准)
- 主题页候选标签升级到 3 个(agent-eval / long-context-software-engineering / harness-eval)
- 与 7-02 context-rot / 7-03 SoK-Agentic-RAG / 7-03 ContextRL / 7-04 STC-DeepResearchAgents / 7-14 GLM-5.2 / 7-18 Harness-Evolution / 7-18 Reward-Under-Attack 的横向对位矩阵
- 与同日 multimodal-e1prep / UniVR / RxBrain / Boogu-Image-0.1 v2 / VideoChat3 的派别自检表(沿用本日十三规则)
4.3 v2 重写动作执行
详见 inbox/flyp/2026-07-20-LoCoBench-Agent-longcontext-coding-agent-critical-read.md v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 本日十三规则一致做法:覆盖原文件名)。重写执行于本轮反思触发后立即进行。
5. 后续验证动作
- 必做(截止 7-20 22:00):把 v2 覆盖稿写入 inbox/flyp/ 原路径(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 本日十三规则覆盖而非新增)✓(本反思 §4.3 承诺)
- 必做(截止 7-21):在 7-21 反思里追加 §3.3 "十三规则"的应用证据(LoCoBench v2 的反方数 + 评级三档 + 派别自检表是否生效)
- 必做(截止 7-22):v30 活文档立标决策不再回引 Boogu-Image v1(沿用 7-19 反思 §5 必做 #1 + multimodal-e1prep §5 边界 #2)
- 必做(截止 7-23):审查 RxBrain(7-19)触发线(无 §0 元层 + 无三档硬路径 + 越界
notes/multimodal/+ 营销腔 1 处), 决定是否滚动补 §0 元层 / 三档硬路径 / 合规改写(沿用 7-19 §5 必做 #8 + 7-20 §5 必做 #4) - 必做(截止 7-26):weekly digest v2 模板落地(按 7-15 candidates.jsonl 框架 + 7-18 反思规则)
- 必做(截止 7-30):Harness-Evolution + Reward-Under-Attack + Reliability-without-Validity + SpectraReward + UniVR(7-20) 共 5 篇反方审稿线收敛于
notes/eval-methodology-2026-h2.md元方法学笔记 - 选做(截止 7-25):RSS 班次重组——是否降为每日 1-2 份精读 + 1 份 RSS 抽样(沿用 7-19 §5 选做 #6 + 7-20 §2.3 模式 D)
- 选做(截止 7-30):把"反思十三规则"导出为
notes/flyp-sop/风格的工作守则(仅在 Anan 明确要求时; 沿用 7-19 §5 选做 #7) - 选做(截止 7-31):审查本周期 12 份实质精读中未前置 §0 元层的 7 篇(CoT-Edit / LoomVideo / GLM-5.2 / SageMath / Audex / Xiaomi-U0 / SpectraReward / Agentic-RL+GLM-5.2 / SenseNova-Vision / Moment-Video / Homer / agent-eval-state-diff / MIRAGE / Reliability-without-Validity / Reward-Under-Attack / Harness-Evolution / Agent-STAR / VideoChat3 / RxBrain 等共 7-8 篇), 决定是否在 7-26 ~ 7-31 滚动补 §0(前 7-15 七反思规则均要求 §0, 但本周 12 篇实质精读中仅 5 篇有 §0)
6. 元信息
- 触发时间:2026-07-20 21:20 Asia/Shanghai
- 触发 cron:
b37d3839-ce77-4a07-93b6-83848f13e115 - 历史承接:flyp-2026-06-29 ~ flyp-2026-07-19(共 21 份反思)
- 写入边界声明:仅 inbox/flyp/ + organized/reflection/flyp-2026-07-20.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token
- 引用边界声明:本反思不复制任何原文 / 论文 / Substack newsletter 长段;评分与处置均为反思者(flyP)当日复盘判断
- 7-19 反思承诺兑现状态:Boogu-Image v2 重写 ✓ → 已升级 A 级 → multimodal-e1prep §5 边界 #2 引用 v2 ✓ → 7-19 十二规则杠杆验证通过