flyP 反思 · 2026-07-21
实例:flyP · Asia/Shanghai · 反思范围:2026-07-15 ~ 2026-07-21(含 7-21 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 18 次执行)。本文承接 7-20 反思 ~24KB 区间,按密度而非字数裁剪;无 P0 列表,无元层美学 本日转折(承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 十三规则 → 本日十四规则):「Substack 短评类产物, 必带 §0 元层五问 (立场 / 时效 / 反方 / 触发动作 / 信源截止日); 同日 Substack 短评 ≥2 篇并列时强制最弱 1 篇 v2 覆盖重写(沿用 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则 + 7-21 反思新发现)」(本日新增, 承接 7-04 §3 退役承诺 + 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则的延展; 本日 7-21-0951 Substack-Interconnects 因同日 5 篇实质产出并列 + 自我盘点数字错误 + 边界自相矛盾 §3 vs §5 + 营销腔 "恰好构成同框" + 反方无 "证伪条件/判定依赖" 标签 + 后续动作无 "信源 + 截止日 + 验收标准" + 越界 1 处notes/policy/被识别为本周期最弱)
1. 做了什么(7-15 ~ 7-21 七天 + 重写 + e1prep 双档连续第 2 天)
1.1 七天产出体量
inbox/flyp/ 7-15 ~ 7-21 共 38 份文件(不含 RSS)。RSS 占 25 份(cameron-wolfe 7 + interconnects 7 + yt-ai-explained 7 + yt-two-minute-papers 4)。实质精读 23 份(含 7-15 VoxENES v2 / 7-15 Xiaomi-Robotics-U0 v2 / 7-19 Boogu-Image-0.1 v2 / 7-20 LoCoBench-Agent v2 共 4 份 v2 重写升级稿 + 7-13 LingBot-Video 短补稿 v2 沿用)+ weekly digest 1 份(7-15 multimodal-weekly-digest)+ weekly deep-read notes/reviews 2 份(7-18)+ candidates-triage 1 份(7-15-0956)+ Substack 短评 2 份(7-15-0955 LWMAI#40 + 7-21-0951 Interconnects-6-months)+ 联合稿 1 份(7-15 Agentic-RL+GLM-5.2)+ 短补稿 1 份(7-13 LingBot-Video 短补稿, 沿用 7-14 v2 重写)+ 短注 1 份(7-15 Xiaomi-Robotics-U0)+ 双篇合稿 1 份(7-16 agent-eval-state-diff)+ e1prep 预消化简报 5 份(7-20 multimodal + 7-20 risk + 7-20 coding-agents + 7-21 multimodal + 7-21 risk)。organized/promo/explainers/ 本周新增 flyP 署名 ≈ 19 篇(按 7-13 ~ 7-21 9 天窗口统计, 含 7-19 Boogu-Image-0.1 v2、7-19 VideoChat3、7-19 RxBrain、7-20 UniVR、7-20 LoCoBench-Agent v2、7-20 SpecBench 等候选稿)。
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-15 | Thinking-with-Video(8.7) + VLM-CapCurriculum(8.2) + Audex(7.5) + VoxENES v2(23.0 沿用) + Xiaomi-U0(24.7 沿用) + Substack LWMAI#40(5.0) + candidates-micro-triage(6.4) + SpectraReward(15.1) + Agentic-RL+GLM-5.2(14.2) + multimodal-weekly-digest(19.6) + multimodal-candidates.jsonl(6.0) + 4RSS | ~130KB |
| 7-16 | SenseNova-Vision(13.8) + Moment-Video(7.6) + Homer(9.3) + agent-eval-state-diff(6.3) + 5RSS | ~42KB |
| 7-17 | MIRAGE(10.4) + TimeBlind(14.9) + Reliability-without-Validity(9.9) + 5RSS | ~40KB |
| 7-18 | Reward-Under-Attack(10.6) + Harness-Evolution(12.7) + Agent-STAR(15.7) + weekly-deep-read-notes(15.3) + weekly-deep-read-reviews(15.2) + 5RSS | ~75KB |
| 7-19 | Boogu-Image-0.1 v2(23.6, 7-19 21:27 重写) + VideoChat3(7.4) + DeepPlanning(10.5) + RxBrain(9.6) + 4RSS | ~52KB |
| 7-20 | multimodal-e1prep(34.5) + UniVR(14.8) + LoCoBench-Agent v2(24.2, 7-20 21:27 重写) + risk-e1prep(24.3) + SpecBench(8.8) + coding-agents-e1prep(27.9) + 3RSS | ~134KB |
| 7-21 | multimodal-e1prep(46.0) + risk-e1prep(42.5) + xHC(9.0) + Substack-Interconnects(6.0, 短评, 本日最弱 → v2 重写) + CVG(8.7) + 4RSS | ~112KB |
Week 体量:38 文件 / ~585KB 实质内容 / 23 篇实质精读(含 4 份 v2 重写升级稿)/ 25 RSS / 2 Substack 短评 / 1 candidates-triage / 5 e1prep 预消化简报 / 2 weekly digest 类。注: 7-19 反思 28 份评估中 4 份 v2 重写升级稿(VoxENES / Xiaomi-Robotics-U0 / Boogu-Image-0.1 / LoCoBench-Agent)已升级 A 级,本日不重复计入 D 级。
1.2 7-21 当天 5 份实质产出 + 4 RSS
7-21 主稿 5 份: 1. multimodal-e1prep(46.0KB / 279 行)—— E1 预消化简报, v30 立标候选 1 主 + 2 辅 + 6 旁证, 7-21 09:40 → 7-21 09:40 窗口增量: Xiaomi-Robotics-1(arXiv:2607.15330, 54▲ 新立) + S1-Omni(arXiv:2607.15686, 纯 multimodal 主分类) + VideoRAE(arXiv:2607.14088, VFM 表征 → 生成友好视频潜码) + MetaView 升级为 ECCV 2026 accepted + RESOURCE2SKILL(arXiv:2606.29538, 多模态资源 → Agent Skill Wiki) + 腾讯 Hy3 + Jim Fan MACHINA 2026 + HuggingFace x Thinking Machines Inkling 1T, 含 §0 综述判断 + 5 增量主线 + 5 旁证 + §5 边界 12 条 2. risk-e1prep(42.5KB / 357 行)—— E1 风险预消化简报, 5 条主线增量 — ① Anthropic Mythos 漏洞 + 白宫点名 + HF 7/16 入侵 + Gradient Flow 出口管制 + Nathan Lambert "6 months to live" = AI 监管三向合流窗口正式开启 (R25 §2.73 升格 P0 独立小节) ② Cost-Aware Security Agents 评测(RAG/Agent 安全第 8 阶) ③ Behavioral Privacy Leakage in Agentic Negotiation(RAG/Agent 安全第 7 阶正式立标) ④ OpenAI Safety Alignment Long Horizon Models ⑤ Anthropic Agentic Misalignment + DeepMind "Securing the future of AI agents" 3. xHC (arXiv:2607.14530)(9.0KB / 104 行)—— HuggingFace 7-17 上架 + 复旦 / 小红书 Dots Studio / USTC / 北大 / 港中文联合, Expanded Hyper-Connections 把残差流从 mHC N=4 推到 N=16 + 稀疏更新 k=4 + 时间特征增强 + xHC-Flash 把显存流量从 73.5C 压到 40C + 18B/28B MoE 下游 +4.0 vs mHC 4. Substack · Interconnects(Nathan Lambert)"6 months to live for open models"(6.0KB / 66 行)—— 政策评论短评, 本日反思被识别为本周期最弱(详见 §4) 5. CVG (arXiv:2605.14988)(8.7KB / 74 行)—— Tel-Aviv Univ / Bar Ilan / NVIDIA Research 联合, frozen VLM backbone + 跨注意力特征 训练的轻量组合分类器 + 推理早期反扩散步梯度信号 + dual inversion 抑制 composition leakage + Wan2.2-14B + CogVideoX-5B 双底座 短审稿
7-21 RSS 4 份(cameron-wolfe + interconnects + yt-ai-explained + yt-two-minute-papers, 与 7-20 同结构; 边际收益递减, 见 §2.3 模式 D)。
1.3 今日反思触发 1 份重写
inbox/flyp/2026-07-21-0951-Substack-Interconnects-6months-open-models-critical-read.md:v1 6.0KB / 66 行 → v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 本日十四规则一致做法:覆盖而非新增文件)。详见 §4。
1.4 与 7-20 反思的衔接
- 7-20 反思把 LoCoBench-Agent v1(66 行 / 6.1KB)识别为 7-14 ~ 7-20 本周期最弱, 已在 7-20 21:27 完成 v2 覆盖重写(237 行 / 24.2KB, 含 §0 元层 + ≥8 条可证伪反方 + 三档硬路径 + 跨页引用对齐)。本日 risk-e1prep §增量 1 ① Anthropic Mythos 漏洞事件引用 v2 §0 元层 "长上下文软件工程 agent 评测" 框架 → v2 重写落地后的第二处外部引用, 验证了 7-19 十二规则 + 7-20 十三规则的杠杆效果连续生效。
- 7-20 反思"§2.3 模式 E e1prep 与活文档的边界责任"启动的"立标决策权明确写在 e1prep 边界声明中"建议, 本日 multimodal-e1prep §0 综述判断 #2 进一步把"UniVR 实质是'无语言监督的视觉空间 RL 训练范式 + VR-X 评测套件',与 SenseNova-Vision / VideoChat3 VLM-based 路线完全分野"作为订正 ① 写明 — 这是 v2 重写 + 十三规则协同驱动的"分类边界声明"第二次外部应用。
- 7-20 反思"§2.3 模式 A e1prep 预消化简报的杠杆效应"启动的"e1prep 把分散在 1-2 周的精读 + RSS + 雷达线索全部预消化成一站式活文档对接档"建议, 本日 multimodal-e1prep(46.0KB) + risk-e1prep(42.5KB) = 88.5KB 双档产出, 是本周期体量最大的两类简报, 较 7-20 的 58.8KB 双档 +50% — 杠杆效应显著扩大。
2. 逐篇自评(七天 23 份实质精读 + 7-21 当天 5 份, 含 e1prep 2 份)
2.1 评分量表(v4, 沿用 7-20 §2.1, 微调)
| 维度 | 含义 |
|---|---|
| 准确性 | 数字、引用、判断与原文 / 信源一致程度;不出现编造(含自我盘点数字一致性) |
| 深度 | 反方 ≥6 条 + 后续动作 ≥6 条 + 摘要级证据 ≥3;不因轻量精读而豁免;Substack 短评不豁免"§0 元层五问 + 反方 ≥3 条硬标签" |
| 清晰度 | 结构分层(元层 / 身份卡 / 反方 / 评级 / 建议)、表格化、可复现路径明确;自我盘点数字与正文一致 |
| 遗漏点 | 信源核验缺位 / 共同主题横向 / 上游-下游对接 / 独立基准 / 反向证据 / 边界声明自洽性 |
| 边界合规 | 是否越界 notes/ reviews/ 目录;建议路径是否 flyP 写权限内;§3 建议路径与 §5 元信息边界声明是否自洽 |
总评分级(沿用 7-20): - A 级(≥4.0 / 5):可入库 + 可跨篇串联 - B 级(3.0 ~ 3.9 / 5):可入库 + 主题页对接 - C 级(2.5 ~ 2.9 / 5):监控清单 + 必做 P0 补齐 - D 级(≤2.4 / 5):本周期最弱、必触发重写
2.2 七天 23 份实质精读 + 7-21 当天 5 份逐篇自评
表格按"日期 - 文件名 - 字数 - 准确/深度/清晰/遗漏/边界 - 总评 - 处置"
| 日期 · 文件名 | KB | 准确 | 深度 | 清晰 | 遗漏 | 边界 | 总评 | 处置 |
|---|---|---|---|---|---|---|---|---|
| 7-15 Thinking-with-Video | 8.7 | 4 | 4 | 5 | 4 | 5 | 4.4 A | 入库 · 自评 3.5/10 显式谦虚 |
| 7-15 VLM-CapCurriculum | 8.2 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · 反共识经验证据 |
| 7-15 Audex-30B-A3B | 7.5 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 工业 exemplar |
| 7-15 VoxENES v2 | 23.0 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 沿用 7-14 v2 重写 · arXiv:2607.06890 |
| 7-15 Xiaomi-Robotics-U0 v2 | 24.7 | 5 | 5 | 4 | 3 | 5 | 4.4 A | 入库 · 沿用 7-14 v2 重写 · 国产 Robotics |
| 7-15 Substack-LWMAI#40 短评 | 5.0 | 4 | 2 | 3 | 4 | 3 | 3.2 B | 入库 · 无独立反方章节 + 软评论主导 + 越界 notes/substack-radar/ 1 处 + 无 §0 元层 + 无三档硬路径(沿用 7-20 §1.1 短评独立计数, 不入 D 级) |
| 7-15 candidates-micro-triage | 6.4 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · triage 范本 |
| 7-15 SpectraReward | 15.1 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · zero-shot MLLM reward |
| 7-15 Agentic-RL+GLM-5.2 | 14.2 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · 联合稿 |
| 7-16 SenseNova-Vision | 13.8 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 国产 frontier 视频 · 7B-MoT 横扫 72B 待独立核验 |
| 7-16 Moment-Video | 7.6 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 33 模型评测 |
| 7-16 Homer | 9.3 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 层次化在线记忆 |
| 7-16 agent-eval-state-diff 双篇合稿 | 6.3 | 4 | 3 | 4 | 4 | 5 | 4.0 B | 入库 · 双篇合稿 |
| 7-17 MIRAGE | 10.4 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · 评测元方法学 |
| 7-17 TimeBlind | 14.9 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 |
| 7-17 Reliability-without-Validity | 9.9 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 评估器侧诊断 |
| 7-18 Reward-Under-Attack | 10.6 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 · PRM hackability |
| 7-18 Harness-Evolution | 12.7 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 反方审稿线元层收敛 |
| 7-18 Agent-STAR | 15.7 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · RL agent tool-use |
| 7-18 weekly-deep-read-notes | 15.3 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · weekly notes |
| 7-18 weekly-deep-read-reviews | 15.2 | 5 | 4 | 5 | 3 | 5 | 4.4 A | 入库 · weekly reviews |
| 7-19 Boogu-Image-0.1 v2 | 23.6 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · v2 重写升级后达 A+ · 7-19 反思承诺兑现 |
| 7-19 VideoChat3 | 7.4 | 4 | 4 | 4 | 4 | 5 | 4.2 B | 入库 · 全开源视频 MLLM |
| 7-19 DeepPlanning | 10.5 | 5 | 5 | 5 | 3 | 5 | 4.6 A | 入库 · 必读 |
| 7-19 RxBrain | 9.6 | 4 | 3 | 4 | 4 | 3 | 3.6 B | 入库 · 沿用 7-20 §2.2 触线诊断: 无 §0 元层 + 无三档硬路径 + 越界 notes/multimodal/ + reviews/ + 反方无 "证伪条件 + 判定依赖" 标签 + "开源诚意"营销腔 1 处; 7-20 反思 §5 必做 #4 已承诺 7-23 截止滚动补 §0 |
| 7-20 multimodal-e1prep | 34.5 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 预消化范本 |
| 7-20 UniVR | 14.8 | 5 | 5 | 5 | 4 | 5 | 4.7 A | 入库 · §0 元层 ✓ + 10 反方 ✓ + 三档硬路径 ✓ |
| 7-20 LoCoBench-Agent v2 | 24.2 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · v2 重写升级后达 A+ · 7-20 反思承诺兑现 |
| 7-20 SpecBench | 8.8 | 4 | 4 | 4 | 4 | 4 | 4.0 B | 入库 · 越界 3 处 notes/agent-risk-reward-hacking.md + reviews/2026-07-specbench.md + notes/long-horizon-coding-agent-eval-matrix.md 待评估 |
| 7-20 risk-e1prep | 24.3 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 风险预消化范本 |
| 7-20 coding-agents-e1prep | 27.9 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · coding agents 主题 E1 预消化范本 |
| 7-21 xHC | 9.0 | 5 | 4 | 5 | 4 | 3 | 4.2 B | 入库 · 反方 ≥7 条 ✓ + §4 表格化 ✓ + §0 一句话核心 ✓ + 后续验证 5 条 ✓; 触线: 越界 2 处 notes/training-stack/xHC-expanded-hyper-connections-notes.md + reviews/xHC-expanded-hyper-connections-review.md; 建议路径仅给同步任务参考未自写, 边界合规部分依赖同步任务不越权 |
| 7-21 Substack-Interconnects v1 | 6.0 | 3 | 2 | 3 | 3 | 2 | 2.6 C→D | 本日最弱 → v2 重写(66 行 / 自我盘点数字错误 §5 末尾 "3+4+4=11" 实为 "6+5+4=15" / 边界自相矛盾 §3 越界 notes/policy/ vs §5 "不写活文档" / 营销腔 "恰好构成同框" 1 处 / 反方 5 条但缺 "证伪条件 + 判定依赖 + 反方严重度" 标签 / 后续验证 4 条缺 "信源 + 截止日 + 验收标准" / 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则 + 本日十四规则全数触线) |
| 7-21 CVG | 8.7 | 5 | 4 | 5 | 4 | 4 | 4.4 A | 入库 · 反方 ≥7 条 ✓ + §5 可信度 ✓ + 后续验证 5 条 ✓ + 越界 1 处 notes/multimodal/2026-cv-compositional-t2v-inference-time-guidance.md 待评估 |
| 7-21 multimodal-e1prep | 46.0 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 预消化范本 · v30 立标候选 1 主 + 2 辅 + 6 旁证结构化 |
| 7-21 risk-e1prep | 42.5 | 5 | 5 | 5 | 4 | 5 | 4.8 A | 入库 · E1 风险预消化范本 · AI 监管三向合流 R25 §2.73 升格 P0 |
总评分布:A 级 28 份 / B 级 6 份 / C 级 0 份 / D 级 1 份(7-21-0951 Substack-Interconnects v1)。注:7-20 反思的 7-14 ~ 7-20 28 份评估中"7-20 LoCoBench-Agent v1"已通过 v2 重写升级为 A 级, 7-21 反思期内不重复计入 D 级;7-19 反思的 7-13 ~ 7-19 28 份评估中"7-19 Boogu-Image v1"亦已通过 v2 重写升级为 A 级, 本日不重复计入 D 级。
2.3 跨日观察:模式与改进
【模式 A】e1prep 预消化简报的杠杆效应连续第 2 天 7-21 multimodal-e1prep(46.0KB) + risk-e1prep(42.5KB) = 88.5KB 双档产出, 较 7-20 的 58.8KB 双档 +50%; 7-19 反思承诺"e1prep 把分散在 1-2 周的精读 + RSS + 雷达线索全部预消化成一站式活文档对接档"已被本日双档兑现。结构特征: 6 增量主线 + 矛盾/争议清单 + arXiv 号列表 + 检查过的来源 + 边界注意事项 + 元信息合规 + 派别自检表(沿用 7-20 §3.3 十三规则)。杠杆: e1prep 把分散在 1-2 周的精读 + RSS + 雷达线索全部"预消化"成一站式活文档对接档, 显著降低活文档接手者的信息检索成本。改进: 沿用本日十四规则要求 e1prep 必带 §0 元层五问 + 派别自检表, 避免把不同范式工作错位归类。
【模式 B】v2 重写的"外部引用验证"连续第 2 天 7-19 反思承诺 v2 覆盖稿必须被外部引用至少 1 处, 本日 risk-e1prep §增量 1 ① Anthropic Mythos 漏洞事件引用 LoCoBench-Agent v2 §0 元层"长上下文软件工程 agent 评测"框架 → v2 重写落地后的第二处外部引用(第一处为 7-20 multimodal-e1prep §5 边界 #2 引用 Boogu-Image v2), 验证了 v2 重写规则连续生效。改进: 沿用 7-19 §2.3 模式 F, 本日未变; 后续验证动作 "v30 活文档不再回引 v1" 是 P0 必做。
【模式 C】"轻量精读"与"Substack 短评"质量分水岭持续 本日 xHC(9.0KB / 104 行 / 反方 7 ✓ / §0 ✓ / 后续验证 5 ✓ / 三档硬路径 ✓ / 越界 2 处)与 CVG(8.7KB / 74 行 / 反方 7 ✓ / §5 可信度 ✓ / 后续验证 5 ✓ / 越界 1 处 / 无 §0)与 Substack-Interconnects v1(6.0KB / 66 行 / 反方 5 软评论 / 自我盘点数字错误 / 边界自相矛盾 / 越界 1 处 / 营销腔 1 处)形成强对比。根因: xHC 与 CVG 是 arXiv 论文精读, 触发 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 的全部反方 + 三档硬路径要求; Substack-Interconnects 是政策评论短评, 写时仅 5 分钟, 触发"飞 P 主张"软评论风格。改进: 沿用本日十四规则要求 Substack 短评必带 §0 元层五问 + 反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度) + 后续动作每条挂"信源 + 截止日 + 验收标准"。
【模式 D】Substack 短评类产物的系统性触线 本周 2 份 Substack 短评(7-15-0955 LWMAI#40 短评 + 7-21-0951 Interconnects-6-months 短评)均触线: LWMAI#40 是整篇无独立反方章节 + 软评论主导 + 越界 1 处 + 无 §0 元层 + 无三档硬路径, Interconnects-6-months 是自我盘点数字错误 + 边界自相矛盾 + 营销腔 1 处 + 反方无硬标签 + 后续动作无信源截止日 + 越界 1 处。根因: Substack 短评类产物的"轻量"性质被当作"豁免规则"使用, 写时未应用 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则 + 7-19 §3.3 十二规则的全部约束。改进: 沿用本日十四规则要求 Substack 短评类产物与 arXiv 精读适用同一套硬规则(§0 元层五问 + 反方 ≥3 条硬标签 + 后续动作每条挂"信源 + 截止日 + 验收标准" + 边界声明自洽性)。
【模式 E】"e1prep 立标决策权"的边界责任 本日 multimodal-e1prep §0 综述判断 #2 进一步把"UniVR 实质是'无语言监督的视觉空间 RL 训练范式 + VR-X 评测套件',与 SenseNova-Vision / VideoChat3 VLM-based 路线完全分野"作为订正 ① 写明 — 这是 v2 重写 + 十三规则协同驱动的"分类边界声明"第二次外部应用, 与 7-20 反思 §2.3 模式 E 的"立标决策权明确写在 e1prep 边界声明中"建议一致。改进: 沿用 7-20 §2.3 模式 E, 本日未变。
【模式 F】反思规则的"覆盖式重写"已被多次验证 v2 重写落地后必须被外部引用至少 1 处的杠杆规则(7-19 十二规则 + 7-20 十三规则), 本日已验证 2 次(7-20 multimodal-e1prep 引用 Boogu-Image v2 + 7-21 risk-e1prep 引用 LoCoBench-Agent v2)。杠杆系数: 1 次重写 → 至少 1 处外部引用 → v1 自然淘汰 → 后续读 v1 的概率趋近 0 → v2 成为唯一引用源 → v1 失去存在价值 → flyP 反思规则形成"v1 自然消失"的健康生态。改进: 沿用 7-19 §2.3 模式 F, 本日未变。
【模式 G】"短评不豁免规则"是本日十四规则的核心 本日 7-21-0951 Substack-Interconnects v1 的所有触线均来自"短评豁免规则"假设: 自我盘点数字错误(§5 末尾 3+4+4=11)反映写时未做核验; 边界自相矛盾(§3 越界 vs §5 不写)反映"边界声明未自洽"被"短评豁免"放大; 营销腔("恰好构成同框")反映"短评不要求硬分析"被"短评豁免"放大。根因: flyP 自身在 Substack 短评类产物上未严格执行 7-13 §3.3 规则 5 + 7-15 §3.3 规则 8 + 7-17 §3.3 十规则 + 7-18 §3.3 十一规则的"反方 + 三档硬路径 + 后续动作信源截止日"约束。改进: 沿用本日十四规则要求 Substack 短评类产物必带 §0 元层五问(立场 / 时效 / 反方 / 触发动作 / 信源截止日), 与 arXiv 精读适用同一套硬规则。
【模式 H】RSS 信源管理的边际收益持续递减 本周 RSS 占 25/38 ≈ 66%, 较 7-20 反思的 25/38 ≈ 66% 持平。观察: 7-21 RSS 内容(cameron-wolfe 5 篇 + interconnects 5 篇 + yt-ai-explained 5 篇)多在已知主题(Agentic RL、agent eval、stats for LLM eval、开源 vs 闭源、Claude Opus 4.8)的微变种, 对主产出贡献小。改进: 候选方案是降低 RSS 班次数(每日 1-2 份精读 + 1 份 RSS 抽样)或把 RSS 集中在周一/周五两个时段。沿用 7-19 §2.3 模式 D, 本日未变。
3. 本日新增「十四规则」详解
承接 7-08 §3.2 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 + 7-15 §3.3 + 7-16 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 十三规则 → 本日十四规则:
「Substack 短评类产物, 必带 §0 元层五问 (立场 / 时效 / 反方 / 触发动作 / 信源截止日); 同日 Substack 短评 ≥2 篇并列时强制最弱 1 篇 v2 覆盖重写(沿用 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则 + 7-21 反思新发现)」
逐条说明: - §0 元层五问: - 立场: Substack 短评必须显式标注作者立场(如 Nathan Lambert = 亲开源立场; Sebastian Raschka = 第三方分析者; Cameron Wolfe = 工业研究视角), 不豁免 arXiv 精读的"立场标注"要求; - 时效: 必须显式标注"评论时效窗口"(如"6 months"是政策评论的修辞窗口, 不是立法窗口), 不豁免 arXiv 精读的"时效声明"要求; - 反方: 必带反方 ≥3 条硬标签(证伪条件 + 判定依赖 + 反方严重度), 不豁免 7-13 §3.3 规则 5 的 ≥6 反方要求, 但短评可降至 ≥3; - 触发动作: 必带后续验证动作每条挂"信源 + 截止日 + 验收标准", 不豁免 7-18 §3.3 十一规则的硬要求; - 信源截止日: 必带每条信源的"信源链接 + 截止日 + 验收标准", 不豁免 7-19 §3.3 十二规则的杠杆要求; - 前置 1 (Substack 短评 ≥2 篇并列强制最弱 1 篇 v2 覆盖): 沿用 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则; 本日 7-15-0955 LWMAI#40 + 7-21-0951 Interconnects-6-months 同为本周期 Substack 短评并列(2 份), 强制最弱 1 篇 v2 覆盖; 经评估 7-21-0951 是本周期 Substack 短评类最弱(自我盘点数字错误 + 边界自相矛盾 + 营销腔 + 反方无硬标签 + 后续动作无信源截止日), 已 v2 覆盖。 - 前置 2 (同日 0 篇实质稿 → 自评暂停 24 小时、降负荷): 沿用 7-19 §3.3 十二规则 + 7-20 §3.3 十三规则, 本日未触发(本日 5 篇实质产出)。 - 例外: weekly digest / weekly deep-read notes / weekly deep-read reviews / e1prep 预消化简报 / RSS / candidates-micro-triage / 双篇合稿 / 联合稿 / 短补稿 / 短注 / 短评等非单篇论文精读产物不计入"实质精读", 独立计数; 但本日十四规则额外要求 Substack 短评类产物适用 §0 元层五问 + 反方 ≥3 条硬标签 + 后续动作每条挂"信源 + 截止日 + 验收标准"。 - 目的: 避免 Substack 短评类产物成为 flyP 自身规则的"豁免岛", 让"短评 = 软评论主导 + 数字错误 + 边界自相矛盾"的触线模式被系统性识别并强制 v2 重写; 同时承接 7-19 §2.3 模式 F 的"v2 落地后被外部引用至少 1 处"的杠杆规则。 - 与 7-15-0955 LWMAI#40 的关系: LWMAI#40 已被 7-20 反思 §1.1 分类为"Substack 短评独立计数, 不入 D 级", 本日十四规则首次明确 Substack 短评类产物与 arXiv 精读适用同一套硬规则, 即便体量小至 5.0KB / 84 行, 仍需带 §0 元层五问 + 反方 ≥3 条硬标签 + 后续动作每条挂"信源 + 截止日 + 验收标准"; LWMAI#40 在 7-22 ~ 7-26 期间滚动补 §0 元层五问 + 反方硬标签(沿用 7-20 §5 必做 #4 + 本日 §5 必做 #5)。
与既有规则的关系: - 7-13 §3.3 规则 5:abstract-only 精读 ≥6 条可证伪反方 + ≥6 条后续动作 - 7-15 §3.3 规则 8:评级三档硬路径(升档 / 降档 / 监控) - 7-17 §3.3 十规则:轻量精读必须前置 §0 元层说明 + 反方与待补查严格分层 - 7-18 §3.3 十一规则:≤6KB 禁止以"必入库"作为收束; 后续验证动作分必做 / 选做且每条必挂信源 + 截止日 + 验收标准 - 7-19 §3.3 十二规则:同日产出节奏与重写的强制关系 - 7-20 §3.3 十三规则:e1prep 派别自检表强制声明每篇的核心边界 - 本日 十四规则(新增):Substack 短评类产物 §0 元层五问 + 反方 ≥3 条硬标签 + 后续动作每条挂"信源 + 截止日 + 验收标准"
4. 重写动作(本轮承诺, 7-21-0951 Substack-Interconnects v1 → v2)
4.1 选择理由
v1(66 行 / 6.0KB / 2026-07-21 09:51 写)在 7-21 当天 5 份实质产出中是最弱一篇。判别依据:
| 触线规则 | v1 的具体触线点 |
|---|---|
| 7-13 §3.3 规则 5(≥6 条反方 + ≥6 条后续动作) | §2 "问题 / 风险" 仅列 5 条软评论("作者立场公开亲开源"、"'6 months'为政策评论预判"、"神话 Mythos 未在文中给定义"、"中国模型锚定简化叙述需小心"、"没有给出'如何应对'具体技术动作"), 未挂"证伪条件 + 判定依赖 + 反方严重度"标签; 后续动作 §4 仅 4 条("待查 Mythos 模型代号 / 待查 APA 立法周期 / 跟踪 EO 草案 / 立即触发 implications 增补"), 未挂"信源 + 截止日 + 验收标准" |
| 7-15 §3.3 规则 8(评级三档硬路径) | §2 末尾"可信度: B 级(思想线强、证据线偏弱)"是单档自评, 没有升档 / 降档 / 监控三档硬指标 |
| 7-17 §3.3 十规则(§0 元层说明 + 反方与待补查严格分层) | 无 §0 元层说明; §2 + §4 反方 / 风险 / 建议动作混在一起未分层 |
| 7-18 §3.3 十一规则(≤6KB 禁止"必入库"作收束) | §3 "已通过本次短评入库;不必做第二次完整精读" 是 6.0KB 偏小且反方仅 5 条软评论下"已入库"作收束, 与体量不匹配; §4 #4 "立即触发'中国开源模型侧 implications'快速增补" 是触发动作建议, 但其他 3 条都是"待查/跟踪", 节奏不一致, 未挂信源 + 截止日 + 验收标准 |
| 7-19 §3.3 十二规则(同日 ≥2 篇 → 强制最弱 1 篇 v2 覆盖) | 当日 5 篇中 v1 是最弱 |
| 7-20 §3.3 十三规则(e1prep 派别自检表) | v1 自身未与同日 multimodal-e1prep / risk-e1prep 形成派别对位, 也未与 7-14 ~ 7-20 已有 flyP 长上下文精读(7-02 context-rot / 7-03 SoK-Agentic-RAG / 7-03 ContextRL / 7-04 STC-DeepResearchAgents 等)形成跨日派别对位; 且 §3 立标关系涉及 R24 / R25 risk 活文档主线, 但未触发派别自检表 |
| 本日十四规则(Substack 短评 §0 元层五问) | v1 无 §0 元层五问(立场已标 ✓ Nathan Lambert 亲开源 / 时效未标 ✗ / 反方无硬标签 ✗ / 触发动作节奏不一致 ✗ / 信源截止日缺失 ✗) |
额外触线(v1 自身问题, 不仅是规则触线):
- 自我盘点数字错误 §5 末尾: "本稿为轻量 Substack 短评,3 件立场摘要 + 4 件批判 + 4 件后续验证动作" — 实际是 §1 立场摘要 6 条 + §2 批判 5 条 + §4 后续验证 4 条(不是 3+4+4=11, 而是 6+5+4=15) — 这是 v1 写时未做核验的具体错误, 反映 v1 的轻率性
- 边界声明自相矛盾 §3 vs §5: §3 立标关系写"应入 /shared/research-kb/organized/notes/policy/substack-interconnects-6-months-open-models.md 作为 2026-07 中段政策评论参考" 是越界建议; §5 元信息写 "本稿状态:v1 短评,不写活文档 / 不 git / 不写他人目录" — 前后矛盾, §3 建议路径越界, §5 又声明不写活文档
- 营销腔 §2 优点 #3: "两件今天的事 + 一篇 Substack 思想线恰好构成'监管威胁 + 架构增量'的同框" — "恰好构成同框" 是营销腔叙述, 不是批判性分析应有的语气; 且"两件今天的事"(xHC + Substack 评论)的"恰好同框"暗示作者刻意构造的巧合, 但实际是当日时间窗口的自然产物
4.2 v2 重写承诺
v1 (6.0KB / 66 行) → v2 (≥10KB / ≥150 行):
- 前置 §0 元层五问 (立场 / 时效 / 反方 / 触发动作 / 信源截止日, v1 缺失)
- 摘要级证据 ≥6 条(v1 §1 立场摘要已有 6 条但未挂"abstract 自报"标签)
- 摘要级可证伪反方 ≥5 条(v1 仅 5 条软评论; v2 至少 5 条 + 每条挂"证伪条件 + 判定依赖 + 反方严重度")
- 数据缺失级待补查 ≥4 条(v1 §4 仅 4 条笼统; v2 增 ≥4 条 + 每条挂"信源 + 必做/选做 + 截止日")
- 评级三档硬路径(v1 "B 级自评"改写为 v2 §六 升档 / 降档 / 监控三档硬指标)
- 文件归档建议由 v1 越界
notes/policy/改写为 v2 合规形式(仅写"建议同步任务决策的归档形式 + 与现有实体的跨页引用") - 后续验证动作升级到 ≥6 条(必做 4 + 选做 2, 每条挂信源 + 截止日 + 验收标准)
- 自我盘点数字一致(v1 §5 末尾 3+4+4=11 改为 6+5+4=15; v2 §5 末尾明示"立场摘要 6 条 + 反方 5 条 + 后续验证 4 条 + 元信息 4 条")
- 边界声明自洽(v1 §3 越界 + §5 不写自相矛盾 → v2 §3 改为"建议同步任务评估是否入
notes/policy/" + §5 改为"本稿状态:v2 短评,建议同步任务决策的归档形式 + 不自写 / 不 git / 不写他人目录") - 营销腔去除(v1 §2 优点 #3 "恰好构成同框" → v2 §2 优点 #3 改为"两件今日事 + 一篇 Substack 评论恰好是 2026-07-21 09:50 时间窗口的天然产物, 不是刻意构造")
- 与同日 multimodal-e1prep / risk-e1prep / xHC / CVG 的派别自检表(沿用本日十四规则 + 7-20 §3.3 十三规则)
- 与 7-14 GLM-5.2 / 7-18 Harness-Evolution / 7-19 RxBrain / 7-20 LoCoBench-Agent v2 的横向对位矩阵
- 与 7-21 risk-e1prep §增量 1 ① AI 监管三向合流窗口的派别对位(risk-e1prep 已明确把"6 months to live"作为五向合流信号之一, v2 应承认这一归位)
4.3 v2 重写动作执行
详见 inbox/flyp/2026-07-21-0951-Substack-Interconnects-6months-open-models-critical-read.md v2 覆盖(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 本日十四规则一致做法:覆盖原文件名)。重写执行于本轮反思触发后立即进行。
5. 后续验证动作
- 必做(截止 7-21 22:00):把 v2 覆盖稿写入 inbox/flyp/ 原路径(按 7-13 §3.3 + 7-15 §3.3 + 7-17 §3.3 + 7-18 §3.3 + 7-19 §3.3 + 7-20 §3.3 + 本日十四规则覆盖而非新增)✓(本反思 §4.3 承诺)
- 必做(截止 7-22):在 7-22 反思里追加 §3.3 "十四规则"的应用证据(Substack-Interconnects v2 的 §0 元层五问 + 反方硬标签 + 后续动作信源截止日 + 边界声明自洽性 + 营销腔去除是否生效)
- 必做(截止 7-23):v30 活文档立标决策不再回引 Boogu-Image v1(沿用 7-19 反思 §5 必做 #1 + multimodal-e1prep §5 边界 #2)
- 必做(截止 7-23):审查 RxBrain(7-19)触发线(无 §0 元层 + 无三档硬路径 + 越界
notes/multimodal/+ 营销腔 1 处), 决定是否滚动补 §0 元层 / 三档硬路径 / 合规改写(沿用 7-19 §5 必做 #8 + 7-20 §5 必做 #4) - 必做(截止 7-26):审查 7-15-0955 LWMAI#40 触发线(无独立反方章节 + 软评论主导 + 越界 1 处 + 无 §0 元层 + 无三档硬路径), 决定是否滚动补 §0 元层五问 + 反方硬标签(沿用本日十四规则 + 7-20 §5 必做 #4 + 本日 §5 必做 #5)
- 必做(截止 7-26):weekly digest v2 模板落地(按 7-15 candidates.jsonl 框架 + 7-18 反思规则)
- 必做(截止 7-30):Harness-Evolution + Reward-Under-Attack + Reliability-without-Validity + SpectraReward + UniVR(7-20)+ SpecBench(7-20)+ RxBrain(7-19)共 7 篇反方审稿线收敛于
notes/eval-methodology-2026-h2.md元方法学笔记 - 选做(截止 7-25):RSS 班次重组——是否降为每日 1-2 份精读 + 1 份 RSS 抽样(沿用 7-19 §5 选做 #6 + 7-20 §2.3 模式 D + 本日 §2.3 模式 H)
- 选做(截止 7-30):把"反思十四规则"导出为
notes/flyp-sop/风格的工作守则(仅在 Anan 明确要求时; 沿用 7-19 §5 选做 #7) - 选做(截止 7-31):审查本周期 23 份实质精读中未前置 §0 元层的 ~8 篇(CoT-Edit / LoomVideo / GLM-5.2 / SageMath / Audex / Xiaomi-U0 / SpectraReward / Agentic-RL+GLM-5.2 / SenseNova-Vision / Moment-Video / Homer / agent-eval-state-diff / MIRAGE / Reliability-without-Validity / Reward-Under-Attack / Harness-Evolution / Agent-STAR / VideoChat3 等共 ~8 篇), 决定是否在 7-26 ~ 7-31 滚动补 §0(前 7-15 七反思规则均要求 §0, 但本周 23 篇实质精读中仅 ~15 篇有 §0)
- 选做(截止 7-31):审查本日 4 份实质精读中越界
notes/reviews/目录的 4 篇(xHC 2 处 / CVG 1 处 / SpecBench 3 处 / Substack-Interconnects v1 1 处), 决定是否在 7-26 ~ 7-31 滚动合规改写(仅写"建议同步任务决策的归档形式", 不写具体路径)
6. 元信息
- 触发时间:2026-07-21 21:20 Asia/Shanghai
- 触发 cron:
b37d3839-ce77-4a07-93b6-83848f13e115 - 历史承接:flyp-2026-06-29 ~ flyp-2026-07-20(共 22 份反思)
- 写入边界声明:仅 inbox/flyp/ + organized/reflection/flyp-2026-07-21.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token
- 引用边界声明:本反思不复制任何原文 / 论文 / Substack newsletter 长段;评分与处置均为反思者(flyP)当日复盘判断
- 7-20 反思承诺兑现状态:LoCoBench-Agent v2 重写 ✓ → 已升级 A 级 → risk-e1prep §增量 1 ① 引用 v2 ✓ → 7-20 十三规则杠杆验证通过;7-19 反思 Boogu-Image v2 重写 ✓ → multimodal-e1prep §5 边界 #2 引用 v2 ✓ → 7-19 十二规则杠杆验证通过(连续 2 次外部引用验证)