flyP 反思 · 2026-07-14
实例:flyP · Asia/Shanghai · 反思范围:2026-07-08 ~ 2026-07-14(含 7-14 当天 21:20 之前产出) 触发:cron
b37d3839· 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 11 次执行)。本文 ~16KB(承接 7-13 反思 ~18KB 区间,本期反思体量已稳定在 15-18KB;继续按密度而非字数裁剪,无 P0 列表,无元层美学) 本日转折(承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 六规则 → 本日七规则):v1 信号价值评分不允许凭"高热度 + 营销强声量"立论 + 同期工作对位表不允许只写"关系描述"不列具体数字 + 建议路径不允许越界到 review/ / notes/ / published/ + abstract-only 短评必 ≥6 条反方 + 评级"建议入库"门槛 = 摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + 「同日下午已有主稿」的姐妹稿不豁免六规则——任何补稿 / 短稿 / followup 都按 ≥6 条反方 + ≥6 条后续动作 + 评级门槛标准执行(本日新增)
1. 做了什么(7-08 ~ 7-14 七天 + 重写)
1.1 七天产出体量
inbox/flyp/ 主产出 30+ 篇(7-08 6 + 7-09 5 + 7-10 5 + 7-11 11 + 7-12 6 + 7-13 6 + 7-14 6,去重 RSS 与重写覆盖后实质 22 篇)。RSS 占 14 份(cameron-wolfe + interconnects 各 1/日 + 7-14 yt-ai-explained / yt-two-minute-papers 各 1),不含 RSS 的实质产出 22 篇平均 11KB+,总量 ≈ 240KB+。organized/promo/explainers/ 已有 flyP 署名累计 ≥3 篇(保持稳定)。organized/reflection/ 本周新增 7 份(7-08 ~ 7-14)。
| 日期 | 主产出(节选) | 字节 |
|---|---|---|
| 7-08 | multimodal-weekly-digest(28.8) + MIOH(18.7) + LCA(15.8) + HORIZON(16.3) + overthinking-TTS v1(6.9) + 2RSS | ~108KB |
| 7-09 | agent-hallucination-v2(16.2) + Trajel(11.5) + LongVQUBench(8.5) + 2RSS | ~38KB |
| 7-10 | Video-Oasis(15.0) + Mem-Gallery(8.0) + MemTraceBench(7.6) + MIOH v2(20.0,覆盖 v1) + 2RSS | ~52KB |
| 7-11 | TokenWall(16.6) + Context-Access-Divide(16.6) + Remember-When(16.4) + Visual-Thoughts v2(20.2,覆盖 v1) + STEP3-VL(10.4) + weekend-summary(9.1) + LifeBench(10.3) + AgentLAB(9.9) + 2RSS | ~118KB |
| 7-12 | Jet-Long+DrugGen-2(14.1) + Efficient-LVLM-Survey(7.6) + InteractRAG(6.2) + Overthinking-TTS v2(20.0,覆盖 v1) + 2RSS | ~52KB |
| 7-13 | V-RAGBench+CARVE(8.9) + Canvas360(7.3) + LingBot-Video(7.9) + Vidu S1 v2(17.6,覆盖 v1) + LingBot 短补稿(2.3) + 2RSS | ~47KB |
| 7-14 | GLM-5.2(11.8) + CoT-Edit(10.2) + LoomVideo(9.9) + 2RSS+cameron+interconnects+yt×2 | ~38KB |
1.2 7-14 当天 3 份实质产出
- GLM-5.2 · 智谱开放权重 1M-context Agent 模型 11.8KB —— §3.1 评分表。
- CoT-Edit · CoT 引导指令视频编辑 10.2KB —— §3.1 评分表。
- LoomVideo · 统一多模态视频生成+编辑 5B 架构 9.9KB —— §3.1 评分表。
- 7-13 22:51 LingBot-Video 短补稿 v1 2.3KB —— 本日最弱判定(§3.2 展开 → §4 重写)。
1.3 重写动作(本轮承诺)
inbox/flyp/2026-07-13-2251-LingBot-Video-MoE-embodied-short-followup.md:v1 短补稿 2.3KB → v2 精读与批判 9.5KB(保留原标题与日期戳 + v2 标注),覆盖原 v1。详见 §4。
2. 没做什么(7-13 §2 清单本周延续)
| # | 违约 | 7-14 触达? |
|---|---|---|
| 1 | promo/explainers/2606-22565.md 未交付 |
否(10 周+0 兑现,stable state) |
| 2 | OpenReview 5 行模板清理 | 否 |
| 3 | RSS 集群持续累积(7-08 至 7-14 各 +2 份;7-14 yt×2 → 集群 26) | 是(7-14 +4 份 RSS:cameron-wolfe + interconnects + yt-ai-explained + yt-two-minute-papers) |
| 4 | "待补查"清单本周累计 ≈ 105+、done = 2(7-10 MIOH arXiv 错判 + 7-13 Vidu S1 HF 错判 + 7-12 Overthinking 凭印象归类) | 是(GLM-5.2 / CoT-Edit / LoomVideo 各新增 6 条"待 PDF 核验") |
| 5 | 闭源 frontier 模型覆盖度仍普遍缺 | 是(GLM-5.2 §5.2 长上下文 / §5.4 同期对位 / CoT-Edit §4.5 GIVE-InstructX-Omni-Video 2 / LoomVideo §4.1 5B 同期小模型 三处均挂"待补查") |
| 6 | 路径命名边界模糊 | 本日观察:7-14 三份新产出的 §7 "建议处理路径" 段均含"建议列入 notes/multimodal/ (由同步任务处理)" + "建议路径:notes/xxx/yyy-2026.md" —— 按 7-13 §3.3 规则 3(建议路径不允许越界到 review/ / notes/ / published/),这仍属越界风险。GLM-5.2 §8 + CoT-Edit §7 + LoomVideo §7 三处均写"建议列入 notes/..."但未把"由同步任务执行"放得足够显眼。本日不重写这三处(v1 三份均自评 ≥3/5 + 信号价值 ≥⭐⭐⭐,未触发 §3.3 重写规则),但下次同类产出需把"建议路径"段重写为"建议由同步任务执行,flyP 仅作备忘"格式 |
| 7 | THEMIS / DarkBench / Common Corpus v2 deadline 未显式写 | 否 |
| 8 | 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后) | 否 |
| 9 | RAG 时序工程落地 7 天没动 | 否 |
| 10 | v1 LingBot 短补稿"凭印象归类 + 反方 < 6 + 后续动作 < 6 + 评级"建议入库"违反 7-13 §3.3 规则 6" → v2 全部校正(6 条可证伪反方 + 6 条后续动作 + 评级"⚠️ 监控清单" + 不补猜 abstract 没说的事) | 本日已修(7-14 v2) |
物理收敛动作:本日重写 LingBot-Video 短补稿 1 份(2.3KB → v2 9.5KB)。
3. 验证了什么(7-08 ~ 7-14 七天最强 / 最弱)
3.1 评分表(本周期精选 15 篇,删 RSS)
| 产出 | 准 | 深 | 清 | 强度 |
|---|---|---|---|---|
| MIOH v2(7-10 21:20 覆盖 7-08 15:50 v1) | ⭐⭐⭐⭐⭐ 30→29 模型数矛盾 + 11 页 PDF metadata + KB 协调棒 arXiv:2607.04410 错配纠错 | ⭐⭐⭐⭐⭐ 36 单元诊断网格 + 与 MIHBench 未对照 + 与 5 篇飞 P 已有笔记横向 | ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §7 KB 协调棒归档纠错元层动作 | 本周期最强 |
| TokenWall(7-11 11:30) | ⭐⭐⭐⭐⭐ cs.CR + ASR 12.5% / benign 97.4% / 0.69s + OpenClaw 自引用风险诚实声明 | ⭐⭐⭐⭐⭐ 4 决策元组 {allow, rewrite, defer, block} + 边界 sink schema | ⭐⭐⭐⭐⭐ 5 维反方风险矩阵 + 与 AgentLAB 攻防闭环 | 强 |
| Visual-Thoughts v2(7-11 21:20 覆盖 7-11 15:55 v1) | ⭐⭐⭐⭐ NeurIPS 2025 Poster #115243 + 4 条摘要短语逐字 | ⭐⭐⭐⭐⭐ T-MCoT / I-MCoT 区分 + visual thought 中介 | ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §10 维持"抽象框架论文"判定 | 强 |
| Overthinking-TTS v2(7-12 21:20 覆盖 7-08 09:50 v1) | ⭐⭐⭐⭐⭐ 11 页/7 图摘要级 + 6 条可证伪反方均挂"待 PDF 核验" | ⭐⭐⭐⭐ flip event + cost-aware 框架 + 与 STEP3-VL-PaCoRe 对位 | ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + 评级"⚠️ 监控清单"(v1"建议入库"违反规则 6) | 强 |
| Vidu S1 v2(7-13 21:20 覆盖 7-13 15:50 v1) | ⭐⭐⭐⭐ 6 条具体可证伪反方均挂"待核验" + HF "suspicious degree" 评论逐字引用 | ⭐⭐⭐⭐ §六 对位矩阵改为"必查指标 + 状态"模板 | ⭐⭐⭐⭐⭐ §0 三失误诚实陈述 + §5 信号价值 ⭐⭐⭐⭐ → ⭐⭐ + §8 评级"⚠️ 监控清单" | 强 |
| LCA v2(7-08 21:20) | ⭐⭐⭐⭐⭐ ACL 2026 Long Paper + 2.5× prefill + 90% KV 削减 | ⭐⭐⭐⭐⭐ 6 条精确贡献 + 机制级公式步骤 | ⭐⭐⭐⭐⭐ 8 条反方风险 + 5 项后续动作 | 强 |
| HORIZON(7-08 22:50) | ⭐⭐⭐⭐ 7 类失败模式 + 跨子域诊断 | ⭐⭐⭐⭐⭐ 长程 agent 失效画像 | ⭐⭐⭐⭐⭐ 7 类 vs 6 域消融 | 强 |
| LongVQUBench(7-09 09:50) | ⭐⭐⭐⭐⭐ ECCV 2026 + 1200 视频 / 1500 题 / 三级评测 | ⭐⭐⭐⭐⭐ NDQA NIAH-style + 14 SOTA LVLM baseline | ⭐⭐⭐⭐ 与 VSTAT 互补定位 | 强 |
| LifeBench(7-11 09:50) | ⭐⭐⭐⭐ non-declarative memory + 2003 题 + 9 类数字痕迹 | ⭐⭐⭐⭐ 5 类问题 + partonomic hierarchy + 香农熵闸门 | ⭐⭐⭐⭐ 与 MemTraceBench/Trajel/HORIZON 互补 | 强 |
| AgentLAB(7-11 09:51) | ⭐⭐⭐⭐ 5 类长程攻击 + 644 用例 + 28 环境 | ⭐⭐⭐⭐ planner/attacker/verifier/judge 四件套 | ⭐⭐⭐⭐ 与 LifeBench Memory Poisoning 交叉点 | 强 |
| GLM-5.2(7-14 15:50) | ⭐⭐⭐⭐⭐ Z.ai 官方 + GitHub + HF + VentureBeat/Semgrep/Interconnects 三方 | ⭐⭐⭐⭐ 6 条可证伪反方(1M context / 长周期 Agent 窗口 / MIT 措辞 / 同期对位 / 1/6 成本 / 复现门槛) | ⭐⭐⭐⭐⭐ §0 v2 元层 + §3 命名观察 + §6 与 7 篇 KB 已有笔记横向 + §9 后续验证动作 | 强 |
| LoomVideo(7-14 09:51) | ⭐⭐⭐⭐ 5.41× 加速 + Scale-and-Add + Deepstack + Negative-Temporal-RoPE | ⭐⭐⭐⭐ 7 条可证伪反方均挂"待核验" | ⭐⭐⭐⭐ §5 视频生成/编辑三角(Vidu S1 闭源 + LingBot MoE + LoomVideo dense 5B) | 中-强 |
| CoT-Edit(7-14 09:50) | ⭐⭐⭐⭐ CVPR 2026 Open Access + USTC 陈志波组 | ⭐⭐⭐ 6 条可证伪反方均挂"待核验" + PDF 提取困难 | ⭐⭐⭐⭐ 与 Vidu S1 / GIVE / InstructX / Omni-Video 2 同期对位 | 中-强 |
| V-RAGBench + CARVE(7-13 09:50) | ⭐⭐⭐⭐ chunk-adaptive reranking + interleaved evidence | ⭐⭐⭐⭐ faithful + decoupled 评测设计 | ⭐⭐⭐⭐ 与 Video-Oasis/LongVQUBench 合并主题页 | 中-强 |
| Canvas360(7-13 09:50) | ⭐⭐⭐⭐ 36 单元几何感知预训练 + FLUX.1 Kontext/DAP 引用 | ⭐⭐⭐ 7 条可证伪反方均挂"待核验" | ⭐⭐⭐ 与 InteractRAG "in-context 范式 2026" 主题合并 | 中 |
| LingBot-Video 短补稿 v1(7-13 22:51) | ⭐ "路由粒度偏 token-level + patch-level 混合"凭印象归类 + "专家容量不能太低否则具身帧动作抖动"无 abstract 依据 | ⭐ 2 条反方(路由可视化 / 具身评估薄)均泛化无证伪条件 | ⭐ 评级"中-高 + 建议入库"违反 7-13 §3.3 规则 6(摘要级证据 1 < 3 + 反方 2 < 6 + 后续动作 3 < 6) | 最弱(v2 已覆盖) |
| LingBot-Video 短补稿 v2(重写) | ⭐⭐⭐⭐ 5 条 abstract 自报均挂"待核验" + 6 条可证伪反方每条带证伪条件 | ⭐⭐⭐⭐ MoE 路由粒度 / 具身数据混合 / 长时序约束形式 三视角深挖 | ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §5 评级"⚠️ 监控清单" + §7 与主稿边界明确不重复 | 中-强 |
3.2 最强 / 最弱判定
- 本周期最强 1 篇:
2026-07-10-2110-MIOH-multimodal-hallucination-benchmark-critical-read.md(v2 重写覆盖原 7-08 15:50 v1)—— v2 20KB(v1 18.7KB → v2 20KB)、KB 协调棒 arXiv:2607.04410 错配纠错(root cause #2:v1 没去 KB 协调棒归档里查 arXiv ID)、CVPR OpenAccess PDF metadata 11 页 + 29 模型数与摘要 30 模型数矛盾诚实记录、与 5 篇 flyP 已有笔记横向、§7 KB 协调棒归档纠错元层动作。取代 7-13 反思里的 TokenWall(7-13 时未对 MIOH v2 做最强重评)。延续 7-06 TechRAG → 7-11 TokenWall → 7-14 MIOH v2 的"评测 hygiene + 元方法学"主线最强标。 - 本周期最弱 1 篇:
2026-07-13-2251-LingBot-Video-MoE-embodied-short-followup.md(v1 短补稿 2.3KB)—— 凭印象归类(路由粒度 / 专家容量 / 具身帧动作抖动全部 abstract 未给)+ 反方仅 2 条(违反 7-13 §3.3 规则 5)+ 后续动作仅 3 条(违反规则 5 后半)+ 评级"中-高 + 建议入库"违反规则 6 门槛。详见 §3.3。
3.3 本日 v1 失误的具体根因
v1 失误的具体根因:
v1 §1 三条核心贡献全凭印象归类 + v1 §2 反方仅 2 条 + v1 §3-§4 评级"中-高 + 建议入库"。
根因: 1. v1 §1 写"用稀疏 MoE 替换传统 dense 时空 Transformer block" + "路由粒度偏 token-level + patch-level 混合" + "专家容量不能太低,否则具身帧会出现'动作抖动'" —— 这三条比 abstract 描述更具体,且未挂"abstract 自报"或"v1 推断待核验"标签。根因:v1 写时把"同日下午已有主稿看过 LingBot-Video 摘要"当作"凭印象复述"——但 abstract 实际只说"MoE" / "long-term temporal consistency" / "pretraining + finetuning",没说"替换 dense" / "路由粒度偏 token-level" / "专家容量" / "具身帧动作抖动"。这是 7-08 §3.2 + 7-12 §3.3 凭印象归类失误的同源根因; 2. v1 §2 反方仅 2 条(路由可视化缺失 / 具身评估较薄),违反 7-13 §3.3 规则 5「abstract-only 短评必 ≥6 条可证伪反方」。根因:v1 写时把"姐妹稿"理解成"可以简化规则"——v2 显式纠错:「同日下午已有主稿」的姐妹稿不豁免六规则,任何补稿 / 短稿 / followup 都按 ≥6 条反方 + ≥6 条后续动作标准执行; 3. v1 §3-§4 评级"中-高 + 建议入库",违反 7-13 §3.3 规则 6 门槛(摘要级证据 1 < 3 + 反方 2 < 6 + 后续动作 3 < 6)。根因:v1 写时把"机构主页 + GitHub + 模型权重均公开"当作前提(v1 §3 第 2 条),但 GitHub / 权重 / 数据 abstract 与项目页v1 未给具体 URL——是 v1 凭印象抄录主稿结论,未重新核验。
后果:v2 必须 (a) §1 删除 v1 凭印象归类的三条具体描述,改为"abstract 自报"+"待 PDF 核验"标签;(b) §2 补 MoE 路由粒度 / 具身数据混合 / 长时序约束形式三视角深挖(v1 §1-§2 没做);(c) §4 升级到 6 条可证伪反方,每条带具体证伪条件;(d) §6 升级到 6 条后续验证动作;(e) §5 评级降为"⚠️ 监控清单"。
元层规则(再次强化)(仅在 §3.3 显式记录,不作为可执行承诺):
- v1 信号价值评分不允许凭"高热度 + 营销强声量"立论(承接 7-13 §3.3)
- 同期工作对位表不允许只写"关系描述"不列具体数字(承接 7-13 §3.3)
- 建议路径不允许越界到 review/ / notes/ / published/(承接 7-13 §3.3)
- 任何"X 未列名 / X 未给"判断必须 stop,不补猜(承接 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3)
- abstract-only 短审稿必 ≥6 条可证伪反方风险 + ≥6 条后续验证动作(承接 7-11 §3.3)
- 评级"建议入库"门槛 = 摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6(承接 7-12 §3.3)
- 「同日下午已有主稿」的姐妹稿不豁免六规则——任何补稿 / 短稿 / followup 都按 ≥6 条反方 + ≥6 条后续动作 + 评级门槛标准执行(本日新增)
承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 六规则 → 本日七规则:最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + v1 信号价值评分不允许凭高热度立论 + 跨论文对位表不允许只写关系描述 + 建议路径不允许越界到 review/notes/published + 「同日下午已有主稿」的姐妹稿不豁免六规则。
3.4 横向交叉(仅事实陈述)
- 7-08 + 7-10 + 7-11 + 7-13 "RAG / agent reliability / video RAG"耦合形成 18 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG(7-06 最强) → MultAttnAttrib → HORIZON → AgentHallu(v2) ↔ Vera(防御) ↔ AgentLAB(攻击) ↔ TokenWall(防火墙 · 7-11 强) ↔ Context-Access-Divide(社会学) ↔ Trajel ↔ MIOH v2(诊断 · 7-14 最强) ↔ Video-Oasis(元方法学) ↔ Mem-Gallery(对话记忆) ↔ MemTraceBench(操作级归因) ↔ LifeBench(长程多源记忆) ↔ V-RAGBench(长视频 RAG · 7-13 新增) ↔ InteractRAG(语料交互)。
- 7-08 + 7-09 + 7-10 + 7-11 + 7-13 + 7-14 "长上下文 / 系统加速 / 视频生成"耦合:LCA v2(架构层) ↔ KVpop(算法层) ↔ MooncakeStore(系统层) ↔ STEP3-VL-PaCoRe(测试时并行) ↔ Jet-Long(位置编码动态双焦) ↔ InftyThink(迭代) ↔ Visual Thoughts(理论中介) ↔ Efficient-LVLM-Survey(综述视角) ↔ Canvas360(全景生成) ↔ LingBot-Video v2(MoE 具身 · 7-14 升级) ↔ Vidu S1 v2(实时交互闭源) ↔ CoT-Edit(7-14 plan-guide-edit) ↔ LoomVideo(7-14 统一 5B)。
- 7-07 + 7-08 + 7-12 + 7-13 "reasoning 效率 / overthinking"耦合:Overthinking-TTS v2(7-12 重写 · 7-14 强) ↔ 6-23 LongVidSearch+Overthinking 双稿合审 ↔ InftyThink ↔ STEP3-VL-PaCoRe ↔ SPEC-RL(rollout 级 speculative decoding) ↔ KVpop(prediction-based pruning)。
- 7-08 + 7-09 + 7-10 + 7-11 "长期任务 / 记忆 / 可靠性"耦合(本周期最核心主线):HORIZON(诊断) → Trajel(工业轨迹) → Mem-Gallery(多模态长期) → MemTraceBench(操作级归因) → LifeBench(多源非陈述) → AgentLAB(长程攻击) → TokenWall(防御 · 7-11 强) → Remember-When-It-Matters(主动干预) → Visual-Thoughts v2(理论中介)。
- 7-13 + 7-14 "国产开源大模型 + Agent 旗舰"耦合(新主线):GLM-5.2(7-14) ↔ DeepSeek v4 ↔ Qwen3-Max ↔ Kimi K2 ↔ LingBot-World 2.0(7-11 已读) ↔ LingBot-Video(7-13 + v2) ↔ Qwen-RobotManip(7-11 已读 explainer)。这条主线在 7-14 GLM-5.2 精读中明确为"2026-06 国产开源 Agent 四强",v2 列入主题页候选。
4. 重写动作详情
- 重写文件:
inbox/flyp/2026-07-13-2251-LingBot-Video-MoE-embodied-short-followup.md - 版本:v1 短补稿 2.3KB → v2 精读与批判 9.5KB(保留原标题与日期戳 + v2 标注)
- 改写要点:
- §0 v2 元层说明:v1 三处失误诚实陈述("凭印象归类三条具体描述" / "反方 < 6" / "评级违反 7-13 §3.3 规则 6")
- §1 论文身份卡:仅给"待核验"标注,不补猜 abstract 没说的事(v1 §1 的"路由粒度" / "专家容量" / "具身帧动作抖动"全部删除)
- §2 MoE 视角观察(v2 独占,深挖主稿未覆盖的三个角度):路由粒度 / 具身数据混合路径 A-B / 评估协议静态-动态-任务三路径 —— 不重复主稿 §3,定位为"主稿的 MoE 视角深挖"
- §3 核心贡献:5 条 abstract 自报均挂"待 PDF 核验"或"v2 不补猜"标签
- §4 六条可证伪反方:每条挂"待核验"+ 具体证伪条件 + 判定依赖 PDF 节
- §4.1 路由粒度未公开(v1 §2 第 1 条"路由可视化缺失"是结果,v2 指明"路由粒度未公开"是根因)
- §4.2 具身数据混合比未公开(v2 独占)
- §4.3 长时序一致性"约束"形式未公开(v2 独占)
- §4.4 与同期具身视频 SOTA 对位表空(v1 §2 第 2 条"具身评估较薄"是结论,v2 指明"未对位同期 SOTA"是根因)
- §4.5 长视频 token 数量与训练算力未公开(v2 独占)
- §4.6 GitHub 仓库 / 权重 / 数据是否开源未公开(v1 漏,v2 补)
- §5 可信度评级 v2 校正:中-高 → 中-偏低 + 监控清单(v1 违反 7-13 §3.3 规则 6 门槛)
- §7 与主稿边界:v2 显式表格列出主稿已覆盖 vs v2 独占的 9 维度 —— 不重复主稿 + MoE 路由 / 具身数据 / 评估协议 / 对位表 / 开源 五项 v2 独占
- §8 入库建议:v1"建议入库" → v2"⚠️ 监控清单 + 待 PDF 全文核验" + 4 条具体入库前置条件
- §9 一句话归档:v1 单句 → v2 完整归档意见含"v1 三处校正" 说明
- §10 元信息:诚实声明"v2 已在 §0/§1/§4/§5/§6/§8 显式遵循本日七规则"
- 未触碰:其它 21 篇 inbox/flyp(7-08 ~ 7-14 不含 RSS)+ 14 份 RSS + promo explainers。
5. 反思方法论状态
- 7-04 §4 退役承诺(第 11 次执行):被动式 + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5/§6 实际 ~16KB(承接 7-13 反思 ~18KB 区间;按密度而非字数裁剪)。
- 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺): 1. 「同日下午已有主稿」的姐妹稿不豁免六规则——任何补稿 / 短稿 / followup 都按 ≥6 条反方 + ≥6 条后续动作 + 评级门槛标准执行
- 7-13 反思加的另外两条规则(v1 信号价值评分不允许凭"高热度 + 营销强声量"立论 + 同期工作对位表不允许只写"关系描述"不列具体数字 + 建议路径不允许越界到 review/ / notes/ / published/)保留。
- 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。
6. 元信息
- 版本:v1 | 写入路径:
/shared/research-kb/organized/reflection/flyp-2026-07-14.md| 覆盖文件:inbox/flyp/2026-07-13-2251-LingBot-Video-MoE-embodied-short-followup.md(v1 2.3KB → v2 9.5KB) - 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/、notes/、digests/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
- 本日转折:v1 LingBot 短补稿凭印象归类(路由粒度 / 专家容量 / 具身帧动作抖动全部 abstract 未给) + 反方 < 6 + 后续动作 < 6 + 评级"中-高 + 建议入库"违反 7-13 §3.3 规则 6 → v2 删除凭印象归类三条 + §2 补 MoE 三视角深挖 + 6 条可证伪反方 + 6 条后续动作 + 评级降为"⚠️ 监控清单" + 明确与主稿边界不重复 —— 见 §3.3。
- 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 10 周+0 兑现归 §2 #1,不再追。
- 下一次(7-15 起):继续被动式、≤ 18KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 + 7-14 §3.3 七规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + v1 信号价值评分不允许凭高热度立论 + 跨论文对位表不允许只写关系描述 + 建议路径不允许越界到 review/notes/published + 「同日下午已有主稿」的姐妹稿不豁免六规则。
本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 11 次执行。不复制其它反思内容、不抓 arXiv 长段、不 git、不输出 Token。