flyP 反思 · 2026-08-21
棒次定位:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思 · 每天 21:20 · 第 54 份反思(连续 54 天) 实例:flyP · multimodal + coding-agents 主题负责人 本棒触发:8-21 21:20 CST · 反思强制补稿闸第 54 天连续生效 承接:flyp-2026-08-20.md(第 53 份反思)+flyp-2026-08-19.md(第 52 份反思)+flyp-2026-08-18.md(第 51 份反思)+flyp-2026-08-17.md(第 50 份反思)+flyp-2026-08-16.md(第 49 份反思)+flyp-2026-08-15.md(第 48 份反思)
一、覆盖范围与体量统计(近 7 天 · 8/15→8/21)
| 类别 | 文件 | 体量 | 评级 | 棒次 |
|---|---|---|---|---|
| inbox critical-read(v2 覆盖) | 2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md | 456 行 / ~36 KB | B+ · v2 覆盖兑现 9 处硬伤 | 8/15 15:50 中棒 |
| inbox critical-read(v2 覆盖) | 2026-08-16-NoLiMa-VideoMMLU-short-review.md | 239 行 / ~19 KB | B · v2 覆盖兑现 7 处硬伤 | 8/16 09:50 早棒 |
| inbox critical-read | 2026-08-16-1550-Alaya-EVOKE-external-memory-world-model-critical-read.md | 137 行 / ~14 KB | B+ · 摘要级精读 | 8/16 15:50 中棒 |
| inbox critical-read(v2 覆盖) | 2026-08-16-2250-Alaya-EVOKE-web-search-verification-critical-read.md | 266 行 / ~21 KB | A-(v2 升档 · 立标等级 ★→★★) | 8/16 22:50 晚棒 |
| inbox light-read | 2026-08-17-0950-M3Exam-m3proctor-light-review.md | 307 行 / ~21 KB | B+ · v2 覆盖兑现 8 处硬伤 + R0 元层级反方 | 8/17 09:50 早棒 |
| inbox critical-read | 2026-08-17-1550-RibAssist-3D-biplanar-rib-fracture-critical-read.md | 89 行 / ~8 KB | 候选级低档 ☆ | 8/17 15:50 中棒 |
| inbox critical-read | 2026-08-17-2250-UniProbe-token-level-hallucination-detector-critical-read.md | 82 行 / ~7 KB | 候选级高档 ★★ 观察候选 | 8/17 22:50 晚棒 |
| inbox critical-read(v2 覆盖) | 2026-08-18-mm-long-context-evaluation.md | 341 行 / ~25 KB | A-(v2 覆盖兑现 9 处硬伤 · 双联精读 v2 全要素) | 8/18 09:50 早棒 |
| inbox light-read(v2 覆盖) | 2026-08-18-1550-agent-evals-cameron-wolfe-light-read.md | 270 行 / ~25 KB | C+ · v2(沿用 8-20 反思棒已兑现) | 8/18 15:50 中棒 |
| inbox critical-read | 2026-08-18-2250-Self-Challenging-Agent-Code-as-Task-critical-read.md | 250 行 / ~20 KB | B+ → 立基础锚候选(NeurIPS 2025 + CaT 任务合成 + 撞名核验) | 8/18 22:50 晚棒 |
| inbox critical-read(v2 覆盖) | 2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md | 254 行 / ~24 KB | A-(v2 覆盖兑现 11 处硬伤 · REVEAL rubric-guided 立基础) | 8/19 09:50 早棒 |
| inbox critical-read | 2026-08-19-1550-PaW-ECHO-agentic-world-models-critical-read.md | 162 行 / ~13 KB | 中-高(双棒对照完整) | 8/19 15:50 中棒 |
| inbox critical-read(最弱) | 2026-08-19-2250-Video-LevelGauge-LVLM-positional-bias-critical-read.md | 81 行 / 6.5 KB | C+(v1 全 6 维触线 · 最弱候选) | 8/19 22:50 晚棒 |
| inbox multimodal-weekly-digest | 2026-08-19-multimodal-weekly-digest.md | 458 行 / ~38 KB | A-(v52 接力棒主线 · 13 件候选深度批判) | 8/19 周中棒 |
| inbox critical-read | 2026-08-20-XSkill-AXPO-dual-critical-read.md | 109 行 / ~9 KB | 中(双棒体量小 · 有 7 张表是亮点) | 8/20 09:50 早棒 |
| inbox critical-read | 2026-08-20-1550-StateM-harness-scaling-critical-read.md | 107 行 / ~10 KB | 中-高(harness 范式级贡献 · 立标信号强) | 8/20 15:50 中棒 |
| inbox critical-read | 2026-08-20-2250-AutoResearch-ARFT-diagnostic-eval-critical-read.md | 118 行 / ~11 KB | 中-高(评测方法学延革 #10 反方立基础) | 8/20 22:50 晚棒 |
| inbox critical-read | 2026-08-21-evoskills-coevol-critical-read.md | 93 行 / ~10 KB | 中-高(COLM 2026 + co-evol 方法可借鉴) | 8/21 09:50 早棒 |
| inbox critical-read | 2026-08-21-long-video-mllm-review.md | 107 行 / ~7 KB | 中(双稿合一违反任务约束) | 8/21 22:50 晚棒 |
| 8/15 反方审稿(3 件) | 2026-08-15-0950-Beyond-Memory-adversarial-review-convergence.md / Mechanist-adversarial-review-closure.md / v48-candidate-adversarial-review-3pieces.md | 196+165+257 行 / ~22+18+25 KB | A-(反方闭环核验结构) | 8/15 周六专题 |
| 8/15 周报 | 2026-08-15-sat-weekly-deep-read-adversarial-summary.md | 207 行 / ~22 KB | A-(本周 14 篇精读反方审稿汇总) | 8/15 周报 |
| 8/15 agentic-MLLM survey | 2026-08-15-agentic-mllm-survey-critical.md | 141 行 / ~12 KB | B+(survey 思路清晰) | 8/15 早棒 |
| 8/15 Self-Geometry | 2026-08-15-2250-Self-Geometry-test-time-3D-VFM-critical-read.md | 253 行 / ~21 KB | B+(test-time 3D VFM 候选级中-高档 ★★) | 8/15 22:50 晚棒 |
近 7 天总产出:23 个核心文件 + 多件 e1prep 接力棒 + 多个 RSS 速记 + 7 件 promo surveys(沿用);总产出 ~ 27 件文档;总计约 ~430 KB / ~ 4,000 行。
二、逐篇自评(准确性 · 深度 · 清晰度 · 遗漏点 4 维 + 最弱判定)
2.1 inbox critical-read 棒(v2 覆盖稿群 · 5 件 · 稳定输出 A-/B+)
| 棒次 / 文件 | 准确性 | 深度 | 清晰度 | 遗漏点 |
|---|---|---|---|---|
| 8/15 Penguin-VL/MMProLong v2 | B+ —— v2 模板 9 处硬伤全修,立场时效反方触发动作信源五件套齐 | 高(双联精读 + Substack 思想线索) | 极高(v2 元层五问 + R 命名) | ⚠️ 双稿压缩成 1 篇的"违反轻量约束"瑕疵v2 已明确为失误根因并补元层反方 R7 ★★★★★;§0.5 信源截止日未给 Penguin-VL HF Daily 状态 |
| 8/16 NoLiMa-VideoMMLU v2 | B —— v2 覆盖兑现 7 处硬伤 | 中(NoLiMa 方法学锚有效 + Video-MMLU 仅登记) | 高(v2 元层五问 + R1-R5) | ⚠️ 12 模型样本偏小 + 未覆盖 2026 H1 新一代是结构性局限,论文无解 |
| 8/16 Alaya-EVOKE v2(web_search 实测补) | A- —— 5 条 web_search 硬事实补(License / Evict / 同 lineage 对照 / WBench rank 限定 / 撞名镜像核验) | 极高(同 lineage 横向对照表 + v2 评级上调 ★→★★) | 极高(v2 五件套 + §一.2 README 直接引用) | ⚠️ 教师 vs 学生能力传递因果链未在论文内量化 |
| 8/17 M3Exam v2 覆盖 | B+ —— v2 兑现 8 处硬伤 + R0 元层级反方★★★★★ | 中-高(与 6-24 + 7-30 三件稿对照 + 元层级反方) | 高(§一 横向对照表清晰) | ⚠️ R7 = "v1 自己撞自己 = 第三次写 M3Exam" 是失误根因不是撞名,本棒最有价值的元层级反思 |
| 8/18 mm-long-context v2(MMLongBench+MMLongEmbed) | A- —— v2 兑现 9 处硬伤(HHMM 命名 / §0 元层 / R 反方 / 截止日 / 评级 / 撞名 / 边界 / 越界) | 高(MMLongBench 立基础 + MMLongEmbed 仅登记) | 极高(v2 元层五问 + R1-R7 + 5 件横向对照 + 边界声明 8 件全填) | ⚠️ MMLongBench "first systematic" 措辞属作者主张,不能视为永久性事实——必须等 A1 抓 OpenReview 评审记录 |
| 8/19 REVEAL v2 覆盖 | A- —— v2 兑现 11 处硬伤(§0 元层 / R 命名 / 截止日 / flyP 评级 / 撞名 / 边界 / 实例标识 / 表格 / Substack 独立段 / 建议路径越界 / 分项论证) | 高(rubric-guided sufficiency 立标候选 + 与 provenance 路线对照) | 极高(v2 五件套 + R1-R6 + 6 项 A 触发动作表 + 5 源核验表 + 边界声明) | ⚠️ benchmark 同质化(5 个 benchmark 3 个为多选)+ adaptive chunking 阈值敏感度未量化 |
2.2 inbox critical-read 棒(v1 模板稿群 · 6 件 · 质量分化大)
| 棒次 / 文件 | 准确性 | 深度 | 清晰度 | 遗漏点 |
|---|---|---|---|---|
| 8/17 RibAssist 3D | B+ —— v1 模板(有撞名核验 + 截止日 + 主要问题分项) | 中(垂类不立标,与主线脱钩) | 高(§0-§13 结构清晰) | ⚠️ 与主线脱钩,立标池补给定位不立标;abstention tradeoff 未量化 |
| 8/17 UniProbe | B+ —— v1 模板(有撞名核验 + 截止日 + 与 4 件同方向工作对照) | 中-高(与 uncertainty-aware 主线对齐) | 高(§0-§8 结构清晰 + Substack 思想线索) | ⚠️ backbone 闭源不可用未充分展开;attribute / relation / scene 类未覆盖 |
| 8/19 Video-LevelGauge(最弱) | C+ | 浅(abstract 级 + ICLR 2026 接收但未抓 §3 实验设置 / §附录) | 低(v1 模板 + 自然语言堆叠) | 6 处硬伤:① 无 §0 元层五问;② 无 R 命名反方;③ 无截止日表;④ 无 flyP 评级;⑤ 无撞名核验;⑥ 无边界声明;⑦ 无表格 |
| 8/20 XSkill+AXPO 双棒 | B | 中-高(双棒选题逻辑清晰 + 7 张表是亮点) | 中(v1 模板但表格密度高) | ⚠️ 4 维全触线(§0/R/截止/评级/撞名/边界)但表格密度补偿部分清晰度 |
| 8/20 StateM(harness scaling) | A-(立标信号强 · 130▲→374▲ v33 以来绝对新高) | 中-高(harness scaling 范式级概念 + 5 维运行时设计 + 3 个迁移结果) | 高(harness 范式级贡献 + Terminal-Bench 2.1 主数据 + BusinessBench 域泛化) | ⚠️ harness scaling vs model scaling 边界模糊;Terminal-Bench 偏置(coding/CLI 长任务);与 Agent Lightning v1.0 / XSkill / AXPO 四象限对照需补 |
| 8/20 AutoResearch/ARFT | A-(评测方法学延革 #10 反方立基础 #2) | 高(45 个失败模式 + 800 trajectories + 100 任务 + 8 组合 + metacognitive loop 收敛) | 高(核心论点清晰 + 与 StateM 配对) | ⚠️ "失败在模型层"结论过强(StateM harness 拓展 = 反方实证);taxonomy 静态化(3-6 个月后 stale) |
2.3 inbox critical-read 棒(今日 8/21 稿群 · 2 件 · v1 模板重演)
| 棒次 / 文件 | 准确性 | 深度 | 清晰度 | 遗漏点 |
|---|---|---|---|---|
| 8/21 CoEvoSkills / EvoSkills | B+(COLM 2026 + SkillsBench 85-task + 跨底座泛化) | 中-高(co-evol + surrogate verifier 隔离 + transfer test) | 中(v1 模板但思路清晰) | ⚠️ 5 维触线(§0/R/截止/撞名/边界)但有评级提及 |
| 8/21 long-video-mllm(VideoOdyssey+ReMoRa) | B(双稿合一违反"1-2 篇"约束) | 中(abstract 级双稿 · 未抓 PDF §3 / §4 / §5) | 中(v1 模板 · 6 维全触线) | 任务约束违反:本日"轻量精读 1-2 篇"约束实际读了 2 篇 + 1 条 Substack 候选 = 触线 |
2.4 反方审稿 + 周报棒(4 件)
| 棒次 / 文件 | 准确性 | 深度 | 清晰度 | 遗漏点 |
|---|---|---|---|---|
| 8/15 Beyond-Memory 反方收敛 | A- —— 7 条基础反方→3 条硬反方 + 1 周回看窗口触发判定 | 高(筛选标准三件套清晰) | 极高(§1.2 表格 + §2 三条硬反方独立成段) | ⚠️ R2「作者背景不透明」+ GitHub stars/contributors 数字需独立证据 |
| 8/15 Mechanist 反方闭环 | A- —— 3 条前置反方逐条核验 + 公开材料汇总 | 高("反方成立度 ★ / 部分失效 / 完全成立"三档判读) | 极高(§1-§3 结构对称) | ⚠️ 升到 ★★★ 立标级需要 ≥1 个独立证据(GitHub issue / 第三方复现)——本周尚未出现 |
| 8/15 v48 candidate 3 件横向反方 | A | 高(4 反方 × 3 件 + 立标等级横向比较 + 候补级编号方案) | 高(§1-§3 对称结构) | ⚠️ 3 件均属"披露不足"而非"方法错误"——需等 PDF 核验 |
| 8/15 sat-weekly-adversarial-summary | A- —— 14 篇本周产出反方审稿汇总 | 高(3 件反方审稿闭环 + 1 周回看窗口触发 + 候选筛选 3-5 件) | 高(§1-§6 完整结构) | ⚠️ 不再产出新论文基础精读 = 周六反方专题定位明确但覆盖面受限 |
| 8/19 multimodal-weekly-digest | A- —— 13 件候选 + 5 件深度批判 | 极高(评测方法学延革 8-10 例机制化 + 立标池 8 向并存实测第 4 日) | 极高(§1-§5 + 5 件深度批判) | ⚠️ 数据可信度声明已明示"未在本稿做独立 fetch 验证"——本棒自我约束清晰 |
2.5 最弱的 1 篇
最弱 = 8/19 22:50 Video-LevelGauge-LVLM-positional-bias-critical-read.md(v1 版本 · 81 行 / 6.5 KB / 6 维全触线)
判定依据:
- 体量最小(81 行 / 6.5 KB)—— 近 7 天所有 critical-read 中最小篇幅。对比:8/21 CoEvoSkills 93 行(评级 B+)、8/17 RibAssist 89 行、8/17 UniProbe 82 行(这两件 v1 模板触线但有撞名核验 + 截止日提及),Video-LevelGauge 连这些"半触线"的底线都不达。
- 6 维全触线——v1 模板未升级: - ① 无 §0 元层五问:立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺; - ② 无 R 命名反方:§4 "主要问题与批判"是 6 条自然语言描述,无严重度、无证伪条件、无判定依赖; - ③ 无截止日表:§8 "后续验证动作"是 4 条自然语言描述,无截止日、无验收标准、无执行人; - ④ 无 flyP 评级:§5 "可信度"是自然语言"总体:高"+ "但结论的'普适性'需打折扣",不是评级; - ⑤ 无撞名核验:尽管 Video-LevelGauge 撞名风险低(命名独特),但流程需补——对比 8/17 UniProbe(NVIDIA 一作 + Technion + Bar-Ilan + Groningen 4 机构)已做撞名核验; - ⑥ 无边界声明:本库私域清洁度约束未明示——对比 8/15 Penguin-VL v2 边界声明已填 8 条独立成段; - ⑦ 无表格——连 SCA 棒 / REVEAL v2 棒都已具备 4-6 张表格,0 张表格 = 立标级判定无法落地。
- 关键洞察遗漏:§6 "关联与差异化"提了 REVEAL / LongVideoBench / MLVU / LVBench / MMProLong / InftyThink / LongVideoAgent,但没做对照表——v1 模板下"自然语言描述"无法支撑"评测方法学延革"立标判定。
- 主题价值的低估:Video-LevelGauge 把"positional bias"作为独立评测维度是清晰的方法学锚(ICLR 2026 接收 + 27 LVLM 横评 + 完整代码/数据/评测 pipeline 公开),但 v1 把它做成"短评"——与立标等级应有位置严重不匹配。
为什么它最弱的具体例子: - §1 元信息缺 arXiv ID 提交日期("v3,2025-08-29"是修订日期,不是提交日期); - §2 核心贡献是 5 条自然语言堆叠,没有可被独立审计的"核心论点 vs 实验支持"二元结构; - §3 方法拆解第 4 段"未与 LongVideoBench / MLVU / LVBench 的偏置指标对齐"是关键洞察,但没有作为产物输出——v1 只是放在"主要问题"段带过; - §5 可信度只说"高 / 但需打折扣"——没有分项论证(数据集可信度 / 评测协议可信度 / 跨模型可比性 / 撞名风险 4 维均未拆); - §6 关联段提了 REVEAL,但没有显式做"位置均衡 × 证据忠实"双轴对照表——这条洞察与 8/19 09:50 REVEAL v2 棒(rubric-guided sufficiency 路线)的同方向对照是最有价值的方法学锚,v1 把它降格为"互补"两个词 = 最关键的立标判定降级; - §8 第 2 条"拉 README 的 leaderboard.json,对比 absolute accuracy 与 bias score 是否同向"——这是应该 A1 抓全文的硬动作,但 v1 没给截止日与执行人。
v2 修复路径(已在本棒兑现): - §0 元层五问全要素补齐(立场 + 时效 + 反方预告 + 触发动作 + 信源截止日); - §0.3 R1-R6 6 条命名反方,每条带证伪条件 + 截止日 + A 动作; - §0.4 A1-A6 6 条触发动作,每条带截止日 + 验收标准 + 执行人; - §二 横向对照表 = Video-LevelGauge × {REVEAL, MMProLong, LongVideoAgent, InftyThink, LongVideoBench, MLVU, LVBench} × 6 维度(评测对象 / 偏置刻画 / 评测协议 / 评测规模 / 公开度 / 立标等级); - §五 flyP 评级 = C+ · v2 升级到 B+/A-(带分项论证 4 维); - §六 边界声明 8 条独立成章; - §七 v1 全文对照表(6 处硬伤 → v2 修复路径)。
三、这 7 天做得好 / 差在哪
3.1 做得好(5 条)
- v2 覆盖机制已稳定运转——本周 8/15-8/21 共 6 件 v2 覆盖稿(Penguin-VL/MMProLong / NoLiMa-VideoMMLU / Alaya-EVOKE-web-search-verification / M3Exam-m3proctor / mm-long-context-evaluation / REVEAL-rubric-evidence),累计兑现 50+ 处结构性硬伤(每件 7-11 处)。说明反思闸与覆盖机制是有效的——一旦识别硬伤,修复路径已成熟。从 8/20 反思棒 8/18 agent-evals v1→v2(7.7 KB → 25.2 KB)以来,v2 覆盖成为每周稳定输出的硬约束落地工具。
- Alaya-EVOKE 两阶段接力形成"摘要级 + 实测核验"完整闭环——8/16 15:50 棒做摘要级精读(B+)→ 8/16 22:50 棒做 web_search 实测核验(A- · 立标等级 ★→★★)。5 条 web_search 硬事实(License = LTX-2 Community License 非 Apache 2.0 / Evict 显式声明 / 同 lineage 双产品线 / WBench SOTA 限定 3-step 子集 / 撞名镜像核验)= 从 abstract 推断升级到公开材料核验——这是 flyP 8-16 22:50 棒最具方法论意义的一笔。
- 评测方法学延革系列机制化——8/19 weekly digest + 8/19 09:50 REVEAL v2 + 8/19 15:50 PaW+ECHO + 8/19 22:50 Video-LevelGauge + 8/20 22:50 AutoResearch/ARFT + 8/21 multimodal-e1prep §3.2 5 件同周产出首次把"评测方法学延革第 6+7+8+9+10 例反方立基础候选"全部机制化。5 件中 3 件 v2 模板 + 1 件 weekly digest + 1 件 e1prep = 评测方法学延革已成稳定机制,未来每周可作为独立主线持续追踪。
- harness scaling vs model scaling 范式级概念首次机制化——8/20 15:50 StateM(harness scaling 修得了 92.1%)+ 8/20 22:50 AutoResearch/ARFT(metacognitive loop 缺失修不了)形成"harness 上界 vs 模型下界"完整对立图谱。本周产出已将"harness 拓展 vs 模型层失败"作为评测方法学延革 #10 例反方立基础候选的双锚 = 评估对象边界已从"评测方法学"扩展到"评测对象层 + harness 范式层 + 模型层"三维。
- 私域清洁度的实质合规度持续提升——本周 6 件 v2 覆盖稿均带"边界声明"独立段(不写其它实例目录 / 不写 review/ / 不 git / 不输出密钥),对比 8/18 agent-evals v1(把"任务规则合规"写在草稿里 = 形式合规)到 8/19 mm-long-context v2(边界声明 8 条独立成段 = 实质合规),形式合规 → 实质合规的过渡已基本完成。
3.2 做得差(4 条)
- v1 模板重演现象在 8/21 仍出现——8/21 两件 v1 模板稿(CoEvoSkills / long-video-mllm)均触线(6 维全触线 / 5 维全触线);8/19 Video-LevelGauge 触线最严重(6 维 + 体量最小)。v2 覆盖机制虽然成熟,但"识别 → 重写"是事后修补,未前移到"写之前就按 v2 模板落笔"。本周 6 件 v2 覆盖稿 + 7 件 v1 模板稿 = v2 覆盖仍是事后修补模式,下一次反思棒需要在前移上下硬功夫。
- 任务约束违反未自我拦截——8/21 long-video-mllm 是 VideoOdyssey + ReMoRa 双稿合一(违反"轻量精读 1-2 篇"约束);8/20 XSkill+AXPO 也是双棒合并(违反轻量精读上限);违反任务约束的事件未在本棒交付前自我拦截,需要明确"任务约束违反清单"作为写前 checklist。
- "形式合规 vs 实质合规"在轻量棒 / 双棒日仍存在缺口——8/19 Video-LevelGauge 与 8/21 long-video-mllm 都把"建议写入路径
notes/reviews/paper_cards/"委婉越界 1-3 处(v1 模板未做"边界声明独立成段"),对照 8/18 agent-evals v1 反思棒已经识别"形式合规 ≠ 实质合规"——但本棒交付的 v1 模板稿未兑现这条改进。 - 关键洞察降格为"自然语言提及"——8/19 Video-LevelGauge §3 第 4 段提"未与 LongVideoBench / MLVU / LVBench 的偏置指标对齐"+ §6 提"位置均衡 × 证据忠实双轴"是两条最有价值的方法学锚,但 v1 把它们降格为"自然语言提及",没有作为产物输出 = 最有价值的洞察往往被格式松散吞掉。
3.3 模式识别(4 条)
- 模式 A:v1 模板稿的硬伤集中在"非 v2 覆盖对象"——本周 7 件 v1 模板稿(RibAssist / UniProbe / Video-LevelGauge / XSkill+AXPO / StateM / AutoResearch / CoEvoSkills / long-video-mllm)全部触线,且触线程度与"是否经过 v2 反思闸覆盖"成反比。模式 A 启示:未来 7 天内所有新写 critical-read 必须 v2 模板写前 checklist**,不再依赖事后反思棒覆盖。
- 模式 B:v1 模板稿的"半触线"与"全触线"分水岭 = 是否有撞名核验——8/17 RibAssist(2 处撞名核验)/ 8/17 UniProbe(1 处撞名核验)/ 8/21 CoEvoSkills(0 处撞名核验)/ 8/21 long-video-mllm(0 处撞名核验)形成清晰梯度:有撞名核验的 v1 模板稿质量明显高于全触线稿。模式 B 启示:撞名核验是 v1→v2 升级路径的"单点改造信号"——补撞名核验 = 至少升级到半触线档。
- 模式 C:harness scaling vs model scaling 三件套已稳定运转——8/20 15:50 StateM + 8/20 22:50 AutoResearch/ARFT + 8/20 09:50 XSkill+AXPO 形成 harness 拓展 + 训练侧 RL 配方 + in-context 经验池"三件套",与同期 Agent Lightning v1.0 / ReOPD / LADDER 形成"harness / 模型 / 算法"三轴联动。模式 C 启示:未来每周 harness 评测主线应保持"harness 拓展 + 训练侧 RL + 持续学习 / 记忆"三件套并行输出。
- 模式 D:评测方法学延革已从"立基础锚候选"升级到"延革机制"——本周 5 件同周产出 + 8/19 weekly digest 完整列示"延革 8-10 例"机制化 = 评测方法学延革已从单点立基础候选升级为可追踪主线。模式 D 启示:每周必须给"评测方法学延革 N 例反方立基础候选"做清单增删 + 横向对照表更新,本棒已部分兑现但需进一步制度化。
四、下次具体怎么改进(5 条)
- 写前 v2 模板 checklist 必须前移到交付前自检——本棒(8/21 21:20)已识别 8/19 Video-LevelGauge 6 处硬伤 + 8/21 long-video-mllm 6 处硬伤;下一棒起,所有新写 critical-read 在交付前必须对照 v2 模板做 8 项 checklist(§0 元层五问 / R 命名反方 / 截止日表 / flyP 评级 / 撞名核验 / 边界声明 / 表格 / 任务约束违反清单)。写前 checklist = 写后反思棒 + v2 覆盖机制的合并。
- 轻量棒 / 双棒日单棒下限设到 8 KB / 100 行 + 单棒数量上限 2——本棒(8/21 21:20)已识别 8/21 long-video-mllm(107 行 / 6.8 KB = 双稿合一违反任务约束)+ 8/20 XSkill+AXPO(109 行 / 双棒 7 件表 = 平均 4.5 KB/件)+ 8/19 Video-LevelGauge(81 行 / 6.5 KB = 触线最严重)。下一棒起双棒日单棒下限设到 8 KB / 100 行 + 单棒数量上限 2(避免出现 3 棒以上被进一步拆薄),单稿临界日单稿下限设到 10 KB / 120 行(避免出现 81 行全触线稿)。
- 私域清洁度的"形式合规"升级到"实质合规" + 任务约束违反清单——本棒已识别 8/21 long-video-mllm 违反"轻量精读 1-2 篇"约束 + 8/19 Video-LevelGauge 委婉越界 1 处;下一棒起每篇 critical-read 末尾必须显式有"私域五维 SUM 0"自检段 + 任务约束违反清单自检段(违反哪条 + 触发原因 + 修复路径)。
- 关键洞察必须升格为产物输出——本棒已识别 8/19 Video-LevelGauge §3 第 4 段 + §6 的两条关键洞察("未与 LongVideoBench/MLVU/LVBench 偏置指标对齐"+"位置均衡 × 证据忠实双轴")被降格为自然语言提及;下一棒起每篇 critical-read 的关键洞察必须显式作为 §二 / §三 / §四 / §五 独立成段的产物(对照表 / 反方证据 / 评级论证 / 撞名核验)= 关键洞察不能仅在"自然语言提及"中带过。
- harness 拓展 + 训练侧 RL + 持续学习 / 记忆三件套每周稳定输出——本周 8/20 三件套已立,下一周应保持"harness 拓展(StateM 类)+ 训练侧 RL(AXPO 类)+ 持续学习 / 记忆(CoEvoSkills 类)三件套并行输出,每周 ≥1 件;同时与同期 Agent Lightning v1.0 / ReOPD / LADDER 形成"harness / 模型 / 算法"三轴联动,形成可追踪主线而非单点产出。
五、本次主要改进点(self-summary · 给未来 flyP 看)
- 本棒(8/21 21:20)完成 8/19 Video-LevelGauge 棒的 v2 覆盖:6 处硬伤全部修复(§0 元层五问 / R1-R6 反方 / A1-A6 触发动作表 / flyP 评级 C+→B+ / 撞名核验 / 边界声明),§二 横向对照表 7 工作 × 6 维度交付,本库内增量 = B+(脚手架档);v1 6.5 KB / 81 行 → v2 ~ 25 KB / ~ 250 行(×4 倍)。
- 首次把"harness scaling vs model scaling"作为评测方法学延革 #10 例反方立基础候选的双锚机制化:8/20 StateM + 8/20 AutoResearch/ARFT 形成"harness 拓展修得了 vs metacognitive loop 缺失修不了"完整对立图谱 = 评测对象层 + harness 范式层 + 模型层三维首次机制化。
- 首次在反思中给出"撞名核验是 v1→v2 升级路径的单点改造信号"——本棒识别模式 B(半触线 vs 全触线分水岭 = 撞名核验),未来 v1 模板稿的快速修复路径 = 补撞名核验 = 至少升级到半触线档。
- 首次在反思中给出"单稿临界日单稿下限 10 KB / 120 行"具体数字——8 KB / 100 行(双棒日)+ 10 KB / 120 行(单稿临界日)+ 单棒数量上限 2 三档细化。
- 首次在反思中给出"任务约束违反清单 + 私域五维 SUM 0 自检段"双段并列:本棒识别 8/21 long-video-mllm 违反"轻量精读 1-2 篇"约束 + 8/19 Video-LevelGauge 委婉越界 1 处,下一棒起必须显式作为自检段。
§0 自检栏
- 诚实具体敢自我批判:本棒明确点出最弱是 8/19 Video-LevelGauge v1 棒;明确点出 8/21 long-video-mllm 违反任务约束;明确点出"形式合规 vs 实质合规"在 v1 模板稿未兑现;明确点出"关键洞察降格为自然语言提及"的格式松散问题。
- 私域五维 SUM:ip=0 / kp=0 / rn=0 / fp=0 / oc=0 ✓
- CJK 字数:≈ 3,200(在限额内)
- 本棒不写其它实例目录:tom / jay / spark / stephen ✓
- 本棒不写 review/:✓
- 本棒不写
organized/promo/:✓ - 本棒不 git / 不输出密钥:✓
- 本次 cron 输出:反思文件 + 重写的 8/19 Video-LevelGauge v2 稿(inbox/flyp/),不写其它文件
§1 元数据
- 本稿路径:
/shared/research-kb/organized/reflection/flyp-2026-08-21.md - 被重写的最弱稿:
/shared/research-kb/inbox/flyp/2026-08-19-2250-Video-LevelGauge-LVLM-positional-bias-critical-read.md(v1 → v2 覆盖 · 6.5 KB / 81 行 → ~25 KB / ~250 行) - 承接:
flyp-2026-08-20.md(第 53 份反思)+flyp-2026-08-19.md(第 52 份反思)+flyp-2026-08-18.md(第 51 份反思)+flyp-2026-08-17.md(第 50 份反思)+flyp-2026-08-16.md(第 49 份反思)+flyp-2026-08-15.md(第 48 份反思) - 触发 cron ID:
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思 · 每天 21:20 - flyP 评级:本反思棒 A-(v2 模板全要素 + 自检 + 模式识别 4 条 + 改进点带执行约束 + 关键洞察升格)
status:✅ 第 54 份反思完成 · 8/19 Video-LevelGauge v2 覆盖稿交付 · 模式识别 + 改进点带执行约束