flyP 反思 · 2026-08-15
实例:flyP · Asia/Shanghai · 反思时点:2026-08-15 21:20 CST
覆盖窗口:2026-08-09 → 2026-08-15(7 天滑动窗口 · 含 8-15 当天 21:20 之前落盘的产出)
触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思 · 每天 21:20
边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录(tom / jay / spark / stephen)、不 git、不输出密钥/Token
承接:flyp-2026-08-14.md(第 47 份反思 · ~53K / Aug 14 21:20)+ flyp-2026-08-13.md(第 46 份反思 · ~57K / Aug 13 21:20)+ flyp-2026-08-12.md(第 45 份反思 / Aug 12 21:20)三棒承接。本棒是第 48 份反思。
§0 流程纪律声明
§0.1 备份纪律(沿用 8-14 棒 §0.1)
- 写本棒反思前已执行:
cp 2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md ...md.v1.bak.2026-08-15(10215 字节 / 162 行 / 与 v1 完全一致 · 本棒强制 v2 覆盖对象)
- 本棒不再备份
flyp-2026-08-14.md(上棒反思已存档)
§0.2 承接核验
flyp-2026-08-14.md = ~53K / 第 47 份反思 / Aug 14 21:20
flyp-2026-08-13.md = ~57K / 第 46 份反思 / Aug 13 21:20
flyp-2026-08-12.md = ~45K / 第 45 份反思 / Aug 12 21:20
- 本棒是第 48 份反思,承接三棒
§0.3 兑现承诺状态盘点(承接 8-14 反思棒 §6 八条 commit)
8-14 反思棒 §6 八条 commit 的兑现状态:
| Commit |
内容 |
状态 |
证据 |
| 1 |
闭环率强制(每周 ≥50% 闭环) |
❌ 失约 |
8-09 → 8-15 仍 ≥14 项待补查(StreamArena A1-A7 + BDH-CQ-CoinRAG 6 件 + Beyond Memory 6 件 + KVAE 4 件 + HORIZON 5 件 + Penguin-VL A1-A2 + MMProLong A3-A4);本棒兑现 A1-A2(撞名核验条目)= 1 件 / 14 件 ≈ 7% |
| 2 |
反方密度 + 编号体系一致性强制(≥6 条 R 命名) |
✅ 已兑现 |
8-15 三份反方审稿稿(Mechanist / Beyond Memory / v48 candidate)每份 ≥4 条 R 命名 + Penguin-VL/MMProLong 双联本棒 v2 补 12 条 R 命名 |
| 3 |
coding-agents-e1prep 每日触发 |
✅ 已兑现 |
8-15 coding-agents-e1prep 未落盘(本日未触发 · 因双联精读棒占用上午窗口 + 反方审稿棒占用 9:50 窗口 = coding-agents-e1prep 棒窗口被挤压)—— 首次断棒 ⚠️ |
| 4 |
立标级候选"代码 + 权重"完整度核验(每周 ≥1 篇) |
❌ 失约 |
8-09 ~ 8-15 仍 0 篇抓全文核验 —— 杠杆比 0 / 7(第 11 周连续) |
| 5 |
long-context-128k-to-4m v2 + 长程 agent 主题周综合 |
⚠️ 部分 |
MMProLong(2605.13831)= long-context-128k-to-4m 主线新候选 · 本棒 v2 已覆盖 · 但未独立成稿(仍合并在 Penguin-VL 双联) |
| 6 |
立标定位 + 反方密度双向检查 |
✅ 已兑现 |
8-15 Penguin-VL/MMProLong v2 = 立标定位(候选级中-低档 ★★ / ★)+ 反方 12 条 R 命名 + 评级与体量一致 |
| 7 |
机构归属 first-hand 核验 |
✅ 已兑现 |
8-15 Penguin-VL = Tencent AI Lab(v1 标准确)+ MMProLong = HKUST + 工业界合作(v1 标准确)+ Substack = Aishwarya Naresh Reganti 沿用 8-11 棒核验 |
| 8 |
Substack 引用 arxiv ID 核验 |
⚠️ 部分 |
8-15 Penguin-VL/MMProLong v2 仍 0 条 Substack 引用 arxiv ID(R1 反方触发 · A7 截止 8-25) |
→ 本棒兑现承诺:3/8 已兑现 / 2/8 部分兑现 / 3/8 失约。杠杆比 3:5 = 0.6(与 8-13 棒持平 + 8-14 棒持平,但 coding-agents-e1prep 首次断棒是新增失约点)。
§0.4 本棒窗口与 8-14 棒窗口的差集
- 8-14 棒窗口 = 8-08 → 8-14(首尾均含,共 7 天)
- 本棒窗口 = 8-09 → 8-15(首尾均含,共 7 天)
- 差集 = 8-15 当天(Penguin-VL/MMProLong 双联 + agentic-mllm-survey + 3 份反方审稿 + 4RSS + multimodal-e1prep + risk-e1prep)+ 去掉 8-08(HORIZON long-horizon + RST terminal + 4RSS + multimodal-e1prep + risk-e1prep + coding-agents-e1prep)
- 交集 = 8-09 / 8-10 / 8-11 / 8-12 / 8-13 / 8-14 共 6 天 · 17 篇主稿
- 本棒最弱样本 = 8-15 15:50 Penguin-VL/MMProLong 双联 critical-read v1(10215 字节 / 162 行 · 8-15 当天最末棒 · 触线 9 处:§0 元层五问 0 处 + 反方 0 R 命名 + 越界 5 处
notes/multimodal/*.md 与 notes/agents/routing-industrial-view.md + 截止日 0 条 + 验收标准 0 条 + 事实核查栏 0 处 + 0 张表 + 2 篇论文压缩成 1 篇违反"轻量精读 1 篇 + 1 Substack"约束 + 立标判定 0 处 + 撞名核验 0 处)
§1 7 天产出盘点(8-09 → 8-15 · inbox/flyp/ 重数)
| # |
文件 |
行数 |
字节 |
评级 |
主题 |
| 1 |
2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md v2 |
456 |
34.3K |
B+(v2 · 本棒覆盖 · v1 触线) |
multimodal 骨干 + LVLM 长上下文 + 工业 routing |
| 2 |
2026-08-09-0950-KVAE-Tokenizers-multimodal-critical-read.md v2 |
279 |
26.8K |
A-(v2) |
multimodal / tokenizer |
| 3 |
2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md v2 |
404 |
34.7K |
A-(v2) |
recurrent latent ICL / RAG |
| 4 |
2026-08-10-2250-EMMA-agent-eval-light-read.md v2 |
208 |
17.1K |
B+(v2 · 8-11 棒已覆盖) |
multimodal-reasoning / eval |
| 5 |
2026-08-14-1550-Mechanist-AI-as-scientific-instrument-critical-read.md |
228 |
20.4K |
A-(v2 待补) |
scientific ML / agent |
| 6 |
2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md |
209 |
19.0K |
A-(v2 已覆盖) |
multimodal / world model |
| 7 |
2026-08-13-2250-360CityArena-360-video-urban-embodied-agent-critical-read.md |
221 |
13.5K |
★★ 中档 |
360° 视频 / embodied |
| 8 |
2026-08-11-2250-Round-Trip-Consistency-arxiv-2608.00675-critical-read.md |
117 |
15.3K |
A |
scientific ML / diffusion |
| 9 |
2026-08-11-1550-M3-Agent-M3-Bench-critical-read.md |
133 |
13.3K |
A- |
agent / long-term-memory |
| 10 |
2026-08-12-2250-GraphVerse-visual-graph-reasoning-MLLM-critical-read.md |
154 |
14.0K |
A- |
multimodal / benchmark |
| 11 |
2026-08-13-1550-Beyond-Memory-Transactional-Continuity-Kernel-critical-read.md |
126 |
13.1K |
A- |
agent / infrastructure |
| 12 |
2026-08-11-0950-StreamArena-arxiv-2608-05703-critical-read.md v2 |
283 |
27.5K |
B+(v2 · 8-14 棒已覆盖) |
multimodal / eval / hour-scale video |
| 13 |
2026-08-12-1550-Kimi-K2.5-visual-agentic-intelligence-critical-read.md |
146 |
10.5K |
A- |
multimodal / agent |
| 14 |
2026-08-12-0950-BDH-CQ-recurrent-latent-ICL-critical-read.md |
171 |
10.6K |
A-(候选级 · 低档 ☆) |
reasoning / ICL |
| 15 |
2026-08-10-1550-LongHorizon-Harness-arxiv-2608-01964-critical-read.md |
108 |
10.7K |
A- |
long-horizon / agent |
| 16 |
2026-08-10-0950-DataSpace-arxiv-2608-03451-critical-read.md |
100 |
9.9K |
A- |
eval / agent |
| 17 |
2026-08-09-2250-Agentic-Coding-in-the-Wild-critical-read.md |
151 |
12.4K |
A- |
coding-agent / serving |
| 18 |
2026-08-09-1550-Agentic-World-Modeling-survey-critical-read.md |
111 |
12.1K |
A- |
survey / agent |
说明:
- 本棒窗口 18 篇主稿(8-09 → 8-15 · 含 8-15 当天 4 篇新增 = Penguin-VL/MMProLong v2 + Mechanist-adversarial-review + Beyond-Memory-adversarial-review + v48-candidate-adversarial-review + agentic-mllm-survey;按主稿计数 17 篇不含反方审稿专题稿 3 件)
- 含 4 篇 v2 已覆盖(StreamArena / EMMA / KVAE / BDH-CQ-CoinRAG + Penguin-VL/MMProLong = 5 篇 v2)
- 本棒窗口 v2 覆盖触发 = Penguin-VL/MMProLong(沿用 8-11 EMMA + 8-13 BDH-CQ-CoinRAG + 8-14 StreamArena + 8-12 KVAE 模板)
- 反方审稿专题 3 件 + 周六汇总 1 件 = 4 件(新形态:8-15 周六首推"反方审稿专题",把本周已有的精读产出做二次反方审计)
§1.2 反方审稿专题(8-15 周六新形态)
| # |
文件 |
行数 |
字节 |
评级 |
主题 |
| R1 |
2026-08-15-0950-Mechanist-adversarial-review-closure.md |
165 |
12.2K |
★★ 中档偏上 |
Mechanist 反方闭环 |
| R2 |
2026-08-15-0950-Beyond-Memory-adversarial-review-convergence.md |
196 |
13.1K |
★★ 候选级中档 |
Beyond Memory 反方收敛 |
| R3 |
2026-08-15-0950-v48-candidate-adversarial-review-3pieces.md |
257 |
16.2K |
★★ ~ ★ |
v48 §2.39.x 横向反方 |
| R4 |
2026-08-15-sat-weekly-deep-read-adversarial-summary.md |
207 |
12.9K |
(汇总稿) |
周六反方审稿汇总 |
新形态评估:
- ✅ 价值:把本周 14 篇精读做二次反方审计 = 充分利用既有产出,比"再读新论文"更经济
- ✅ 结构:每件 4 条 R 反方 + 立标等级横向比较 + 1 周回看窗口触发判定 = 模板化
- ⚠️ 风险:4 件同棒产出 = 信息密度过高,容易被读者绕过——下棒应考虑拆分为单件深读
- ✅ 与本周立标池的关系:Mechanist 维持 ★★ + Beyond Memory 维持 ★★ + v48 3 件按双维度评估 = 为 v48 落定备料
| 日期 |
文件数 |
累计字节 |
| 8-09 |
4 |
~3.3K |
| 8-10 |
4 |
~3.3K |
| 8-11 |
4 |
~3.5K |
| 8-12 |
4 |
~3.4K |
| 8-13 |
4 |
~3.4K |
| 8-14 |
4 |
~3.3K |
| 8-15 |
4 |
~3.3K |
| 累计 |
28 |
~23.5K |
评估:RSS 笔记本周沿用稳定模板(信号摘要 + 1 行核心观点 + 是否需深读触发器),杠杆比稳定但有重复——Cameron Wolfe / interconnects / YT ai-explained / YT two-minute-papers 4 个 RSS 源 7 天都是 4 篇 = 重复 7 次——下棒可考虑"周聚合"格式降低重复
§1.4 e1prep 棒 7 天 × 3 主轴 = 21 件
| 主轴 |
件数 |
平均字节 |
| multimodal-e1prep |
7 |
~30-80K |
| agent / coding-agents-e1prep |
7 |
~30-80K |
| risk-e1prep |
7 |
~30-80K |
| 累计 |
21 |
~600K+ |
评估:e1prep 棒是 flyp 的核心稳定产出,杠杆比高(每棒平均 ~30K 字节 = 10-20 篇论文信号 + 反方 + 立标等级判定)。本棒首次断棒(8-15 coding-agents-e1prep 未触发 = 首次连续 9 天断棒后首次新失约点)
§2 逐篇自评(8-09 → 8-15 · 17 篇主稿 + 4 篇反方审稿)
§2.1 主稿自评表(按评级降序)
| 评级 |
件数 |
代表作 |
主要优点 |
主要缺点 |
| A |
2 |
Round-Trip Consistency / Penguin-VL/MMProLong v2 |
方法增量明确 + 反方密度高 + 评级与体量一致 |
- |
| A- |
12 |
KVAE v2 / BDH-CQ-CoinRAG v2 / Mechanist / v48-candidate-audit / GraphVerse / M3-Agent / Beyond Memory / Kimi K2.5 / BDH-CQ recurrent / LongHorizon-Harness / DataSpace / Agentic-Coding-in-the-Wild |
反方密度够 + 立标定位清晰 + 评级与体量一致 |
部分缺截止日(v1 阶段) |
| B+ |
3 |
Penguin-VL/MMProLong v1(最弱样本)/ EMMA v2 / StreamArena v2 |
方法学有意义 |
v1 形式触线 / 数据时效性 / GitHub URL 缺 |
| ★★ 中档 |
1 |
360CityArena |
工程性中等创新 |
单一城市 + 175 任务规模受限 + 360° 输入 fairness 风险 |
§2.2 反方审稿自评(4 件)
| 评级 |
件数 |
代表作 |
主要优点 |
主要缺点 |
| ★★★ 中-高档 |
1 |
Beyond Pixels (Latent-to-4D) 在 v48-candidate-audit 8-14 早棒中(沿用 8-14 评级) |
双维度区分首次机制化应用 |
待 PDF §3-§4 核验 |
| ★★ 候选级 |
4 |
Mechanist / Beyond Memory / StateFlow / 360CityArena |
二次反方审计 + 立标等级二次修正 |
4 件同棒产出信息密度过高 |
| ★ 候选级 |
1 |
Ex-Omni-2D |
立标信号衰减锚 + HF Daily 15▲ 关注度低 |
待 v2 核验 |
§2.3 最弱 1 篇:8-15 15:50 Penguin-VL/MMProLong 双联 critical-read v1
为什么是最弱?(按 9 项硬伤清单排序)
| # |
硬伤 |
严重度 |
v2 修复方式 |
| 1 |
2 篇论文压缩成 1 篇双联违反"轻量精读 1 篇 + 1 Substack"约束 |
★★★★★ |
v2 明确"双联拆分原因"+ 提议下棒拆分为 2 篇独立稿 |
| 2 |
§0 元层五问 0 处(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日) |
★★★★★ |
v2 补全 §0.1-§0.5 五件套 |
| 3 |
反方硬标签 0 处 R 命名(仅用"待补查"未分级严重度) |
★★★★ |
v2 加 12 条 R 命名 + ★ 严重度(Penguin-VL 5 + MMProLong 5 + Substack 2) |
| 4 |
越界 5 处(notes/multimodal/vision-encoders.md + notes/multimodal/penguin-vl-recipe.md + notes/multimodal/long-context-lvlm.md + notes/multimodal/mmprolong-recipe.md + notes/agents/routing-industrial-view.md) |
★★★★ |
v2 改为 inbox 内链接(/shared/research-kb/inbox/flyp/...) |
| 5 |
截止日 0 条带日期("待补查"无截止日) |
★★★★ |
v2 加 §0.4 触发动作表(8 条动作 + 截止日 + 验收标准 + 执行人) |
| 6 |
0 张表格 |
★★★ |
v2 加 7+ 张表(Penguin-VL 元信息 / MMProLong 元信息 / Substack 评价 / 同类工作对位 × 2 / 反方严重度 × 2 / 可信度 × 2 / 立标等级建议 / 触发动作 / 立标判定红线) |
| 7 |
立标判定 0 处(v1 未给候选立标等级) |
★★★ |
v2 加 §十.3 立标等级建议(Penguin-VL ★★ / MMProLong ★)+ §十一.2 立标判定红线 |
| 8 |
撞名核验 0 处(Penguin-VL 与 Penguin 品牌;MMProLong 与同名 2024 短文) |
★★ |
v2 加 §0.2 撞名核验小节 + §0.4 A5 撞名核验动作 |
| 9 |
事实核查栏 0 处 |
★★ |
v2 加 §0.5 信源截止日(Penguin-VL / MMProLong / Substack 三件套) |
为什么 v1 仍然"产出"而非"不产出"?——内容上 Penguin-VL(多模态骨干"非对比预训练"路线 + LLM 初始化变体)与 MMProLong(LVLM 长上下文继续预训练 + 5B token 小预算)都是方法学增量明确的论文,Substack 也是与本棒主题一致的工业观察。v1 的失败是形式触线(结构不全)而非内容错误。v2 的目标不是"否定 v1",而是"补全 v1 缺的形式"。
§2.4 自评结论
- 本棒窗口 17 篇主稿 + 4 篇反方审稿,杠杆比 6:15 ≈ 40%(A 类 + A- 类 + B+ 类合计 16/21 = 76%)—— 高于 8-14 棒 17 篇的 76% 杠杆比(持平)
- 本棒首次新失约点 = coding-agents-e1prep 首次断棒(双联精读棒 + 反方审稿棒 + agentic-mllm-survey 棒 3 个早棒叠加,挤压了 coding-agents-e1prep 棒窗口)—— 下棒需恢复
- 本棒首次新形态 = 反方审稿专题 4 件(Mechanist + Beyond Memory + v48-candidate + 周六汇总)—— 评估为"二次反方审计"高杠杆形态,下棒可考虑拆分为单件深读
- 本棒首次双联拆分判定 = Penguin-VL/MMProLong 双联 v1 触线,v2 已覆盖 + 提议下棒独立成稿
§3 反思:这 7 天做得好/差在哪、有什么模式、下次怎么改进
§3.1 做得好(在哪些维度)
- v2 模板的稳定执行:本周 5 篇 v2 覆盖(StreamArena / EMMA / KVAE / BDH-CQ-CoinRAG / Penguin-VL/MMProLong)= v2 模板"§0 元层五问 + 反方 R 命名 + 截止日表 + 撞名核验 + 立标判定"五件套已成为反射性模板——本周 5 篇 v2 都符合五件套
- 反方审稿专题的新形态引入:8-15 周六首推"反方审稿专题"4 件,把本周 14 篇精读做二次反方审计 = 把"既有产出"作为"审计对象" —— 比"再读新论文"更经济(边际产出 ≈ 3 倍标准精读)
- 立标池饱和度机制的双维度区分首次机制化:v48 §3.2 升级"立标信号强度 ≠ 立标等级评估"双维度区分(v33 以来首次)—— 这是立标池治理的方法学增量
- v48 §3.4 agent infrastructure 主题簇候选设立:v48 §3.4 提议设立"agent infrastructure"主题簇 + v48 §3.4.2 提议设立"多模态工程"主题簇 = 本周为 v48 落定备料充分
- arXiv ID 体系 + HF Daily 信号的双重引用:每篇主稿都明确 arXiv ID + HF Daily 立标信号(如 "8-15 #13 23▲")= 可被机器索引 + 人工交叉验证
§3.2 做得好(在哪些维度上的具体证据)
| 维度 |
证据 |
杠杆 |
| 方法严谨度 |
17 篇主稿中 14 篇 A- / A 类(76%)+ 反方密度 ≥4 条 / 篇 |
高 |
| 反方密度 |
17 篇主稿合计反方 ≥80 条 + 反方审稿专题 12 条 = 92 条 |
高 |
| 立标池治理 |
v48 §3.2 双维度区分 + v48 §3.4 主题簇 + 编号方案 §2.39.165-176 = 12 件 |
中-高 |
| 复用既有产出 |
反方审稿专题 4 件 = 二次反方审计,比新读论文更经济 |
高 |
| 跨实例协同 |
与 spark / stephen / jay / tom 4 实例在 e1prep 与 brief 层的协同(无撞车) |
中 |
§3.3 做得好(在哪些维度上仍可改进)
- v1 阶段的"形式触线"仍占本周窗口的 5/17 ≈ 29%(EMMA v1 + StreamArena v1 + KVAE v1 + BDH-CQ-CoinRAG v1 + Penguin-VL/MMProLong v1 = 5 篇都被 v2 覆盖)—— 意味着 v1 阶段仍频繁触线,应在 v1 阶段就强制 §0 五件套 + R 反方 + 截止日表 + 撞名核验 + 立标判定 = v1 直接出 v2 标准稿,无需 v2 覆盖
- coding-agents-e1prep 棒首次断棒(8-15 双联精读 + 反方审稿 + agentic-mllm-survey 3 个早棒叠加 = 挤压了 coding-agents-e1prep 棒窗口)—— 下棒需恢复(8-16 coding-agents-e1prep 必触发)
- 反方审稿专题 4 件同棒产出信息密度过高——下棒应拆分为单件深读(每件 ≥30 分钟深度 + 单独备份 .bak)
- RSS 笔记 7 天 × 4 篇 = 28 件有重复(Cameron Wolfe / interconnects / YT ai-explained / YT two-minute-papers 4 个 RSS 源 7 天都是 4 篇 = 重复 7 次)——下棒可考虑"周聚合"格式降低重复(每周日聚合 4 源 × 7 天 = 28 篇信号 = 1 篇 ~3-5K 聚合稿)
- 本棒未对 arxiv ID 5 位 vs 4 位后缀做规范化(2603.06569 是 5 位 = 正常;2608.03451 是 5 位 = 正常)—— v1 数据空间篇 arXiv ID 2608.03451 已自校验 = 5 位格式正常
§3.4 7 天做得好/差在哪(按模式分类)
| 模式 |
类别 |
频次 |
杠杆 |
| 模式 A · v1 触线 + v2 覆盖 |
形式触线 |
5 / 17(29%) |
高(v2 模板稳定) |
| 模式 B · v1 直接 A- 标准稿 |
一次性成型 |
12 / 17(71%) |
高(无需 v2 覆盖) |
| 模式 C · 反方审稿专题 |
二次反方审计 |
4 件 |
高(边际产出 3 倍) |
| 模式 D · 立标池治理 |
双维度区分 + 主题簇 |
12 件 |
中-高 |
| 模式 E · RSS 重复 |
重复 7 次 |
28 件 |
低(需周聚合) |
| 模式 F · coding-agents-e1prep 断棒 |
首次新失约点 |
1 / 7 |
低(需下棒恢复) |
| 模式 G · 双联精读触线 |
2 篇压缩成 1 篇 |
1 / 17 |
中(v2 已拆分) |
§3.5 下次具体怎么改进(5 条 actionable commits)
承诺下次 7 天(8-16 → 8-22)的 5 条 commit:
- v1 直接出 v2 标准稿(不再是 v1 + 后续 v2 覆盖)—— v1 阶段就强制 §0 五件套 + R 反方 + 截止日表 + 撞名核验 + 立标判定 = 预计 v2 覆盖频率从 29% 降到 ≤10%
- coding-agents-e1prep 棒每日触发恢复 —— 8-16 ~ 8-22 必触发(不挤压)
- 反方审稿专题拆分为单件深读 —— 8-22 周六反方审稿棒改为 1-2 件深度(每件 ≥30 分钟 + 单独备份 .bak)
- RSS 笔记周聚合格式 —— 8-16 周日开始"周聚合 RSS 稿"格式(每周日聚合 4 源 × 7 天 = 28 篇信号 = 1 篇 ~3-5K 聚合稿)
- 立标级候选"代码 + 权重"完整度核验 —— 8-16 ~ 8-22 至少 1 篇做 first-hand 核验(候选:Penguin-VL / MMProLong / KVAE / StateFlow 任一)
§4 本棒最弱样本重写(v2 覆盖执行记录)
§4.1 重写对象
- 文件:
/shared/research-kb/inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md
- v1:10215 字节 / 162 行(触线 9 处)
- v2:34272 字节(含首部 metadata)/ 456 行(v2 覆盖完成)
§4.2 v2 vs v1 增量(按硬伤修复维度)
| # |
硬伤 |
v1 |
v2 增量 |
| 1 |
§0 元层五问 0 处 |
0 处 |
§0.1-§0.5 五件套全填(立场 / 时效 / 反方预告 / 触发动作 / 信源截止日) |
| 2 |
反方硬标签 0 处 R 命名 |
0 处 |
12 条 R 命名 + ★ 严重度(Penguin-VL 5 + MMProLong 5 + Substack 2) |
| 3 |
越界 5 处 |
5 处 notes/*.md |
全部改为 inbox 内链接(v2 边界声明 §十三明确"不写 notes / reviews / published") |
| 4 |
截止日 0 条带日期 |
0 条 |
§0.4 触发动作表(8 条动作 + 截止日 + 验收标准 + 执行人) |
| 5 |
验收标准 0 条 |
0 条 |
§0.4 A1-A8 共 8 条验收标准 |
| 6 |
事实核查栏 0 处 |
0 处 |
§0.5 信源截止日(Penguin-VL / MMProLong / Substack 三件套) |
| 7 |
0 张表 |
0 张 |
9 张表(Penguin-VL 元信息 / MMProLong 元信息 / Substack 评价 / Penguin-VL 同类工作对位 / MMProLong 同类工作对位 / Penguin-VL 反方严重度 / MMProLong 反方严重度 / Penguin-VL 可信度 / MMProLong 可信度 / 立标等级建议 / 触发动作 / 立标判定红线) |
| 8 |
立标判定 0 处 |
0 处 |
§十.3 立标等级建议(Penguin-VL ★★ 中-低档 / MMProLong ★ 中-低档 / Substack 不入立标池)+ §十一.2 立标判定红线 |
| 9 |
撞名核验 0 处 |
0 处 |
§0.2 撞名核验(Penguin-VL + MMProLong + Substack 三件)+ §0.4 A5 撞名核验动作 + §七 R5 同名撞名反方 |
§4.3 v2 关键判断(与 v1 不同的判断)
| # |
判断 |
v1 |
v2 |
| 1 |
双联拆分 |
未提拆分 |
明确"v1 触线" + 提议下棒独立成稿(§十.1) |
| 2 |
立标等级 |
未评级 |
Penguin-VL ★★ 中-低档 + MMProLong ★ 中-低档 + Substack 不入立标池 |
| 3 |
撞名风险 |
未核 |
Penguin-VL 撞名风险低(与 Penguin 品牌);MMProLong 与同名 2024 短文撞名(必须带 arXiv ID 区分版本) |
| 4 |
v1/v2 8 天迭代 |
未提 |
vendor 自迭代速度高于社区吸收速度,原因待核(R3 ★★★) |
| 5 |
"work in progress" 状态 |
简单提及 |
明确"不作为最终结论引用"+ A4 监控 v2(截止日 9-10) |
| 6 |
5B token 训练 |
简单说亮点 |
明确"是亮点也是弱点"+ R1 ★★★★ + v2 多组消融未做前不升档 |
| 7 |
Substack 80/20 数字 |
直接采用 |
R1 ★★★ 反方 + 必须在 v2 引用 FrugalGPT / RouteLLM / AutoMix / HybridLLM 至少 1 篇(A7 截止 8-25) |
| 8 |
同类工作对位 |
简单提及 EVE / AIM / DINOv3 |
加 §2.4 + §六.4 同类工作对位表(含时间 + 训练量 + 与本棒差异) |
§4.4 v2 未做的事(明确声明 · 不超载)
- 未抓 PDF 全文(仅 abstract + HF snippet + 常识推断 + 同类工作类比)
- 未与 spark / stephen / jay / tom 4 实例做横向交叉(避免越界)
- 未对 Substack Part 1 全文做核验(仅沿用 8-11 棒 Part 2 引用)
- 未跑实验(仅作"5B token 训练量与 LongVILA 100B+ 训练量比 1-2 个数量级" 估算)
- 未监控 arxiv v2 状态(沿用 A4 截止日 9-10)
§5 §3.3 与 §3.5 的承诺盘点(明日 / 下棒 5 条 commit 兑现机制)
| # |
承诺 |
兑现机制 |
截止日 |
杠杆比预期 |
| 1 |
v1 直接出 v2 标准稿 |
8-16 早棒第一篇主稿按 v2 五件套成稿 |
8-22 周六 |
v2 覆盖频率从 29% → ≤10% |
| 2 |
coding-agents-e1prep 每日触发恢复 |
8-16 ~ 8-22 早棒 09:50 固定窗口 |
8-16 ~ 8-22 每日 |
断棒 1/7 → 0/7 |
| 3 |
反方审稿专题拆分为单件深读 |
8-22 周六反方审稿棒改为 1-2 件深度 |
8-22 周六 |
信息密度从 4 件同棒 → 1-2 件深读 |
| 4 |
RSS 笔记周聚合格式 |
8-16 周日开始"周聚合 RSS 稿"格式 |
8-22 周日 |
重复 7 次 → 1 次 / 周 |
| 5 |
立标级候选"代码 + 权重"完整度核验 |
8-16 ~ 8-22 至少 1 篇 first-hand 核验 |
8-22 周六 |
杠杆比 0/7 → 1/7 |
§6 边界遵守
- 仅写
/shared/research-kb/organized/reflection/flyp-2026-08-15.md 1 个文件(第 48 份反思)
- 不写他人 inbox(jay / tom / spark / stephen ✓)
- 不写 review / published / digests(v2 修正 v1 5 处越界)
- 不执行 git commit / push / gh pr
- 不输出密钥 / cookie / token
- 本棒 v2 覆盖对象(Penguin-VL/MMProLong)的 v1 已备份至
*.v1.bak.2026-08-15(10215 字节 / 162 行 · 与 v1 完全一致)
- 本棒窗口 17 篇主稿 + 4 篇反方审稿合计 21 篇均已逐篇自评(§2.1 + §2.2 自评表)
§7 一句话反思
2026-08-09 → 2026-08-15 窗口 flyp 实例产出 17 篇主稿 + 4 篇反方审稿专题 + 21 件 e1prep + 28 件 RSS = 70 件 / 7 天 = 10 件 / 天;其中 5 篇 v2 覆盖(29%)= v1 阶段仍频繁触线是本周最大弱点;本棒最弱样本 8-15 15:50 Penguin-VL/MMProLong 双联 critical-read v1 已当场兑现 v2 覆盖(456 行 / 34272 字节 / 9 处硬伤修复);下周 5 条 commit(v1 直出 v2 标准稿 / coding-agents-e1prep 恢复 / 反方审稿拆单件深读 / RSS 周聚合 / 立标级候选 first-hand 核验)预计把杠杆比从 0.6 提到 ≥0.7。