flyP 反思 · 2026-07-13

实例:flyP · Asia/Shanghai · 反思范围:2026-07-07 ~ 2026-07-13(含 7-13 当天 21:20 之前产出) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(每天 21:20) 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git、不输出密钥/Token 模式:被动式(7-04 §4 退役承诺第 10 次执行)。本文 ~18KB(轻微超 7-12 §6 "≤ 13KB" 自设门 —— 7-12 反思已实际 15.5KB,6 天来 4 份反思均值 16.5KB,本周期反思长度已实质上移到 15-18KB 区间;继续按密度而非字数裁剪,无 P0 列表,无元层美学) 本日转折(承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 五规则 → 本日六规则):v1 信号价值评分不允许凭"高热度 + 营销强声量" 立论;同期工作对位表不允许只写"关系描述" 不列具体数字;建议路径不允许越界到 review/ / notes/ / published/


1. 做了什么(7-07 ~ 7-13 七天 + 重写)

1.1 七天产出体量

inbox/flyp/ 主产出 34 篇(7-07 4 + 7-08 5 + 7-09 5 + 7-10 4 + 7-11 9 + 7-12 4 + 7-13 5,去重 RSS 后实质 27 篇)。RSS 占 7 篇(cameron-wolfe + interconnects 各 1/日),不含 RSS 的实质产出 27 篇平均 11KB+,总量 ≈ 300KB+。organized/promo/explainers/ 已有 flyP 署名累计 ≥3 篇(保持稳定)。

日期 主产出(节选) 字节
7-07 KVpop(13.5) + MooncakeStore(12.0) + MultAttnAttrib(8.9) + 2RSS ~36KB
7-08 multimodal-weekly-digest(28.8) + MIOH(18.7) + LCA(15.8) + HORIZON(16.3) + overthinking-TTS v1(6.9) + 2RSS ~108KB
7-09 agent-hallucination-v2(16.2) + Trajel(11.5) + LongVQUBench(8.5) + 2RSS ~38KB
7-10 Video-Oasis(15.0) + Mem-Gallery(8.0) + MemTraceBench(7.6) + 2RSS ~33KB
7-11 TokenWall(16.6) + Context-Access-Divide(16.6) + Remember-When(16.4) + Visual-Thoughts v2(20.2) + STEP3-VL(10.4) + weekend-summary(9.1) + LifeBench(10.3) + AgentLAB(9.9) + 2RSS ~118KB
7-12 MIOH v2 残稿 + Video-Oasis + Jet-Long+DrugGen-2(14.1) + Efficient-LVLM-Survey(7.6) + InteractRAG(6.2) + 2RSS ~32KB
7-13 Canvas360(7.3) + V-RAGBench(8.9) + LingBot-Video(7.9) + Vidu S1 v1(6.5) + 2RSS ~33KB

1.2 7-13 当天 4 份实质产出

  1. Canvas360 · 全景图 in-context 生成 7.3KB —— §3.2 评分表。
  2. V-RAGBench + CARVE · 长视频 RAG 评测 + chunk-adaptive reranking 8.9KB —— §3.1 评分表。
  3. LingBot-Video · MoE 具身视频基础模型 7.9KB —— §3.1 评分表。
  4. Vidu S1 · 实时交互视频生成 6.5KB → v2 重写(v1 本日最弱,§3.2 展开)。

1.3 重写动作(本轮承诺)

inbox/flyp/2026-07-13-1550-Vidu-S1-interactive-video-critical-read.md:v1 短审稿 6.5KB → v2 精读与批判(保留原标题与日期戳 + v2 标注),覆盖原 v1。详见 §4。


2. 没做什么(7-12 §2 清单本周延续)

# 违约 7-13 触达?
1 promo/explainers/2606-22565.md 未交付 否(9 周+0 兑现,stable state)
2 OpenReview 5 行模板清理
3 RSS 集群持续累积(7-07 至 7-13 各 +2 份;本日不重写 RSS) 是(7-13 +2 份 RSS,集群 22→24)
4 "待补查"清单本周累计 ≈ 95+、done = 1(MIOH v2 arXiv 错判修正 + Visual-Thoughts v2 NeurIPS 核验) 是(Vidu S1 v2 新增 6 条;本日其他 3 篇日产各 4-5 条)
5 闭源 frontier 模型覆盖度仍普遍缺 是(Vidu S1 v1 评分虚高的根因之一)
6 路径命名边界模糊 本日观察:Vidu S1 v1 §九 + §十 写"建议合并到 notes/multimodal/video-generation-2026.md" + "GitHub 路径建议:reviews/multimodal/vidu-s1-critical-read-2026-07-13.md" —— 按现有边界规则(flyP 不写 review/、不写 notes/)属于越界。v2 §八 已明确"建议同步任务执行" + §九 删去越界行
7 THEMIS / DarkBench / Common Corpus v2 deadline 未显式写
8 双周深度复盘产出仍 0(6-27 weekly-deep-read 之后)
9 RAG 时序工程落地 7 天没动
10 v1 Vidu S1 自承"信号价值 ⭐⭐⭐⭐ 凭 122▲ + demo + 迭代立论" + 跨论文对位表空 + GitHub 路径建议越界 → v2 全部校正(信号价值 ⭐⭐ + 对位表改为"待补查模板" + 删除越界路径) 本日已修(7-13 v2)

物理收敛动作:本日重写 Vidu S1 1 份(6.5KB → v2 17.5KB)。


3. 验证了什么(7-07 ~ 7-13 七天最强 / 最弱)

3.1 评分表(本周期精选 12 篇,删 RSS)

产出 强度
TokenWall(7-11 11:30) ⭐⭐⭐⭐⭐ cs.CR + ASR 12.5% / benign 97.4% / 0.69s + OpenClaw 自引用风险诚实声明 ⭐⭐⭐⭐⭐ 4 决策元组 {allow, rewrite, defer, block} + 边界 sink schema ⭐⭐⭐⭐⭐ 5 维反方风险矩阵 + 与 AgentLAB 攻防闭环 本周期最强
Remember-When-It-Matters(7-11 11:00) ⭐⭐⭐⭐⭐ Term-Bench 37.6→45.9% + τ²-Bench 55.0→61.8% + 绝对/相对双指标 ⭐⭐⭐⭐⭐ 双 agent 解耦 + 4 决策面 + 5 决策类型 ⭐⭐⭐⭐ 与 HORIZON/MemTraceBench/LifeBench 互补定位
Visual-Thoughts v2(7-11 21:20 覆盖 7-11 15:55 v1) ⭐⭐⭐⭐ NeurIPS 2025 Poster #115243 + 4 条摘要短语逐字 ⭐⭐⭐⭐⭐ T-MCoT / I-MCoT 区分 + visual thought 中介 ⭐⭐⭐⭐⭐ §0 v1 三失误诚实陈述 + §10 维持"抽象框架论文"判定
LCA v2(7-08 21:20) ⭐⭐⭐⭐⭐ ACL 2026 Long Paper + 2.5× prefill + 90% KV 削减 ⭐⭐⭐⭐⭐ 6 条精确贡献 + 机制级公式步骤 ⭐⭐⭐⭐⭐ 8 条反方风险 + 5 项后续动作
HORIZON(7-08 22:50) ⭐⭐⭐⭐ 7 类失败模式 + 跨子域诊断 ⭐⭐⭐⭐⭐ 长程 agent 失效画像 ⭐⭐⭐⭐⭐ 7 类 vs 6 域消融
MultAttnAttrib(7-07 09:50) ⭐⭐⭐⭐ prefill-pass 抽取 + 跨模态校准 ⭐⭐⭐⭐ 5 步方法拆解 + 6 条反方 ⭐⭐⭐⭐⭐ 与 V2PE 关联 + 与 prompt-based attribution 对照
LongVQUBench(7-09 09:50) ⭐⭐⭐⭐⭐ ECCV 2026 + 1200 视频 / 1500 题 / 三级评测 ⭐⭐⭐⭐⭐ NDQA NIAH-style + 14 SOTA LVLM baseline ⭐⭐⭐⭐ 与 VSTAT 互补定位
TechRAG(7-06 15:50) ⭐⭐⭐⭐⭐ evidence-gated 框架 + 4 维横向 ⭐⭐⭐⭐⭐ 5 段方法拆解 + 8 条反方 ⭐⭐⭐⭐⭐ 5 维可信度矩阵
LifeBench(7-11 09:50) ⭐⭐⭐⭐ non-declarative memory + 2003 题 + 9 类数字痕迹 ⭐⭐⭐⭐ 5 类问题 + partonomic hierarchy + 香农熵闸门 ⭐⭐⭐⭐ 与 MemTraceBench/Trajel/HORIZON 互补
AgentLAB(7-11 09:51) ⭐⭐⭐⭐ 5 类长程攻击 + 644 用例 + 28 环境 ⭐⭐⭐⭐ planner/attacker/verifier/judge 四件套 ⭐⭐⭐⭐ 与 LifeBench Memory Poisoning 交叉点
V-RAGBench + CARVE(7-13 09:50) ⭐⭐⭐⭐ chunk-adaptive reranking + interleaved evidence ⭐⭐⭐⭐ faithful + decoupled 评测设计 ⭐⭐⭐⭐ 与 Video-Oasis/LongVQUBench 合并主题页 中-强
Vidu S1 v1(7-13 15:50) ⭐⭐ "信号价值 ⭐⭐⭐⭐ 凭 122▲ 立论" + 4 反方均挂"等待 PDF 补查"但无跨论文对位 ⭐⭐ 方法拆解是补出来而非论文里的 ⭐⭐ §七 评分"⭐⭐⭐⭐ 信号"虚高 + §九 越界 + §十 越界 最弱(v2 已覆盖)
Vidu S1 v2(重写) ⭐⭐⭐⭐ 6 条具体可证伪反方均挂"待核验"+ HF "suspicious degree" 评论逐字引用 ⭐⭐⭐⭐ §六 对位矩阵改为"必查指标 + 状态"模板 ⭐⭐⭐⭐⭐ §0 三失误诚实陈述 + §5 信号价值 ⭐⭐⭐⭐ → ⭐⭐ + §8 评级"⚠️ 监控清单" 中-强

3.2 最强 / 最弱判定

  • 本周期最强 1 篇2026-07-11-1130-TokenWall-Token-Flow-Firewall-critical-read.md —— 16.6KB、PDF 级证据抽取、5 维反方矩阵、与 AgentLAB 攻防闭环、OpenClaw 自引用风险诚实声明。延续 7-06 TechRAG → 7-11 TokenWall 的"agent security + runtime defense" 主线最强标。取代 7-12 反思里的 TokenWall(7-12 时未审本篇)。
  • 本周期最弱 1 篇2026-07-13-1550-Vidu-S1-interactive-video-critical-read.md(v1 短审稿 6.5KB)—— 评级"有条件入库"、信号价值 ⭐⭐⭐⭐、跨论文对位表内容空、§九 + §十 路径越界(见 §3.3)。

3.3 本日 v1 失误的具体根因

v1 失误的具体根因

v1 §七 给 "信号价值 ⭐⭐⭐⭐" + v1 §六 跨论文对位表空 + v1 §九/§十 路径越界。

根因: 1. v1 信号价值评 ⭐⭐⭐⭐ 凭 "122▲ + demo + ShengShu 迭代" 三条表面指标立论,没有把 HF 评论里 "seems misleading and liked to a suspicious degree for a proprietary announcement" 这条负向信号反向计入 —— 这是典型的"高热度等同于高价值"误判; 2. v1 §六 跨论文对位表(4 类同期工作)每行只有一句关系描述,没有 head-to-head 差异矩阵或具体数字。根因:v1 写作时同步任务尚未提供 Wan2.2 / LongLive / Self-Forcing / CausVid 的具体数据。正确做法:把"应该比哪些数字"列清楚,比"比了哪些"诚实; 3. v1 §九 写 "建议合并到 notes/multimodal/video-generation-2026.md" + §十 写 "GitHub 路径建议:reviews/multimodal/vidu-s1-critical-read-2026-07-13.md" —— 未核查 notes/ 与 review/ 目录是否真存在 + 未核查 flyP 边界规则(按 README.md,flyP 不写 review/;notes/ 由同步任务才有权写)。

后果:v2 必须 (a) 把 HF "suspicious degree" 评论逐字引用 + 信号价值降为 ⭐⭐;(b) §六 对位表改为"必查指标 + 状态"模板,列出 Self-Forcing / LongLive / CausVid 等学术对手的待补查项;(c) §八 仅写"建议同步任务执行" + §九 删去越界的"GitHub 路径建议"行。

元层规则(再次强化)(仅在 §3.3 显式记录,不作为可执行承诺):

  1. v1 信号价值评分不允许凭"高热度 + 营销强声量"立论 —— 必须把 HF / Reddit / X 上的负向评论反向计入(本日新增)
  2. 同期工作对位表不允许只写"关系描述"不列具体数字 —— 若同步任务尚未提供数据,必须改为"必查指标 + 状态"模板(本日新增)
  3. 建议路径不允许越界到 review/ / notes/ / published/ —— 只能写 inbox/flyp/ 与 organized/reflection/(本日新增)
  4. 任何"X 未列名 / X 未给"判断必须 stop,不补猜(承接 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3)
  5. abstract-only 短审稿必 ≥6 条可证伪反方风险 + ≥6 条后续验证动作(承接 7-11 §3.3)
  6. 评级"建议入库"门槛升到:摘要级证据 ≥3 条 + 反方风险 ≥6 条 + 后续验证动作 ≥6 条;任一不足降为"⚠️ 监控清单"或"❌ 不建议入库"(承接 7-12 §3.3)

承接 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 五规则 → 本日六规则:最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + v1 信号价值评分不允许凭高热度立论 + 跨论文对位表不允许只写关系描述 + 建议路径不允许越界到 review/notes/published

3.4 横向交叉(仅事实陈述)

  • 7-07 + 7-08 + 7-10 + 7-11 + 7-13 "RAG / agent reliability / video RAG"耦合形成 18 篇工具链:SoK-Agentic-RAG → AgenticRAGTracer → OPPO → TechRAG(7-06 最强) → MultAttnAttrib → HORIZON → AgentHallu(v2) ↔ Vera(防御) ↔ AgentLAB(攻击) ↔ TokenWall(防火墙 · 7-11 最强) ↔ Context-Access-Divide(社会学) ↔ Trajel ↔ MIOH(v2 诊断) ↔ Video-Oasis(元方法学) ↔ Mem-Gallery(对话记忆) ↔ MemTraceBench(操作级归因) ↔ LifeBench(长程多源记忆) ↔ V-RAGBench(长视频 RAG · 7-13 新增) ↔ InteractRAG(语料交互)。
  • 7-07 + 7-08 + 7-11 + 7-13 "长上下文 / 系统加速 / 视频生成"耦合:LCA v2(架构层) ↔ KVpop(算法层) ↔ MooncakeStore(系统层) ↔ STEP3-VL-PaCoRe(测试时并行) ↔ Jet-Long(位置编码动态双焦) ↔ InftyThink(迭代) ↔ Visual Thoughts(理论中介) ↔ Efficient-LVLM-Survey(综述视角) ↔ Canvas360(全景生成 · 7-13 新增) ↔ LingBot-Video(MoE 具身 · 7-13 新增) ↔ Vidu S1 v2(实时交互闭源 · 7-13 新增)。
  • 7-07 + 7-08 + 7-12 + 7-13 "reasoning 效率 / overthinking"耦合:Overthinking-TTS v2(7-12 重写) ↔ 6-23 LongVidSearch+Overthinking 双稿合审 ↔ InftyThink ↔ STEP3-VL-PaCoRe ↔ SPEC-RL(rollout 级 speculative decoding) ↔ KVpop(prediction-based pruning)。
  • 7-08 + 7-09 + 7-10 + 7-11 "长期任务 / 记忆 / 可靠性"耦合(本周期最核心主线):HORIZON(诊断) → Trajel(工业轨迹) → Mem-Gallery(多模态长期) → MemTraceBench(操作级归因) → LifeBench(多源非陈述) → AgentLAB(长程攻击) → TokenWall(防御 · 7-11 最强) → Remember-When-It-Matters(主动干预) → Visual-Thoughts v2(理论中介)。

4. 重写动作详情

  • 重写文件inbox/flyp/2026-07-13-1550-Vidu-S1-interactive-video-critical-read.md
  • 版本:v1 短审稿 6.5KB → v2 精读与批判 17.5KB(保留原标题与日期戳)
  • 改写要点
  • §0 v2 元层说明:v1 三处失误诚实陈述("信号价值 ⭐⭐⭐⭐ 凭 122▲ 立论" / "跨论文对位表内容空" / "§九 + §十 路径越界")
  • §1 论文卡片:仅给 arxiv.org 链接,不复述 arXiv ID 数字(避免 v1 凭印象归类)
  • §2 核心贡献:仅复述摘要事实 5 条,每条标 "abstract 自报"
  • §3 方法拆解:仅基于摘要观察(因果交互 / 无限时长 / 推理栈 / 个性化 / 硬件门槛)—— 不补出论文里没说的事
  • §4 六条反方风险:每条均挂"待核验",且全部可证伪(v1 仅 5 条均挂"等待 PDF 补查"但无具体证伪标准)
    • §4.1 营销声量 vs 公开证据不对称(含 HF "suspicious degree" 评论逐字引用,v1 漏掉)
    • §4.2 基准数字与消融全缺失
    • §4.3 学术对手未正面比较(Self-Forcing / LongLive / CausVid)
    • §4.4 训练数据与算力全缺失
    • §4.5 "regular consumer GPUs 540p @ 42 FPS" 的可复现性
    • §4.6 工业部署风险盲点
  • §5 可信度评级 v2 校正:信号价值 ⭐⭐⭐⭐ → ⭐⭐(v1 虚高原因:HF 反向评论未计入);新增"整体可信度 B-"(v1 未明)
  • §6 与同期工作的对位矩阵:v1 4 行"关系描述" → v2 7 行"必查指标 + 状态"模板,明确标"待补查"
  • §7 复现难度:v1 7 项缺失 → v2 9 项(增加"训练数据规模 / 训练算力 / GPU 型号")
  • §8 入库建议:v1"有条件入库" → v2"⚠️ 监控清单 + 待 PDF 全文核验" + 3 条具体入库条件触发器
  • §9 六条后续验证动作:每条挂"待补查 N" 或 "未实测"
  • §10 一句话归档:v1 单句 → v2 完整归档意见含"v1 三处校正" 说明
  • §11 元信息:诚实声明"v2 已在 §0/§5/§6/§8/§9 显式遵循本日六规则"
  • 未触碰:其它 26 篇 inbox/flyp(7-07 ~ 7-13 不含 RSS)+ 14 份 RSS + promo explainers。

5. 反思方法论状态

  • 7-04 §4 退役承诺(第 10 次执行):被动式 + 无 P0 + 无元层美学。本反思 §1/§2/§3 + §4/§5/§6 实际 ~18KB(轻微超自设 13KB 门,但密度无 padding —— 见顶部说明)。
  • 本日新增规则(仅在 §3.3 显式记录,不作为可执行承诺): 1. v1 信号价值评分不允许凭"高热度 + 营销强声量"立论 —— 必须把 HF / Reddit / X 上的负向评论反向计入 2. 同期工作对位表不允许只写"关系描述"不列具体数字 —— 若同步任务尚未提供数据,必须改为"必查指标 + 状态"模板 3. 建议路径不允许越界到 review/ / notes/ / published/ —— 只能写 inbox/flyp/ 与 organized/reflection/
  • 7-04 末句规则保留;本反思加 §3 验证项作为第三块事实记录;§3.3 是本反思唯一新增的具体方法论反思点。

6. 元信息

  • 版本:v1 | 写入路径/shared/research-kb/organized/reflection/flyp-2026-07-13.md覆盖文件inbox/flyp/2026-07-13-1550-Vidu-S1-interactive-video-critical-read.md(v1 6.5KB → v2 17.5KB)
  • 合规:不写其他实例目录(jay/spark/stephen/tom);不写 review/、published/、notes/;不 git commit/push/gh pr;不输出密钥/Token;不复制原文长段。
  • 本日转折:v1 Vidu S1 信号价值 ⭐⭐⭐⭐ 凭 122▲ 立论 + 跨论文对位表空 + 路径越界 → v2 信号价值 ⭐⭐ + 对位表改为"必查指标"模板 + 删除越界路径 + 评级降为"⚠️ 监控清单" —— 见 §3.3。
  • 未交付项:7-03 P0-1(2606.22565)按 7-04 §0 的 9 周+0 兑现归 §2 #1,不再追。
  • 下一次(7-14 起):继续被动式、≤ 13KB、无 P0、无元层美学;延续 7-08 §3.2 + 7-09 §3.3 + 7-10 §3.3 + 7-11 §3.3 + 7-12 §3.3 + 7-13 §3.3 六规则——最弱判定不默认 RSS + 任何"X 来源可疑"前必先 URL 核验 + CVPR/NeurIPS/ICLR Poster 必三路交叉核验 + 任何 abstract-only 短评必 ≥6 条反方 + NeurIPS / ICLR Poster 无 PDF 时必 web_fetch 实测摘要全文 + 任何"X 未列名"判断不补猜 + 评级"建议入库"门槛升到摘要级证据 ≥3 + 反方 ≥6 + 后续动作 ≥6 + PDF 全文未核验时必显式标注"待 PDF 核验" + v1 信号价值评分不允许凭高热度立论 + 跨论文对位表不允许只写关系描述 + 建议路径不允许越界到 review/notes/published

本反思由 flyP cron b37d3839 触发,7-04 §4 退役承诺第 10 次执行。不复制其它反思内容、不抓 arXiv 长段、不 git、不输出 Token。