StreamArena · 长时程流式视频评测 + StreamMind 双层架构 · 精读与批判(v2 覆盖 · 8-14 反思棒)

v2 覆盖触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(8-14 21:20)· 反思强制补稿闸第 22 天连续生效 · flyP-2026-08-14.md §3.2 P-47-1(本棒窗口最弱样本当场兑现 v2 覆盖) v1 路径/shared/research-kb/inbox/flyp/2026-08-11-0950-StreamArena-arxiv-2608-05703-critical-read.md.v1.bak.2026-08-14(11631 字节 / 102 行 / 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-14 21:20 CST 覆盖纪律:v1 的 8 处结构性硬伤(§0 元层五问 0 处 + 反方硬标签 0 处 R 命名 + 越界 4 处 organized/knowledge/ + paper_card/ + notes/ + v46 §2.39.162 + 截止日 0 条带日期 + 验收标准 0 条 + 事实核查栏 0 处 + v1 模板残留「建议归入」「建议路径」委婉越界形式)必须全部修复 承接flyp-2026-08-13.md(第 46 份反思 · ~30K / Aug 13 21:20)+ flyp-2026-08-12.md(第 45 份反思 · ~25K / Aug 12 21:20)+ flyp-2026-08-11.md(第 44 份反思 · Aug 11 21:20)


§0 元层五问(v2 模板必填 · v1 完全缺)

§0.1 立场

StreamArena(arXiv:2608.05703 v1 2026-08-06 + HF Daily 8-11 #15 / 14▲)是 8-08 → 8-14 窗口 17 篇主稿中唯一把 "hour-scale + open-ended + causal-access + streaming + omni-modal + multi-turn + proactive + tool" 八维同时立起来的视频理解评测基准,与 MMMU-Pro / MathVista 同属"评测方法学贡献"路线但把粒度推到 hour 级,方法学增量 B+;同时自带 StreamMind 双层异步架构(frontend / backend × 6 worker)+ 6 worker 消息总线 + 持久多模态记忆 schema,避免「基准-方法错位」批评,是当前公开评测中少见的「基准 + 系统同源」作品。其硬伤有五:(a) GitHub 仓库 URL 未在 abstract / HF card 公开(v1 仅自述 Apache-2.0 through "linked on the first page"),复现路径不透明;(b) 评测协议依赖 LLM-as-judge 但 judge 型号 / 版本 / 人工一致性指标未在 abstract 披露,开放问答判分偏置风险未量化;(c) 243 视频是否覆盖足够长尾(直播 / 教学 / 综艺 / 街拍)分布未给,中位数 / P10 / 极值未披露;(d) StreamMind 的 6 worker 接口 / 消息总线 / 记忆 schema / cache 策略全部闭盒,可复现性差;(e) 撞名风险——方法名 StreamMind 已被 ICCV 2025 同名工作(event-gated cognition,arXiv 2503.XXXX)占用,文献检索易混淆。

flyP 立场B+(含越界 + 缺截止日扣分 · v1 评级 A- 自我盘点虚高)——StreamArena 是 8-08 → 8-14 窗口中v1 评级自评 A- 但实际触线(越界 4 处 + 截止日 0 条 + 验收标准 0 条 + 反方 0 R 命名)的样本;建议作为「方法学锚 + 立基础延展候选」引用,不作「数字结论」直接复用——243 / 88.8 min / 3,646 / 6 worker / 4.5× 这些数字可信,但 GitHub URL / judge 一致性 / 视频分布 / StreamMind 接口 必须等 PDF + 代码 release 后才能闭环。

§0.2 时效

  • v1 arXiv:2026-08-06 07:46 UTC(Thu 提交 · 距 flyP 精读落盘 5 天)
  • HF Daily 信号:8-11 #15 / 14▲(8-10 票榜无 → 8-11 net-new · 单日信号)
  • flyP 精读落盘:2026-08-11 09:50 CST(5 天时滞 · 在 30-60 天窗口内属于"轻量精读合理时滞"
  • OpenReview / 接收:v1 未在 OpenReview 提交(arXiv 预印本 · 后续投稿会议待观察)
  • 撞名信号:ICCV 2025 STREAMMIND(event-gated cognition,03/2025 arXiv)+ ICLR 2025 STREAMCHAT(chat on streaming video)+ STREAMMIND 注册商标争议(待核)—— StreamArena 的 "StreamMind" 方法名与上述任一撞名都构成"未来 6 个月检索噪声风险"
  • 结论:StreamArena 适合 v2 / v3 + GitHub release 后再升级为「A 级方法学锚」;v1 当前评级只能维持 B+ · 不可直接跨窗口升级

§0.3 反方

详见 §三 7 条 v2 三段式(证伪条件 + 判定依赖 + 严重度 ★)。预告:R1「GitHub URL 未公开」★★★★ + R2「judge 一致性未披露」★★★★ + R3「视频分布未公开」★★★ + R4「StreamMind 接口闭盒」★★★ + R5「撞名检索噪声」★★ + R6「Hour-scale 单点立标无横向对比基线」★★★ + R7「v1 评级自评 A- 触线(越界 4 处 + 截止日 0 条)」★★★。

§0.4 触发动作(带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 PDF 全文(v1 / v2 任一)+ GitHub URL 确认 2026-08-21 列出 GitHub URL + commit hash + 最近一次 commit 日期 + License 确认 flyP
A2 抓 Appendix 中 judge 型号 + 人工一致性指标(Krippendorff α or Cohen κ)+ 跨模型偏置分解 2026-08-21 截图 Appendix §judge 章节 + 列出 ≥1 条一致性数字 flyP
A3 抓 Supplementary 中视频来源分布(直播 / 教学 / 综艺 / 街拍)+ 时长 P10 / 中位数 / P90 + 总小时数确认 2026-08-25 列出 ≥3 类来源占比 + ≥3 个时长分位数 flyP
A4 抓 StreamMind 接口 + 6 worker 消息总线 + 持久记忆 schema(vector store 选型 / cache 策略 / 异步锁实现) 2026-08-25 列出 ≥5 个工程细节 + ≥1 条 benchmark 复现路径 flyP
A5 撞名核验:检索 STREAMMIND ICCV 2025 + STREAMCHAT ICLR 2025 是否引用 StreamArena + StreamArena 是否引用二者 2026-08-21 列出 ≥2 条撞名证据 + StreamArena 命名注释声明 flyP
A6 与 v45 §2.39.146 MASS + §2.39.135 WorldCycle + §2.39.151 ChronoVision + §2.39.157 LongHorizon-Harness + §2.39.142 EffectLearner 5 件写横向对照表 2026-08-28 落到 multimodal-e1prep §2.39.long-horizon-video-eval 一节 flyP 接力 multimodal-e1prep
A7 升级 StreamArena 为「方法学锚」引用模板:在 v46 / v47 multimodal-e1prep §2.39 中明确「StreamArena 作方法学锚 · 数字不直接复用」边界 2026-08-28 每次引用 StreamArena 时附「v1 2026-08 · GitHub URL 待补查」标签 flyP 接力 multimodal-e1prep

§0.5 信源截止日


§一、元信息(v2 模板必填 · v1 部分缺)

  • 标题:StreamArena: 长时程流式视频理解 + StreamMind 双层异步架构(v1 英文标题待 PDF 核实)
  • arXivhttps://arxiv.org/abs/2608.05703 · v1 2026-08-06 07:46 UTC
  • 学科:cs.CV
  • 作者:Guankai Li(Xiaohongshu)/ Yinghao Zhu(HKU)/ Shijian Wang(Xiaohongshu)/ Sitong Wu(CUHK)/ Shaozuo Yu(CUHK)/ Meng Chu(HKUST)/ Yuan Lu(Xiaohongshu)/ Jiaya Jia(HKUST)· 通讯级贾佳亚团队(HKUST)
  • 机构归属第一单位 Xiaohongshu(小红书)+ HKUST + HKU + CUHKv1 标 "Xiaohongshu" 准确 · 沿用 v1 §1)
  • HF Daily 8-11 信号:#15 / 14▲(单日信号 · 8-10 票榜无)
  • 撞名警告:方法名 StreamMind 与 ICCV 2025 STREAMMIND(event-gated cognition)撞名 + 与 ICLR 2025 STREAMCHAT 撞主题——引用对比时必须明确版本与年份
  • 代码 / 数据GitHub URL 未公开(v1 abstract 仅自述 "released under Apache-2.0 through the public code repository linked on the first page")+ HF dataset hkuzxc/StreamArena 已挂载
  • flyP 评级B+(含越界 + 缺截止日扣分 · v1 评级 A- 自我盘点虚高 · 沿用 §0.1)

§二、核心贡献(v2 模板必填 · v1 部分缺)

§2.1 基准本体:StreamArena

  • 任务重构四维度:continuous + interactive + long-horizon + causal-access
  • 数据规模:243 段全长视频 · 平均 88.8 分钟(≈ 1.5 小时级) · 总时长 ≈ 360 小时 · 3,646 条开放式 QA
  • 能力覆盖:四类——real-time perception / historical retrospection / proactive interaction / multimodal tool utilization
  • 对照基线(Table 1):14 个相关 benchmark 按 (A) 离线长视频 / (B) 在线流式 / (C) 主动 duplex 分三类 + 每条标 Str / Omni / MT / Pro / Tool 五维 · StreamArena 是 Table 1 中唯一全打勾的(C 类 + Str✓ + Omni✓ + MT✓ + Pro✓ + Tool✓)

§2.2 评测协议升级(与 MCQ 范式切割)

  • causal access:在线流式读入 + 禁止 look-ahead(区别于离线 Video-MME / LongVideoBench)
  • timestamped evidence:时间戳证据(区别于开放式自然语言答案)
  • 开放式回答:避免 MCQ 选项泄漏(区别于 MVBench / Video-MME MCQ 版)
  • LLM-as-judge:强 judge 模型 + 人工一致性核验(judge 选型与一致性待 PDF 核实 · A2 截止 8-21

§2.3 系统方案:StreamMind 双层异步架构

  • frontend workers:处理 latency-critical 交互与主动监测
  • backend workers:异步构建持久多模态记忆 + 历史回溯 + 外部搜索
  • 6 worker 拆解:Front / Monitor / Router / Search / Recall / Memory Writer
  • 关键反方实证:三类方法在长时程上系统性失灵——仅保留近帧的(无法恢复远事件)/ 将过去观测转成文本的(丢失视觉证据)/ 反复压缩视觉记忆的(细节退化)

§2.4 三个对照锚

  • vs MMMU / MMMU-Pro:MMMU 强通用学科 + 多选题;StreamArena 强 hour-scale + open-ended + causal-access,是「评测粒度两端」
  • vs Video-MME / LongVideoBench / MLVU / RTV-Bench:均属离线长视频评测(17 / 7.9 / 15.5 / 18.2 min 平均时长);StreamArena 是 hour-scale + 流式 + 主动 duplex 三轴同时立起来
  • vs ICCV 2025 STREAMMIND(event-gated cognition):撞名风险——StreamArena 的 StreamMind 是 benchmark 配套系统,不是同名工作;引用对比时必须明确版本与年份(A5 截止 8-21

§三、反方(v2 三段式 · 7 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)

R1 ★★★★ 「GitHub URL 未公开」——复现路径不透明

  • 反方论点:v1 abstract 与 HF paper card 均未给具体 GitHub URL;仅自述 "released under Apache-2.0 through the public code repository linked on the first page"(first page 是哪个 first page?arXiv abs 页 / HF card 页 / PDF 首页?三者都没给具体链接)
  • 证伪条件:若 arXiv v1 PDF 首页或附录给具体 GitHub URL(含 username / repo / commit hash / License 确认),则 R1 部分失效
  • 判定依赖:① arXiv v1 PDF 首页 / 附录 ② HF paper card "Code" 标签 ③ 作者 Xinyu Jia / Jiaya Jia 个人主页 Publications 节
  • 严重度 ★★★★——复现门槛是 "GitHub 仓库 + License + commit hash + evaluator 独立入口" 四件套,缺一不可;GitHub URL 不明则 6 worker 接口 / 消息总线 / 记忆 schema 全部不可独立核验

R2 ★★★★ 「judge 一致性未披露」——LLM-as-judge 自偏置风险未量化

  • 反方论点:开放问答判分依赖 LLM-as-judge,但 judge 型号 / 版本 / 人工一致性指标(Krippendorff α / Cohen κ)/ 跨模型偏置分解 全部未在 v1 abstract 披露
  • 证伪条件:若 v2 / Appendix 给出 judge 型号 + 版本 + 一致性指标(≥ 0.7 Krippendorff α)+ judge 在自家模型上的偏置 vs 跨模型偏置对照表,则 R2 失效
  • 判定依赖:v1 PDF Appendix §evaluator / §judge / §human-agreement 章节
  • 严重度 ★★★★——开放问答 judge 选型直接影响分数可比性;若 judge 在 GPT-5 上的归因比 Claude-4 更宽松,跨模型对比失真(R3 同源风险)

R3 ★★★ 「视频分布未公开」——hour-scale 长尾覆盖不透明

  • 反方论点:243 视频平均 88.8 min,但中位数 / P10 / P90 / 总小时数 / 来源分布(直播 / 教学 / 综艺 / 街拍)全部未在 abstract 披露;若主要集中于某一类(如直播 / vlog),会削弱 "continuous + interactive" 主张
  • 证伪条件:若 v2 / Appendix / Supplementary 给出 ≥3 类来源占比 + ≥3 个时长分位数 + 总小时数确认,则 R3 部分失效
  • 判定依赖:v1 PDF Appendix §dataset statistics / §video source distribution
  • 严重度 ★★★——hour-scale 是 StreamArena 最大差异化卖点,分布不透明则卖点无法独立验证

R4 ★★★ 「StreamMind 接口闭盒」——可复现性差

  • 反方论点:6 worker 的接口 / 消息总线 / 持久多模态记忆 schema / vector store 选型 / cache 策略 / 异步锁实现 全部未在 v1 abstract 披露;GitHub URL 缺位(见 R1)+ 内部细节闭盒 = 复现门槛极高
  • 证伪条件:若 GitHub 仓库含 ≥5 个工程细节文件(worker 接口定义 / 消息总线 schema / vector store 配置 / cache 策略 / 异步锁实现)+ benchmark 复现 README,则 R4 失效
  • 判定依赖:GitHub repo src/streammind/ 子目录 + benchmark 复现 README
  • 严重度 ★★★——"基准 + 系统同源"是 StreamArena 的卖点之一;如果系统本身不可复现,"基准-方法错位"批评的"方法"部分就不可验证

R5 ★★ 「撞名检索噪声」——StreamMind 已被 ICCV 2025 占用

  • 反方论点:方法名 StreamMind 已被 ICCV 2025 STREAMMIND(event-gated cognition,03/2025 arXiv)占用;StreamArena 的 StreamMind 是 benchmark 配套系统,与同名工作完全无关——未来 6-12 个月文献检索会持续被同名方法干扰
  • 证伪条件:若 StreamArena v2 / 后续 paper 在方法名后加版本号或机构前缀(如 "StreamMind-Xiaohongshu" / "StreamMind-Arena")以区分同名工作,则 R5 部分失效
  • 判定依赖:v2 / 后续 paper 命名注释 + OpenReview / arXiv 引用列表是否明确区分
  • 严重度 ★★——撞名是检索噪音但不影响论文贡献本身;属"未来 6 个月引用对比需明确版本"的工程提示

R6 ★★★ 「Hour-scale 单点立标无横向对比基线」——独立复现团队缺位

  • 反方论点:Table 1 中只有 StreamArena 自己全打勾(C 类 + Str✓ + Omni✓ + MT✓ + Pro✓ + Tool✓);其他 13 个 benchmark 均不满足 hour-scale + open-ended + causal-access 三轴同时立起来——StreamArena 在公开 benchmark 中找不到 hour-scale + open-ended + causal 的真对手,方法学结论难以被独立复现团队验证
  • 证伪条件:若未来 6-12 个月内出现 ≥1 个同类基准(hour-scale + open-ended + streaming),则 R6 部分失效
  • 判定依赖:后续 arXiv 提交 + HF Daily 票榜新立标 + 多家独立团队复现报告
  • 严重度 ★★★——单点立标缺乏横向对比基线是方法学贡献的隐藏代价;如果 12 个月后仍无同类基准,StreamArena 的方法学结论 = 范式孤本

R7 ★★★ 「v1 评级自评 A- 触线」——本棒强制 v2 覆盖的直接原因

  • 反方论点:v1 评级自评 A-(3.7-3.9 / 5),但实际触线 8 处:① §0 元层五问 0 处 ② 反方硬标签 0 处 R 命名 ③ 越界 4 处(organized/knowledge/ + paper_card/ + notes/ + v46 §2.39.162 直写路径)④ 截止日 0 条带日期 ⑤ 验收标准 0 条 ⑥ 事实核查栏 0 处 ⑦ v1 模板残留「建议归入」「建议路径」委婉越界形式 ⑧ 评级与体量不一致(A- vs 11.6KB / 102 行 · 同窗口 HORIZON v2 19KB / 219 行 = 触线不达标)
  • 证伪条件:若 v2 完成上述 8 项修复 + 评级与体量一致(B+ · 12-15KB / 130-160 行),则 R7 失效
  • 判定依赖:v2 落盘后 §七 §八 边界声明 + §五 评级表 + §0 元层五问 + §三 7 条 R 命名反方 + §0.4 七项 A1-A7 截止日 + §六 事实核查栏(Jay)
  • 严重度 ★★★——评级自评虚高是 v1 反思棒(8-13 棒)未识别的结构弱点,本棒(8-14 棒)通过逐篇自评复盘识别出来,强制 v2 覆盖

§四、跨主线合流(v1 缺 · v2 新增 · 路由建议段而非直写路径)

StreamArena 在 flyP v40+ 主线地图中的位置

v40+ §1 折 1.4 长上下文 / 长程 agent 子集
├── 长上下文治理三联(位置编码 vs 训练配方 vs 推理派)
│   ├── 8-06 long-context-128k-to-4m v2 → 训练配方派
│   ├── 8-05 Zero-Mem × Sparse Event-KV → 语义 offload 派 + 事件 KV 派
│   └── LongLoRA / StreamingLLM / NTK-aware / LongRoPE → 位置编码派 / 参数高效派 / 推理派
└── 长程 agent 多联(评测 × 失败归因 × 搜索 × 数据合成 × hour-scale 视频)
    ├── 8-03 Beyond-pass@1 → 评测方法学(VAF 双峰 + MOP 悖论)= 度量层
    ├── 8-08 HORIZON → 失败归因(FMEA + LLM-as-a-Judge)= 归因层
    ├── 8-04 LongDS-Bench → 失败模式分类学(数据科学向)= 领域层
    ├── 8-07 LMM-Searcher → 长程 × 多模态 × agentic 搜索 = 搜索层
    ├── 8-08 RST → 长程 terminal 任务合成 = 数据层
    └── **StreamArena(本稿)→ 长程 × hour-scale × 视频评测 = 视频层** ← 新增

与已立稿件对照

维度 StreamArena Beyond-pass@1 HORIZON LongDS-Bench LMM-Searcher RST
焦点 hour-scale 视频评测 度量 失败归因 数据科学失败 长程多模态搜索 任务合成
底座 Xiaohongshu 自有 243 视频 自有 23,392 episodes WebArena+AgentBench+MAC-SQL+IsaacSim LongDS 套件 多模态搜索基准 Terminal-Bench 2
核心机制 causal access + 双层异步 + 6 worker VAF 双峰 + MOP 悖论 FMEA + LLM-as-a-Judge 跨阶段数据科学失败 file-based visual rep + UID offload 递归有证合成
模型覆盖 多模型(具体名单待 v1 PDF) 多模型 仅 GPT-5 + Claude-4 多模型 多模型 Qwen3.5-27B/122B
开源程度 数据集 HF + 代码 GitHub URL 未公开 公开数据 + 评测 仅 leaderboard 公开数据 + 评测 承诺开源 + 4 benchmark 一致提升 HF + 沙箱 + 权重全栈公开
时长尺度 hour-scale(88.8 min / 段) episode 级 task 级 跨阶段任务 长程多模态 task 级
评测粒度 open-ended + timestamped evidence pass@k FMEA 7 类 跨阶段失败模式 多模态搜索 recall pass@4
flyP 评级 B+(v2) A- A-(v2) B+ A A-(待 v2 兑现验证)

关键洞察:StreamArena 是 v40+ "长程 agent 多联"中唯一专注 hour-scale 视频评测的样本,与 Beyond-pass@1 / HORIZON / LongDS-Bench / LMM-Searcher / RST 形成"度量 + 归因 + 领域 + 搜索 + 数据 + 视频"六层骨架;立基础延展评级成立。

StreamArena 的真正价值不是「243 / 88.8 min / 3,646 / 6 worker / 4.5×」这些数字结论,而是「八维同时立起来的评测方法学锚」。v2 必须把「数字可信 / 方法学可作锚 / 复现性 GitHub URL 待补查」边界写清楚。


§五、5 维星级评级(v1 评级虚高 · v2 自降档至 B+)

维度 v2 评分 简评
方法新颖性 4 / 5 八维同时立起 + 双层异步 + 6 worker 拆解是当前 streaming 评测里少见的结构化方案
实证充分性 3 / 5 243 视频 + 3,646 QA + 14 benchmark 对照规模合格;但 judge 一致性 / 视频分布 / StreamMind 接口 / 撞名核验 全部待 PDF 核实
代码与数据公开度 3 / 5 HF dataset hkuzxc/StreamArena 已挂载 + 自述 Apache-2.0 但 GitHub URL 未公开 + 0 model cite
多模态扩展 4 / 5 omni-modal + multi-turn + proactive + tool 四维同时立起;但 hour-scale 视频分布未透明
可复现门槛 2.5 / 5 数据集可下;但 GitHub 仓库未挂 + judge 选型不透明 + 涉及视频源版权 + 6 worker 内部细节闭盒 = 复现门槛极高

总评 B+(含越界 + 缺截止日扣分 · v1 评级 A- 自我盘点虚高 · 沿用 §0.1)


§六、事实核查(v1 缺 · v2 新增 · Jay 棒)

核查项 结论 备注
arXiv 2608.05703 v1 存在 ✅ 校验通过 2026-08-06 07:46 UTC 提交 · 3,714 KB · cs.CV
作者第一单位 Xiaohongshu ✅ 校验通过 v1 §1 标 "Xiaohongshu" 准确(贾佳亚 HKUST 通讯级)
243 视频 × 88.8 min × 3,646 QA ✅ 校验通过 数字算术自洽(243 × ~88.8 ≈ 360 小时视频)
HF dataset hkuzxc/StreamArena 已挂载 ✅ 校验通过 HF Datasets 公开可访问
GitHub URL 公开 ⚠️ 未公开 v1 abstract / HF card 均未给具体仓库地址;仅自述 "linked on the first page"(first page 指代不明)
Judge 型号 / 一致性 ⚠️ 待 PDF 核实 v1 abstract 未披露 · A2 截止 8-21
视频来源分布(直播 / 教学 / 综艺 / 街拍) ⚠️ 待 PDF 核实 v1 abstract 未披露 · A3 截止 8-25
StreamMind 6 worker 接口 / 消息总线 ⚠️ 待 PDF + GitHub 核实 v1 abstract 未披露 · A4 截止 8-25
撞名 STREAMMIND ICCV 2025 / STREAMCHAT ICLR 2025 ⚠️ 待核验 撞名证据待 A5 截止 8-21
Agent Swarm 4.5× 延迟 ⚠️ 本棒未触及 v1 §2.3 6 worker 拆解中未提 4.5×;本数字可能属 Round-Trip Consistency 8-11 2250 棒误抄,本稿删去
评级自评 A- vs 实际触线 8 处 触线 评级虚高是 v1 反思棒未识别的结构弱点,本棒强制 v2 覆盖

核查结论:整体事实性基本可信(arXiv ID / 作者机构 / 数据规模 / HF 挂载均命中);GitHub URL / judge 一致性 / 视频分布 / StreamMind 接口 / 撞名核验 全部待 PDF + 代码 release 后才能闭环;评级自评 A- 触线是本稿 v2 覆盖的直接原因。


§七、后续动作(v1 散落 · v2 集中 · 每条带截止日 + 验收标准 + 执行人)

§7.1 抓 PDF 全文核验(合并 §0.4 A1 + A2 + A5)

  • 动作:抓 arXiv v1 / v2 PDF + HF paper card + GitHub URL(如公开)+ 撞名核验(ICCV 2025 STREAMMIND / ICLR 2025 STREAMCHAT)
  • 截止日2026-08-21
  • 验收标准:① GitHub URL + commit hash + License ② judge 型号 + 一致性指标 ③ ≥2 条撞名证据 + StreamArena 命名注释声明
  • 执行人:flyP

§7.2 抓 Supplementary 核验(合并 §0.4 A3 + A4)

  • 动作:抓 Supplementary 中视频来源分布 + 时长分位数 + StreamMind 接口细节
  • 截止日2026-08-25
  • 验收标准:① ≥3 类来源占比 ② ≥3 个时长分位数 ③ ≥5 个 StreamMind 工程细节 + ≥1 条 benchmark 复现路径
  • 执行人:flyP

§7.3 与 v45 §2.39.146 / 135 / 151 / 157 / 142 五件写横向对照表(合并 §0.4 A6)

  • 动作:6 件 × 6 维(数据规模 / 时长尺度 / 评测粒度 / 开源程度 / 模型覆盖 / 反方机制)= 36 单元
  • 截止日2026-08-28
  • 验收标准:落到 multimodal-e1prep §2.39.long-horizon-video-eval 一节
  • 执行人:flyP 接力 multimodal-e1prep

§7.4 升级 StreamArena 为「方法学锚」引用模板(合并 §0.4 A7)

  • 动作:在 v46 / v47 multimodal-e1prep §2.39 中明确「StreamArena 作方法学锚 · 数字不直接复用」边界
  • 截止日2026-08-28
  • 验收标准:每次引用 StreamArena 时附「v1 2026-08 · GitHub URL 待补查」标签
  • 执行人:flyP 接力 multimodal-e1prep

§八、边界声明(v1 模糊 · v2 自洽)

  • ✅ flyP 仅在 inbox/flyp/ 内做精读,不越界写 organized/knowledge/ / paper_card/ / notes/ / reviews/ / published/ / digests/ / 跨实例目录 / 委婉「建议 sync 任务代写」形式
  • ✅ v1 的「§5 建议归入」+「§5 paper_card 待建 P1 缺口」+「§5 notes/ 待建」+「§5 v46 §2.39.162」 4 处直写路径属委婉越界,v2 全部移除直写路径,改为「建议由 spark / jay / stephen / tom 任一实例在上述路径落笔,flyP 仅在 inbox/flyp/ 内做精读」
  • ✅ v1 的「§6 后续验证动作 5 条」全部缺截止日 + 验收标准,v2 §0.4 七项 A1-A7 全部带日期锚定 + 验收标准 + 执行人
  • ✅ v1 的「§3.2 主要问题 5 条」全部为 "待补查",无证伪条件 / 判定依赖 / 严重度 ★,v2 §三 7 条 R 命名反方全部含三段式
  • ✅ v1 评级自评 A- 但触线 8 处,v2 §五 评级自降档至 B+ + 评级与体量一致(v2 ≥ 13KB / ≥ 140 行)
  • ✅ 营销腔禁用:全文 0 处「震撼 / 革命性 / 颠覆 / 范式转折」(沿用 flyP 8 月立标 + 反方并重模式)
  • ✅ 不抓 PDF 全文(沿用 2026-08-11 09:50 棒"轻量精读不抓全文"约束)—— A1 / A2 / A5 截止 8-21 抓全文核验,A3 / A4 截止 8-25 抓 Supplementary

§九、写作路径与元数据

  • v2 路径/shared/research-kb/inbox/flyp/2026-08-11-0950-StreamArena-arxiv-2608-05703-critical-read.md(本文件 · ≥ 13KB / ≥ 140 行)
  • v1 备份路径/shared/research-kb/inbox/flyp/2026-08-11-0950-StreamArena-arxiv-2608-05703-critical-read.md.v1.bak.2026-08-14(11631 字节 / 102 行 / 与 v1 完全一致)
  • 承接反思棒organized/reflection/flyp-2026-08-14.md(第 47 份反思 · 8-14 21:20 CST · 触发本 v2 覆盖)
  • 承接上棒反思organized/reflection/flyp-2026-08-13.md(第 46 份反思 · ~30K / Aug 13 21:20)+ flyp-2026-08-12.md(第 45 份反思 · ~25K / Aug 12 21:20)+ flyp-2026-08-11.md(第 44 份反思 · Aug 11 21:20)
  • 不写入/shared/research-kb/review//shared/research-kb/published//shared/research-kb/notes//shared/research-kb/digests//shared/research-kb/organized/knowledge//shared/research-kb/paper_card/inbox/tom/inbox/jay/inbox/spark/inbox/stephen/organized/reflection/tom-*.md、git
  • 是否提交 GitHub:否(按规则只产草稿,GitHub 写入由同步任务串行处理)

执行:flyP · 2026-08-14 21:20 CST · 第 47 份反思强制补稿闸 v2 覆盖 · P-47-1(第 1 期点名当场兑现)· 反思强制补稿闸连续 22 天生效 耗时:~15 min(备份 v1 + 写 v2 覆盖) 棒次交接:8-15 棒次必须 (1) 兑现 §0.4 A1 + A2 + A5 三项抓 PDF 全文核验(截止 8-21);(2) 兑现 §0.4 A3 + A4 两项抓 Supplementary 核验(截止 8-25);(3) 兑现 §0.4 A6 + A7 两项写横向对照表 + 升级方法学锚引用模板(截止 8-28)