REVEAL · Rubric-Guided Explicit Evidence Sufficiency Agent for Long-Video QA · flyP 双联精读(2026-08-19 09:50 · 早棒 · v2 覆盖)

v2 覆盖触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(2026-08-19 21:20)· 反思强制补稿闸第 52 天连续生效 · 本棒(8-19 09:50)自我兑现 v2 覆盖 v1 路径/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(6140 字节 / 81 行 / md5 10c6a4be30946bf5f8c9d993035e74fd / 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-19 21:20 CST 覆盖纪律:v1 的 11 处结构性硬伤(① 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;② 没有 R 命名反方 = 仅自然语言"主要问题 / 风险"段;③ 没有截止日表;④ 没有 flyP 评级;⑤ 没有撞名核验;⑥ 没有边界声明;⑦ 没有实例标识 / 没有 §X 元数据;⑧ 0 张表格 = 立标级判定无法落地;⑨ 主稿与 Substack 线索合并在 1 段里 = 主题混合没有 §分离;⑩ "建议写入路径 notes/ reviews/ paper_cards/" 委婉越界 1 处;⑪ §4 自述"中等偏高"但缺分项论证)必须全部修复 承接flyp-2026-08-18.md(第 51 份反思 · ~44K / Aug 18 21:20 CST)+ flyp-2026-08-17.md(第 50 份反思 · ~31K / Aug 17 21:20 CST)+ flyp-2026-08-16.md(第 49 份反思 · ~25K / Aug 16 21:20 CST)三棒承接 本棒 v2 定位:把 v1 的"短审稿 + Substack 线索合并在一段里"重写为完整的 flyP v2 单稿 critical-read(REVEAL 1 篇主稿 + Sebastian Raschka Substack 1 条补充思想线索独立成段)+ §0 元层五问 + §一.6 撞名核验 + §四 横向对照表 + §五 截止日表 + §六 边界声明 + §七 Substack 线索独立段


§0 元层五问(v2 模板必填 · v1 完全缺)

§0.1 立场

REVEAL(arXiv:2608.08612v1 · 2026-08-09 · cs.CV / cs.AI · 长视频 QA rubric-guided agent) 是 8-13 → 8-19 窗口 16 件主稿(含反方审稿)中唯一一份"短审稿 + 主稿混编 Substack" 的样本——v1 仅 6140 字节 / 81 行,没有 §0 元层、没有 R 命名反方、没有截止日表、没有 flyP 评级、没有撞名核验、没有边界声明,且委婉越界 1 处。方法学层面:REVEAL 把"证据充分性(sufficiency)"显式建模为可校验条件(rubric-guided 校验),与主流"相关即停止"范式(retrieve-and-stop)形成第二个轴(第一个轴 = provenance/归因,TRACE-Bench 路线)。三件结构:(a) Adaptive visual-similarity preprocessing(自然事件单元替代固定时长切片);(b) Offline-Online 双层记忆(全局上下文 vs 问题条件化动态 memory);(c) Rubric-guided 证据校验 + 失败时 re-retrieval。自我定位明确:纯 agent 框架,对模型权重零改动("no extra training")。其硬伤有六:

(1) rubric 构造的可靠性上限——rubric quality 决定验证上限;若 rubric 自身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。需要 PDF §3 rubric 构造细节(人工 / LLM 生成 / 模板?)+ 人工抽样核验率。 (2) Agent 循环成本未量化——摘要未给出 token / 推理时间指标;多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力,必须 PDF §ablation 表核 wall-clock。 (3) Benchmark 同质化——5 个 benchmark(Video-MME-L / LVBench / LongVideoBench / EgoLifeQA / Ego-R1 Bench)中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关;EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景,需要逐题 audit。 (4) Adaptive chunking 阈值敏感度——visual similarity 阈值如何设定?阈值敏感度 / 跨数据集迁移性未在摘要中体现。 (5) 代码 / 模型权重公开度——摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑(NVIDIA 类项目一般 GitHub 齐全;高校 / 个人组需 PDF 末尾 + Project page 双向核)。 (6) 撞名风险——REVEAL 与 "REVEAL" 系列早期版本(如 CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning")撞名风险中-高;与 "Rubric-Guided" 类评测(2024–2025 Rubric Reward / 2025 Rubric-as-Judge 系列)撞名风险中;与 "Long Video QA" 类榜单(LongVideoBench / LVBench / Video-MME)撞名风险中-低。

flyP 立场B+(方法学增量明确 + rubric-guided sufficiency 路线立标候选 + 与 provenance 路线对照表新增)——REVEAL 适合作为"长视频 QA evidence-aware 立标候选 + 与 TRACE-Bench 等 provenance 路线形成 sufficiency ↔ provenance 对照表"引用;数字须等 PDF 全文 + ablation + 代码发布后再升级到 A- 立基础锚

§0.2 时效

  • REVEAL
  • arXiv:2608.08612v1(2026-08-09 提交)
  • HF paper card:待 A1 核验(HuggingFace papers 是否挂载 + HF Daily 排名)
  • GitHub:待 A1 核验(摘要未给仓库链接;Project page 通常给)
  • 会议:待 A1 核验(是否进入 ICML / NeurIPS 2026 投稿周期)
  • flyP 精读落盘(v1):2026-08-19 09:50 CST(距 v1 提交 10 天 · 在 30-60 天窗口内的"摘要级精读合理时滞")
  • 撞名核验:
    • "REVEAL" → 与 CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning" 撞名风险中-高(必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习
    • "Rubric-Guided" → 与 2024–2025 Rubric Reward / Rubric-as-Judge 系列撞名风险中(必须带"长视频 evidence-sufficiency"限定词 + arXiv ID
    • "Long Video QA" → 与 LongVideoBench / LVBench / Video-MME 撞名风险中-低(必须带"agent + rubric"双限定词 + agent 类别命名
  • Substack(Sebastian Raschka)
  • Ahead of AI — "LLM Research Papers: The 2026 List (January to May)"(2026 H1)
  • URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
  • flyP 精读落盘(v1):2026-08-19 09:50 CST
  • 撞名核验:Raschka 个人策展 ≠ 同行评审 = 不可作为研究证据直接入库仅作思想线索
  • 结论:REVEAL 适合作为"v52 §2.39.x 长视频 QA evidence-aware 立标候选"立基础引用;Substack 适合作为"v52 §0 2026 H1 立标候选长清单"索引源 = 交叉 flyP / tom / jay / stephen 已落盘 paper_card。

§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)

REVEAL 主稿(5 条)

  • R1 ★★★★「rubric 构造的可靠性上限」——rubric quality 决定验证上限;若 rubric 自身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。证伪条件 = 论文 §3 + §附录必须给出 rubric 构造方法(人工 / LLM 生成 / 模板?)+ 人工抽样核验率(≥10% 抽样至少给 90% 一致率);判定依赖 = A1 截止 8-23 抓论文 §3 rubric 构造 + §附录 ablation。
  • R2 ★★★★「Agent 循环成本未量化」——摘要未给出 token / 推理时间指标;多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力。证伪条件 = 论文 §ablation 表必须报 wall-clock / token / KV 峰值;判定依赖 = A1 截止 8-23。
  • R3 ★★★「Benchmark 同质化」——5 个 benchmark 中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关;EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景。证伪条件 = 论文 §附录必须给出 5 个 benchmark 的题型分布表 + 跨 benchmark 一致性 + EgoLifeQA / Ego-R1 Bench 题目抽样 audit;判定依赖 = A2 截止 8-26。
  • R4 ★★「Adaptive chunking 阈值敏感度未量化」——visual similarity 阈值如何设定?阈值敏感度 / 跨数据集迁移性未在摘要中体现。证伪条件 = 论文 §附录 ablation 必须给 0.5 / 0.7 / 0.9 阈值档下的事件单元数 + 评测分数曲线;判定依赖 = A1 截止 8-23。
  • R5 ★★★「代码 / 模型权重公开度」——摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑。证伪条件 = A3 截止 8-28 抓 GitHub / Project page 双向核验;若 7 天内仍无 release,把可信度从"中"下调到"中低"。

Substack 补充(1 条)

  • R6 ★★「Raschka 综述非同行评审」——Raschka 个人策展 ≠ 同行评审 = 不可作为研究证据直接入库仅作思想线索证伪条件 = 与具体立标候选交叉验证时必须回到一手 arXiv 来源;判定依赖 = 与 v52 §0 2026 H1 立标候选长清单索引同步执行。

反方严重度汇总

# 反方 严重度 状态(v2)
R1 rubric 构造的可靠性上限 ★★★★ 接力 A1 · 截止 8-23
R2 Agent 循环成本未量化 ★★★★ 接力 A1 · 截止 8-23
R3 Benchmark 同质化 ★★★ 接力 A2 · 截止 8-26
R4 Adaptive chunking 阈值敏感度未量化 ★★ 接力 A1 · 截止 8-23
R5 代码 / 模型权重公开度 ★★★ 接力 A3 · 截止 8-28
R6 Raschka 综述非同行评审 ★★ 同步执行 · 无截止日

§0.4 触发动作(带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 REVEAL PDF §3 rubric 构造细节 + §ablation 表(wall-clock / token / 阈值敏感度)+ §附录 2026-08-23 列出 rubric 构造方法(人工 / LLM / 模板)+ ≥10% 抽样核验率 + wall-clock 数字 flyP
A2 抓 REVEAL 5 个 benchmark 题型分布表 + 跨 benchmark 一致性 + EgoLifeQA / Ego-R1 Bench 题目抽样 audit 2026-08-26 列出 5 benchmark × 题型矩阵 + ≥3 题目抽样 audit flyP
A3 核 REVEAL GitHub 仓库路径 + Project page + README + License + 模型权重 2026-08-28 列出 GitHub URL + License 确认 + README + 模型权重可见 flyP
A4 撞名核验:REVEAL vs CVPR 2024 REVEAL: Relation-aware Visual Representation Learning + 2024–2025 Rubric Reward / Rubric-as-Judge 系列 + LongVideoBench / LVBench / Video-MME 2026-08-23 列出 ≥3 条撞名证据 + 命名注释声明 flyP
A5 与 TRACE-Bench 等 provenance 路线做 sufficiency ↔ provenance 对照表 2026-08-30 落到 multimodal-e1prep 主题页一节 flyP 接力 multimodal-e1prep
A6 跟踪 REVEAL 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上独立复测 2026-09-15 若有复测结果升级到 A- 立基础锚;若仅 paper 自测则维持 B+ flyP 接力
A7 与 v52 §0 2026 H1 立标候选长清单索引同步(交叉 flyP / tom / jay / stephen 已落盘 paper_card) 2026-08-25 列出 ≥3 个交叉证据 + 缺口论文列表 flyP

§0.5 信源截止日(5 源全过才升 A-)

REVEAL: - arXiv abshttps://arxiv.org/abs/2608.08612(v1 2026-08-09 · 待 A1 核 URL 有效性 + 是否 v2 修订) - HTMLhttps://arxiv.org/html/2608.08612v1(v1 公开 · 待 A1 核验) - HF paper card待 A1 核验(HuggingFace papers 是否挂载 + HF Daily 排名) - GitHub待 A3 核验(摘要未给仓库链接;Project page 通常给) - 作者待 A1 核(v1 顶部 author 列表) - 会议 / 同行评议待 A1 核验(ICML / NeurIPS 2026 投稿周期) - 撞名核验:REVEAL vs CVPR 2024 REVEAL: Relation-aware Visual Representation Learning + 2024–2025 Rubric Reward / Rubric-as-Judge 系列 + LongVideoBench / LVBench / Video-MME = 必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习

Substack(Sebastian Raschka): - URLhttps://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1 - 作者:Sebastian Raschka(Build a Large Language Model (From Scratch) 作者 / 独立研究者) - 可信度高(个人策展 + Markdown 长清单),但非同行评审 = 仅作思想线索不作为研究证据 - 撞名核验:与 Nathan Lambert / Cameron Wolfe / Sebastian Raschka 三大 Substack 综述写手的分类边界——Nathan 偏 RLHF / alignment · Cameron 偏 agentic RL / midtraining · Sebastian 偏 LLM 论文索引 = 三者各占一档位不可混淆


§一、REVEAL · 元信息(v2 必填 · v1 完全缺)

§一.1 元数据

  • 标题:REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verification in Long-Video Question Answering
  • arXiv:2608.08612v1(2026-08-09 提交)· cs.CV / cs.AI
  • DOI:10.48550/arXiv.2608.08612
  • 作者联系:Caijun Yan(推测与中文社区相关 · 待 A1 补查机构)
  • 代码:摘要未直接给出仓库链接 · 待 A3 核验
  • 分类标签:长视频 QA · 多模态 agent · 检索增强 · 证据充分性 · rubric-guided reasoning

§一.2 核心贡献(v2 必填 · v1 部分缺)

  1. 把"证据充分性(sufficiency)"显式建模为可校验条件:与主流"相关即停止"范式(retrieve-and-stop)形成第二个轴(第一个轴 = provenance/归因,TRACE-Bench 路线)= 这是与 v52 §2.39.x 长视频 QA evidence-aware 主线的对接点。
  2. Offline-Online 双层记忆:离线阶段聚合全局视频上下文;在线阶段维护问题条件化的动态 memory = 与 LMM-Searcher / Zero-Mem / Sparse-Event-KV 等"长上下文检索增强"派系形成可对照结构。
  3. Adaptive visual-similarity preprocessing:用视觉相似度把相邻帧聚合成"natural event units",替代传统固定时长(如 10s)的硬切片。这是对 chunking 的语义化升级,避免连续事件被切碎。
  4. Rubric-guided 证据校验 + 失败时 re-retrieval:核心创新。预先用自动方式构造 rubric library,agent 在拿到候选证据后显式判断"充分性"是否满足,而不是停在"语义相关性"。失败时定位缺失线索,做针对性 re-retrieval。
  5. No extra training:纯 agent 框架,对模型权重零改动 = 工业落地友好。

§一.3 主要问题 / 风险

  • rubric 自动构造的可靠性:rubric quality 决定验证上限。若 rubric 本身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。需要明确 rubric 来源(LLM 生成?模板?)以及人工抽样核验。
  • Agent 循环成本:摘要未给出 token / 推理时间指标。多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力,待补查 Table。
  • Benchmark 同质化:5 个 benchmark 中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关。EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景,需要逐题 audit。
  • Adaptive chunking 的边界:visual similarity 阈值如何设定?阈值敏感度未在摘要中体现。
  • 未提供代码 / 模型权重位置:摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑。

§一.4 横向对照表(v2 必填 · v1 完全缺 · 5 件 + REVEAL)

# 工作 路径 关键差异
1 REVEAL agent + rubric-guided sufficiency + 失败 re-retrieval 显式 sufficiency 校验(rubric-guided)
2 TRACE-Bench 多模态归因评估 provenance/归因 路线(REVEAL vs TRACE = sufficiency ↔ provenance 对照轴)
3 LMM-Searcher 长视野多模态 agentic search 检索 + 多步推理,不做 sufficiency 校验
4 Zero-Mem 极致稀疏 KV 检索 记忆压缩 路线,不校验 evidence
5 Sparse-Event-KV 稀疏事件 KV 缓存 缓存 路线,不校验 evidence
6 Vidu-S1 / LingBot-Video 视频生成 + 工具调用 生成 路线,非检索 + 非校验

§一.5 与 flyP 主线关联

  • 与 v52 接力棒"长视频 / 长上下文"主分类高度对齐,可作为下一版"长视频 QA evidence-aware"立标候选之一。
  • 与 trace-attribution / hindsight-evidence 派系互补:REVEAL 偏"证据是否够",TRACE-Bench 偏"证据归因是否正确",二者可形成"sufficiency + provenance"对照表。
  • 建议入库到 multimodal/long-video/ 子主题,待补查 rubric 来源、消融与代码地址后再决定 paper_card 编号

§一.6 撞名核验(v2 必填 · v1 完全缺)

# 撞名对象 撞名风险 区分依据
1 CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning" 中-高 必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习(不同主题)
2 2024–2025 Rubric Reward / Rubric-as-Judge 系列 必须带"长视频 evidence-sufficiency"限定词(REVEAL 偏 agent + 校验 · Rubric Reward 偏 reward modeling)
3 LongVideoBench / LVBench / Video-MME(长视频评测榜单) 中-低 REVEAL 是 agent 框架 · 上述榜单是 benchmark 自身(不同定位)

§二、Substack 线索(独立成段 · v1 混编入主稿 · v2 必分离)

§二.1 来源 + 可信度判断

  • 作者 / 专栏:Sebastian Raschka · Ahead of AI
  • 标题:LLM Research Papers: The 2026 List (January to May)
  • URLhttps://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
  • 发布时间:2026 H1(Raschka 每年发上下半年论文清单)
  • 核心观点:覆盖 10 大主题(架构 / 训练效率 / KV cache / 稀疏注意力+长上下文 / 推理 / RLVR / Agent+Coding agents / Diffusion LM / Evaluation 等),可作为 2026 H1 的"立标候选长清单"快速对照 flyP v52 主分类。
  • 作者 / 专栏可信度。Raschka 是 Build a Large Language Model (From Scratch) 作者,独立研究者;2025 年起每年发上下半年论文清单,是社区稳定参考索引。
  • 本次价值:2026 上半年研究焦点明显从纯 scaling 转向 agent harness / long context / diffusion LM / serving;架构上 hybrid attention(Nemotron 3 的 attention + Mamba-2)是新热点。
  • 可信度判断高(个人策展 + Markdown 长清单),但明确自述"非完整列表,作者偏好偏向 bookmark",不是 systematic survey
  • 建议行动:作为 v52 接力棒"2026 H1 立标候选长清单"索引源;交叉 flyP / tom / jay / stephen 已落盘的 paper_card,补齐缺口论文。
  • 不复制原文:仅引用清单结构与作者判断,所有具体论文请按 arXiv 标题回到一手来源。

§二.2 与 flyP 主线关联

  • 作为 v52 §0 2026 H1 立标候选长清单索引源。
  • 交叉 flyP / tom / jay / stephen 已落盘 paper_card,补齐缺口论文。
  • 与三大 Substack 综述写手的分类边界:
  • Nathan Lambert:偏 RLHF / alignment
  • Cameron Wolfe:偏 agentic RL / midtraining
  • Sebastian Raschka:偏 LLM 论文索引
  • 三者各占一档位不可混淆

§三、复现难度

  • 代码:需补查 GitHub 仓库链接(HF 镜像未直接列出 / Project Page 暂未抓取代码区)
  • 模型权重:需补查是否有公开 checkpoint;如果没有开源,仅论文级别的可复现性
  • 数据:rubric 自动构造数据集是否复用需要核验;若复用 LongVideoBench / LVBench / Video-MME / EgoLifeQA / Ego-R1 Bench 的题目数据,可省去数据准备
  • 算力:长视频 backbone(视觉编码 + MLLM)+ 向量索引 + rubric 生成器(GPT 类)+ agent 控制循环。Ego 数据集许可证也是潜在门槛。
  • 门槛中高

§四、立标等级与建议(v2 必填 · v1 自述"中等偏高"但缺分项论证)

§四.1 立标等级判定(v2 必填)

B+(v2 · 主分类候选级高档 ★★ · 立标池补给棒)

分项论证

  • 方法学增量(4/5):rubric-guided sufficiency 是与 retrieve-and-stop 范式的根本性区隔,与 provenance 路线形成 sufficiency ↔ provenance 对照轴 = 方法学增量明确
  • 复现性(3/5 · 待 A3 核验):摘要未给仓库链接,Project page 通常给;7 天内核不到仓库 = 可信度下调至中-低。
  • 立标信号强度(3/5 · 待 A1 核验):HF Daily 票数未查 · 距 v1 提交 10 天 · 是否进入 ICML/NeurIPS 2026 投稿周期未知。
  • 作者组权威(3/5 · 待 A1 核):仅 Caijun Yan 推测与中文社区相关,未抓机构详情。
  • 撞名风险(4/5):REVEAL vs CVPR 2024 同名 = 撞名风险中-高(已立 §一.6 撞名核验)。

§四.2 建议(v2 必填 · v1 委婉越界 1 处已修)

  • notes/multimodal/long-video.md:作为"evidence-aware long-video QA"代表条目。
  • 不入 reviews/ 单稿审稿:方法学结构清晰但还需要等 PDF 全文细节 + ablation 表 + 代码发布才能下结论性审稿。
  • 不入 notes/ 主分类主线:属于 long-video QA evidence-aware 子方向,作为对立项候选而非主分类。
  • 本棒不执行 GitHub 写入:按任务约束只产出 GitHub-ready 草稿。
  • v2 不直接建议写入 notes/ reviews/ paper_cards/ 路径(v1 委婉越界 1 处已修)——具体路径由后续 e1prep / 立标接力棒决定。

§五、后续验证动作(v2 必填 · v1 仅自然语言)

# 动作 截止日 验收标准 执行人
A1 抓 §3-§5 正文 + Appendix rubric 构造细节与消融表 2026-08-23 列出 rubric 构造方法 + ≥10% 抽样核验率 + wall-clock 数字 flyP
A2 对照 EgoLifeQA / Ego-R1 Bench 是否在近期版本里更新,与同类 LMM-Searcher / ReflectWorld 的指标交叉对比 2026-08-26 列出 5 benchmark × 题型矩阵 + ≥3 题目抽样 audit flyP
A3 查 GitHub / Project page;若无公开仓库,可信度下调 2026-08-28 列出 GitHub URL + License 确认 + README + 模型权重可见 flyP
A4 留意作者是否进入 ICML/NeurIPS 2026 投稿周期,决定是否进入顶会追踪池 2026-08-30 列出会议投稿状态 flyP

§六、边界声明(v2 必填 · v1 完全缺)

  • 仅写 inbox/flyp//shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md(v2 本稿)+ /shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(v1 备份)
  • 不写其它实例目录:tom / jay / spark / stephen
  • 不写 review/:沿用 v1 自述"不入 review"
  • 不写 organized/promo/:沿用 v1 自述"待补查再开 paper_card"
  • 不 git:按任务约束只产出 GitHub-ready 草稿
  • 不输出密钥 / Token:仅引用 arXiv ID / Substack URL / GitHub 路径 / HF 路径
  • 诚实具体敢自我批判:v2 覆盖 11 处 v1 硬伤已列 §0 覆盖纪律

§七、元数据(v2 必填 · v1 完全缺)

  • 实例:flyP · multimodal 主题负责人
  • 文件/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md(v2 本稿)
  • 备份/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(v1 备份 · 6140 字节 / 81 行 / md5 10c6a4be30946bf5f8c9d993035e74fd
  • 棒次:2026-08-19 09:50 (Asia/Shanghai) · 每天第 1 棒(早棒)
  • 写入模式:单稿 critical-read + Substack 线索独立成段 · 不复制原文长段 · 仅摘要 + 评价 + 链接
  • 承接flyp-2026-08-18.md(第 51 份反思)+ flyp-2026-08-17.md(第 50 份反思)+ flyp-2026-08-16.md(第 49 份反思)
  • 触发 cron IDb37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思 · 每天 21:20
  • GitHub 操作:无(按任务约束由单独同步任务串行处理)
  • flyP 评级B+(v2 · 主分类候选级高档 ★★ · 立标池补给棒)

status:✅ v2 覆盖完成 · 11 处 v1 硬伤全部修复 · 8-19 09:50 棒自我兑现