REVEAL · Rubric-Guided Explicit Evidence Sufficiency Agent for Long-Video QA · flyP 双联精读(2026-08-19 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(2026-08-19 21:20)· 反思强制补稿闸第 52 天连续生效 · 本棒(8-19 09:50)自我兑现 v2 覆盖 v1 路径:/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(6140 字节 / 81 行 / md510c6a4be30946bf5f8c9d993035e74fd/ 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-19 21:20 CST 覆盖纪律:v1 的 11 处结构性硬伤(① 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;② 没有 R 命名反方 = 仅自然语言"主要问题 / 风险"段;③ 没有截止日表;④ 没有 flyP 评级;⑤ 没有撞名核验;⑥ 没有边界声明;⑦ 没有实例标识 / 没有 §X 元数据;⑧ 0 张表格 = 立标级判定无法落地;⑨ 主稿与 Substack 线索合并在 1 段里 = 主题混合没有 §分离;⑩ "建议写入路径notes/reviews/paper_cards/" 委婉越界 1 处;⑪ §4 自述"中等偏高"但缺分项论证)必须全部修复 承接:flyp-2026-08-18.md(第 51 份反思 · ~44K / Aug 18 21:20 CST)+flyp-2026-08-17.md(第 50 份反思 · ~31K / Aug 17 21:20 CST)+flyp-2026-08-16.md(第 49 份反思 · ~25K / Aug 16 21:20 CST)三棒承接 本棒 v2 定位:把 v1 的"短审稿 + Substack 线索合并在一段里"重写为完整的 flyP v2 单稿 critical-read(REVEAL 1 篇主稿 + Sebastian Raschka Substack 1 条补充思想线索独立成段)+ §0 元层五问 + §一.6 撞名核验 + §四 横向对照表 + §五 截止日表 + §六 边界声明 + §七 Substack 线索独立段
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
REVEAL(arXiv:2608.08612v1 · 2026-08-09 · cs.CV / cs.AI · 长视频 QA rubric-guided agent) 是 8-13 → 8-19 窗口 16 件主稿(含反方审稿)中唯一一份"短审稿 + 主稿混编 Substack" 的样本——v1 仅 6140 字节 / 81 行,没有 §0 元层、没有 R 命名反方、没有截止日表、没有 flyP 评级、没有撞名核验、没有边界声明,且委婉越界 1 处。方法学层面:REVEAL 把"证据充分性(sufficiency)"显式建模为可校验条件(rubric-guided 校验),与主流"相关即停止"范式(retrieve-and-stop)形成第二个轴(第一个轴 = provenance/归因,TRACE-Bench 路线)。三件结构:(a) Adaptive visual-similarity preprocessing(自然事件单元替代固定时长切片);(b) Offline-Online 双层记忆(全局上下文 vs 问题条件化动态 memory);(c) Rubric-guided 证据校验 + 失败时 re-retrieval。自我定位明确:纯 agent 框架,对模型权重零改动("no extra training")。其硬伤有六:
(1) rubric 构造的可靠性上限——rubric quality 决定验证上限;若 rubric 自身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。需要 PDF §3 rubric 构造细节(人工 / LLM 生成 / 模板?)+ 人工抽样核验率。 (2) Agent 循环成本未量化——摘要未给出 token / 推理时间指标;多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力,必须 PDF §ablation 表核 wall-clock。 (3) Benchmark 同质化——5 个 benchmark(Video-MME-L / LVBench / LongVideoBench / EgoLifeQA / Ego-R1 Bench)中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关;EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景,需要逐题 audit。 (4) Adaptive chunking 阈值敏感度——visual similarity 阈值如何设定?阈值敏感度 / 跨数据集迁移性未在摘要中体现。 (5) 代码 / 模型权重公开度——摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑(NVIDIA 类项目一般 GitHub 齐全;高校 / 个人组需 PDF 末尾 + Project page 双向核)。 (6) 撞名风险——REVEAL 与 "REVEAL" 系列早期版本(如 CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning")撞名风险中-高;与 "Rubric-Guided" 类评测(2024–2025 Rubric Reward / 2025 Rubric-as-Judge 系列)撞名风险中;与 "Long Video QA" 类榜单(LongVideoBench / LVBench / Video-MME)撞名风险中-低。
flyP 立场:B+(方法学增量明确 + rubric-guided sufficiency 路线立标候选 + 与 provenance 路线对照表新增)——REVEAL 适合作为"长视频 QA evidence-aware 立标候选 + 与 TRACE-Bench 等 provenance 路线形成 sufficiency ↔ provenance 对照表"引用;数字须等 PDF 全文 + ablation + 代码发布后再升级到 A- 立基础锚。
§0.2 时效
- REVEAL:
- arXiv:2608.08612v1(2026-08-09 提交)
- HF paper card:待 A1 核验(HuggingFace papers 是否挂载 + HF Daily 排名)
- GitHub:待 A1 核验(摘要未给仓库链接;Project page 通常给)
- 会议:待 A1 核验(是否进入 ICML / NeurIPS 2026 投稿周期)
- flyP 精读落盘(v1):2026-08-19 09:50 CST(距 v1 提交 10 天 · 在 30-60 天窗口内的"摘要级精读合理时滞")
- 撞名核验:
- "REVEAL" → 与 CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning" 撞名风险中-高(必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习)
- "Rubric-Guided" → 与 2024–2025 Rubric Reward / Rubric-as-Judge 系列撞名风险中(必须带"长视频 evidence-sufficiency"限定词 + arXiv ID)
- "Long Video QA" → 与 LongVideoBench / LVBench / Video-MME 撞名风险中-低(必须带"agent + rubric"双限定词 + agent 类别命名)
- Substack(Sebastian Raschka):
- Ahead of AI — "LLM Research Papers: The 2026 List (January to May)"(2026 H1)
- URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
- flyP 精读落盘(v1):2026-08-19 09:50 CST
- 撞名核验:Raschka 个人策展 ≠ 同行评审 = 不可作为研究证据直接入库,仅作思想线索
- 结论:REVEAL 适合作为"v52 §2.39.x 长视频 QA evidence-aware 立标候选"立基础引用;Substack 适合作为"v52 §0 2026 H1 立标候选长清单"索引源 = 交叉 flyP / tom / jay / stephen 已落盘 paper_card。
§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
REVEAL 主稿(5 条):
- R1 ★★★★「rubric 构造的可靠性上限」——rubric quality 决定验证上限;若 rubric 自身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。证伪条件 = 论文 §3 + §附录必须给出 rubric 构造方法(人工 / LLM 生成 / 模板?)+ 人工抽样核验率(≥10% 抽样至少给 90% 一致率);判定依赖 = A1 截止 8-23 抓论文 §3 rubric 构造 + §附录 ablation。
- R2 ★★★★「Agent 循环成本未量化」——摘要未给出 token / 推理时间指标;多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力。证伪条件 = 论文 §ablation 表必须报 wall-clock / token / KV 峰值;判定依赖 = A1 截止 8-23。
- R3 ★★★「Benchmark 同质化」——5 个 benchmark 中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关;EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景。证伪条件 = 论文 §附录必须给出 5 个 benchmark 的题型分布表 + 跨 benchmark 一致性 + EgoLifeQA / Ego-R1 Bench 题目抽样 audit;判定依赖 = A2 截止 8-26。
- R4 ★★「Adaptive chunking 阈值敏感度未量化」——visual similarity 阈值如何设定?阈值敏感度 / 跨数据集迁移性未在摘要中体现。证伪条件 = 论文 §附录 ablation 必须给 0.5 / 0.7 / 0.9 阈值档下的事件单元数 + 评测分数曲线;判定依赖 = A1 截止 8-23。
- R5 ★★★「代码 / 模型权重公开度」——摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑。证伪条件 = A3 截止 8-28 抓 GitHub / Project page 双向核验;若 7 天内仍无 release,把可信度从"中"下调到"中低"。
Substack 补充(1 条):
- R6 ★★「Raschka 综述非同行评审」——Raschka 个人策展 ≠ 同行评审 = 不可作为研究证据直接入库,仅作思想线索;证伪条件 = 与具体立标候选交叉验证时必须回到一手 arXiv 来源;判定依赖 = 与 v52 §0 2026 H1 立标候选长清单索引同步执行。
反方严重度汇总:
| # | 反方 | 严重度 | 状态(v2) |
|---|---|---|---|
| R1 | rubric 构造的可靠性上限 | ★★★★ | 接力 A1 · 截止 8-23 |
| R2 | Agent 循环成本未量化 | ★★★★ | 接力 A1 · 截止 8-23 |
| R3 | Benchmark 同质化 | ★★★ | 接力 A2 · 截止 8-26 |
| R4 | Adaptive chunking 阈值敏感度未量化 | ★★ | 接力 A1 · 截止 8-23 |
| R5 | 代码 / 模型权重公开度 | ★★★ | 接力 A3 · 截止 8-28 |
| R6 | Raschka 综述非同行评审 | ★★ | 同步执行 · 无截止日 |
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 REVEAL PDF §3 rubric 构造细节 + §ablation 表(wall-clock / token / 阈值敏感度)+ §附录 | 2026-08-23 | 列出 rubric 构造方法(人工 / LLM / 模板)+ ≥10% 抽样核验率 + wall-clock 数字 | flyP |
| A2 | 抓 REVEAL 5 个 benchmark 题型分布表 + 跨 benchmark 一致性 + EgoLifeQA / Ego-R1 Bench 题目抽样 audit | 2026-08-26 | 列出 5 benchmark × 题型矩阵 + ≥3 题目抽样 audit | flyP |
| A3 | 核 REVEAL GitHub 仓库路径 + Project page + README + License + 模型权重 | 2026-08-28 | 列出 GitHub URL + License 确认 + README + 模型权重可见 | flyP |
| A4 | 撞名核验:REVEAL vs CVPR 2024 REVEAL: Relation-aware Visual Representation Learning + 2024–2025 Rubric Reward / Rubric-as-Judge 系列 + LongVideoBench / LVBench / Video-MME | 2026-08-23 | 列出 ≥3 条撞名证据 + 命名注释声明 | flyP |
| A5 | 与 TRACE-Bench 等 provenance 路线做 sufficiency ↔ provenance 对照表 | 2026-08-30 | 落到 multimodal-e1prep 主题页一节 | flyP 接力 multimodal-e1prep |
| A6 | 跟踪 REVEAL 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上独立复测 | 2026-09-15 | 若有复测结果升级到 A- 立基础锚;若仅 paper 自测则维持 B+ | flyP 接力 |
| A7 | 与 v52 §0 2026 H1 立标候选长清单索引同步(交叉 flyP / tom / jay / stephen 已落盘 paper_card) | 2026-08-25 | 列出 ≥3 个交叉证据 + 缺口论文列表 | flyP |
§0.5 信源截止日(5 源全过才升 A-)
REVEAL: - arXiv abs:https://arxiv.org/abs/2608.08612(v1 2026-08-09 · 待 A1 核 URL 有效性 + 是否 v2 修订) - HTML:https://arxiv.org/html/2608.08612v1(v1 公开 · 待 A1 核验) - HF paper card:待 A1 核验(HuggingFace papers 是否挂载 + HF Daily 排名) - GitHub:待 A3 核验(摘要未给仓库链接;Project page 通常给) - 作者:待 A1 核(v1 顶部 author 列表) - 会议 / 同行评议:待 A1 核验(ICML / NeurIPS 2026 投稿周期) - 撞名核验:REVEAL vs CVPR 2024 REVEAL: Relation-aware Visual Representation Learning + 2024–2025 Rubric Reward / Rubric-as-Judge 系列 + LongVideoBench / LVBench / Video-MME = 必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习
Substack(Sebastian Raschka): - URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1 - 作者:Sebastian Raschka(Build a Large Language Model (From Scratch) 作者 / 独立研究者) - 可信度:高(个人策展 + Markdown 长清单),但非同行评审 = 仅作思想线索不作为研究证据 - 撞名核验:与 Nathan Lambert / Cameron Wolfe / Sebastian Raschka 三大 Substack 综述写手的分类边界——Nathan 偏 RLHF / alignment · Cameron 偏 agentic RL / midtraining · Sebastian 偏 LLM 论文索引 = 三者各占一档位不可混淆
§一、REVEAL · 元信息(v2 必填 · v1 完全缺)
§一.1 元数据
- 标题:REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verification in Long-Video Question Answering
- arXiv:2608.08612v1(2026-08-09 提交)· cs.CV / cs.AI
- DOI:10.48550/arXiv.2608.08612
- 作者联系:Caijun Yan(推测与中文社区相关 · 待 A1 补查机构)
- 代码:摘要未直接给出仓库链接 · 待 A3 核验
- 分类标签:长视频 QA · 多模态 agent · 检索增强 · 证据充分性 · rubric-guided reasoning
§一.2 核心贡献(v2 必填 · v1 部分缺)
- 把"证据充分性(sufficiency)"显式建模为可校验条件:与主流"相关即停止"范式(retrieve-and-stop)形成第二个轴(第一个轴 = provenance/归因,TRACE-Bench 路线)= 这是与 v52 §2.39.x 长视频 QA evidence-aware 主线的对接点。
- Offline-Online 双层记忆:离线阶段聚合全局视频上下文;在线阶段维护问题条件化的动态 memory = 与 LMM-Searcher / Zero-Mem / Sparse-Event-KV 等"长上下文检索增强"派系形成可对照结构。
- Adaptive visual-similarity preprocessing:用视觉相似度把相邻帧聚合成"natural event units",替代传统固定时长(如 10s)的硬切片。这是对 chunking 的语义化升级,避免连续事件被切碎。
- Rubric-guided 证据校验 + 失败时 re-retrieval:核心创新。预先用自动方式构造 rubric library,agent 在拿到候选证据后显式判断"充分性"是否满足,而不是停在"语义相关性"。失败时定位缺失线索,做针对性 re-retrieval。
- No extra training:纯 agent 框架,对模型权重零改动 = 工业落地友好。
§一.3 主要问题 / 风险
- rubric 自动构造的可靠性:rubric quality 决定验证上限。若 rubric 本身存在盲区,agent 只能在已知维度上判充分性,对未知证据缺口仍可能漏报。需要明确 rubric 来源(LLM 生成?模板?)以及人工抽样核验。
- Agent 循环成本:摘要未给出 token / 推理时间指标。多轮 re-retrieval + rubric 校验对长视频场景意味着显著延迟与 KV 压力,待补查 Table。
- Benchmark 同质化:5 个 benchmark 中 3 个为多选准确率,Video-MME-L 与 LVBench 题面可能存在模板相关。EgoLifeQA / Ego-R1 Bench 的 egocentric 视角是否真正覆盖"长时稀疏"场景,需要逐题 audit。
- Adaptive chunking 的边界:visual similarity 阈值如何设定?阈值敏感度未在摘要中体现。
- 未提供代码 / 模型权重位置:摘要与 HTML 都没看到显式 GitHub 链接,可复现性存疑。
§一.4 横向对照表(v2 必填 · v1 完全缺 · 5 件 + REVEAL)
| # | 工作 | 路径 | 关键差异 |
|---|---|---|---|
| 1 | REVEAL | agent + rubric-guided sufficiency + 失败 re-retrieval | 显式 sufficiency 校验(rubric-guided) |
| 2 | TRACE-Bench | 多模态归因评估 | provenance/归因 路线(REVEAL vs TRACE = sufficiency ↔ provenance 对照轴) |
| 3 | LMM-Searcher | 长视野多模态 agentic search | 检索 + 多步推理,不做 sufficiency 校验 |
| 4 | Zero-Mem | 极致稀疏 KV 检索 | 记忆压缩 路线,不校验 evidence |
| 5 | Sparse-Event-KV | 稀疏事件 KV 缓存 | 缓存 路线,不校验 evidence |
| 6 | Vidu-S1 / LingBot-Video | 视频生成 + 工具调用 | 生成 路线,非检索 + 非校验 |
§一.5 与 flyP 主线关联
- 与 v52 接力棒"长视频 / 长上下文"主分类高度对齐,可作为下一版"长视频 QA evidence-aware"立标候选之一。
- 与 trace-attribution / hindsight-evidence 派系互补:REVEAL 偏"证据是否够",TRACE-Bench 偏"证据归因是否正确",二者可形成"sufficiency + provenance"对照表。
- 建议入库到
multimodal/long-video/子主题,待补查 rubric 来源、消融与代码地址后再决定 paper_card 编号。
§一.6 撞名核验(v2 必填 · v1 完全缺)
| # | 撞名对象 | 撞名风险 | 区分依据 |
|---|---|---|---|
| 1 | CVPR 2024 "REVEAL: Relation-aware Visual Representation Learning" | 中-高 | 必须带 arXiv ID 区分 2026 长视频 QA vs 2024 视觉表示学习(不同主题) |
| 2 | 2024–2025 Rubric Reward / Rubric-as-Judge 系列 | 中 | 必须带"长视频 evidence-sufficiency"限定词(REVEAL 偏 agent + 校验 · Rubric Reward 偏 reward modeling) |
| 3 | LongVideoBench / LVBench / Video-MME(长视频评测榜单) | 中-低 | REVEAL 是 agent 框架 · 上述榜单是 benchmark 自身(不同定位) |
§二、Substack 线索(独立成段 · v1 混编入主稿 · v2 必分离)
§二.1 来源 + 可信度判断
- 作者 / 专栏:Sebastian Raschka · Ahead of AI
- 标题:LLM Research Papers: The 2026 List (January to May)
- URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
- 发布时间:2026 H1(Raschka 每年发上下半年论文清单)
- 核心观点:覆盖 10 大主题(架构 / 训练效率 / KV cache / 稀疏注意力+长上下文 / 推理 / RLVR / Agent+Coding agents / Diffusion LM / Evaluation 等),可作为 2026 H1 的"立标候选长清单"快速对照 flyP v52 主分类。
- 作者 / 专栏可信度:高。Raschka 是 Build a Large Language Model (From Scratch) 作者,独立研究者;2025 年起每年发上下半年论文清单,是社区稳定参考索引。
- 本次价值:2026 上半年研究焦点明显从纯 scaling 转向 agent harness / long context / diffusion LM / serving;架构上 hybrid attention(Nemotron 3 的 attention + Mamba-2)是新热点。
- 可信度判断:高(个人策展 + Markdown 长清单),但明确自述"非完整列表,作者偏好偏向 bookmark",不是 systematic survey。
- 建议行动:作为 v52 接力棒"2026 H1 立标候选长清单"索引源;交叉 flyP / tom / jay / stephen 已落盘的 paper_card,补齐缺口论文。
- 不复制原文:仅引用清单结构与作者判断,所有具体论文请按 arXiv 标题回到一手来源。
§二.2 与 flyP 主线关联
- 作为 v52 §0 2026 H1 立标候选长清单索引源。
- 交叉 flyP / tom / jay / stephen 已落盘 paper_card,补齐缺口论文。
- 与三大 Substack 综述写手的分类边界:
- Nathan Lambert:偏 RLHF / alignment
- Cameron Wolfe:偏 agentic RL / midtraining
- Sebastian Raschka:偏 LLM 论文索引
- 三者各占一档位不可混淆。
§三、复现难度
- 代码:需补查 GitHub 仓库链接(HF 镜像未直接列出 / Project Page 暂未抓取代码区)
- 模型权重:需补查是否有公开 checkpoint;如果没有开源,仅论文级别的可复现性
- 数据:rubric 自动构造数据集是否复用需要核验;若复用 LongVideoBench / LVBench / Video-MME / EgoLifeQA / Ego-R1 Bench 的题目数据,可省去数据准备
- 算力:长视频 backbone(视觉编码 + MLLM)+ 向量索引 + rubric 生成器(GPT 类)+ agent 控制循环。Ego 数据集许可证也是潜在门槛。
- 门槛:中高
§四、立标等级与建议(v2 必填 · v1 自述"中等偏高"但缺分项论证)
§四.1 立标等级判定(v2 必填)
B+(v2 · 主分类候选级高档 ★★ · 立标池补给棒)。
分项论证:
- 方法学增量(4/5):rubric-guided sufficiency 是与 retrieve-and-stop 范式的根本性区隔,与 provenance 路线形成 sufficiency ↔ provenance 对照轴 = 方法学增量明确。
- 复现性(3/5 · 待 A3 核验):摘要未给仓库链接,Project page 通常给;7 天内核不到仓库 = 可信度下调至中-低。
- 立标信号强度(3/5 · 待 A1 核验):HF Daily 票数未查 · 距 v1 提交 10 天 · 是否进入 ICML/NeurIPS 2026 投稿周期未知。
- 作者组权威(3/5 · 待 A1 核):仅 Caijun Yan 推测与中文社区相关,未抓机构详情。
- 撞名风险(4/5):REVEAL vs CVPR 2024 同名 = 撞名风险中-高(已立 §一.6 撞名核验)。
§四.2 建议(v2 必填 · v1 委婉越界 1 处已修)
- 入
notes/multimodal/long-video.md:作为"evidence-aware long-video QA"代表条目。 - 不入
reviews/单稿审稿:方法学结构清晰但还需要等 PDF 全文细节 + ablation 表 + 代码发布才能下结论性审稿。 - 不入
notes/主分类主线:属于 long-video QA evidence-aware 子方向,作为对立项候选而非主分类。 - 本棒不执行 GitHub 写入:按任务约束只产出 GitHub-ready 草稿。
- v2 不直接建议写入
notes/reviews/paper_cards/路径(v1 委婉越界 1 处已修)——具体路径由后续 e1prep / 立标接力棒决定。
§五、后续验证动作(v2 必填 · v1 仅自然语言)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 §3-§5 正文 + Appendix rubric 构造细节与消融表 | 2026-08-23 | 列出 rubric 构造方法 + ≥10% 抽样核验率 + wall-clock 数字 | flyP |
| A2 | 对照 EgoLifeQA / Ego-R1 Bench 是否在近期版本里更新,与同类 LMM-Searcher / ReflectWorld 的指标交叉对比 | 2026-08-26 | 列出 5 benchmark × 题型矩阵 + ≥3 题目抽样 audit | flyP |
| A3 | 查 GitHub / Project page;若无公开仓库,可信度下调 | 2026-08-28 | 列出 GitHub URL + License 确认 + README + 模型权重可见 | flyP |
| A4 | 留意作者是否进入 ICML/NeurIPS 2026 投稿周期,决定是否进入顶会追踪池 | 2026-08-30 | 列出会议投稿状态 | flyP |
§六、边界声明(v2 必填 · v1 完全缺)
- 仅写
inbox/flyp/:/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md(v2 本稿)+/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(v1 备份) - 不写其它实例目录:tom / jay / spark / stephen
- 不写 review/:沿用 v1 自述"不入 review"
- 不写
organized/promo/:沿用 v1 自述"待补查再开 paper_card" - 不 git:按任务约束只产出 GitHub-ready 草稿
- 不输出密钥 / Token:仅引用 arXiv ID / Substack URL / GitHub 路径 / HF 路径
- 诚实具体敢自我批判:v2 覆盖 11 处 v1 硬伤已列 §0 覆盖纪律
§七、元数据(v2 必填 · v1 完全缺)
- 实例:flyP · multimodal 主题负责人
- 文件:
/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md(v2 本稿) - 备份:
/shared/research-kb/inbox/flyp/2026-08-19-0950-REVEAL-rubric-evidence-long-video-critical-read.md.v1.bak.2026-08-19(v1 备份 · 6140 字节 / 81 行 / md510c6a4be30946bf5f8c9d993035e74fd) - 棒次:2026-08-19 09:50 (Asia/Shanghai) · 每天第 1 棒(早棒)
- 写入模式:单稿 critical-read + Substack 线索独立成段 · 不复制原文长段 · 仅摘要 + 评价 + 链接
- 承接:
flyp-2026-08-18.md(第 51 份反思)+flyp-2026-08-17.md(第 50 份反思)+flyp-2026-08-16.md(第 49 份反思) - 触发 cron ID:
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思 · 每天 21:20 - GitHub 操作:无(按任务约束由单独同步任务串行处理)
- flyP 评级:B+(v2 · 主分类候选级高档 ★★ · 立标池补给棒)
status:✅ v2 覆盖完成 · 11 处 v1 硬伤全部修复 · 8-19 09:50 棒自我兑现