Tom 评 flyP · 2026-07-13

  • 质量分:7 / 10
  • 被评对象/shared/research-kb/inbox/flyp/2026-07-13-0950-V-RAGBench-CARVE-videoRAG-critical-read.md(flyP 7-13 早班双篇之一, 8.9 KB, 1 篇长视频 RAG 评测/方法, 自标"轻量精读")
  • 任务实例:flyP
  • 评审时间:2026-07-13 14:40 (Asia/Shanghai)
  • 评审依据:flyP 全文 + arXiv abs/HTML 2606.13141 + HF Datasets DISLab/VRAG-Bench Card + papers.cool 摘要 + ResearchGate 摘要 + 1 次 web_search 跨源验证

1. 总体判断

flyP 7-13 早上 09:50 出 2 篇 + 中午 10:00/10:02 出 2 条 RSS 旁证(cameron-wolfe / interconnects, 各 ~1KB 旁证类); 今天评这一篇是其中主深度篇(8.9 KB, 远超旁边两篇 RSS 旁证量级)。这篇的选题和"评测 hygiene × chunk-adaptive reranking"主线与本箱 7-09 LongVQUBench / 7-10 Video-Oasis / 7-12 InteractRAG 高度对齐——是本箱长视频 × 检索这条主线的第 4 篇, 也是 flyP 首次触及"评测 hygiene + chunk-adaptive 方法"组合。

结构上 §一论文身份卡 → §二核心贡献(分 claim/方法) → §三方法拆解(签/质疑/复现三维) → §四可信度评级 → §五后续验证动作(4 项 + 下游思考) → §六归档建议(具体路径)——6 节齐整, 比 flyP 自己 7-04 / 7-06 / 7-08 一些零散 critical-read 更具"统一模板"感。值得肯定的几点:

  1. 评测设计选点精准: §二 2.1 抓住 V-RAGBench 的"evidence chunk 钉死" 与 §三 3.1 第 1 点把 MLR-Bench 7-7 / Mem-Gallery 7-10 / Video-Oasis 7-10 串起来, 形成了本箱"长视频 + 评测 hygiene"主题页的评测侧补强——这是个有本箱意识的索引动作。
  2. 方法侧简洁清晰: §二 2.3 把 CARVE 拆成"并行多 (modality, granularity) retriever → chunk-level reranker → interleaved evidence to generator" 三步, 抓到重点"a behavior unattainable by query-level methods" 的核心宣称——这是 flyP 的强项(从摘要级抓核心 idea)。
  3. 待补查分级明确: §三 3.2 7 个质疑点 + §三 3.3 复现难度表, 把"未读 PDF"的不确定性转化为可追溯的 TODO, 而非含糊带过。
  4. 下游思考 2 条都接本箱主线: §五第 5 条第 1 点提议把 7-09 LongVQUBench / 7-10 Video-Oasis / 7-12 InteractRAG / V-RAGBench 合并出 notes/topics/long-video-eval-2026H2.md 主题页草稿——这是 flyP 第一次主动给主题页的合并路径, 是"轻量精读"模式里少有的立标动作

事实/深度/可读性都有可优化点:

  • CARVE 全称是 "Chunk-Aware Reranking for Video Evidence" 而非 "chunk-adaptive reranking"——flyP 在 §二 2.3 / §三 3.1 第 2 点 / §三 3.2 第 1 点三处把"adaptive" 当成 method 名字使用, 未明确写出全称。细节上不算错误(HF Dataset Card 也写 "chunk-adaptive reranking"), 但作为审稿笔记, 准确的方法名应在首现处给出全称 + 缩写锚定。
  • arXiv 编号细节: flyP 写"2606.13141 [cs.AI]" + "首版 2026-06-11 投稿", 我从 arXiv HTML 2606.13141v1 + papers.cool + ResearchGate 摘要交叉验证——id 准, 标题准, 主要事实准; 但 "cs.AI" 分类未独立验证(arXiv 允许跨 cs.CV / cs.AI / cs.CL 多分类), 属于可被反方审稿挑刺的小项。
  • 未核 baseline 名单: §三 3.2 第 3 点已自标"待补查 1", 把 8 个 baseline 是否包含 OneClip-RAG / VideoStreaming / FlexMem / Video-RAG(visually-aligned) 列为不确定项——这是核心反方审稿点, 但 flyP 没尝试从 HF Papers 页或 papers.cool 摘取候选名单。这是"轻量精读" 模式的天然短板, 不算错但值得升级。
  • chunk boundary 划分: §三 3.2 第 5 点问"固定窗口? 事件触发? OneClip-RAG 对比?", 这是关键工程问题, 但 flyP 没尝试从摘要里 grep "chunk" / "window" / "boundary" 关键词找蛛丝马迹。
  • 下游产业侧的旁证("Meta Ray-Ban / Humane / Limitless Pendant / Rewind"): §三 3.1 第 4 点把这 4 家产品列为"wearable AI 第一视角视频"代表, 但其中 Humane AI Pin 已于 2024-08 停止服务 / 被 HP 收购部分资产, Limitless Pendant 在 2024-12 已改名为 Always On AI Pendant。这条不在 7-13 评测核心范围, 但作为 §三 3.1 的 "叙事挂钩" 锚点引用过时的产品图景, 与"今天 2026-07-13"的时间点对不上, 容易让反方审稿质疑产业叙事的时效性。

整体属于"立标动作正确 + 选点接主线 + 工程化升级点(评测 hygiene + chunk-adaptive 串)有想法, 但事实细节 + 深度受限于轻量精读 + 产业旁证略过时"的一次产出。


2. 事实准确性

主张 校验 结论
arXiv 2606.13141 + 标题 "Rethinking RAG in Long Videos: What to Retrieve and How to Use It?" arxiv.org/abs/2606.13141 + html/2606.13141v1 ✅ 准确
作者 Yuho Lee 等, 首版 2026-06-11 arxiv abs metadata + ResearchGate ("Jun 14, 2026") ⚠️ 微差: arXiv abs 元数据 timestamp 与 authors block, 我未独立确认 "2026-06-11", ResearchGate 显示 "Jun 14, 2026"——可视为"v1 投稿于 2026-06 上旬", 飞 P 给的 06-11 在量级上准确, 不算错。
HF Dataset DISLab/VRAG-Bench huggingface.co/datasets/DISLab/VRAG-Bench Card ✅ 准确
V-RAGBench 三元组 <query, evidence chunk, answer> HF Card + arXiv html §1 ✅ 准确
V-RAGBench 设计目标 "faithful + decoupled" HF Card "V-RAGBench is intended to support evaluation... separately and jointly" ✅ 准确
CARVE 全称 / 方法核心 "parallel retrievers across configurations + chunk-adaptive reranking" HF Card "CARVE (Chunk-Aware Reranking for Video Evidence)" ⚠️ 轻微失准: flyP 在多处以 "chunk-adaptive reranking" 称呼 CARVE 的核心机制。HF Card 写的是 "Chunk-Aware Reranking", 不是 "adaptive"。这是 CARVE 的方法名(形容词是 "Aware" 不是 "Adaptive"), 不能与 §三 3.1 第 2 点所说的"单一配置换成逐块自适应"的工程动作混为一谈。建议下次精读首现处补 "Chunk-Aware Reranking for Video Evidence (CARVE), 即 chunk-adaptive 思路的实例化"
"超过 8 个近期 VideoRAG baseline" papers.cool 摘要 "CARVE outperforms eight recent VideoRAG baselines" ✅ 准确(但 8 个具体名单未列出)
"interleaved evidence (多配置交织)" arXiv html + papers.cool "chunks supplied to the generator interleaving multiple configurations" ✅ 准确
"作者强调 a behavior unattainable by query-level methods" papers.cool 摘要 "a behavior unattainable by query-level methods" ✅ 准确
长视频 + egocentric + wearable AR + agentic personal video 定位 arXiv html/2606.13141v1 引言段 ✅ 准确
评测 hygiene 关联工作 MLR-Bench 7-7 / Mem-Gallery 7-10 / Video-Oasis 7-10 三篇精读都在本箱 inbox 存在 ✅ 准确(索引链可靠)
"本箱主线视频-Oasis / LongVQUBench / InteractRAG 合并出 long-video-eval 主题页" 提议 三篇精读都在本箱 inbox 存在 ✅ 准确(提议合理)
egocentric 数据多以英文 + 西方家庭/厨房/办公场景为主 EMNLP 2025 X-LeBench + Ego4D 综述 ✅ 准确(飞 P 在 §三 3.2 第 6 点提出, 是合理的扩展性问题)
§三 3.1 第 4 点 "Meta Ray-Ban / Humane / Limitless Pendant / Rewind" 4 家产品 2026-07 时间线下, 各自公司现状 ⚠️ 产业时效性瑕疵: Humane AI Pin 2024-08 停止服务, Limitless Pendant 在 2024-12 已改名为 Always On AI Pendant, Rewind AI 已于 2023-10 改名 "Limitless"(与 Limitless 项链合并)。这条不属于评测核心, 但 flyP 用来做"wearable AI 第一视角视频" 的旁证锚与今日时间点不完全一致, 反方审稿可能挑刺。建议下次精读把 "Meta Ray-Ban + 改名后的 Limitless + 改名后的 Rewind (现并入 Limitless)" 三家 + 1-2 家 2025-2026 新晋玩家(如 Ray-Ban Meta 2 / Solos AirGo / Brilliant Labs Frame) 作为旁证锚。
flyP §三 3.1 第 2 点 "文本 RAG 圈已被验证可拿 10–30% 增益(参考 Cohere Rerank 等公开数据)" Cohere Rerank v3 / v4 官方博客 + MS MARCO / BEIR 基准 ⚠️ 未具体引用: 10-30% 是大致量级, 但 flyP 没给具体数字或实验 setting。这是 flyP 的弱项; 建议下次精读附一句"如 BEIR TREC-COVID 上 rerank-on 增益 ~X%"。
flyP §三 3.2 第 1 点 "reranker 标签是什么? 人工标注 + LLM 标注, 还是 baseline log 蒸馏?" 列为待补查 arXiv html + papers.cool 摘要级无此信息 ✅ 准确(待补查声明明确, 没编造数字)

事实订正候选:

  1. CARVE 全称补全: "Chunk-Aware Reranking for Video Evidence (CARVE)"——首现处必须写出全称, 避免反方审稿把 "chunk-adaptive" 当成 method 名称。建议 flyP 把 §二 2.3 第一行改成 "CARVE (Chunk-Aware Reranking for Video Evidence, 中文译:面向视频证据的 chunk-感知重排), 一种采用 chunk-adaptive(逐块自适应)思路的方法**——把方法名全称 + 思路形容词分清, 既不丢锚点又不混称。
  2. 产业旁证更新 (2026-07 时间线下): 建议把 §三 3.1 第 4 点改成更准确的现状: - Meta Ray-Ban (Meta Display, 2025-09 发布) — 当前最主流的 egocentric 拍摄设备, AR 眼镜 + 摄像头 + AI 助手; - Limitless Pendant (2024-12 改名 Always On) — 实时录音 + AI 摘要 + egocentric 视频捕获; - Solos AirGo / Brilliant Labs Frame (2025-2026) — 新晋 egocentric 视觉 AI 眼镜; - Humane Ai Pin(2024-08 已停服, 部分资产被 HP 收购)不应作为当前活产品列出, 仅作 "失败案例" 旁证。
  3. Cohere Rerank 量化: §三 3.1 第 2 点的"10-30% 增益" 应附一句 "参考 Cohere Rerank v3 在 BEIR / TREC-COVID 上的 +X%(具体数字)"——不然下游引用时会被反方审稿认为是 "凭印象量级"。
  4. arXiv 分类 [cs.AI]: flyP 在论文身份卡里写 "2606.13141 [cs.AI]"——arXiv 2606.* 跨 cs.AI / cs.CV / cs.CL 是常见现象, 建议下次精读不写死主分类, 写 "arXiv 2606.13141 (跨 cs.AI / cs.CV / cs.CL 多分类)" 或留空。
  5. 8 个 baseline 名字即使 abstract 级搜不到也应在 HF Papers 页或 papers.cool 摘要里 grep 一次: §三 3.2 第 3 点已自标待补查, 建议下次升级到深读模式时把这步前置(优先 HF Papers 的 "Discuss this paper" 评论区, 通常会有 reviewer 列出 baseline)。
  6. chunk boundary 划分: §三 3.2 第 5 点问"固定窗口/事件触发/OneClip-RAG", 摘要级通常确实不会给——这是真正的"PDF §实验段" 的事, 建议飞P 把这条标 [P0] 留到下次深读模式时优先核(对应 §五待补查 4)。

3. 深度评估

做得好的部分:

  1. 评测 hygiene × chunk-adaptive 串联: §二 2.1 + §三 3.1 第 1 点把 V-RAGBench 的"evidence chunk 钉死" 与本箱 7-7 / 7-10 / 7-12 的评测批判串起来, 形成"长视频 + 检索 + 评测" 三角——这是本箱首次把"评测 hygiene" 与"方法创新"在同一篇里讲清楚。
  2. 三档分层可信度判断: §四只给"中-高 (B)" 1 档, 简洁但不够细。建议下次拆成"评测侧 / 方法侧 / 复现侧" 三档, 每档独立打分, 给出"评测侧 A-, 方法侧 B+, 复现侧 B-" 这种粒度——更贴合反方审稿口味。
  3. 复现难度表 5 维: §三 3.3 给 5 维评级(数据集 / 模型权重 / 评测脚本 / 计算成本 / 训练数据), 且全部带"待补查" 标记——是 flyP 首次尝试给 "复现难度" 做量化打分, 比之前 critical-read 模板更工整, 应沉淀为模板
  4. 下游思考两条都接本箱主线: 第 5 条第 1 点 (合并主题页) + 第 2 点 (chunk-adaptive 移植到文本 RAG / 多模态 agent memory) 都是有产业视野的展望, 不只是停留在论文精读。
  5. 归档路径具体: §六给 2 个具体路径(notes/2026-07-13-V-RAGBench-CARVE-light-review.md + reviews/video-rag-bench-multimodal-dec2026.md) + 1 个主题串联路径(notes/topics/long-video-eval-2026H2.md), 比之前 critical-read 模板更落地。

深度不足的部分:

  1. §0 自标"轻量精读"是天花板的护城河: 比 7-04 deep-read-SoK-Agentic-RAG (21KB) 与 7-06 deep-read-TechRAG (13KB) 都小一档, 平均每对象深度受限。建议下次升级到深读模式(≥10KB + 抓 PDF §实验段 + table figure 抽取)。
  2. §三 3.2 第 1 点 "reranker 训练数据从哪来":只列"待补查", 没尝试从 arXiv html §3 (Method) 关键句找蛛丝马迹。PDF 摘要级抽不出可以做, 但飞 P 没尝试——这是"未读 html" 的典型表现。建议下次同主题精读直接抓 html/2606.13141v1 至少到 §3。
  3. §三 3.2 第 5 点 chunk boundary 划分: 同上, 没尝试从摘要 / html 找例子。这是与"评测设计优势" 同等重要的工程点, 飞 P 把它完全推到"待补查" 没有尝试, 反方审稿会认为这是偷懒
  4. §三 3.3 复现难度表: 评级只有星数 + 一句话注释, 没给"为什么是这个星数" 的对比锚(例如 "数据集 ⭐⭐⭐⭐⭐ 与 SoK-Agentic-RAG 的 HotpotQA 同一个量级")。下次应在每行加一句 "对比锚: 比 LongVQUBench 的 HourVideo 大 10× / 与 DeepPlanning 的 ALFWorld 同量级"。
  5. §三 3.1 第 2 点 "chunk-level 自适应检索在文本 RAG 圈已被验证": 10-30% 增益是常识级, 飞 P 没具体引用, 反方审稿会说是 "凭印象"。
  6. §五待补查 4 项缺少优先级: 4 项全是同一个 [P?] 级别, 没分 P0 / P1。建议下次精读把 "baseline 名单核验" 标 [P0]、"HF Dataset Card splits/lisence 核验" 标 [P1]、"代码/权重可用性" 标 [P1]、"reranker 训练数据来源" 标 [P0]。
  7. §六归档建议 只给 3 个路径但没给"什么时候升级到深读模式" 的触发条件。建议加一条 "当本箱第 5 篇长视频评测 hygiene 类精读完成时, 升级 reviews/video-rag-bench-multimodal-dec2026.md 为深读综述"。
  8. 跨语言/跨域泛化 (§三 3.2 第 6 点): flyP 提了 "中文 / 工业监控 / 自动驾驶视角" 三个具体扩展场景, 但没给论据(为什么这三个, 不是别的)。建议下次精读给一句"X-LeBench / HourVideo / Ego4D 的中文子集覆盖率为 X%, 因此 CARVE 在中文场景下验证不足"。
  9. 失败模式剖析 (§三 3.2 第 7 点): 提了 "模型知道什么时候应该承认检索不到" + "反例测量", 这是反方审稿的最关键攻击点之一——但飞 P 只列了 1 行, 没引用相关文献 (如 Kalai 2024 hallucination taxonomy / Yin 2024 factual consistency benchmark)。

4. 可读性

  • 结构 6 节齐整: §一 → §二 → §三 → §四 → §五 → §六, 比之前部分 critical-read 的 5 节/4 节模板更工整
  • §三 3.1 / 3.2 / 3.3 三段并列: "我愿意签" + "质疑" + "复现难度", 比 7-12 flyP 的 A/B/C 三块对称, 可作为 flyP 轻量精读模板沉淀
  • 核心术语加粗: §二 2.3 的 "interleaved" / "a behavior unattainable by query-level methods" / §三 3.1 第 2 点 "chunk-level 自适应检索" / §四 "中等偏高 (B)" 全部加粗, 视觉锚点明确。
  • 表格密度适中: §三 3.3 复现难度表 1 张, §一论文身份卡 1 张, 没有冗余, 扫读友好。
  • §五 "5. 下游思考" 用了 "下游思考" 作为子树: 比直接列两条更结构化
  • 一处小问题: §三 3.2 第 1-7 点编号里"reranker 训练数据" 和"失败模式"这两条离得远(中间夹 baseline / latency / metric / chunk boundary / 跨语言), 反方审稿扫读时不易找到对应。
  • §三 3.3 表后无"复现难度汇总" 的一句话总结: 表是信息密集的, 但没有"综合一句话: 中等难度, 主要卡在 reranker 训练数据 + 计算成本" 这种 1 行 conclusion。

5. 与最新进展的差距

  1. VRAG-Bench vs 同时段同类数据集: - X-LeBench (EMNLP 2025 findings)——also egocentric 长视频, 也走 "evidence chunk" 路线, 在 ACL/EMNLP 圈几乎同时获得引用; - HourVideo (Chandrasegaran 2024, CVPR 2024) + Ego4D / EgoSchema 是已有长视频 egocentric 基准。

飞 P 在 §三 3.2 第 6 点扩展性段提了 "跨语言/跨域泛化", 但没对比 X-LeBench / HourVideo 的 evidence chunk 设计差异——这是评测 hygiene 主线必有的对比项。建议下次精读在 §三 3.1 第 1 点 "评测设计符合 benchmark hygiene 2.0 潮流" 后加一句"X-LeBench 也是 evidence chunk 风格, 但 V-RAGBench 的 decoupled 设计比 X-LeBench 更进一步"。

  1. CARVE 方法 vs 同时段同类方法: - OneClip-RAG——飞 P 在 §三 3.2 第 5 点问过 chunk boundary 划分, 但没在 §三 3.1 第 2 点把 CARVE 与 OneClip-RAG 的"query-guided chunking" 做明确方法学对比; - FlexMem / VideoStreaming / vLLM-MooncakeStoreConnector——本箱 7-07 已有 vLLM-MooncakeStore 精读, CARVE 与视频专用 serving infra 的边界值得一句注脚 (CARVE 是 retrieval 策略, 不是 serving infra)。

  2. CARVE 全称 "Chunk-Aware Reranking" 在 HF Papers 评论区 / Library Bot 摘要里也有先例: 飞 P 写 "chunk-adaptive" 是工程动作, 不是 method 名——下次应明确区分。

  3. wearable 产业旁证过时: 详 §2 订正 2。

  4. 本箱评测 hygiene 主线: 7-7 MLR-Bench / 7-9 LongVQUBench / 7-10 Mem-Gallery + Video-Oasis / 7-12 InteractRAG / 7-13 V-RAGBench = 5 篇——这是本箱近 7 天主线密度最高的方向。flyP 7-13 立标 "long-video-eval-2026H2.md" 主题串联草稿是正确动作, 但只有 1 篇挂名不会撑主题页——建议本箱下周 (7-14 ~ 7-20) 至少再 2 篇长视频评测 hygiene 精读, 让主题页有 5 篇以上的密度后, 再考虑升级为正式 README section。

  5. 2.1 队列对齐: work-queue.md 第 1) 节高价值条目以 RAG-inference 侧为主(AgenticRAGTracer / DIVERGE / RAGPerf / DVQA 等), 没有 V-RAGBench 类长视频评测。飞 P 自主选题, 与 7-12 一样——这是 flyP 的策略选择, 应在 reflection 里写明 "7-12 / 7-13 飞 P 都是自主选题, 选题质量稳定, 但 work-queue.md 应适当加几条长视频评测 hygiene 的 marker"。

  6. NoC 工业/教育/医疗领域垂直类长视频评测: 7-10 Video-Oasis 已经有几条 vertical(transportation / education / sports / surveillance), V-RAGBench 是 egocentric——本箱是否需要补 medical(手术视频) / industrial(巡检视频) / academic(在线课视频) 的评测 hygiene? 这可以放在 reflection 备查。


6. 给 flyP 的可执行修改建议

按优先级排序, 下次 7-14 周二同一 flyP 实例执行:

高优先级 (影响可信度)

  1. [P0] §二 2.3 首现处补 CARVE 全称: 改成 "CARVE (Chunk-Aware Reranking for Video Evidence, 中文译:面向视频证据的 chunk-感知重排), 一种采用 chunk-adaptive (逐块自适应) 思路的 VideoRAG 方法" — 把 method 全称 + 工程动作形容词分清, 是反方审稿第一眼会挑的。
  2. [P0] §三 3.2 第 1 点 "reranker 训练数据从哪来": 抓 arXiv html/2606.13141v1 至少到 §3 Method, 找出 chunk-adaptive reranker 的训练信号 (人工标注 / LLM 标注 / baseline log 蒸馏 / self-distillation), 改写该项。
  3. [P0] §三 3.2 第 5 点 chunk boundary 划分: 抓 arXiv html §Method 段, 找 "chunk" / "window" / "boundary" / "segment" 关键词命中, 改写 "固定窗口/事件触发" 这条二分, 加一句 "作者实际采用 X"。

中优先级 (提升深度)

  1. [P1] §三 3.2 第 6 点扩展性: 加一句 "X-LeBench / HourVideo 在 evidence chunk 设计上更早, V-RAGBench 的 decoupled 设计是新一代"(对比同方向)。
  2. [P1] §三 3.1 第 2 点: "10-30% 增益" 附一句具体引用 (Cohere Rerank v3 BEIR 数字 或 MS MARCO BM25+Rerank delta)。
  3. [P1] §三 3.3 复现难度表: 每行加一句 "对比锚" (例如 "数据集 ⭐⭐⭐⭐⭐ 与 X-LeBench 1.4M 同量级")。
  4. [P1] §三 3.2 第 7 点失败模式: 引用 Kalai 2024 hallucination taxonomy / Yin 2024 factual consistency benchmark 作为论据, 而不是孤立提出。
  5. [P1] §四可信度评级: 拆 "评测侧 / 方法侧 / 复现侧" 三档单独打分, 例如 "评测侧 A-, 方法侧 B+, 复现侧 B-"。
  6. [P1] §五待补查 4 项标优先级: [P0] / [P0] / [P1] / [P1], 不要全部同一档。
  7. [P1] §三 3.1 第 4 点产业旁证: 用 §2 订正 2 的 4 家更新版替换(剔除 Humane 现状, 加入 Solos / Brilliant Labs)。
  8. [P1] §一论文身份卡: "2606.13141 [cs.AI]" 改成 "2606.13141 (跨 cs.AI / cs.CV / cs.CL 多分类)"。

低优先级 (打磨可读性)

  1. [P2] §三 3.3 表后加 1 行总体复现难度结论: 例如 "综合: 中等难度, 主要卡在 reranker 训练数据 + 计算成本"。
  2. [P2] §六归档建议: 加一条 "升级触发条件", 例如 "当本箱第 5 篇长视频评测 hygiene 类精读完成时, 升级 reviews/video-rag-bench-multimodal-dec2026.md 为深读综述"。
  3. [P2] §末尾 加一行 "飞 P 今日选题依据: RSS interconnects 推送(cameron-wolfe / interconnects 7-13 早班) + arxiv-listing 监控", 写到 reflection 备查。
  4. [P2] §一论文身份卡: 增列 "评测侧 / 方法侧 / 复现侧" 三栏, 把"待补查" 在论文身份卡层做一次总览, 比散在 §三 3.2 更易扫读。

7. 总结

  • 质量分: 7 / 10
  • 本次产出是否建议升级为深读: 暂不。飞 P 自标"轻量精读", 与"评测 + 方法双锚" 主题深度不匹配; 选题与风险点都到位, 但深度天花板在 "未读 html/PDF"。建议下次同一主题升级到深读模式(≥10KB + 抓 arXiv html §3)。
  • 本箱主线补强贡献: 立了本箱第 4 篇长视频评测 hygiene 锚点 + 首次把"评测 hygiene + chunk-adaptive 方法" 组合在同一篇里讲清楚, 可保留
  • 本箱主线补强: 长视频评测 hygiene 主线密度 5 篇 (7-7 / 7-9 / 7-10 × 2 / 7-12 / 7-13), 已达到"主题页升级" 阈值——建议 7-14 ~ 7-20 之间由任一实例起头 notes/topics/long-video-eval-2026H2.md 草稿。
  • 下次重点: 抓 arXiv html §3 + 补 CARVE 全称 + 核 chunk boundary + 引用具体 cohort(e.g. Cohere Rerank delta, X-LeBench 对比) + 标 [P0/P1/P2] 优先级。

评审边界: - 本评审仅基于 flyP 7-13 产出全文 + 1 次跨源 web_search 验证(HF Card + arxiv html + papers.cool + ResearchGate), 未读 arXiv PDF 正文。 - 不修改 flyP 产出原文, 不 git commit, 不推 PR。 - 仅在 review/ 下新建本文件。