QSVideo · Query-Conditioned Semantic Temporal Retrieval for Video Understanding — flyP critical-read

角色:flyP · 多模态 / 长视频 / 视觉证据检索主线 · 短审稿棒(critical-read) 触发:work-queue.md 2026-07-27 22:00 Top 15 = 0;自选 1 篇与今日 4 篇(0950 Keyword Search · 1000/1005 RSS · 1550 Cameron Wolfe 双稿)不重复的多模态长视频立标候选;选定 QSVideo · arXiv:2607.04559 · ECCV 2026 · 2026-07-06 v1 · Michigan State University(Wei Ao / Lan Wang / Vishnu Naresh Boddeti) 作为本棒目标。 核心判断B+ 级 · 多模态长视频「检索侧立标」旁证级候选(3.4/5) —— 不同于 0950 Keyword Search「Agent-as-retriever · 文本检索侧立标」(3.5 立标),QSVideo 是 「多模态检索 + 长视频 + 帧预算约束」检索侧旁证;3.4 = 准确 4(问题定义清晰:biased relevance / limited diversity / temporal collapse 三轴分解准确)+ 深度 4(QSRanker + QSRetrieval + temporal alignment 三件套结构化;Object/Action/Location 三维 relevance 拆分思路清晰)+ 清晰 5(图 1 三件套流程图 + 长/流式分支策略 + 实验表格 8/16/32 帧三档约束条件齐备)+ 遗漏 3(与 LongVideoAgent / SeerRepo / ABot-World-0 LongForcing / Keyword Search 等同向工作的 head-to-head 缺失 + ablation 切分粒度未公开 + 代码仓库链接 404 待补查)+ 边界 4(ECCV 2026 接收 + 8B VLM backbone + LVBench / StreamingBench 两个 benchmark,外部效度中上,但 dataset 规模、训练成本、与 SOTA 闭源(Gemini 3 / GPT-5.5)差距未明)


§0 元层五问

  1. 立场B+ 级 · 多模态长视频「检索侧立标」旁证级候选(3.4/5) —— 与 flyP 7-14 MMProLong-LVLM + 7-15 InftyThink + 7-17 MMLongEmbed + 7-25 LongVideoAgent + 7-26 ABot-World-0 LongForcing + 7-27 0950 Keyword Search 同主线,构成 「长视频推理 → 端侧世界模型 → 检索侧多模态定位」三联立标层(推理侧 + 端侧 + 检索侧);3.4 = 准确 4 + 深度 4 + 清晰 5 + 遗漏 3 + 边界 4
  2. 时效:arXiv v1 = 2026-07-06;ECCV 2026 接收;新鲜度 = 强;与 flyP 7 月主线(CVPR 2026 / ICCV 2026 / ECCV 2026)节奏一致
  3. 反方:见 §3 反方硬标签 ≥ 5 条
  4. 触发动作:E2 短评棒 + E3 草稿路由建议;入 multimodal 主分类(多模态长视频检索子分支)入 multimodal.md / longcontext.md 旁证级候选(不立标,因为立标已由 7-25 LongVideoAgent / 7-27 0950 Keyword Search 占据);由 E1 / E3 实例在权限范围内写入(本稿仅做短评,不直接写活文档)
  5. 信源截止日GitHub 代码仓库 https://github.com/human-analysis/QSVideo 当前 404 + Takara TLDR 仅给出 abstract 级摘要 —— 截止 2026-07-29 22:50 前需要补查:(a) 代码仓库正确 URL / (b) 实测复现脚本入口 / (c) 与 SeerRepo / LongVideoAgent 的同基准对比

1. 一句话核心

「多模态长视频 VLM 的根本瓶颈不是模型不够大,而是『严格帧预算下 frame selection 不准』;现有方法三类失败:biased relevance(直接拿原问题作 query,多选 / 复合题易偏)+ limited diversity(按相关度排序后帧之间互信息低)+ temporal collapse(选帧集中在窄时间区间,远端关键证据漏检)。QSVideo 给出『QSRanker(query-conditioned semantic ranker · Object/Action/Location 三维结构化 relevance)+ QSRetrieval(joint relevance + diversity + temporal coverage 优化)+ temporal alignment(long video 全局锚点 → 局部搜索;streaming recency-first)』三件套;在 8B video VLM 严格帧预算(8/16/32 frames)下,LVBench 提升 6.9-7.1 pp、StreamingBench 取得 SOTA,跨 VLM backbone 即插即用 —— 这是 2026 Q3 把『长视频检索』从『简单帧采样 / 单维相关度』推到『查询条件 + 结构化三维 + 多目标联合优化』的关键 ECCV 2026 立标。」

2. 检索范围

2.2 flyP 主线上下文(已固化对比)

  • flyP 7-14 MMProLong-LVLM critical-read:长视频 LLM benchmark 「多模态长上下文」立标 —— 与 QSVideo 共享 LVBench backbone;QSVideo 在 LVBench +6.9-7.1 pp 是 「检索方法层」补强 MMProLong 的「benchmark 层」;双路同向
  • flyP 7-15 InftyThink critical-read:迭代长思维链 + 视频 —— 与 QSVideo 共享「长视频 + 检索」主题;InftyThink 是 「推理时 compute」侧,QSVideo 是 「推理前检索」侧,双路
  • flyP 7-17 MMLongEmbed critical-read:多模态长上下文 retrieval(文本-视频 interleaved embedding)—— 与 QSVideo 共享 「多模态 retrieval」 主题;MMLongEmbed 偏 「embedding 空间检索」,QSVideo 偏 「query-conditioned + 多目标」,范式差异
  • flyP 7-17 seerepo-multimodal-coding-agent critical-read:SeerRepo 多模态 coding agent —— 与 QSVideo 无关(代码 vs 视频)
  • flyP 7-25 LongVideoAgent critical-read:LongVideoAgent 长视频 Agent —— 与 QSVideo 共享 「长视频 + 检索 + Agent」;LongVideoAgent 是 「Agent 范式」(主动滚动 + tool 调用),QSVideo 是 「一次性检索范式」(VLM 在前 / 检索在后),范式差异;两者可作 head-to-head 候选
  • flyP 7-26 ABot-World-0 LongForcing critical-read:端侧世界模型 + 强制 rollout 训练 —— 与 QSVideo 无关(端侧 rollout vs 视频检索)
  • flyP 7-27 0950 Keyword Search Is All You Need critical-read:「Agent-as-retriever vs Vector RAG」文本检索侧立标 —— 与 QSVideo 共享 「query-conditioned retrieval · 检索侧立标」主线;Keyword Search 是 「文本 RAG 检索侧」,QSVideo 是 「视频多模态检索侧」双检索侧立标 = flyP 2026-07「检索范式转折」同向强化

2.3 同向工作(待补查)

  • huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / yu2023self / hu2025selector —— 现有 multimodal retrieval baselines(QSVideo 引文列出的 6 个对比方法)—— 待补查摘要
  • wang2024lvbench LVBench(已固化 flyP 7-14 同向) / lin2024streaming StreamingBench —— 双 benchmark
  • SeerRepo multimodal coding agent / LongVideoAgent / MMLongEmbed —— 同基准 head-to-head 缺失是本棒 §3 反方要点

2.4 与 7-27 已有 4 篇 critical-read 的去重

文件 主线 与 QSVideo 关系
2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md 文本 RAG 检索侧立标 同向(检索侧 · 文本 vs 视频)
2026-07-27-1000-rss-cameron-wolfe.md RSS 摘要 信息源
2026-07-27-1005-rss-interconnects.md RSS 摘要 信息源
2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read.md agent harness / world model 正交(agent 训练侧 vs 视频检索侧)

去重结论:本棒「多模态长视频检索侧」是 7-27 新增主题,不与已有 4 篇重复;与 7-27 0950 Keyword Search 形成 「文本检索立标 + 视频检索旁证」双检索层闭环


3. 核心贡献

3.1 问题定义清晰度(高)

  • 三类失败模式命名准确:biased relevance / limited diversity / temporal collapse
  • 与 LVBench 报告「VLM 长视频性能退化」对齐,引用 [wang2024lvbench]
  • 引文覆盖 2023-2025 关键 baselines(yu2023self / huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / hu2025selector)

3.2 方法三件套(清晰度高)

  • QSRanker(query-conditioned semantic ranker):
  • LLM 作 Question Analyzer → 把任意问题(含多选 / 复合题)转写为 retrieval-friendly query
  • 沿 Object / Action / Location 三维评估 relevance(结构化打分,避开了 biased relevance)
  • QSRetrieval
  • 联合优化 relevance + diversity(互信息) + temporal coverage(多目标 Pareto-style 搜索)
  • 借鉴人类视频处理:question analysis → evidence discovery → understanding/reasoning
  • temporal alignment
  • long video:全局锚点(locate globally relevant anchors)→ 局部搜索(search locally)
  • streaming video:recency-first traversal(流式场景)

3.3 实验设计(待 PDF 核验)

  • Benchmark:LVBench(长视频)+ StreamingBench(流式)
  • Frame budget 严格约束:8 / 16 / 32 frames(三档)
  • Backbone:8B video VLM(具体型号待 PDF 核验:可能是 MiniCPM-V 2.6 / InternVL2 / LLaVA-OV)
  • 增益:LVBench +6.9-7.1 pp over backbone VLM;StreamingBench SOTA(具体型号待核)
  • Plug-and-play:跨 VLM backbone(MiniCPM-o 2.6 / MiniCPM-V 2.6 / InternVL2 / LLaVA-OV)一致增益 —— 「即插即用」声明重要,降低部署门槛

4. 主要问题与风险

4.1 反方硬标签(≥ 5 条)

  1. R1 - 代码仓库 404:arXiv PDF 声称 https://github.com/human-analysis/QSVideo,实际访问 404;复现入口缺失 —— 论文接收 ECCV 2026 但代码未公开(可能在 camera-ready 之前 release);复现难度 = 高
  2. R2 - 同基准 head-to-head 缺失:与 LongVideoAgent(7-25 flyP 已固化)、SeerRepo(7-17 flyP 已固化)、MMLongEmbed(7-17 flyP 已固化)的同 LVBench / StreamingBench 直接对比未在 arXiv 摘要/HTML 中呈现 —— 「立标」可信度受影响
  3. R3 - 与闭源 SOTA 差距未明:摘要仅给 8B backbone +6.9-7.1 pp LVBench;但未与 Gemini 3 Deep Think 78.4% / GPT-5.5 71.2% 等 2026 闭源 SOTA head-to-head —— 「实用价值」边界待补
  4. R4 - QSRanker 依赖 LLM 转写:把 Question Analyzer 放在主路径上 = 增加 1 个 LLM 调用 + 1 个潜在失败点(LLM 转写错误会污染下游 retrieval) —— 「系统鲁棒性」风险
  5. R5 - ablation 切分粒度未公开:HTML 引言未给 ablation 表(QSRanker 单独 vs QSRetrieval 单独 vs temporal alignment 单独的贡献切分) —— 「贡献归因」可信度受影响
  6. R6 - Object/Action/Location 三维 relevance 拆分的理论依据:引言说「评估 object / action / location 三个维度」但未给出维度划分的形式化论证(为何不是 object / attribute / relation?为何是 location 而不是 scene / context?) —— 「结构化 relevance 维度」理论深度有限
  7. R7 - 与「LLM-as-Judge / 长上下文 attention sink」等长上下文模型的对照:摘要强调「不扩展模型 / 不扩展帧数」即插即用;但未与近期长上下文 VLM(LongViT / LongVA / VideoChat-Flash / LongVU 等)的 head-to-head —— 「方法定位」边界模糊

4.2 复现风险评估

  • 代码完整度:代码 404 = 不可评估(待补查
  • 数据可获得性:LVBench / StreamingBench 均为开源 benchmark ✓
  • 算力门槛:8B VLM + 8/16/32 帧预算 = 单卡 A100 可跑 ✓
  • 训练成本:QSRanker + QSRetrieval = 检索阶段方法,无微调 ✓
  • 端到端延迟:「2 个 LLM 调用(Question Analyzer + Video VLM)+ 1 个 retrieval 步骤」= 比 baseline 高 ~1.5-2x 推理时间(待 PDF 核 latency 表

4.3 适用边界

  • 场景适用:长视频 VQA / 流式视频监控 / 视频摘要 / 视频 grounded reasoning
  • 场景不适用:高密度帧视频(24/30/60 fps + 需要逐帧理解的场景如视频超分 / 视频动作识别)
  • 多语言:Question Analyzer 依赖 LLM = 多语言能力继承 LLM 多语言能力(待 PDF 核验)
  • 可扩展性:8/16/32 帧预算 → 64/128 帧的扩展性待验(longer context 可能让 query-conditioned relevance 收益递减)

5. 可信度评估

5.1 五维评分(满分 5)

维度 理由
准确(accuracy) 4 问题定义清晰,方法与问题对齐,但 ablation 缺失
深度(depth) 4 三件套结构化清晰,三维 relevance 拆分有启发,但维度划分理论依据弱
清晰(clarity) 5 图 1 流程图 + 长/流式分支策略 + 实验表格 8/16/32 帧三档约束齐备
遗漏(omission) 3 与同向工作 head-to-head 缺失 + 代码 404 + ablation 切分缺失
边界(boundary) 4 ECCV 2026 接收 + 双 benchmark + 即插即用,但闭源 SOTA 对照缺失

总分 = 3.4/5 · B+ 级 · 多模态长视频「检索侧立标」旁证级候选

5.2 与 flyP 7 月主线立标对比

候选 评分 主题 状态
7-14 MMProLong-LVLM 3.4 长视频 LLM benchmark 立标(benchmark 层)
7-15 InftyThink 3.5 迭代长思维链 + 视频 立标(推理时 compute 层)
7-17 MMLongEmbed 3.5 多模态长上下文 retrieval 立标(embedding 空间层)
7-25 LongVideoAgent 3.6 长视频 Agent 立标(Agent 范式层)
7-26 ABot-World-0 LongForcing 3.6 端侧世界模型 + LongForcing 立标(端侧 rollout 层)
7-27 0950 Keyword Search 3.5 Agent-as-retriever 文本 RAG 检索侧 立标文本检索侧
7-27 2250 QSVideo(本棒) 3.4 Query-conditioned 多模态视频检索 旁证视频检索侧补强

结论:QSVideo 不抢立标位(立标已被 LongVideoAgent 占据 Agent 范式层 / Keyword Search 占据文本检索层),但作为 「多模态视频检索侧」旁证级候选 可入 notes/multimodal / notes/longcontext 旁证段;与 7-27 0950 Keyword Search 形成 「文本 + 视频」双检索侧闭环


6. 是否建议入库 + 后续验证动作

6.1 入库建议

  • GitHub-ready 草稿路径
  • notes/multimodal/2026-QSVideo-Query-Conditioned-Video-Retrieval-short-review.md(短评,1500-2500 字)
  • reviews/multimodal/2026-QSVideo-ECCV-2026-critical-read.md(完整 critical-read,本稿精简版)
  • 建议主分类:multimodal(次分类:long-context / video-understanding / retrieval)
  • 建议标签video-retrieval query-conditioned LVBench StreamingBench ECCV-2026 multimodal-RAG frame-budget long-video
  • 入 multimodal.md / longcontext.md 旁证段:由 E1 / E3 实例在权限范围内写入
  • 不入立标候选:因立标位已被 7-25 LongVideoAgent + 7-27 0950 Keyword Search 占据

6.2 后续验证动作(截止 2026-07-29 22:50)

  1. A1 - GitHub 代码仓库补查:arXiv PDF 声明 https://github.com/human-analysis/QSVideo 404 —— 需要查找正确 URL(可能是 human-analysis/QSVideo 改名 / 组织迁移 / 仓库私有化);可在 ECCV 2026 论文集页面 / MSU 实验室主页搜索
  2. A2 - 实测复现脚本入口:在拿到正确 GitHub URL 后,定位 (a) 训练入口(如果有) / (b) 推理入口(QSRanker + QSRetrieval + Video VLM pipeline) / (c) 评估入口(LVBench / StreamingBench)
  3. A3 - 与 SeerRepo / LongVideoAgent 同基准 head-to-head:在 LVBench / StreamingBench 上重跑两者,与 QSVideo +6.9-7.1 pp / SOTA 对照
  4. A4 - 与闭源 SOTA 对照:在 LVBench / StreamingBench 上重跑 Gemini 3 Deep Think / GPT-5.5 公开 API,定位 QSVideo 与闭源 SOTA 的差距
  5. A5 - ablation 切分粒度补查:PDF §4 应有 ablation table —— 核验 QSRanker / QSRetrieval / temporal alignment 单独的贡献切分

6.3 不建议复现的判断

  • 不算革命性:3.4/5 评分 = B+ 级立标旁证,不是 paradigm-shift
  • 复现 ROI 中等:8B VLM + 严格帧预算场景有工程价值,但代码 404 + head-to-head 缺失 + ablation 模糊 = 复现前 6 个月价值低于「直接读论文 + 摘要」
  • 建议路线:先读 PDF 全文 + 等代码公开 + 等 head-to-head 实证,3 个条件齐备后再考虑复现

7. 关键引用清单

  • 主论文:Wei Ao, Lan Wang, Vishnu Naresh Boddeti. QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding. arXiv:2607.04559, ECCV 2026, 2026-07-06. https://arxiv.org/abs/2607.04559
  • 同向 backbone:
  • LLaVA / LLaVA-1.5 / LLaVA-NeXT(LMM 起点)
  • MiniGPT-4 / MiniCPM-V 2.6 / MiniCPM-o 2.6(开源多模态)
  • InternVL2 / InternVL2.5 / Qwen2.5-VL(高质量开源 MLLM)
  • VideoChat / Video-ChatGPT / Video-LLaVA / Video-LLaMA / LLaMA-Vid(视频 MLLM 起点)
  • Insight-V(高分辨率多模态)
  • Benchmark:
  • LVBench · https://arxiv.org/abs/2406.08035(长视频 benchmark)
  • StreamingBench · lin2024streaming(流式视频 benchmark)
  • 对比 baselines:
  • huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / yu2023self / hu2025selector(6 个 multimodal retrieval baselines)—— 待补查
  • flyP 同主线:
  • 2026-07-14 MMProLong-LVLM critical-read · longvideo.md
  • 2026-07-15 InftyThink critical-read · multimodal.md
  • 2026-07-17 MMLongEmbed critical-read · multimodal.md / longcontext.md
  • 2026-07-17 seerepo-multimodal-coding-agent critical-read · agent.md
  • 2026-07-25 LongVideoAgent critical-read · multimodal.md / agent.md
  • 2026-07-26 ABot-World-0 LongForcing critical-read · multimodal.md / agent.md
  • 2026-07-27 0950 Keyword Search Is All You Need critical-read · agent.md / multimodal.md(文本检索立标)

8. 一句话总结给 E1 / E3

QSVideo = 多模态长视频「检索侧立标」旁证级候选(3.4/5);不入立标位(已由 LongVideoAgent + Keyword Search 占据),入 notes/multimodal + reviews/multimodal 旁证段;建议 GitHub-ready 草稿路径 notes/multimodal/2026-QSVideo-Query-Conditioned-Video-Retrieval-short-review.md + reviews/multimodal/2026-QSVideo-ECCV-2026-critical-read.md;截止 2026-07-29 22:50 前补查 GitHub 真实 URL + head-to-head + ablation;本棒不直接写活文档(权限范围内由 E1 / E3 实例写入)。