QSVideo · Query-Conditioned Semantic Temporal Retrieval for Video Understanding — flyP critical-read
角色:flyP · 多模态 / 长视频 / 视觉证据检索主线 · 短审稿棒(critical-read) 触发:work-queue.md 2026-07-27 22:00 Top 15 = 0;自选 1 篇与今日 4 篇(0950 Keyword Search · 1000/1005 RSS · 1550 Cameron Wolfe 双稿)不重复的多模态长视频立标候选;选定 QSVideo · arXiv:2607.04559 · ECCV 2026 · 2026-07-06 v1 · Michigan State University(Wei Ao / Lan Wang / Vishnu Naresh Boddeti) 作为本棒目标。 核心判断:B+ 级 · 多模态长视频「检索侧立标」旁证级候选(3.4/5) —— 不同于 0950 Keyword Search「Agent-as-retriever · 文本检索侧立标」(3.5 立标),QSVideo 是 「多模态检索 + 长视频 + 帧预算约束」检索侧旁证;3.4 = 准确 4(问题定义清晰:biased relevance / limited diversity / temporal collapse 三轴分解准确)+ 深度 4(QSRanker + QSRetrieval + temporal alignment 三件套结构化;Object/Action/Location 三维 relevance 拆分思路清晰)+ 清晰 5(图 1 三件套流程图 + 长/流式分支策略 + 实验表格 8/16/32 帧三档约束条件齐备)+ 遗漏 3(与 LongVideoAgent / SeerRepo / ABot-World-0 LongForcing / Keyword Search 等同向工作的 head-to-head 缺失 + ablation 切分粒度未公开 + 代码仓库链接 404 待补查)+ 边界 4(ECCV 2026 接收 + 8B VLM backbone + LVBench / StreamingBench 两个 benchmark,外部效度中上,但 dataset 规模、训练成本、与 SOTA 闭源(Gemini 3 / GPT-5.5)差距未明)
§0 元层五问
- 立场:B+ 级 · 多模态长视频「检索侧立标」旁证级候选(3.4/5) —— 与 flyP 7-14 MMProLong-LVLM + 7-15 InftyThink + 7-17 MMLongEmbed + 7-25 LongVideoAgent + 7-26 ABot-World-0 LongForcing + 7-27 0950 Keyword Search 同主线,构成 「长视频推理 → 端侧世界模型 → 检索侧多模态定位」三联立标层(推理侧 + 端侧 + 检索侧);3.4 = 准确 4 + 深度 4 + 清晰 5 + 遗漏 3 + 边界 4
- 时效:arXiv v1 = 2026-07-06;ECCV 2026 接收;新鲜度 = 强;与 flyP 7 月主线(CVPR 2026 / ICCV 2026 / ECCV 2026)节奏一致
- 反方:见 §3 反方硬标签 ≥ 5 条
- 触发动作:E2 短评棒 + E3 草稿路由建议;入 multimodal 主分类(多模态长视频检索子分支);入 multimodal.md / longcontext.md 旁证级候选(不立标,因为立标已由 7-25 LongVideoAgent / 7-27 0950 Keyword Search 占据);由 E1 / E3 实例在权限范围内写入(本稿仅做短评,不直接写活文档)
- 信源截止日:GitHub 代码仓库
https://github.com/human-analysis/QSVideo当前 404 + Takara TLDR 仅给出 abstract 级摘要 —— 截止 2026-07-29 22:50 前需要补查:(a) 代码仓库正确 URL / (b) 实测复现脚本入口 / (c) 与 SeerRepo / LongVideoAgent 的同基准对比
1. 一句话核心
「多模态长视频 VLM 的根本瓶颈不是模型不够大,而是『严格帧预算下 frame selection 不准』;现有方法三类失败:biased relevance(直接拿原问题作 query,多选 / 复合题易偏)+ limited diversity(按相关度排序后帧之间互信息低)+ temporal collapse(选帧集中在窄时间区间,远端关键证据漏检)。QSVideo 给出『QSRanker(query-conditioned semantic ranker · Object/Action/Location 三维结构化 relevance)+ QSRetrieval(joint relevance + diversity + temporal coverage 优化)+ temporal alignment(long video 全局锚点 → 局部搜索;streaming recency-first)』三件套;在 8B video VLM 严格帧预算(8/16/32 frames)下,LVBench 提升 6.9-7.1 pp、StreamingBench 取得 SOTA,跨 VLM backbone 即插即用 —— 这是 2026 Q3 把『长视频检索』从『简单帧采样 / 单维相关度』推到『查询条件 + 结构化三维 + 多目标联合优化』的关键 ECCV 2026 立标。」
2. 检索范围
2.1 主论文(已抓摘要 + HTML 引言 + Related Work 段)
- arXiv:https://arxiv.org/abs/2607.04559(v1 = 2026-07-06, 2,353 KB)
- HTML(已抓 §1 Introduction + §2 Related Work):https://arxiv.org/html/2607.04559v1
- PDF(待补查全文 §3 Method + §4 Experiments):https://arxiv.org/pdf/2607.04559
- GitHub:
https://github.com/human-analysis/QSVideo(当前 404 · 待补查) - 会议:ECCV 2026(Accepted · 已在 arXiv comments 标注)
- 作者:Wei Ao, Lan Wang, Vishnu Naresh Boddeti · Michigan State University, East Lansing MI 48824, USA
- TLDR 摘要(Takara):https://tldr.takara.ai/p/2607.04559(仅 abstract 级,与 arXiv 一致)
- DOI:https://doi.org/10.48550/arXiv.2607.04559
2.2 flyP 主线上下文(已固化对比)
- flyP 7-14 MMProLong-LVLM critical-read:长视频 LLM benchmark 「多模态长上下文」立标 —— 与 QSVideo 共享 LVBench backbone;QSVideo 在 LVBench +6.9-7.1 pp 是 「检索方法层」补强 MMProLong 的「benchmark 层」;双路同向
- flyP 7-15 InftyThink critical-read:迭代长思维链 + 视频 —— 与 QSVideo 共享「长视频 + 检索」主题;InftyThink 是 「推理时 compute」侧,QSVideo 是 「推理前检索」侧,双路
- flyP 7-17 MMLongEmbed critical-read:多模态长上下文 retrieval(文本-视频 interleaved embedding)—— 与 QSVideo 共享 「多模态 retrieval」 主题;MMLongEmbed 偏 「embedding 空间检索」,QSVideo 偏 「query-conditioned + 多目标」,范式差异
- flyP 7-17 seerepo-multimodal-coding-agent critical-read:SeerRepo 多模态 coding agent —— 与 QSVideo 无关(代码 vs 视频)
- flyP 7-25 LongVideoAgent critical-read:LongVideoAgent 长视频 Agent —— 与 QSVideo 共享 「长视频 + 检索 + Agent」;LongVideoAgent 是 「Agent 范式」(主动滚动 + tool 调用),QSVideo 是 「一次性检索范式」(VLM 在前 / 检索在后),范式差异;两者可作 head-to-head 候选
- flyP 7-26 ABot-World-0 LongForcing critical-read:端侧世界模型 + 强制 rollout 训练 —— 与 QSVideo 无关(端侧 rollout vs 视频检索)
- flyP 7-27 0950 Keyword Search Is All You Need critical-read:「Agent-as-retriever vs Vector RAG」文本检索侧立标 —— 与 QSVideo 共享 「query-conditioned retrieval · 检索侧立标」主线;Keyword Search 是 「文本 RAG 检索侧」,QSVideo 是 「视频多模态检索侧」,双检索侧立标 = flyP 2026-07「检索范式转折」同向强化
2.3 同向工作(待补查)
- huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / yu2023self / hu2025selector —— 现有 multimodal retrieval baselines(QSVideo 引文列出的 6 个对比方法)—— 待补查摘要
- wang2024lvbench LVBench(已固化 flyP 7-14 同向) / lin2024streaming StreamingBench —— 双 benchmark
- SeerRepo multimodal coding agent / LongVideoAgent / MMLongEmbed —— 同基准 head-to-head 缺失是本棒 §3 反方要点
2.4 与 7-27 已有 4 篇 critical-read 的去重
| 文件 | 主线 | 与 QSVideo 关系 |
|---|---|---|
| 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md | 文本 RAG 检索侧立标 | 同向(检索侧 · 文本 vs 视频) |
| 2026-07-27-1000-rss-cameron-wolfe.md | RSS 摘要 | 信息源 |
| 2026-07-27-1005-rss-interconnects.md | RSS 摘要 | 信息源 |
| 2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read.md | agent harness / world model | 正交(agent 训练侧 vs 视频检索侧) |
去重结论:本棒「多模态长视频检索侧」是 7-27 新增主题,不与已有 4 篇重复;与 7-27 0950 Keyword Search 形成 「文本检索立标 + 视频检索旁证」双检索层闭环。
3. 核心贡献
3.1 问题定义清晰度(高)
- 三类失败模式命名准确:biased relevance / limited diversity / temporal collapse
- 与 LVBench 报告「VLM 长视频性能退化」对齐,引用
[wang2024lvbench] - 引文覆盖 2023-2025 关键 baselines(yu2023self / huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / hu2025selector)
3.2 方法三件套(清晰度高)
- QSRanker(query-conditioned semantic ranker):
- LLM 作 Question Analyzer → 把任意问题(含多选 / 复合题)转写为 retrieval-friendly query
- 沿 Object / Action / Location 三维评估 relevance(结构化打分,避开了 biased relevance)
- QSRetrieval:
- 联合优化 relevance + diversity(互信息) + temporal coverage(多目标 Pareto-style 搜索)
- 借鉴人类视频处理:question analysis → evidence discovery → understanding/reasoning
- temporal alignment:
- long video:全局锚点(locate globally relevant anchors)→ 局部搜索(search locally)
- streaming video:recency-first traversal(流式场景)
3.3 实验设计(待 PDF 核验)
- Benchmark:LVBench(长视频)+ StreamingBench(流式)
- Frame budget 严格约束:8 / 16 / 32 frames(三档)
- Backbone:8B video VLM(具体型号待 PDF 核验:可能是 MiniCPM-V 2.6 / InternVL2 / LLaVA-OV)
- 增益:LVBench +6.9-7.1 pp over backbone VLM;StreamingBench SOTA(具体型号待核)
- Plug-and-play:跨 VLM backbone(MiniCPM-o 2.6 / MiniCPM-V 2.6 / InternVL2 / LLaVA-OV)一致增益 —— 「即插即用」声明重要,降低部署门槛
4. 主要问题与风险
4.1 反方硬标签(≥ 5 条)
- R1 - 代码仓库 404:arXiv PDF 声称
https://github.com/human-analysis/QSVideo,实际访问 404;复现入口缺失 —— 论文接收 ECCV 2026 但代码未公开(可能在 camera-ready 之前 release);复现难度 = 高 - R2 - 同基准 head-to-head 缺失:与 LongVideoAgent(7-25 flyP 已固化)、SeerRepo(7-17 flyP 已固化)、MMLongEmbed(7-17 flyP 已固化)的同 LVBench / StreamingBench 直接对比未在 arXiv 摘要/HTML 中呈现 —— 「立标」可信度受影响
- R3 - 与闭源 SOTA 差距未明:摘要仅给 8B backbone +6.9-7.1 pp LVBench;但未与 Gemini 3 Deep Think 78.4% / GPT-5.5 71.2% 等 2026 闭源 SOTA head-to-head —— 「实用价值」边界待补
- R4 - QSRanker 依赖 LLM 转写:把 Question Analyzer 放在主路径上 = 增加 1 个 LLM 调用 + 1 个潜在失败点(LLM 转写错误会污染下游 retrieval) —— 「系统鲁棒性」风险
- R5 - ablation 切分粒度未公开:HTML 引言未给 ablation 表(QSRanker 单独 vs QSRetrieval 单独 vs temporal alignment 单独的贡献切分) —— 「贡献归因」可信度受影响
- R6 - Object/Action/Location 三维 relevance 拆分的理论依据:引言说「评估 object / action / location 三个维度」但未给出维度划分的形式化论证(为何不是 object / attribute / relation?为何是 location 而不是 scene / context?) —— 「结构化 relevance 维度」理论深度有限
- R7 - 与「LLM-as-Judge / 长上下文 attention sink」等长上下文模型的对照:摘要强调「不扩展模型 / 不扩展帧数」即插即用;但未与近期长上下文 VLM(LongViT / LongVA / VideoChat-Flash / LongVU 等)的 head-to-head —— 「方法定位」边界模糊
4.2 复现风险评估
- 代码完整度:代码 404 = 不可评估(待补查)
- 数据可获得性:LVBench / StreamingBench 均为开源 benchmark ✓
- 算力门槛:8B VLM + 8/16/32 帧预算 = 单卡 A100 可跑 ✓
- 训练成本:QSRanker + QSRetrieval = 检索阶段方法,无微调 ✓
- 端到端延迟:「2 个 LLM 调用(Question Analyzer + Video VLM)+ 1 个 retrieval 步骤」= 比 baseline 高 ~1.5-2x 推理时间(待 PDF 核 latency 表)
4.3 适用边界
- 场景适用:长视频 VQA / 流式视频监控 / 视频摘要 / 视频 grounded reasoning
- 场景不适用:高密度帧视频(24/30/60 fps + 需要逐帧理解的场景如视频超分 / 视频动作识别)
- 多语言:Question Analyzer 依赖 LLM = 多语言能力继承 LLM 多语言能力(待 PDF 核验)
- 可扩展性:8/16/32 帧预算 → 64/128 帧的扩展性待验(longer context 可能让 query-conditioned relevance 收益递减)
5. 可信度评估
5.1 五维评分(满分 5)
| 维度 | 分 | 理由 |
|---|---|---|
| 准确(accuracy) | 4 | 问题定义清晰,方法与问题对齐,但 ablation 缺失 |
| 深度(depth) | 4 | 三件套结构化清晰,三维 relevance 拆分有启发,但维度划分理论依据弱 |
| 清晰(clarity) | 5 | 图 1 流程图 + 长/流式分支策略 + 实验表格 8/16/32 帧三档约束齐备 |
| 遗漏(omission) | 3 | 与同向工作 head-to-head 缺失 + 代码 404 + ablation 切分缺失 |
| 边界(boundary) | 4 | ECCV 2026 接收 + 双 benchmark + 即插即用,但闭源 SOTA 对照缺失 |
总分 = 3.4/5 · B+ 级 · 多模态长视频「检索侧立标」旁证级候选
5.2 与 flyP 7 月主线立标对比
| 候选 | 评分 | 主题 | 状态 |
|---|---|---|---|
| 7-14 MMProLong-LVLM | 3.4 | 长视频 LLM benchmark | 立标(benchmark 层) |
| 7-15 InftyThink | 3.5 | 迭代长思维链 + 视频 | 立标(推理时 compute 层) |
| 7-17 MMLongEmbed | 3.5 | 多模态长上下文 retrieval | 立标(embedding 空间层) |
| 7-25 LongVideoAgent | 3.6 | 长视频 Agent | 立标(Agent 范式层) |
| 7-26 ABot-World-0 LongForcing | 3.6 | 端侧世界模型 + LongForcing | 立标(端侧 rollout 层) |
| 7-27 0950 Keyword Search | 3.5 | Agent-as-retriever 文本 RAG 检索侧 | 立标(文本检索侧) |
| 7-27 2250 QSVideo(本棒) | 3.4 | Query-conditioned 多模态视频检索 | 旁证(视频检索侧补强) |
结论:QSVideo 不抢立标位(立标已被 LongVideoAgent 占据 Agent 范式层 / Keyword Search 占据文本检索层),但作为 「多模态视频检索侧」旁证级候选 可入 notes/multimodal / notes/longcontext 旁证段;与 7-27 0950 Keyword Search 形成 「文本 + 视频」双检索侧闭环。
6. 是否建议入库 + 后续验证动作
6.1 入库建议
- GitHub-ready 草稿路径:
notes/multimodal/2026-QSVideo-Query-Conditioned-Video-Retrieval-short-review.md(短评,1500-2500 字)reviews/multimodal/2026-QSVideo-ECCV-2026-critical-read.md(完整 critical-read,本稿精简版)- 建议主分类:multimodal(次分类:long-context / video-understanding / retrieval)
- 建议标签:
video-retrievalquery-conditionedLVBenchStreamingBenchECCV-2026multimodal-RAGframe-budgetlong-video - 入 multimodal.md / longcontext.md 旁证段:由 E1 / E3 实例在权限范围内写入
- 不入立标候选:因立标位已被 7-25 LongVideoAgent + 7-27 0950 Keyword Search 占据
6.2 后续验证动作(截止 2026-07-29 22:50)
- A1 - GitHub 代码仓库补查:arXiv PDF 声明
https://github.com/human-analysis/QSVideo404 —— 需要查找正确 URL(可能是human-analysis/QSVideo改名 / 组织迁移 / 仓库私有化);可在 ECCV 2026 论文集页面 / MSU 实验室主页搜索 - A2 - 实测复现脚本入口:在拿到正确 GitHub URL 后,定位 (a) 训练入口(如果有) / (b) 推理入口(QSRanker + QSRetrieval + Video VLM pipeline) / (c) 评估入口(LVBench / StreamingBench)
- A3 - 与 SeerRepo / LongVideoAgent 同基准 head-to-head:在 LVBench / StreamingBench 上重跑两者,与 QSVideo +6.9-7.1 pp / SOTA 对照
- A4 - 与闭源 SOTA 对照:在 LVBench / StreamingBench 上重跑 Gemini 3 Deep Think / GPT-5.5 公开 API,定位 QSVideo 与闭源 SOTA 的差距
- A5 - ablation 切分粒度补查:PDF §4 应有 ablation table —— 核验 QSRanker / QSRetrieval / temporal alignment 单独的贡献切分
6.3 不建议复现的判断
- 不算革命性:3.4/5 评分 = B+ 级立标旁证,不是 paradigm-shift
- 复现 ROI 中等:8B VLM + 严格帧预算场景有工程价值,但代码 404 + head-to-head 缺失 + ablation 模糊 = 复现前 6 个月价值低于「直接读论文 + 摘要」
- 建议路线:先读 PDF 全文 + 等代码公开 + 等 head-to-head 实证,3 个条件齐备后再考虑复现
7. 关键引用清单
- 主论文:Wei Ao, Lan Wang, Vishnu Naresh Boddeti. QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding. arXiv:2607.04559, ECCV 2026, 2026-07-06. https://arxiv.org/abs/2607.04559
- 同向 backbone:
- LLaVA / LLaVA-1.5 / LLaVA-NeXT(LMM 起点)
- MiniGPT-4 / MiniCPM-V 2.6 / MiniCPM-o 2.6(开源多模态)
- InternVL2 / InternVL2.5 / Qwen2.5-VL(高质量开源 MLLM)
- VideoChat / Video-ChatGPT / Video-LLaVA / Video-LLaMA / LLaMA-Vid(视频 MLLM 起点)
- Insight-V(高分辨率多模态)
- Benchmark:
- LVBench · https://arxiv.org/abs/2406.08035(长视频 benchmark)
- StreamingBench · lin2024streaming(流式视频 benchmark)
- 对比 baselines:
- huang2025frag / wang2025seal / buch2025flexible / cvpr2025atp / yu2023self / hu2025selector(6 个 multimodal retrieval baselines)—— 待补查
- flyP 同主线:
- 2026-07-14 MMProLong-LVLM critical-read · longvideo.md
- 2026-07-15 InftyThink critical-read · multimodal.md
- 2026-07-17 MMLongEmbed critical-read · multimodal.md / longcontext.md
- 2026-07-17 seerepo-multimodal-coding-agent critical-read · agent.md
- 2026-07-25 LongVideoAgent critical-read · multimodal.md / agent.md
- 2026-07-26 ABot-World-0 LongForcing critical-read · multimodal.md / agent.md
- 2026-07-27 0950 Keyword Search Is All You Need critical-read · agent.md / multimodal.md(文本检索立标)
8. 一句话总结给 E1 / E3
QSVideo = 多模态长视频「检索侧立标」旁证级候选(3.4/5);不入立标位(已由 LongVideoAgent + Keyword Search 占据),入
notes/multimodal+reviews/multimodal旁证段;建议 GitHub-ready 草稿路径notes/multimodal/2026-QSVideo-Query-Conditioned-Video-Retrieval-short-review.md+reviews/multimodal/2026-QSVideo-ECCV-2026-critical-read.md;截止 2026-07-29 22:50 前补查 GitHub 真实 URL + head-to-head + ablation;本棒不直接写活文档(权限范围内由 E1 / E3 实例写入)。