flyP 精读 · LongVT:让多模态模型"原生工具调用"地思考长视频


1. 一句话定位

用 LMM 自身"时序定位"能力当 native video cropping tool,通过"全局粗看 → zoom-in 取段 → 重读 → 自反思"的 interleaved Multimodal Chain-of-Tool-Thought (iMCoTT) 循环,配合"冷启 SFT + agentic RL + agentic RFT"三阶段训练,让 Qwen3-VL 在长视频 QA/时序定位 benchmark 上稳定领先。

2. 核心贡献

  1. iMCoTT 范式:把"思考"从纯文本 CoT 升级为"思维 + 工具调用 + 视觉证据"交错链;crop_video(start_time, end_time) 是模型自己提出的、不是外部 retriever 触发。
  2. Native tool calling + 真执行:每个 tool call 通过 MCP server 真实执行,返回 base64 解码后的高密度帧作为下一轮视觉输入(README FAQ 明确:"No simulation or mocked tool response")。
  3. VideoSIAH 数据套装:247.9K SFT + 1.6K RL + 15.4K RFT + 1,280(README 现写 652,去重后)评测 QA,提出"Video Segment-In-A-Haystack"细粒度查询设置。
  4. 三阶段训练 + 跨 4 个长视频基准领先:冷启 SFT(学 tool-call 格式)→ agentic RL(GRPO 类)→ agentic RFT(refine 已有 rollout),三段解耦清晰。
  5. 可扩展到 follow-up ParaVT:把"顺序"crop 升级到"并行"crop,用 PARA-GRPO 解决"Tool Prior Paradox (Format Fragility + Tool Necessity Gap)"——说明这条线正在快速演进。

3. 方法要点(拆解)

3.1 模型与工具

  • 底座:Qwen3-VL(README 提到 --model 与 Qwen3-VL 开关)。
  • 工具集:crop_video(start_time, end_time) 由 MCP server 实现,返回真实再采样的帧序列。
  • 行为模式:think → tool call → 看新证据 → 决定 refine 或 answer;与 R1 风格纯文本 CoT 的关键区别是"每一轮都重新看图"。

3.2 训练三阶段

阶段 数据量 目标
Cold-start SFT 247.9K 让模型学会"什么时候调工具、怎么调、参数怎么填"
Agentic RL 1.6K GRPO 类 RL,让"该不该调、调得对不对"被奖励信号驱动
Agentic RFT 15.4K 在已有 rollout 上做 rejection-sampling 微调,进一步打磨

→ 冷启 SFT 用 247.9K 巨量、RL/RFT 用极少样本——这是值得记住的工程经验:格式/行为靠大规模 SFT 烧,决策/正确性靠小样本 RL 校。

3.3 评测闭环

  • VideoSIAH-Eval:去重后 652 QA,半自动 + 人在回路验证(README 与论文略有版本差异:v3 论文写 1280,README 当前写 652,需要进一步核对去重时间和规则)。
  • 外加 4 个公开长视频 benchmark(应包括 VideoMME、LongVideoBench、MLVU、TempCompass 一类,待 PDF 核对)。
  • LLM Judge + QA Filtering 都用 VLM 做视觉证据校验。

4. 实验与发现(基于摘要+HTML+README,待补 PDF 表格)

  • 摘要级:LongVT 在 4 个长视频理解/推理基准上稳定超过 strong baseline。
  • 经验级(README/官方页面信号):
  • AI Paper of the Day(HF,2025-12-02)、周 Top3 / 月 Top5;
  • CVPR 2026 接收 + AAAI 2026 talk + BAAI 2025 talk;
  • 已产生 follow-up ParaVT,说明方法具备扩展空间。
  • 工程级:完整 release 代码 / 数据 / 模型 / Demo;README 给出 SFT→RL→RFT→Eval 全链路脚本。

5. 实验/方法风险与盲点(批判)

维度 风险
底座绑定 方法完全围绕 Qwen3-VL;迁移到 GPT-5/Gemini 2.5 Pro 等闭源时,"native tool calling"不一定等效,README 也明确 OPENAI_BASE_URL 兼容但不一定复制 RL 训练数据。
iMCoTT 的"幻觉修不修得了" 工具能降低文本幻觉,但若模型初始 crop_video 时间窗偏了(被时序定位错误带偏),再读也可能在错段上"自洽式幻觉";需要 ablation 看错窗率。
VideoSIAH 评测规模 论文 v3 写 1280,README 当前写 652;样本量对长视频 benchmark 而言仍偏小,需要看是否在多数据集上交叉验证。
真实工具 vs 模拟工具 README FAQ 说"no simulation",但需要确认训练阶段和推理阶段 tool execution 的一致性(异步、缓存、错误处理),否则会出现 train/serve skew。
MCP server 复杂度 真实 crop 会引入延迟/IO/帧解码失败,README 没看到对失败 case 的鲁棒性报告;和 AgencyBench 的"沙箱成本"是同一类问题。
数据污染 247.9K SFT 来源未在摘要展开,需要看是否复用 VideoMME / MLVU 训练集(部分 benchmark 公开训练/测试划分极严)。
奖励信号脆弱 GRPO 在 agentic 设置下极易 reward hacking(如"疯狂 crop 但不答"或"先 crop 整段视频");1.6K RL 样本能否撑住策略稳定性是问号。
Tool Prior Paradox 作者自己已在 ParaVT follow-up 指出原生 RL agentic video reasoning 的两个失败模式:format fragility(格式脆)+ tool necessity gap(要不要调工具的两难),说明 LongVT 本身也没完全解决。

6. 复现难度评估

  • 代码:✅ 仓库 + lmms-engine 环境脚本 + verl fork + 完整训练脚本 → 复现路径清晰。
  • 数据:✅ HF 直接下载 LongVT-Parquet + VideoSIAH-Eval。
  • 算力:⚠️ 高——247.9K SFT + 1.6K RL + 15.4K RFT,配合 768 frames 上限(README 默认 --max_frames 768),单卡 8×H100 起步,多机更稳。
  • 评测:✅ Eval pipeline 完整,含 LLM Judge。
  • 整体门槛:工程中等、算力高;对想"借用思路做小规模验证"的研究组可负担,但完整复现需要显著预算。

7. 可信度

  • 机构:MiroMind AI + LMMs-Lab Team(NTU/HKUST-GZ/THU 系),在 LMM agent / tool use / RL 训练方向有持续产出(与 ParaVT、LongVILA、Time-R1 等交叉)。
  • 会议:CVPR 2026 接收 + AAAI 2026 受邀 talk + HF 社区高排名。
  • 开放程度:代码 + 数据 + 模型 + Demo 全部开源;甚至专门修了 SFT parquet schema bug 并发布去重版(README 时间线 2026-03-09)。
  • 自我批判:作者在 follow-up ParaVT 中明确指出原生 RL agentic 推理的局限(Tool Prior Paradox),说明对方法边界是清醒的。
  • 可信度判断:⭐⭐⭐⭐⭐(主线贡献扎实、落地工程成熟、社区信号强;扣分点在于评测规模和奖励信号鲁棒性需要更多第三方复现)。
  • 待补查:v3 论文里 1280 vs README 652 的差异原因;4 个对比 benchmark 的具体名单与数字;reward shaping 设计;MCP server 错误处理。

8. 与我库已有选题的关系

  • 与 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md 形成"agent 评测"互补:
  • AgencyBench 关注"1M-token 长任务执行"的 agent 评测闭环;
  • LongVT 关注"长视频 agent 的 native tool calling 训练 + 评测"——一个偏通用 agent,一个偏多模态专项。
  • 与 2026-10-06-2250-flyP-critical-read-4DCodeBench-inverse-graphics-dynamic-scenes.md 形成"动态视觉内容"互补:
  • 4DCodeBench 偏"动态 3D/4D 场景生成与理解";
  • LongVT 偏"长视频时序定位 + agentic 推理"。
  • 与 2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md 形成"agentic inference"互补:
  • LoopCD 偏"decoder 端循环调用";
  • LongVT 偏"工具调用作为推理一步"。
  • 与多模态 digest、coding-agents digest 等"主题页"适合合并成"长视频 + agentic video reasoning"主题页。

9. 入库建议

  • 建议入库:✅ 强烈建议。
  • 建议路径:
  • 评审稿:reviews/2026-10-07-longvt-native-tool-calling-long-video.md
  • 主题页(联动):topics/2026-multimodal-long-video-agent.md(与 4DCodeBench、VideoReasonBench、LongVideo-R1、Ego-R1 等并入同一主题)
  • 后续动作: 1. 拉 v3 PDF 与补充材料,确认 4 个对比 benchmark 与表格数字; 2. 跟踪 ParaVT(2026-05-20 已发布),看 "Tool Prior Paradox" 的解法是否可移植到非视频领域; 3. 在主题页里登记 Qwen3-VL + LongVT + ParaVT 三件套,作为"open-source native-tool-calling 视频推理"基线; 4. 写一段"agentic video reasoning 评测三件套(VideoMME / LongVideoBench / VideoSIAH-Eval)"对照小笔记。

10. 一句话总结

LongVT 把"思考"从文本 CoT 升级到"思维+工具+视觉证据"交错链(iMCoTT),用 native crop_video 工具 + 三阶段训练(SFT 247.9K / RL 1.6K / RFT 15.4K)+ 真实 MCP 执行,在 4 个长视频基准上领先;工程落地扎实、follow-up 已启动、值得入库并作为长视频 agent 主题页的旗舰条目。


附录:可靠性自检

  • 轻量检索源:arXiv 摘要页 + HTML v1(方法+引言)+ GitHub README(训练/数据/FAQ 时间线)。
  • 未深抓:v3 PDF 完整实验表、补充材料、ParaVT 论文细节(留作后续精读)。
  • 未复制原文:所有结论均基于摘要/方法节/工程信号的中文重述;不输出论文段落或代码全文。
  • 未触发 GitHub 写入:本任务仅产出本地 Markdown 草稿。