flyP 精读 · LongVT:让多模态模型"原生工具调用"地思考长视频
- 日期:2026-10-07
- 实例:flyP(长上下文 + 多模态 + agent)
- 本文档:轻量精读 + 批判 + 入库建议
- 论文:LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
- 链接:https://arxiv.org/abs/2511.20785(v1 2025-11-25;v3 2026-05-21;HTML
https://arxiv.org/html/2511.20785v1) - 会议:CVPR 2026
- 作者机构:MiroMind AI + NTU + HKUST(GZ) + Tsinghua(LMMs-Lab Team),通讯 Zuhao Yang / Lidong Bing
- 代码/数据/模型:
- GitHub:https://github.com/EvolvingLMMs-Lab/LongVT
- 数据集:https://huggingface.co/datasets/longvideotool/LongVT-Parquet、https://huggingface.co/datasets/longvideotool/VideoSIAH-Eval
- 模型集合:https://huggingface.co/collections/lmms-lab/longvt
- Demo:https://huggingface.co/spaces/longvideotool/LongVT-Demo
- 主题标签:
#long-video#multimodal-agent#tool-calling#iMCoTT#agentic-RL#GRPO#VideoSIAH#MCP#open-source
1. 一句话定位
用 LMM 自身"时序定位"能力当 native video cropping tool,通过"全局粗看 → zoom-in 取段 → 重读 → 自反思"的 interleaved Multimodal Chain-of-Tool-Thought (iMCoTT) 循环,配合"冷启 SFT + agentic RL + agentic RFT"三阶段训练,让 Qwen3-VL 在长视频 QA/时序定位 benchmark 上稳定领先。
2. 核心贡献
- iMCoTT 范式:把"思考"从纯文本 CoT 升级为"思维 + 工具调用 + 视觉证据"交错链;
crop_video(start_time, end_time)是模型自己提出的、不是外部 retriever 触发。 - Native tool calling + 真执行:每个 tool call 通过 MCP server 真实执行,返回 base64 解码后的高密度帧作为下一轮视觉输入(README FAQ 明确:"No simulation or mocked tool response")。
- VideoSIAH 数据套装:247.9K SFT + 1.6K RL + 15.4K RFT + 1,280(README 现写 652,去重后)评测 QA,提出"Video Segment-In-A-Haystack"细粒度查询设置。
- 三阶段训练 + 跨 4 个长视频基准领先:冷启 SFT(学 tool-call 格式)→ agentic RL(GRPO 类)→ agentic RFT(refine 已有 rollout),三段解耦清晰。
- 可扩展到 follow-up ParaVT:把"顺序"crop 升级到"并行"crop,用 PARA-GRPO 解决"Tool Prior Paradox (Format Fragility + Tool Necessity Gap)"——说明这条线正在快速演进。
3. 方法要点(拆解)
3.1 模型与工具
- 底座:Qwen3-VL(README 提到
--model与 Qwen3-VL 开关)。 - 工具集:
crop_video(start_time, end_time)由 MCP server 实现,返回真实再采样的帧序列。 - 行为模式:
think → tool call → 看新证据 → 决定 refine 或 answer;与 R1 风格纯文本 CoT 的关键区别是"每一轮都重新看图"。
3.2 训练三阶段
| 阶段 | 数据量 | 目标 |
|---|---|---|
| Cold-start SFT | 247.9K | 让模型学会"什么时候调工具、怎么调、参数怎么填" |
| Agentic RL | 1.6K | GRPO 类 RL,让"该不该调、调得对不对"被奖励信号驱动 |
| Agentic RFT | 15.4K | 在已有 rollout 上做 rejection-sampling 微调,进一步打磨 |
→ 冷启 SFT 用 247.9K 巨量、RL/RFT 用极少样本——这是值得记住的工程经验:格式/行为靠大规模 SFT 烧,决策/正确性靠小样本 RL 校。
3.3 评测闭环
- VideoSIAH-Eval:去重后 652 QA,半自动 + 人在回路验证(README 与论文略有版本差异:v3 论文写 1280,README 当前写 652,需要进一步核对去重时间和规则)。
- 外加 4 个公开长视频 benchmark(应包括 VideoMME、LongVideoBench、MLVU、TempCompass 一类,待 PDF 核对)。
- LLM Judge + QA Filtering 都用 VLM 做视觉证据校验。
4. 实验与发现(基于摘要+HTML+README,待补 PDF 表格)
- 摘要级:LongVT 在 4 个长视频理解/推理基准上稳定超过 strong baseline。
- 经验级(README/官方页面信号):
- AI Paper of the Day(HF,2025-12-02)、周 Top3 / 月 Top5;
- CVPR 2026 接收 + AAAI 2026 talk + BAAI 2025 talk;
- 已产生 follow-up ParaVT,说明方法具备扩展空间。
- 工程级:完整 release 代码 / 数据 / 模型 / Demo;README 给出 SFT→RL→RFT→Eval 全链路脚本。
5. 实验/方法风险与盲点(批判)
| 维度 | 风险 |
|---|---|
| 底座绑定 | 方法完全围绕 Qwen3-VL;迁移到 GPT-5/Gemini 2.5 Pro 等闭源时,"native tool calling"不一定等效,README 也明确 OPENAI_BASE_URL 兼容但不一定复制 RL 训练数据。 |
| iMCoTT 的"幻觉修不修得了" | 工具能降低文本幻觉,但若模型初始 crop_video 时间窗偏了(被时序定位错误带偏),再读也可能在错段上"自洽式幻觉";需要 ablation 看错窗率。 |
| VideoSIAH 评测规模 | 论文 v3 写 1280,README 当前写 652;样本量对长视频 benchmark 而言仍偏小,需要看是否在多数据集上交叉验证。 |
| 真实工具 vs 模拟工具 | README FAQ 说"no simulation",但需要确认训练阶段和推理阶段 tool execution 的一致性(异步、缓存、错误处理),否则会出现 train/serve skew。 |
| MCP server 复杂度 | 真实 crop 会引入延迟/IO/帧解码失败,README 没看到对失败 case 的鲁棒性报告;和 AgencyBench 的"沙箱成本"是同一类问题。 |
| 数据污染 | 247.9K SFT 来源未在摘要展开,需要看是否复用 VideoMME / MLVU 训练集(部分 benchmark 公开训练/测试划分极严)。 |
| 奖励信号脆弱 | GRPO 在 agentic 设置下极易 reward hacking(如"疯狂 crop 但不答"或"先 crop 整段视频");1.6K RL 样本能否撑住策略稳定性是问号。 |
| Tool Prior Paradox | 作者自己已在 ParaVT follow-up 指出原生 RL agentic video reasoning 的两个失败模式:format fragility(格式脆)+ tool necessity gap(要不要调工具的两难),说明 LongVT 本身也没完全解决。 |
6. 复现难度评估
- 代码:✅ 仓库 + lmms-engine 环境脚本 + verl fork + 完整训练脚本 → 复现路径清晰。
- 数据:✅ HF 直接下载 LongVT-Parquet + VideoSIAH-Eval。
- 算力:⚠️ 高——247.9K SFT + 1.6K RL + 15.4K RFT,配合 768 frames 上限(README 默认
--max_frames 768),单卡 8×H100 起步,多机更稳。 - 评测:✅ Eval pipeline 完整,含 LLM Judge。
- 整体门槛:工程中等、算力高;对想"借用思路做小规模验证"的研究组可负担,但完整复现需要显著预算。
7. 可信度
- 机构:MiroMind AI + LMMs-Lab Team(NTU/HKUST-GZ/THU 系),在 LMM agent / tool use / RL 训练方向有持续产出(与 ParaVT、LongVILA、Time-R1 等交叉)。
- 会议:CVPR 2026 接收 + AAAI 2026 受邀 talk + HF 社区高排名。
- 开放程度:代码 + 数据 + 模型 + Demo 全部开源;甚至专门修了 SFT parquet schema bug 并发布去重版(README 时间线 2026-03-09)。
- 自我批判:作者在 follow-up ParaVT 中明确指出原生 RL agentic 推理的局限(Tool Prior Paradox),说明对方法边界是清醒的。
- 可信度判断:⭐⭐⭐⭐⭐(主线贡献扎实、落地工程成熟、社区信号强;扣分点在于评测规模和奖励信号鲁棒性需要更多第三方复现)。
- 待补查:v3 论文里 1280 vs README 652 的差异原因;4 个对比 benchmark 的具体名单与数字;reward shaping 设计;MCP server 错误处理。
8. 与我库已有选题的关系
- 与
2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md形成"agent 评测"互补: - AgencyBench 关注"1M-token 长任务执行"的 agent 评测闭环;
- LongVT 关注"长视频 agent 的 native tool calling 训练 + 评测"——一个偏通用 agent,一个偏多模态专项。
- 与
2026-10-06-2250-flyP-critical-read-4DCodeBench-inverse-graphics-dynamic-scenes.md形成"动态视觉内容"互补: - 4DCodeBench 偏"动态 3D/4D 场景生成与理解";
- LongVT 偏"长视频时序定位 + agentic 推理"。
- 与
2026-10-05-1550-flyP-critical-read-LoopCD-Looped-Transformer-Decoding.md形成"agentic inference"互补: - LoopCD 偏"decoder 端循环调用";
- LongVT 偏"工具调用作为推理一步"。
- 与多模态 digest、coding-agents digest 等"主题页"适合合并成"长视频 + agentic video reasoning"主题页。
9. 入库建议
- 建议入库:✅ 强烈建议。
- 建议路径:
- 评审稿:
reviews/2026-10-07-longvt-native-tool-calling-long-video.md - 主题页(联动):
topics/2026-multimodal-long-video-agent.md(与 4DCodeBench、VideoReasonBench、LongVideo-R1、Ego-R1 等并入同一主题) - 后续动作: 1. 拉 v3 PDF 与补充材料,确认 4 个对比 benchmark 与表格数字; 2. 跟踪 ParaVT(2026-05-20 已发布),看 "Tool Prior Paradox" 的解法是否可移植到非视频领域; 3. 在主题页里登记 Qwen3-VL + LongVT + ParaVT 三件套,作为"open-source native-tool-calling 视频推理"基线; 4. 写一段"agentic video reasoning 评测三件套(VideoMME / LongVideoBench / VideoSIAH-Eval)"对照小笔记。
10. 一句话总结
LongVT 把"思考"从文本 CoT 升级到"思维+工具+视觉证据"交错链(iMCoTT),用 native
crop_video工具 + 三阶段训练(SFT 247.9K / RL 1.6K / RFT 15.4K)+ 真实 MCP 执行,在 4 个长视频基准上领先;工程落地扎实、follow-up 已启动、值得入库并作为长视频 agent 主题页的旗舰条目。
附录:可靠性自检
- 轻量检索源:arXiv 摘要页 + HTML v1(方法+引言)+ GitHub README(训练/数据/FAQ 时间线)。
- 未深抓:v3 PDF 完整实验表、补充材料、ParaVT 论文细节(留作后续精读)。
- 未复制原文:所有结论均基于摘要/方法节/工程信号的中文重述;不输出论文段落或代码全文。
- 未触发 GitHub 写入:本任务仅产出本地 Markdown 草稿。