Visual prompt engineering for video models

  • 类型:arxiv
  • 标识:2607.25537
  • 链接:https://arxiv.org/abs/2607.25537
  • 主分类:multimodal
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar + OpenAlex
  • S2被引:0
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:It is found that visual prompt engineering, or VIPE for short, improves video reasoning performance across tasks and can be even more effective than classic text-based prompt engineering or test-time scaling.
  • OpenAlex ID:W7171626448
  • OpenAlex DOI:10.48550/arxiv.2607.25537
  • DOI:10.48550/arxiv.2607.25537
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.25537
  • OpenAlex更新:2026-08-25
  • 待LLM分类:否
  • 标题中文:视频模型的视觉提示工程
  • TLDR中文:本文发现视觉提示工程(visual prompt engineering,简称 VIPE)能在多项任务上提升视频推理性能,甚至比经典的文本提示工程或 test-time scaling 更有效。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-29-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]