DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

  • 类型:arxiv
  • 标识:2608.00486
  • 链接:https://arxiv.org/abs/2608.00486
  • 主分类:multimodal
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:This work proposes DreamTraj, which predicts a 6-DoF object trajectory from a single RGB image and a task instruction, requiring no video, depth, or CAD model at inference, and is the first approach to directly decode object 6-DoF trajectories from intermediate video diffusion representations rather than generated pixels.
  • 待LLM分类:否
  • 标题中文:DreamTraj:通过读取未渲染的视频扩散潜在生成 6-DoF 物体轨迹
  • TLDR中文:本文提出 DreamTraj,从单张 RGB 图像和任务指令预测物体 6-DoF 轨迹,推理时无需视频、深度或 CAD 模型,是首个直接从中间视频扩散表征(而非生成像素)解码物体 6-DoF 轨迹的方法
  • 来源文件
  • /inbox/tom/_candidates/2026-08-04-agent-rag-longcontext-candidates.json
  • [S2 enrich]