RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

  • 类型:arxiv
  • 标识:2609.05324
  • 链接:https://arxiv.org/abs/2609.05324
  • 主分类:multimodal
  • 形态:benchmark
  • TLDR:Vision-Language-Action (VLA) models have shown promising progress in language-conditioned robotic manipulation. However, existing datasets and benchmarks mainly evaluate task completion under predefined settings, offering limited insight into model reasoning under increasing spatial and procedural complexity. We introduce RoboSPA (Robot Spatial-Procedural Assessment), a large-scale robotic manipulation dataset and benchmark for diagnosing embodied reasoning in VLA models. RoboSPA focuses on two core dimensions, Fine-Grained Spatial Reasoning and Long-Horizon Procedural Planning, covering 10 ta
  • 副分类:evaluation
  • 待LLM分类:否
  • 来源文件
  • /inbox/tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json