CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
- 类型:arxiv
- 标识:2607.05465
- 链接:https://arxiv.org/abs/2607.05465
- 主分类:agent
- 形态:method
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction are introduced.
- OpenAlex ID:W7167739663
- OpenAlex DOI:10.48550/arxiv.2607.05465
- DOI:10.48550/arxiv.2607.05465
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.05465
- OpenAlex更新:2026-07-19
- 副分类:multimodal
- 待LLM分类:否
- 标题中文:CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑
- TLDR中文:提出了用于复杂图像创建与编辑的大规模多模态工具调用数据集 CanvasCraft,以及通过多轮交互学习编排异构视觉工具的工具增强多模态 Agent CanvasAgent。
- 来源文件:
- /inbox/tom/_candidates/2026-07-08-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]