SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- 类型:arxiv
- 标识:2607.10966
- 链接:https://arxiv.org/abs/2607.10966
- 主分类:multimodal
- 形态:benchmark
- 被引:1
- 被引来源:Semantic Scholar
- S2被引:1
- OpenAlex被引:0
- 影响力被引:0
- TLDR:Self-Verified Reasoner (SVR-R1), a multi-turn RL framework that turns a model's own verification into a learning signal for multimodal reasoning, is introduced, offering a simple yet effective recipe for bootstrapping multimodal reasoning.
- OpenAlex ID:W7168319354
- OpenAlex DOI:10.48550/arxiv.2607.10966
- DOI:10.48550/arxiv.2607.10966
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.10966
- OpenAlex更新:2026-09-03
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:SVR-R1:在强化学习中通过自验证自举多模态推理
- TLDR中文:本文提出自验证推理器 SVR-R1,一种多轮强化学习框架,将模型自身的验证转化为多模态推理的学习信号,提供了一种简洁而有效的多模态推理自举方案。
- 来源文件:
- /inbox/tom/_candidates/2026-07-21-rag-retrieval-reranking-candidates.json
- /inbox/tom/_candidates/2026-07-21-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]