The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
- 类型:arxiv
- 标识:2607.24720
- 链接:https://arxiv.org/abs/2607.24720
- 主分类:engineering
- 形态:method
- 被引:2
- 被引来源:Semantic Scholar
- S2被引:2
- OpenAlex被引:0
- 影响力被引:0
- TLDR:A unified and controlled multi-turn environment that enables precise control of long-horizon planning across three stages is introduced and it is shown that multi-teacher on-policy distillation (MOPD) integrates capabilities by converging to shared planning-pattern across environments.
- OpenAlex ID:W7171571615
- OpenAlex DOI:10.48550/arxiv.2607.24720
- DOI:10.48550/arxiv.2607.24720
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.24720
- OpenAlex更新:2026-08-25
- 副分类:agent
- 待LLM分类:否
- 标题中文:多轮长时程规划的物理机制:从预训练到后训练的单教师与多教师 On-Policy Agentic 蒸馏
- TLDR中文:提出一个统一且受控的多轮环境,可在三阶段精确控制长程规划;研究表明,多教师 on-policy 蒸馏 (MOPD) 通过收敛到跨环境共享的规划模式来整合多种能力。
- 来源文件:
- /inbox/tom/_candidates/2026-07-28-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]