The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

  • 类型:arxiv
  • 标识:2607.24720
  • 链接:https://arxiv.org/abs/2607.24720
  • 主分类:engineering
  • 形态:method
  • 被引:2
  • 被引来源:Semantic Scholar
  • S2被引:2
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:A unified and controlled multi-turn environment that enables precise control of long-horizon planning across three stages is introduced and it is shown that multi-teacher on-policy distillation (MOPD) integrates capabilities by converging to shared planning-pattern across environments.
  • OpenAlex ID:W7171571615
  • OpenAlex DOI:10.48550/arxiv.2607.24720
  • DOI:10.48550/arxiv.2607.24720
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.24720
  • OpenAlex更新:2026-08-25
  • 副分类:agent
  • 待LLM分类:否
  • 标题中文:多轮长时程规划的物理机制:从预训练到后训练的单教师与多教师 On-Policy Agentic 蒸馏
  • TLDR中文:提出一个统一且受控的多轮环境,可在三阶段精确控制长程规划;研究表明,多教师 on-policy 蒸馏 (MOPD) 通过收敛到跨环境共享的规划模式来整合多种能力。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-28-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]