Multi-Turn On-Policy Distillation with Prefix Replay

  • 类型:arxiv
  • 标识:2607.04763
  • 链接:https://arxiv.org/abs/2607.04763
  • 主分类:agent
  • 形态:method
  • 被引:6
  • 被引来源:Semantic Scholar
  • S2被引:6
  • 影响力被引:0
  • TLDR:ReOPD turns expensive agent-environment interaction into a reusable offline resource, enabling scalable distillation across tools, tasks, and environments and preserves or improves OPD-level accuracy, uses zero tool calls during student training, and is at least 4$\times faster per rollout than OPD.
  • 待LLM分类:否
  • 标题中文:多轮在策略蒸馏与前缀回放
  • TLDR中文:ReOPD 将昂贵的 Agent-环境交互转化为可复用的离线资源,实现跨工具、任务和环境的可扩展蒸馏,在学生训练期间保持或提升 OPD 级别的准确率,零次工具调用,并且每次 rollout 至少比 OPD 快 4×。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-24-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-07-25-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-07-26-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-07-27-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-07-27-agent-memory-tool-use-candidates.json
  • [S2 enrich]