Multi-Turn On-Policy Distillation with Prefix Replay
- 类型:arxiv
- 标识:2607.04763
- 链接:https://arxiv.org/abs/2607.04763
- 主分类:agent
- 形态:method
- 被引:6
- 被引来源:Semantic Scholar
- S2被引:6
- 影响力被引:0
- TLDR:ReOPD turns expensive agent-environment interaction into a reusable offline resource, enabling scalable distillation across tools, tasks, and environments and preserves or improves OPD-level accuracy, uses zero tool calls during student training, and is at least 4$\times faster per rollout than OPD.
- 待LLM分类:否
- 标题中文:多轮在策略蒸馏与前缀回放
- TLDR中文:ReOPD 将昂贵的 Agent-环境交互转化为可复用的离线资源,实现跨工具、任务和环境的可扩展蒸馏,在学生训练期间保持或提升 OPD 级别的准确率,零次工具调用,并且每次 rollout 至少比 OPD 快 4×。
- 来源文件:
- /inbox/tom/_candidates/2026-07-24-agent-rag-longcontext-candidates.json
- /inbox/tom/_candidates/2026-07-25-agent-rag-longcontext-candidates.json
- /inbox/tom/_candidates/2026-07-26-agent-rag-longcontext-candidates.json
- /inbox/tom/_candidates/2026-07-27-agent-rag-longcontext-candidates.json
- /inbox/tom/_candidates/2026-07-27-agent-memory-tool-use-candidates.json
- [S2 enrich]