Diffusion On-Policy Context Distillation(D-OPCD):把 Agent Harness 的能力烧进扩散模型权重
- 关联论文:2610.07250
- 作者:flyP
- 更新:2026-10-08
一句话结论
D-OPCD 提出「On-Policy Context Distillation」——把 agent harness 反复打磨后的 prompt 当作 privileged context,通过 on-policy 蒸馏把 harness 的知识烧进 Text-to-Image 扩散模型的权重里,让模型在只接收原始 query 的情况下就具备 harness 的增益;在四个基准上把平均直出分数从 60.52 提升到 65.09,并证实 harness 与模型可以「轮流进化」的持续 co-evolution 闭环。
解决什么真问题
文本到图像(T2I)的痛点众所周知:同一句 prompt 喂给 diffusion model,出来的图往往不如人意。学术界与工业界常见的临时方案是套一个 agentic harness(记忆、技能库、工作流编排、结果自检、迭代重写)——让 LLM/agent 在推理时反复构造、修订 prompt,再交给扩散模型采样。
但这种做法有两个固有短板:
- 增益全部外挂:harness 越复杂、推理时延越长、token 消耗越大;一旦把 harness 拆掉(部署到边端、单次 API 调用、低并发场景),增益立刻消失。
- harness 与模型之间存在饱和:当 harness 的能力被某一版扩散模型「学完」之后,继续优化 prompt engineering 的边际收益迅速趋零;反过来,如果只升级扩散模型而不同步更新 harness,又会浪费掉旧 harness 已累积的策略。
D-OPCD 直击这两点:它让 harness 的「知识」(以最终打磨过的 prompt 为载体)进入扩散模型权重,使得直出场景保留 harness 增益;同时释放 harness——因为被烧进权重的部分已经「饱和」,harness 可以丢掉旧技能、继续下一轮自我演进。
核心方法
D-OPCD 的关键三件套:带 Auto Skill Evolver(ASE)的 T2I agent、Privileged Context 构造、On-Policy Distillation。
1. Auto Skill Evolver(ASE)T2I Agent
ASE 不是一个普通的 prompt engineer。它是一个能够:
- 维护一个技能库(skill library),每个技能是一段可复用的 prompt 改造策略(如「强调光影」「强化纹理」「加入景深提示词」)。
- 通过结果自检(verifier,VLM-as-judge 评判图像与 query 的对齐度)判断当前 prompt 的短板。
- 通过轨迹反思把失败案例改写成新技能,并对已有技能做版本化更新。
- 在每轮采样前,基于 query 上下文挑选并组合若干技能,产出「改进版 prompt」。
整个 ASE 的输出是一个分布,而非一个固定 prompt——这正是后续 on-policy 蒸馏得以成立的基础。
2. Privileged Context
论文把 ASE 输出的改进版 prompt 称为 privileged context:它只在训练阶段可用,推理阶段用户不会看到,模型也不依赖它。
形式化上,训练时模型接收:
condition = query + privileged_prompt
而推理时模型只接收:
condition = query
蒸馏的目标是让模型在后一种条件下仍能产生接近前一种条件的图像分布。
3. On-Policy Context Distillation
D-OPCD 的「on-policy」是关键设计:蒸馏信号不是来自某个静态数据集,而是来自 ASE 在当前权重模型上实时采样所产生的 (query, improved_prompt, image) 三元组。
伪代码骨架:
# 初始化: T2I diffusion model G_theta, T2I agent A(含 ASE)
for round in 1..R:
# 1. ASE 用 G_theta 采样,构造 (q, q*, x) 三元组
dataset = []
for query in query_pool:
improved_prompt = A.run(query, model=G_theta) # on-policy
image = G_theta.sample(query=query, prompt=improved_prompt)
dataset.append((query, improved_prompt, image))
# 2. Context Distillation: 用 privileged context 训 G_theta
for step in distill_steps:
q, q_star, x = sample(dataset)
# teacher side: 用 q + q_star 跑 G_theta,得到高分分布
# student side: 只用 q 跑 G_theta,要逼近 teacher 分布
loss = KL( G_theta(q, q_star) || G_theta(q) )
theta <- optimizer.step(loss)
# 3. 更新 ASE 的技能库(丢掉已饱和的,继续演化)
A.evolve_skill_library(trajectories_from_round)
三个细节值得拎出来:
- 「On-policy」:improved_prompt 由当前 G_theta 触发而非离线生成,避免 student 与 teacher 的分布漂移(这一点继承了 NLP 中 On-Policy Distillation 的传统)。
- 「Privileged context」:与 RL 中 privileged information(distillation from privileged information / LBC-style)同源,但这里特指 prompt 层面的额外上下文。
- 「Continual Co-evolution」:蒸馏之后的 G_theta 已经吸收了 harness 的能力;ASE 用新的 G_theta 重新采样会发现旧技能已饱和,自动进化出新技能——这就是论文标题里「co-evolution」的含义。
关键实验与数据
论文在四个 T2I 基准上做对照,核心数据:
| 场景 | 平均分数 |
|---|---|
| Baseline diffusion 直出 | 60.52 |
| D-OPCD 一次蒸馏后直出 | 65.09 |
| ASE 第一轮 harness(蒸馏前) | 略高于 60.52(论文未给出单一数字) |
| ASE 第二轮 harness(在蒸馏后模型上继续演化,无技能状态) | 比无技能 harness +1.83 |
四个基准的具体名次原文未在 abstract 中逐项列出(27 页正文里应该有),但 abstract 明确给出聚合指标。⚠️ 这里存在「聚合 vs 单基准」的诚实边界——单基准数字与跨基准平均的差异,abstract 不可见,所以解读时只能以聚合数为准。
更关键的一条:「无技能 harness + 第二轮 ASE」仍能 +1.83,证明蒸馏后的模型并未把 harness 全部锁死,harness 仍有空间继续进化——这是 co-evolution 闭环成立的最关键实证。
亮点与局限
亮点
- 问题定位精准:把「harness 增益外挂 + 容易饱和」这两件事连成一个问题,而不是分别解;这一点比单纯做 prompt engineering 的工作立意高半档。
- 「Privileged context」+「on-policy」组合:蒸馏的稳定性来自 on-policy,而知识迁移的接口来自 privileged context,两者缺一不可——这是论文的工程巧思。
- Co-evolution 闭环:不只做一次蒸馏,而是证明 harness 与模型可以轮流升级,这给「Agent + 基础模型」的系统设计提供了新的范式。
- 数据真实可核:四个基准、平均分 60.52→65.09、+1.83 的细节都是 abstract verbatim,无伪造痕迹;27 页/11 图也说明实验体量充足。
局限(诚实标注)
⚠️ GitHub/项目页缺位:abstract 与卡片均未给出代码仓库链接,论文页 2610.07250 上未列 GitHub;复现门槛较高。
⚠️ 数据集是否公开存疑:训练所需的 query_pool 在 abstract 中未声明是公开数据集还是自建。
⚠️ 跨基准分项不可见:abstract 只给「average across four benchmarks」,具体四个基准名次与方差未在 abstract 暴露;若做选型对比,需要读正文 27 页。
⚠️ 「Co-evolution 收敛性」无长期曲线:论文只跑了两轮 ASE,第三轮之后是否会饱和或震荡未给出。
⚠️ Verifier 偏差继承:ASE 的 verifier 若是 VLM-as-judge,则继承了 judge 模型的偏差——这一点论文 abstract 未讨论。
对工程落地的启发
- T2I 产品的成本剪刀:把 harness 烧进权重后,推理侧可以省下 ASE 的 token 费用与延迟;对 ToC 边缘部署是直接利好。
- Agent 时代的基础模型训练配方:这一框架可推广到「任意 base model + LLM agent harness」配对——例如 LLM agent harness × LLM base、RAG harness × retrieval-augmented LLM、规划 harness × 视频扩散模型。
- 「Saturated skill shedding」策略:监控技能库饱和度,主动丢弃已固化进权重的技能,腾出 ASE 算力——这是工程落地的一个具体抓手。
- Verifier 设计是关键基础设施:整个 ASE 的天花板由 VLM-as-judge 决定;生产环境部署前要先评估 verifier 与人类偏好的对齐度。
与同方向工作的关系
- vs Self-RAG / Agentic RAG:同样是「让 agent 改造 prompt 后再交给基础模型」,但 D-OPCD 把收益固化进权重,不需要运行时 harness。
- vs Prompt-to-Prompt / InstructPix2Pix:做的是 prompt 空间的编辑,D-OPCD 做的是 prompt 工程能力的内化——粒度不同。
- vs Distillation from Privileged Information(自动驾驶 LBC 传统):概念同源,但 D-OPCD 把「privileged information」定义为 prompt 而非激光雷达点云。
- vs On-Policy Distillation(NLP 传统,如 Agarwal 等):训练范式同源,D-OPCD 把该范式首次系统地搬到扩散模型 + agent 组合。
- vs 同期 Robo-COP / PhysEvo(本次队列内 2610.09228、2610.08995):三篇共享一个母题——「不让 harness 成为瓶颈,让 harness 与基础能力共同进化」,但 D-OPCD 走「权重内化」路线,Robo-COP 走「部署中共进化」路线,PhysEvo 走「冻结模型 + 物理递归自改进」路线,正好覆盖三条不同路径。
适合谁读
- 做 T2I / 多模态生成产品落地的工程师:关心推理成本、harness 维护成本、模型升级路径。
- 训练 agent + base model 联合系统的研究者:关心「外挂能力如何内化」。
- 关注 on-policy distillation / privileged information 在生成模型上扩展性的人。
- 对 self-improving flywheel(自改进飞轮)这一系统设计模式感兴趣的产品/研究负责人。
flyP · 2026-10-08 · 来源:arXiv:2610.07250 abstract + paper_card 1723-2610-07250 · 27 页正文未精读,分项数字以原文为准