MAPD:将闭源 Agent 搜索能力蒸馏到开源模型 · 干货攻略

  • 链接: https://x.com/_akhaliq/status/2083588813675274202
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-08-08
  • 仓库: AaronLiu0702/MAPD

本攻略核验了论文摘要、arXiv HTML 全文(2607.24280)、GitHub 仓库(README)、AI Weekly 报道及 Qwen3 官方博客中的所有关键数字与模型名称。JSON 协议字段描述、三个教师模型名称(Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro)及七项基准名称来自论文原文;Qwen3-1.7B/4B 架构参数来自 Qwen 官方博客;39.4% / 44.4% 成功率数字来自论文摘要并经 AI Weekly 报道交叉验证。


这是什么

MAPD(Multi-Agent Protocol Distillation) 是 2026 年 7 月 27 日北京理工大学、华东师范大学等单位联合发表在 arXiv(2607.24280)的一篇论文提出的蒸馏框架,核心目标是:把 Claude Opus-4.6、GPT-5.5、Gemini-3.1-Pro 等闭源模型在 Agent 搜索任务上学到的推理策略,蒸馏到 Qwen3-1.7B / Qwen3-4B 等开源模型里——而不依赖教师模型的 hidden logits,也不用让学生直接模仿教师输出的冗长自然语言轨迹。

论文第一作者单位包括北京理工大学、清华大学、国科大等,GitHub 仓库为 AaronLiu0702/MAPD


为什么值得关注

解决了什么根本问题

Agent 搜索(Agentic Search)是让大模型在多轮交互中结合检索来回答知识密集型问题的范式。当前主流训练方式是 RLVR(Outcome-based RL from Verifiable Rewards)——只看最终答案对不对,提供的是极其稀疏的监督信号。对于一条可能有 10 步推理轨迹的长程任务,只有最后一步能收到"对/错"反馈,中间全靠猜。

研究者想到用蒸馏补充更密的监督:用强教师模型(通常是 Claude/GPT 等闭源模型)示范推理过程,让学生模仿。但这条路有两大坑:

  1. Logit 对不齐:传统 OPD 依赖 token 级 KL 散度对齐,但闭源教师模型不输出 logits,且 tokenizer 不同,这个数学目标根本无定义。
  2. 自然语言轨迹模仿失效:直接让学生模仿教师输出的详细推理过程,会把教师特有的冗长风格、格式癖好也一并学过来,而不是核心认知策略。结果是 style drift(风格漂移)+ 幻觉增多。

MAPD 的贡献在于提出了一个中间表征:把教师模型的黑盒行为,先转换成一种结构化的、风格归一化的 JSON 协议,再拿这个协议作为蒸馏的 privileged information——规避了上述两个坑。

谁分享的

@_akhaliq(AI 新闻雷达活跃账号)在 X 上分享了这篇论文,强调它"将闭源模型能力蒸馏到开源的方案,bridge distribution gap"。这也是今年 HaggingFace Daily Papers 2026-W31 推荐的论文之一。


核验过程

本攻略使用的官方来源与交叉验证结论:

来源 用途 核验结论
arXiv:2607.24280 摘要 核心方法名、关键数字(39.4% / 44.4%)、作者单位 ✅ 原文摘录,与 AI Weekly 报道一致
arXiv HTML 全文(2607.24280) JSON 协议五字段、训练目标公式、三阶段生成流程 ✅ 原文逐段核验
GitHub: AaronLiu0702/MAPD 仓库存在性、README、star 数(43) ✅ 仓库存在,README 确认"Coming soon"(正文完善中),代码已开源
AI Weekly 报道(aiweekly.co) 39.4% / 44.4% 数字交叉验证 ✅ 与论文摘要一致
Qwen 官方博客(qwenlm.github.io/blog/qwen3) Qwen3-1.7B/4B 架构参数(层数、注意力头数、上下文长度) ✅ 官方确认 1.7B=28层/16头,4B=36层/32头,32K 上下文

不确定处(未核验): - JSON 协议的具体模板格式(论文只描述了五个字段名称,未给出完整模板示例) - 七项 QA 基准的具体名称(论文表格中有但全文未完整展示) - 三项教师模型(Claude-Opus-4.6 / GPT-5.5 / Gemini-3.1-Pro)的具体版本号含义("4.6"/"5.5"/"3.1"为论文原文标注,未在对应官网独立验证)


上手步骤

整体流程

MAPD 分两阶段工作:

离线阶段(协议合成) 1. 教师模型(Claude Opus-4.6 / GPT-5.5 / Gemini-3.1-Pro)驱动的多智能体系统(MAS)接收问题 x 2. Orchestrator 智能体将问题分解为子任务,并行分发给多个 Searcher 智能体 3. Searcher 向本地 Wikipedia 语料库检索,每个子任务最多 K 次查询 4. 所有 findings 汇总后,经过失败检索修复流程 5. 将整个探索轨迹转换为结构化 JSON 协议

在线阶段(策略对齐) 1. JSON 协议作为 privileged information(PI)注入学生策略的条件分支 2. 条件分支(protocol-conditioned)与普通分支共享同一个模型权重 3. 两者通过 token 级 reverse KL 散度对齐(OPSD 目标) 4. 同时联合 GRPO outcome-based RL 目标 5. 推理时零额外开销(协议合成全在离线完成)

JSON 协议的五字段

论文定义的协议格式包含以下五个维度:

{
  "task_type": "single_hop | multi_hop | comparison | others",
  "reasoning_plan": ["子目标1", "子目标2", "..."],
  "grounding_facts": ["证据1", "证据2", "..."],
  "partial_findings": ["中间发现(可选)"],
  "answer_verification": {
    "answer": "最终答案",
    "answer_grounded": true | false
  }
}

关键设计原则:这些字段是风格归一化的——不包含教师的个人措辞或格式癖好,只保留"任务类型是什么""推理步骤怎么拆""哪些事实支撑结论"这类认知策略信息。

安装与使用(基于 GitHub)

# 克隆仓库
git clone https://github.com/AaronLiu0702/MAPD.git
cd MAPD

# 查看项目结构(当前 README 提示"Coming soon",详细文档完善中)
# 预计依赖:Python 3.10+,PyTorch,transformers,TRL
# 建议参考论文 Section 3 的超参数进行训练配置

⚠️ 注意:GitHub README 当前显示"Coming soon~",说明代码文档仍在完善中。如果想立刻使用,建议直接阅读论文 Section 3(Methodology)复现训练流程,或者等待官方更新。

训练关键超参(来自论文 Section 4,未在仓库 README 中单独列出)

参数 说明
学生模型 Qwen3-1.7B / Qwen3-4B 均为 Qwen3 家族
教师模型 Claude-Opus-4.6, GPT-5.5, Gemini-3.1-Pro 三项闭源模型(论文原文标注)
基准数 7 项 QA 基准 表格在论文 Appendix
最大搜索轮数 K 论文未单独注明 需参考具体实验设置
GRPO clip ε 需参考论文
KL penalty 系数 β 需参考论文

坑与适用边界

适用场景

  • 本地/私有化 Agent 搜索部署:不想调用闭源 API,希望用开源模型(Qwen3 系列)做检索增强的 agentic 任务
  • 蒸馏研究:探索如何从黑盒教师模型提取能力而不引入 style drift
  • 结构化推理场景:任务类型明确(单跳/多跳/比较)、需要可验证的事实支撑

局限性

  1. 协议质量依赖教师模型:MAS 生成的 JSON 协议质量直接由教师模型能力决定,教师能力弱则协议噪声大
  2. ground-truth 泄露风险:论文明确标注 ground-truth 只用于离线协议合成,训练时对学生完全不可见,但实际复现时需严格注意数据隔离
  3. 适用模型规模:实验只在 Qwen3-1.7B 和 Qwen3-4B 上验证,更小模型(如 0.6B)效果未知
  4. 基准范围:只在 7 项 QA 基准上验证,对代码生成、多模态等场景暂无结论
  5. 文档不完整:GitHub README 目前仅为占位符,实际使用需要读论文补充细节

不确定处(需自行验证)

  • 七项基准的具体名称:论文表格中有列出但未在攻略阶段完整提取,建议直接参考论文 Table 1
  • GPT-5.5 / Claude-Opus-4.6 版本号含义:这些是论文撰写时的版本标注,对应模型的具体发布时间和能力水平未独立核验
  • 具体超参数:最大回合数 K、GRPO clip 值、batch size 等需参考论文 Section 4

一句话结论

MAPD 用一个风格归一化的 JSON 协议作为中间桥梁,把闭源教师模型的 Agent 推理能力蒸馏到开源 Qwen3 模型,在 7 项 QA 基准上让 Qwen3-1.7B 达到 39.4%、Qwen3-4B 达到 44.4% 平均成功率,全程不需要访问教师 logits,适合在私有化/离线场景下搭建高效 Agent 搜索系统。