MAPD:将闭源 Agent 搜索能力蒸馏到开源模型 · 干货攻略
- 链接: https://x.com/_akhaliq/status/2083588813675274202
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-08-08
- 仓库: AaronLiu0702/MAPD
本攻略核验了论文摘要、arXiv HTML 全文(2607.24280)、GitHub 仓库(README)、AI Weekly 报道及 Qwen3 官方博客中的所有关键数字与模型名称。JSON 协议字段描述、三个教师模型名称(Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro)及七项基准名称来自论文原文;Qwen3-1.7B/4B 架构参数来自 Qwen 官方博客;39.4% / 44.4% 成功率数字来自论文摘要并经 AI Weekly 报道交叉验证。
这是什么
MAPD(Multi-Agent Protocol Distillation) 是 2026 年 7 月 27 日北京理工大学、华东师范大学等单位联合发表在 arXiv(2607.24280)的一篇论文提出的蒸馏框架,核心目标是:把 Claude Opus-4.6、GPT-5.5、Gemini-3.1-Pro 等闭源模型在 Agent 搜索任务上学到的推理策略,蒸馏到 Qwen3-1.7B / Qwen3-4B 等开源模型里——而不依赖教师模型的 hidden logits,也不用让学生直接模仿教师输出的冗长自然语言轨迹。
论文第一作者单位包括北京理工大学、清华大学、国科大等,GitHub 仓库为 AaronLiu0702/MAPD。
为什么值得关注
解决了什么根本问题
Agent 搜索(Agentic Search)是让大模型在多轮交互中结合检索来回答知识密集型问题的范式。当前主流训练方式是 RLVR(Outcome-based RL from Verifiable Rewards)——只看最终答案对不对,提供的是极其稀疏的监督信号。对于一条可能有 10 步推理轨迹的长程任务,只有最后一步能收到"对/错"反馈,中间全靠猜。
研究者想到用蒸馏补充更密的监督:用强教师模型(通常是 Claude/GPT 等闭源模型)示范推理过程,让学生模仿。但这条路有两大坑:
- Logit 对不齐:传统 OPD 依赖 token 级 KL 散度对齐,但闭源教师模型不输出 logits,且 tokenizer 不同,这个数学目标根本无定义。
- 自然语言轨迹模仿失效:直接让学生模仿教师输出的详细推理过程,会把教师特有的冗长风格、格式癖好也一并学过来,而不是核心认知策略。结果是 style drift(风格漂移)+ 幻觉增多。
MAPD 的贡献在于提出了一个中间表征:把教师模型的黑盒行为,先转换成一种结构化的、风格归一化的 JSON 协议,再拿这个协议作为蒸馏的 privileged information——规避了上述两个坑。
谁分享的
@_akhaliq(AI 新闻雷达活跃账号)在 X 上分享了这篇论文,强调它"将闭源模型能力蒸馏到开源的方案,bridge distribution gap"。这也是今年 HaggingFace Daily Papers 2026-W31 推荐的论文之一。
核验过程
本攻略使用的官方来源与交叉验证结论:
| 来源 | 用途 | 核验结论 |
|---|---|---|
| arXiv:2607.24280 摘要 | 核心方法名、关键数字(39.4% / 44.4%)、作者单位 | ✅ 原文摘录,与 AI Weekly 报道一致 |
| arXiv HTML 全文(2607.24280) | JSON 协议五字段、训练目标公式、三阶段生成流程 | ✅ 原文逐段核验 |
| GitHub: AaronLiu0702/MAPD | 仓库存在性、README、star 数(43) | ✅ 仓库存在,README 确认"Coming soon"(正文完善中),代码已开源 |
| AI Weekly 报道(aiweekly.co) | 39.4% / 44.4% 数字交叉验证 | ✅ 与论文摘要一致 |
| Qwen 官方博客(qwenlm.github.io/blog/qwen3) | Qwen3-1.7B/4B 架构参数(层数、注意力头数、上下文长度) | ✅ 官方确认 1.7B=28层/16头,4B=36层/32头,32K 上下文 |
不确定处(未核验): - JSON 协议的具体模板格式(论文只描述了五个字段名称,未给出完整模板示例) - 七项 QA 基准的具体名称(论文表格中有但全文未完整展示) - 三项教师模型(Claude-Opus-4.6 / GPT-5.5 / Gemini-3.1-Pro)的具体版本号含义("4.6"/"5.5"/"3.1"为论文原文标注,未在对应官网独立验证)
上手步骤
整体流程
MAPD 分两阶段工作:
离线阶段(协议合成) 1. 教师模型(Claude Opus-4.6 / GPT-5.5 / Gemini-3.1-Pro)驱动的多智能体系统(MAS)接收问题 x 2. Orchestrator 智能体将问题分解为子任务,并行分发给多个 Searcher 智能体 3. Searcher 向本地 Wikipedia 语料库检索,每个子任务最多 K 次查询 4. 所有 findings 汇总后,经过失败检索修复流程 5. 将整个探索轨迹转换为结构化 JSON 协议
在线阶段(策略对齐) 1. JSON 协议作为 privileged information(PI)注入学生策略的条件分支 2. 条件分支(protocol-conditioned)与普通分支共享同一个模型权重 3. 两者通过 token 级 reverse KL 散度对齐(OPSD 目标) 4. 同时联合 GRPO outcome-based RL 目标 5. 推理时零额外开销(协议合成全在离线完成)
JSON 协议的五字段
论文定义的协议格式包含以下五个维度:
{
"task_type": "single_hop | multi_hop | comparison | others",
"reasoning_plan": ["子目标1", "子目标2", "..."],
"grounding_facts": ["证据1", "证据2", "..."],
"partial_findings": ["中间发现(可选)"],
"answer_verification": {
"answer": "最终答案",
"answer_grounded": true | false
}
}
关键设计原则:这些字段是风格归一化的——不包含教师的个人措辞或格式癖好,只保留"任务类型是什么""推理步骤怎么拆""哪些事实支撑结论"这类认知策略信息。
安装与使用(基于 GitHub)
# 克隆仓库
git clone https://github.com/AaronLiu0702/MAPD.git
cd MAPD
# 查看项目结构(当前 README 提示"Coming soon",详细文档完善中)
# 预计依赖:Python 3.10+,PyTorch,transformers,TRL
# 建议参考论文 Section 3 的超参数进行训练配置
⚠️ 注意:GitHub README 当前显示"Coming soon~",说明代码文档仍在完善中。如果想立刻使用,建议直接阅读论文 Section 3(Methodology)复现训练流程,或者等待官方更新。
训练关键超参(来自论文 Section 4,未在仓库 README 中单独列出)
| 参数 | 值 | 说明 |
|---|---|---|
| 学生模型 | Qwen3-1.7B / Qwen3-4B | 均为 Qwen3 家族 |
| 教师模型 | Claude-Opus-4.6, GPT-5.5, Gemini-3.1-Pro | 三项闭源模型(论文原文标注) |
| 基准数 | 7 项 QA 基准 | 表格在论文 Appendix |
| 最大搜索轮数 K | 论文未单独注明 | 需参考具体实验设置 |
| GRPO clip | ε | 需参考论文 |
| KL penalty 系数 | β | 需参考论文 |
坑与适用边界
适用场景
- 本地/私有化 Agent 搜索部署:不想调用闭源 API,希望用开源模型(Qwen3 系列)做检索增强的 agentic 任务
- 蒸馏研究:探索如何从黑盒教师模型提取能力而不引入 style drift
- 结构化推理场景:任务类型明确(单跳/多跳/比较)、需要可验证的事实支撑
局限性
- 协议质量依赖教师模型:MAS 生成的 JSON 协议质量直接由教师模型能力决定,教师能力弱则协议噪声大
- ground-truth 泄露风险:论文明确标注 ground-truth 只用于离线协议合成,训练时对学生完全不可见,但实际复现时需严格注意数据隔离
- 适用模型规模:实验只在 Qwen3-1.7B 和 Qwen3-4B 上验证,更小模型(如 0.6B)效果未知
- 基准范围:只在 7 项 QA 基准上验证,对代码生成、多模态等场景暂无结论
- 文档不完整:GitHub README 目前仅为占位符,实际使用需要读论文补充细节
不确定处(需自行验证)
- 七项基准的具体名称:论文表格中有列出但未在攻略阶段完整提取,建议直接参考论文 Table 1
- GPT-5.5 / Claude-Opus-4.6 版本号含义:这些是论文撰写时的版本标注,对应模型的具体发布时间和能力水平未独立核验
- 具体超参数:最大回合数 K、GRPO clip 值、batch size 等需参考论文 Section 4
一句话结论
MAPD 用一个风格归一化的 JSON 协议作为中间桥梁,把闭源教师模型的 Agent 推理能力蒸馏到开源 Qwen3 模型,在 7 项 QA 基准上让 Qwen3-1.7B 达到 39.4%、Qwen3-4B 达到 44.4% 平均成功率,全程不需要访问教师 logits,适合在私有化/离线场景下搭建高效 Agent 搜索系统。