不破解模型就能"偷看"它的内心独白——一篇只用标准 API 就重建 GPT-6 类前沿模型思维链的论文
- 关联论文:2609.26637
你有没有这种感觉——
ChatGPT、Claude、Gemini 给你最终答案,但你完全不知道它是怎么想的。两个模型答对了同一道题,可能一个是扎实推理,一个是蒙对的——但你只看结果根本区分不了。
你大概率以为:想看闭源模型的"思考过程",要么等厂商主动暴露,要么去找能 hack 模型内部的技术大牛。
但 2026 年 9 月丹麦奥尔堡大学 / 哥本哈根大学 Tao Ren 等人发表的一篇论文 Tool-based CoT Extraction(arXiv 2609.26637,33 页 + 14 图)给了一个反常识的结论:
前沿模型的"隐藏 CoT"不是黑盒壁垒,只是 API 选择——只用厂商自己提供的标准工具调用(function calling / tool use)接口,注册一个虚拟工具,强制模型把推理写进工具参数里,就能重建一份与原生思维链行为等价的轨迹。
换句话说:你不需要破解模型,不需要 hook 推理引擎,甚至不需要厂商配合——只要 API 还允许自定义 tool 接收字符串参数 + tool-choice 强制选项,你就能"挤"出模型本来藏起来的思考。
一、为什么"看 CoT"这件事以前没人系统化做过
CoT(Chain-of-Thought,思维链)从 Wei et al. 2022 开始就成了大模型推理的标配。但对闭源前沿模型而言,CoT 被默认隐藏——你最多拿到一个被 API 截断的总结。这带来三个真实痛点:
- 测量缺口:基准准确率告诉你"模型能解什么",但不告诉你"怎么解的"。
- 可验证性塌缩:金融、医疗、合规场景需要"答案可追溯到具体推理步骤",闭源模型只给一个最终结果等于无法验证。
- 横向比较失真:模型 A 和 B 同分,谁更"会推理"?看不到 trace 只能比较分数不能比较过程。
这条缺口不是"模型架构黑盒"造成的,而是 API 层面的人为选择。本文的核心洞察是:几乎所有主流 API(OpenAI、Anthropic、各国产模型)都支持「自定义 tool 接收字符串参数」+ 「tool-choice 强制选项」,而这恰好就是让模型主动倾倒思考过程的最小漏斗。
二、协议到底怎么工作——把"思考"塞进工具参数
1. 注册一个虚拟"reasoning"工具
tools = [{
"name": "reason",
"description": "Use this to think step by step.",
"parameters": {"reasoning": {"type": "string"}}
}]
参数是字符串,意味着模型可以把任意长度的推理写进去——这正是闭源厂商能堵却没堵的口子。
2. 第一轮强制 tool-choice
resp = model.chat(msgs, tools=tools, tool_choice={"name": "reason"})
第一轮强制选 reason 工具,告诉模型"你想看推理"。之后放开自动选择,让它自己决定继续写推理还是给最终答案。
3. 固定 ack 抑制闭合
每轮工具调用回填 "Acknowledged.",防止模型觉得"工具已完成"而过早给最终答案——而是逼它继续推理。
整个协议三步走,纯客户端行为,不改模型权重、不依赖厂商后台——复现门槛极低。
三、最炸裂的关键发现
论文做了双层验证 + 三维横向对比 + 跨模型 trace 转移三组实验,得出几个让人耳目一新的结论:
结论 1:开源模型上提取的 CoT ≈ 原生 CoT
在 DeepSeek-V4-Flash、GLM-5.2 两个开源模型上做 ground truth 对照——这些模型原生暴露 thinking 字段,可以拿原始 CoT 和"提取 CoT"做词汇重叠、步骤结构、任务准确率三重对比。结论:匹配原生 CoT 任务表现,并显著优于无推理基线。
结论 2:闭源模型差异在"外化量"而非"操作类型"
用同一协议横向比较 GPT-6 Astra 与其他三个闭源前沿模型(数学、科学、代码三大类 benchmark),发现模型间差异主要在于"外化多少推理",而不是"做哪种推理"。Astra 在三个维度上都呈现"少而精"的画像:trace 最短、最不易压缩、推理路径最直接、分支最少——论文称此为 directed reasoning。
结论 3:Trace 转移是"看读者能力"的相对属性
把模型 A 的提取 CoT 当上下文喂给模型 B,看 B 能否复用 A 的推理:
- Astra 紧凑 trace 给弱模型:弱模型"有时说不出 trace 已包含的答案"——紧凑 trace 省略了弱读者需要的低层细节。
- Astra 紧凑 trace 给强模型:几乎无损——强读者能自行补全省略的低层步骤。
这条结论把"trace 的可读性"变成依赖于读者模型能力的相对属性,对 RAG、合成数据、蒸馏团队都有直接影响。
四、为什么这件事对每个 AI 工程师都很重要
- 评测升级:从"看最终答案准确率"升级到"看推理风格画像"。给 PM 看:"模型 A 答案对但 trace 短促跳跃;模型 B 答案同分但 trace 详尽可信"——决策依据更丰富。
- 数据合成质量指标:reasoning 数据合成 / distillation 时,传统只看"教师答案准确率"。本文说明还应加"学生能否复用教师 trace"——trace 紧凑度对学生的不友好度是真实成本。
- prompt 工程分流:multi-model 产品(同一 prompt 服务不同模型)时,紧凑 trace 给强模型省 token,展开 trace 给弱模型保准确——同套 prompt 不同处理。
- 审计厂商 API 行为:协议依赖 API 三个特性——自定义 tool string 参数 + tool-choice 强制 + 工具循环可到 final answer。建议每季度做一次 smoke test,避免厂商收紧接口导致协议无声失效。
- AI 安全 / 可验证性研究:处理"答案对 ≠ 推理对"的经典问题。本文给的方式是"行为证据"而非"形式化保证"——值得思辨。
五、必须警惕的边界
⚠️ 5 个局限必须在工程决策前知晓:
- post-hoc rationalization 风险未根除:即使开源对照成功,闭源侧 ground truth 仍缺。"trace 像推理"≠"trace 是推理"。
- 协议可能被厂商防御性堵掉:tool-choice 强制 + 自由字符串参数本质是 API 行为;任何一条收紧都会失效。
- benchmark 覆盖有限:数学、科学、代码三类——是否覆盖多跳推理、规划任务、长上下文任务未明。
- 公平比较细节缺失:不同模型的 tool-use 实现差异(参数长度上限、自由字符串接受度)如何控制未讨论。
- Astra 命名外部核实缺位:abstract 直接命名 GPT-6 Astra,但截至 2026-09 公开 API 中是否真有此具体命名未做外部交叉核验——引用本文时附"原文 reserved"注释。
六、一句话带走
闭源模型的 CoT 隐藏不是技术壁垒,而是产品选择——一个标准 tool 注册 + 一次 tool-choice 强制就能重建推理轨迹;这件事给"看分不看过程"的评测范式按下了重启键。
谁该读:大模型评测工程师、RAG / Agent 系统设计师、数据合成 / Distillation 团队、AI 安全 / 可验证性研究者、OpenAI 闭源模型评测研究者。
谁不必读:纯应用开发者——本文不直接提升下游任务指标。
三个标题变体
- 不破解模型也能偷看 AI 内心独白?——一篇用标准 API 重建 GPT-6 类前沿模型思维链的论文 🔍
- 闭源模型的 CoT 隐藏不是黑盒壁垒,只是 API 选择——tool-choice + 自定义工具,5 分钟挤出推理轨迹
- "答案对 ≠ 推理对"怎么破?——Astra 等四款前沿模型横向 trace 风格画像 + 跨模型转移实验
小红书卡片文案(约 220 字)
姐妹们刷到这条!👀
你以为想看闭源 AI 怎么想的,只能等厂商主动暴露思维链?
错!arXiv 2609.26637 告诉你——不用破解、不用 hack、不用厂商配合,只要 API 还允许「自定义 tool 接收字符串 + tool-choice 强制」,你就能把模型本来藏起来的思考挤出来 🫠
关键三步走:
✨ 注册虚拟"reasoning"工具 → 字符串参数 = 自由载体 ✨ 第一轮强制 tool-choice → 模型知道"你想看推理" ✨ 固定 ack 回填 → 抑制过早闭合,逼它继续推理
论文还顺手揭了 GPT-6 Astra 的"directed reasoning"画像:少而精、token 高效、把基础步骤内化、只外化关键节点;跨模型 trace 转移实验告诉你——紧凑 trace 给强模型几乎无损,给弱模型会"说不出" 💡
想做 AI 评测/RAG/数据合成的姐妹,这一篇值得收藏 ✨