ThinkingCap-Qwen3.6-27B:推理 Token 减半、精度不降的微调攻略 · 干货攻略
- 链接: https://x.com/_akhaliq/status/2074195249732128870
- 分类: x-tips
- 来源: X @_akhaliq
- 作者: Jay
- 更新: 2026-07-15
- 仓库: bottleapai/ThinkingCap-Qwen3.6-27B
这是什么
ThinkingCap-Qwen3.6-27B 是由 BottleCap AI 发布的推理效率优化微调模型,基于 Qwen 团队 2026 年 4 月开源的 Qwen3.6-27B(稠密 27B 参数多模态模型,支持思维链推理与非思维推理双模式)进行微调,核心目标是:在保持答案质量和风格完全不变的前提下,系统性削减推理时的"思考 Token"数量。
原帖分享者 @_akhaliq 标注的核心价值是"可直接复现的微调方案 + 精准 benchmark 数据,Token 成本压缩实操参考价值高"。非单纯压缩输出长度——而是让模型学会更高效地组织内部推理过程,等效缩短思考路径。
为什么值得关注
解决什么问题
大语言模型在复杂推理任务(数学、代码、科学问答)上普遍依赖"思考 Token"——模型在给出最终答案前生成的大量中间推理步骤。这些思考 Token 消耗大量上下文窗口和计算资源,尤其在 GPQA-Diamond(研究生级科学问答)这类高难度任务上,思考 Token 数量非常庞大。
传统压缩思考的方法(如截断、Prompt 限制)往往同时损害答案质量。ThinkingCap 的核心主张是:通过微调,模型学会了更精简但同样有效的推理路径,而非简单截断。
谁分享的
@_akhaliq 是 X 平台上知名的 AI 论文与代码雷达账号,以快速搬运高质量开源模型和论文著称。该帖获约 50K 阅读。
核验过程
本攻略基于以下来源进行核验,每条数据均可溯源:
| 来源 | 核验内容 |
|---|---|
HuggingFace 模型卡 bottleapai/ThinkingCap-Qwen3.6-27B(搜索索引片段) |
基准模型 vs ThinkingCap 在 SuperGPQA、MMLU-Pro、LiveCodeBench 的精度与 Token 数量对照表;模型使用说明 |
BottleCap 官方博客 bottleapai.com/thinkingcap-qwen3-6-27b |
整体方法论、12 个基准综合结论、Apache 2.0 许可声明 |
AI Weekly 报道(aiweekly.co) |
GSM8K 精度 93.3%→96.5%、LiveCodeBench 80.7%→84.3%、HuggingFace GGUF 变体 |
| Reddit r/LocalLLaMA 讨论帖 | 社区实测反馈,"same accuracy as base Qwen3.6 with ~50% fewer thinking" |
关键说法交叉验证结论:
- ✅ "50% 平均减少":BottleCap 官方 + AI Weekly 均有,远、近分布基准均有支撑(近分布 -57.7%,远分布 -45.8%)
- ✅ "SuperGPQA 精度 64.0±0.1 vs 64.0±0.2":来自 HF 模型卡搜索片段,两模型精度在统计误差范围内无法区分
- ✅ "MMLU-Pro 85.9→85.4(↓53.7% tokens)":来自 HF 模型卡搜索片段,精度下降 0.5 个百分点在统计误差内
- ✅ "LiveCodeBench 80.7%→84.3%(↓41.1% tokens)":AI Weekly 明确引用,精度反而提升
- ✅ "GSM8K 93.3%→96.5%(↓74.1% tokens)":AI Weekly 明确引用,精度提升且 Token 大幅减少
- ✅ "安全拒绝行为不变":Nemotron-Safety 98.9%→99.0%,HEx-PHI 99.9%→100.0%,均属统计噪声
- ✅ GGUF 量化版本存在:
bottleapai/ThinkingCap-Qwen3.6-27B-GGUF,Q4_K_M 等多种精度可选 - ⚠️ "超过 90% 减少的最佳情况":原帖主张,官方博客仅表述为"well over 60%",以官方描述为准
上手步骤
方式一:HuggingFace Transformers(最通用)
from transformers import AutoTokenizer, AutoModelForCausalLM
model_path = "bottleapai/ThinkingCap-Qwen3.6-27B"
tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
model_path,
torch_dtype="auto",
device_map="auto"
)
messages = [{"role": "user", "content": "Solve: 3x + 7 = 22. What is x?"}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
采样设置(来自 HF 模型卡): temperature=1.0, top_p=0.95, top_k=20, min_p=0.0,ThinkingCap 使用基模型的采样参数,不需要额外调整。
方式二:vLLM(高吞吐推理)
vllm serve bottleapai/ThinkingCap-Qwen3.6-27B \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.9 \
--enable-chunked-prefill
API 调用与 OpenAI 兼容:
curl -X POST http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "bottleapai/ThinkingCap-Qwen3.6-27B",
"messages": [{"role": "user", "content": "Your question here"}],
"max_tokens": 512
}'
方式三:SGLang
python -m sglang.launch_server \
--model-path bottleapai/ThinkingCap-Qwen3.6-27B \
--port 30000 \
--mem-fraction-static 0.88
方式四:GGUF + llama.cpp(消费级 GPU)
从 bottleapai/ThinkingCap-Qwen3.6-27B-GGUF 下载 Q4_K_M 量化(约需 17GB 内存):
huggingface-cli download bottleapai/ThinkingCap-Qwen3.6-27B-GGUF \
ThinkingCap-Qwen3.6-27B-Q4_K_M.gguf --local-dir .
llama-cli -hf bottleapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M \
-p "Hi"
方式五:Ollama
ollama run bottleapai/Thinkingcap-Qwen3.6-27B
坑与适用边界
⚠️ 适用边界
- 仅限思维链任务:ThinkingCap 针对的是有"思考过程"的推理任务优化。纯知识问答、闲聊等非推理场景,Token 节省效果不明显。
- 基座模型要求:必须基于 Qwen3.6-27B,其他模型不适用(无跨模型移植版)。
- 温度设置:官方推荐
temperature=1.0,低温度可能影响推理 Token 分配的优化效果。 - 精度选择:如需更高精度保留,优先使用 f16 而非量化版本;Q4_K_M 适合资源受限场景但可能有微小质量损失。
- 模型规模:27B 参数,需至少双卡或 48GB+ 显存(如 vLLM fp16);GGUF Q4_K_M 可单卡运行。
🔍 实用观察
- Token 节省幅度因任务而异:数学类(GSM8K)改善最显著(74%),长程推理(GPQA-Diamond)超过 60%,通用推理基准平均约 50%。
- 安全行为未受损:安全微调后的拒绝行为保持一致,不会因为减少思考 Token 而更容易 jailbreak。
- 精度有升有降:整体在统计误差范围内,但 LiveCodeBench 和 GSM8K 反而出现精度提升,说明部分场景下更高效的推理路径带来了更好的结果。
🔧 已知问题
- HuggingFace 页面直接访问有时 404,需通过模型 ID 直接引用(
bottleapai/ThinkingCap-Qwen3.6-27B在 Transformers 中可正常加载)。 - 官方未公布具体使用了何种 RL 算法,搜索片段中仅提到"state-of-the-art algorithms"和"online reinforcement learning"。
一句话结论
ThinkingCap-Qwen3.6-27B 用 RL 微调换来了平均 50%(部分场景 70%+)的推理 Token 节省,同时精度完全不动甚至局部提升,是 2026 年推理效率优化最值得关注的开源复现方案——只要你在用 Qwen3.6-27B,就值得试试。