减少思考 token:下一代模型的核心优化方向 · 干货攻略

  • 链接:https://x.com/abacaj/status/2093114766738718755
  • 分类:x-tips
  • 来源:X @abacaj
  • 作者:Jay
  • 更新:2026-09-05

这是什么

2026年8月,AI 开发者 @abacaj 在 X 上发了一条简短而犀利的观察:

"they need to make models that think less, seems to be the only lever they have is how many tokens it generates while thinking"

这条帖获得 4.5K 次浏览,折射出一个正在形成共识的趋势——推理模型(thinking model)的 token 膨胀问题,已经成为行业痛点,而减少思考 token 数量,正成为下一代模型最重要的优化方向之一。

背后的核心问题是过度思考(overthinking):R1 风格模型在生成答案前,会输出大量"Wait"、"Hmm"、"Alternatively" 等自反思 token,有时高达数千个,其中大量是冗余的验证和试错循环。这些 token 不仅增加了延迟,还直接推高了推理成本——而商业 API 通常对输出 token 定价高于输入 token。

为什么值得关注

@abacaj 的洞察指向一个结构性问题:模型厂商当前可用的主要效率杠杆,就是控制思考 token 的生成量。这个判断在2026年正在被多路研究从不同角度印证:

  • NoWait 论文(arXiv:2506.08343)证明:直接压制"Wait"/"Hmm"类反思 token,可在 5 个 R1 系列模型上将 CoT 轨迹长度减少 27%–51%,且不损失模型效用。
  • TRS 论文(arXiv:2604.21764, ACL 2026 Industry)证明:引入"推理技能库"(skill library),在降低 token 消耗的同时反而提升了准确率,打破了"效率–准确率"二选一的困局。
  • 行业层面,agentic 工作流对 token 的消耗是普通对话的 5–30 倍(Gartner 分析),每增加一个工具调用就多一次模型调用,思考 token 的成本在规模化部署中被急剧放大。

对于 AI 工程师和模型使用者而言,这意味着: - 选型时不能只看原始 benchmark 分值,还要看模型在同等质量下的 token 消耗 - 在生产环境调度模型时,思考 token 长度是影响成本和延迟的关键变量 - 未来的模型护城河,很大程度上取决于谁能更高效地"思考"

核验过程

官方来源

1. NoWait 论文(arXiv:2506.08343,v2,2025-06-18)

  • arXiv 摘要页(2506.08343):确认论文全称为 Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency,作者团队以 UCL Chenlong Wang 为首,联合作者包括华盛顿大学 Ranjay Krishna 和 Tianyi Zhou。核心方法:训练-free,通过在解码时将 "Wait"、"Hmm"、"Alternatively" 等反思关键词的 logit 调为负值来抑制其生成。
  • arXiv HTML 全文(2506.08343v2):确认了关键数字——在 10 个 benchmark 上测试,涵盖文本推理(AMC 2023、AIME 2024、AIME 2025、GPQA-D)、视觉推理(MMMU、MMMU-Pro、MathVista、EMMA-mini)和视频推理(MMVU、VSI-Bench),5 个 R1 系列模型(QwQ、Phi4、Qwen3、Kimi-VL、QvQ)上 CoT 轨迹减少 27%–51%,文本推理任务 token 生成减少 13%–31%,不损失模型效用。
  • HuggingFace Papers 页面:总结 NoWait 为"训练-free 的即插即用方案,在多模态推理中提升效率同时保持效用",与摘要描述一致。

2. TRS 论文(arXiv:2604.21764, ACL 2026 Industry)

  • arXiv HTML 全文(2604.21764v1):确认论文全称为 Thinking with Reasoning Skills: Fewer Tokens, More Accuracy,作者来自 stallone0000(GitHub: stallone0000/Reasoning-Skill)。核心方法:训练-free、基于检索增强的框架,将长推理轨迹离线蒸馏为可复用的紧凑推理技能,在推理时检索相关技能指导后续推理,号称"打破效率–准确率 trade-off"。
  • EMNLP Findings PDF 备份(aclanthology.org):提取了 TRS 在 AIME 2024 I 上的结果——准确率 +2.54,输出 token 减少 11.4%,成本降低 10.8%;AIME 2024 II:准确率 +0.12,token 减少 7.4%,成本降低 6.3%。同时引用 NoWait(Wang et al., 2025)和 CoD(Chain-of-Draft,Xu et al., 2025)作为对比方法。
  • GitHub 仓库(stallone0000/Reasoning-Skill):确认了代码和数据集(HuggingFace: stallone0000/Reasoning-Skill)可用,还提供了在线 Demo(reasoning-skill.onrender.com)。

交叉验证

  • AlphaXiv 摘要页(alphaxiv.org/abs/2506.08343):独立描述 NoWait 达到 13–31% 的 token 生成减少,与 arXiv 原文的 27%–51% 减少范围同属一个量级,数字差异来自不同任务类型(文本推理 13–31%,多模态综合 27%–51%),两者不冲突。
  • Aclanthology PDF(ACL 2026 Findings):TRS 论文中直接引用了 NoWait 作为对比基线,确认两篇论文在学术上是独立且互补的工作,引用关系可交叉验证。
  • Rohan Paul X 推文(2025):独立描述了 NoWait 的方法("training-free method that prevents these models from generating explicit self-reflection tokens"),与论文摘要描述一致。
  • MarkTechPost 报道(关于 DTR 工作,2026-02):复现了 DTR 论文的核心数字(AIME 2025 Think@n 94.7% vs 92.7%),说明同类"减少思考 token"话题在行业中有持续报道热度,与 abacaj 的观察相互印证。

原帖与官方文档的一致性

@abacaj 的帖文为纯观点性陈述("they need to make models that think less"),没有具体数字或引用,因此不存在与官方文档的冲突。其核心判断——"减少思考 token 是模型厂商唯一可用的效率杠杆"——是一个方向性观点,与 NoWait 和 TRS 两篇论文的实证结论方向一致,可视为这一趋势的早期信号。

上手步骤

方法一:NoWait——直接压制反思 token

NoWait 是训练-free 的,不需要额外数据或微调,核心是在解码时将特定关键词的 logit 设为负值:

# NoWait 伪代码逻辑(基于论文描述)
# 在每个解码 step,检查下一个 token 是否为 "Wait"/"Hmm"/"Alternatively"
# 如果是,将其 logit 设置为负值,引导模型选择其他 token 继续推理

reflection_tokens = ["Wait", "Hmm", "Alternatively"]
for token in reflection_tokens:
    logits[token_id[token]] = -inf  # 抑制生成

实际实现需要: 1. 获取目标模型的词表(vocab),确定"Wait"/"Hmm"/"Alternatively"对应的 token ID 2. 在解码循环中,对这些 token 的 logit 做干预 3. 配合 beam search 或 sampling 策略使用

官方实现可参考 stallone0000/Reasoning-Skill 仓库(TRS),NoWait 的具体实现细节可在 arXiv PDF 中找到。

方法二:TRS——推理技能库

TRS 的思路是:不压缩当前推理过程,而是将过去的有效推理路径存为可复用技能:

# TRS 核心流程(伪代码)

# 离线阶段:将长 CoT 轨迹蒸馏为推理技能
skills = distill_skills(long_cot_trajectories)
# 每个技能 = {task_type, condition, reasoning_steps}

# 在线阶段:检索 + 引导
retrieved = retrieve_skills(query, skills)  # 向量检索
response = model.generate(query, skills=retrieved)

关键优势:不需要对模型做权重更新,是黑盒兼容的训练-free 方案。

快速实验建议

方法 适用场景 额外训练 质量影响 成本
NoWait 想直接压 token、接受轻微策略调整 多数任务无损失,部分复杂任务待验证 显著降低
TRS 任务有可复用推理模式(数学/代码) 离线构建技能库 有时反而提升准确率 降低(检索开销小)
组合 生产级推理优化 技能库 + 解码干预 最佳 最低

坑与适用边界

NoWait 的局限: - 对某些需要多步"等待–验证"模式的复杂任务,压制反思 token 可能导致模型跳过关键步骤,论文在 AIME 2025 等较新/较难的 benchmark 上观察到小幅质量波动(-0.04 到 -0.56),需要根据实际任务评估。 - NoWait 主要针对显式反思 token("Wait"/"Hmm"),对隐式的冗长推理链效果有限。 - 该方法在 R1 风格模型上验证,GPT-4o/o1/o3 等闭源模型的内部机制未知,无法直接应用。

TRS 的局限: - 技能库需要离线构建和维护,有额外的工程成本。 - 检索质量直接影响推理质量,如果任务类型与技能库不匹配,效果打折扣。 - 目前 Demo 和代码仓库质量有待生产验证。

@abacaj 判断的适用性: - "唯一杠杆"这个说法过于绝对——模型厂商还有其他维度:量化、剪枝、speculative decoding、架构改进(如 Mamba、linear attention)等。但对当前闭源模型 API 用户而言,思考 token 确实是他们可控的最主要效率杠杆。 - 对于本地部署模型,用户可以控制的杠杆远不止 token 长度,还包括硬件选择、batch size、量化精度等。

生产部署注意: - Agentic 场景中,思考 token 的成本会被工具调用次数放大(一次任务 = 多次模型调用),优化 token 效率的收益远大于单次对话。 - 在延迟敏感场景(如实时交互),NoWait 的解码干预会增加少量额外延迟,但减少了输出 token 总数,整体延迟通常是降低的。

一句话结论

减少思考 token 不是在削弱智能,而是在把智能变得更高效——NoWait 和 TRS 等研究已经证明,在某些场景下减少 token 反而能提升准确率;这正在成为下一代模型和推理系统的核心设计哲学,而对于 API 用户而言,思考 token 管理是当前最具性价比的效率杠杆。


核验来源:arXiv:2506.08343(NoWait)、arXiv:2604.21764(TRS)、stallone0000/Reasoning-Skill(TRS 代码)、AlphaXiv 2506.08343ACL Findings PDF;原帖 4.5K 播放量数据来自 X 平台展示值,未经独立核验。