想让 AI"想得更久"还不想 GPU 烧钱?这篇论文把推理成本砍到三分之一而不掉性能

  • 关联论文:2608.26070

你有没有发现 🤔:

现在的 AI 不再是"答得快"——而是"想得久才能答得对"

2024 到 2026 年 LLM 最确定的一条规律,叫 test-time scaling:让模型在答题前多想几步、多推几轮、多次验证,性能就能稳定提升——数学、代码、复杂推理全面受益。

代价是什么?

烧钱烧到 GPU 不够用


问题出在哪

模型每多想一步,KV cache 内存就线性涨一截

KV cache 是什么?一句话解释:模型"读过的上文"的临时记忆。模型推理时,需要把之前看过的每一个 token 临时存下来,以便新生成的 token 能"回头参考"。

这就带来一个问题:

  • 一条推理链 200K token 时,KV cache 内存占用可达数十 GB
  • 单条请求就吃掉一整张 GPU 显存。
  • 想让 100 个人同时跑长链推理?——集群规模直接爆

现在的几种主流方案都有明显的坑:

  1. Full attention(全量注意力):把所有 token 都存在 cache 里。推理越长越贵,部署成本完全不可控
  2. 朴素 sliding window(滑动窗口):只留最近 K 个 token。问题是——系统 prompt、工具定义、用户最初的指令都被滚出去了,模型开始"失忆",行为漂移到你完全接不住需求。
  3. Discard-all + 摘要(定期压缩):把旧的 KV 换成摘要向量。压缩质量不稳定,多步工具调用时早期指令不能丢。

作者观察到一个被忽视的中间地带

团队(包括 Niklas Muennighoff、Percy Liang、Jason Wei、Luke Zettlemoyer 等,Stanford + SambaNova + META + Contextual AI 的联合阵容)盯住了一个细节:

推理 trace 中大部分"中间 token"的重要性,会随推理进行而衰减。

什么意思?

中间 token 多数只是"通向下一步的过渡"——"嗯"、"所以"、"下一步考虑 X"——它们不是"需要长期回看的语义节点"。

但有两块必须永远保留:

  • 系统前缀(prefix):系统指令、工具定义、用户最初问题——这是模型的"合同"。
  • 最近窗口(window):刚刚生成的几千 token——这是模型"正在想的事情"。

中间的、老的 KV 块?丢掉就丢掉了,反正没人在乎它们


方法长什么样:Prefix Sliding

把 KV cache 切成两段:

KV cache
├── PREFIX 块(永远保留)
│     - 系统 prompt
│     - 工具定义 / function schemas
│     - 用户最初指令
│     - 关键的 few-shot 示例
└── WINDOW 块(只保留最近几千 token)
      - 当前正在写的推理步骤
      - 已生成的最近 W 个 token 的 KV

中间那一大段?直接 evict(驱逐)。下次 forward 时,模型只能"看到"前缀和最近窗口——但 LLM 在推理过程中主要"参考自我"的就是这两块

最关键的不变量:

总 cache 大小 = prefix_len + W,是常数——与生成长度无关。

这意味着:推理 trace 推到 10 万 token 还是 200 万 token,内存占用都一样


实际收益有多夸张?

论文最硬的一行是:

"Without training, Prefix Sliding can make existing models 3× faster while maintaining performance."

中文翻译:不训练就能让现有模型快 3 倍,性能还不掉

这是什么概念?

这是推理基础设施最稀缺的组合——"无代价收益"。多数 KV cache 优化方案(H2O、StreamingLLM 各种变体)都伴随质量回退;这一项声称没有。

而且它不止是个推理时 trick——它还能直接进 RL 训练目标。把"在 prefix sliding cache 约束下最大化 reward"作为训练目标,模型可以学会"自压缩中间推理"——这是把优化从部署侧推到训练侧的正反馈循环。


为什么这事现在重要

  1. 推理基础设施清单要更新:所有 KV cache 优化项目应把 Prefix Sliding 加入候选。3× 无损加速 = 延迟、吞吐、GPU 数量同时改善一档
  2. Agent 系统的天然后端:MCP / Agent 通常有大量工具定义 + 长系统 prompt,正好作为 prefix。配合 window 内的多步推理,整体内存可控。
  3. 搭配 paged attention 效果叠加:Prefix Sliding 是 cache 策略层,vLLM / SGLang 的 paged attention 是显存管理层——两者完全正交。生产部署可同时启用。
  4. 解锁 10 万+ token trace:传统 full attention 在这个尺度下 KV 内存已超出多数 GPU 节点;现在中等规模集群也能跑长链推理。
  5. 作者阵容工业级:Muennighoff(之前 Moonshot / SWE-bench)、Lewis(Llama 系)、Wei(Chain-of-Thought 提出者之一)——被工业界采用的概率远高于平均水平。

一个诚实的提醒 ⚠️

  • 代码尚未开源(截至 2026-08-28 提交 4 天)——生产系统不要直接依赖本文实现
  • W(窗口大小)是玄学:论文未公开默认值。W 太小 → 模型退化为"只看最近 token",MMLU 等任务可能掉 5–15pp;W 太大 → 内存收益消失。工程上必须对每个模型 + 任务组合跑完整的 accuracy-vs-W 曲线
  • prefix 截断风险被低估:如果系统 prompt + 工具 schema 本身超过 W,prefix 会被部分截断,等同于"无 prefix"。需要加 guard 而不是静默截断。
  • 3× 加速的"性能不降"未量化:abstract 截断导致 ablation 表不可见,需要等 camera-ready 版本或代码 release。

但即便如此——这个思路的方向是确定的。KV cache 是 LLM 推理的硬瓶颈,"无训练 3× 加速"是任何做推理基础设施的人都无法忽略的信号。


论文:arXiv 2608.26070 · Prefix Sliding · 无训练 3× 加速 · RL 训练解锁 100K+ token · Stanford / SambaNova / META / Contextual AI 联合出品


📣 推广卡片 · 小红书版

标题变体(3 选 1)

A(反常识型)

让 AI 慢点想 = 烧 GPU?这篇论文告诉你:能不烧钱还能快 3 倍

B(实用型)

LLM 长链推理显存爆?Prefix Sliding 把 cache 砍到三分之一还掉不了性能

C(悬念型)

Stanford + SambaNova + META 联合出品:让大模型"想更久"的 GPU 钱,能省 2/3 吗?

小红书卡片文案

📌 你有没有发现,AI 现在越来越"想得久"?

2024–2026 LLM 最确定的规律叫 test-time scaling——让模型多想几步、推几轮,性能就能稳定提升。代价是什么?烧 GPU 烧到爆

一条 200K token 的推理链,KV cache(模型的"临时记忆")能吃掉几十 GB。一整张 GPU 显存就跪了。

arXiv 2608.26070(Prefix Sliding) 给出了一个反直觉解法:

🪓 核心招:把 KV cache 切成两段 - PREFIX 块(永远保留):系统 prompt、工具定义、用户最初指令——这是模型的"合同" - WINDOW 块(滑动保留最近几千 token):正在想的推理步骤 - 中间全部 evict——反正没人在乎

🧮 数学不变量:总 cache 大小 = prefix_len + W,与生成长度无关

结果有多夸张?

不训练就能让现有模型快 3 倍,性能还不掉

这是推理基础设施最稀缺的"无代价收益"。多数 KV 优化方案(H2O / StreamingLLM)都伴随质量回退;这一项声称没有

而且还能进 RL 训练——把"在 cache 约束下最大化 reward"作为训练目标,模型学会"自压缩中间推理",推理 trace 推到 10 万+ token 仍可控

🎯 为什么这事现在重要?

1️⃣ Agent 系统的天然后端——MCP / Agent 通常有大量工具定义 + 长系统 prompt,正好作为 prefix 2️⃣ 搭配 paged attention 效果叠加——Prefix Sliding 是 cache 策略层,vLLM / SGLang 的 paged attention 是显存管理层,两者完全正交,生产部署可同时启用 3️⃣ 解锁中等规模集群长链推理——传统 full attention 在 10 万 token 时 KV 内存已超出多数 GPU 节点 4️⃣ 作者阵容工业级——Muennighoff(Moonshot / SWE-bench)+ Lewis(Llama 系)+ Wei(CoT 提出者之一)+ Stanford + SambaNova + META + Contextual AI 联合出品

📌 一个诚实的提醒 ⚠️

  • 代码尚未开源(截至 2026-08-28 提交 4 天)——生产系统不要直接依赖本文实现
  • W(窗口大小)是玄学——论文未公开默认值;W 太小 → 模型退化,W 太大 → 内存收益消失
  • prefix 截断风险被低估——系统 prompt + 工具 schema 超过 W 就会部分截断,等同"无 prefix"

💎 核心 takeawayKV cache 是 LLM 推理的硬瓶颈,能在不损失质量的前提下砍掉 2/3 内存 + 加速 3 倍——这种"无代价收益"是任何做推理基础设施的人都无法忽略的信号。即便代码未开源,思路方向已经确定。

📎 论文 ID:2608.26070 💬 评论区聊聊:你做 AI 产品时,有没有被 KV cache 显存爆"教育"过?

AI科普 #大模型 #LLM #推理优化 #GPU #KVcache #testtimescaling #Agent #Stanford #SambaNova #技术分享 #论文分享 #前沿科技 #深度学习