你和 ChatGPT 聊到第 5 轮,它就开始"忘了"你最初要什么 —— ICLR 2026 获奖团队的新论文告诉你为什么

  • 关联论文:2607.20734
  • 作者Jihoon Tack¹(Microsoft Research Redmond, AI Interaction and Learning 组 Senior Researcher · KAIST PhD AI 2025-08 · Google PhD Fellowship 2023)+ Philippe Laban¹(Microsoft Research)+ Jennifer Neville²(Purdue University · Department of Computer Science + Statistics)
  • 机构Microsoft Research Redmond(AI Interaction and Learning 组)+ Purdue University(¹ Microsoft Research · ² Purdue University)
  • 完整链接
  • 论文:https://arxiv.org/abs/2607.20734
  • v1:https://arxiv.org/abs/2607.20734v1(2026-07-22 21:14:44 UTC 提交 · 1,802 KB)
  • PDF:https://arxiv.org/pdf/2607.20734
  • DOI:https://doi.org/10.48550/arXiv.2607.20734(arXiv-issued DOI via DataCite)
  • HF:https://huggingface.co/papers/2607.20734(显示"MicrosoftResearch"作者归属)
  • 提交人邮箱:https://arxiv.org/show-email/30f6ac23/2607.20734
  • 论文基本信息:20 pages · 10 figures · cs.LG · v1 2026-07-22 21:14:44 UTC
  • 重要研究脉络:本篇是同团队 arXiv:2505.06120 "LLMs Get Lost In Multi-Turn Conversation" 的延续工作 —— 后者于 ICLR 2026 获 Best Paper Award(Philippe Laban + Jennifer Neville 团队获奖)

你有没有过这种体验:跟 ChatGPT 聊了一个复杂任务,聊到一半改了主意、改了约束、甚至完全换了个方向,结果 AI 就开始"装糊涂"——它好像只记得你最近两句话,你一开始想要什么、为什么想要,它全忘了?

这不全是你的错觉。2026 年 7 月 22 日挂在 arXiv 上的一篇论文(arXiv:2607.20734 · "LLMs Get Lost in Evolving User Intent" · 作者 Jihoon Tack¹ + Philippe Laban¹ + Jennifer Neville² · 隶属 Microsoft Research Redmond(AI Interaction and Learning 组)+ Purdue University)用一组严谨的实验证明了一件事:当用户的意图在多轮对话中不断演变,所有主流大模型都会出现显著性能下降(substantial drops across model families)

为什么这件事重要?因为这是当下几乎所有 AI 产品(不管是个人助理、客服 Agent、还是 Coding Agent)的核心场景:用户从来不会一次性把任务说清楚。他们会先抛个大概方向,再补充细节,再推翻前面的想法,再转向另一个目标。论文把这个过程叫做 "意图演变"(Evolving User Intent),并把它从模糊的"多轮对话"中抽出来,作为一个独立的、可评测的维度。

⚠️ 必须说明:本篇是 Microsoft Research + Purdue 团队的延续工作。他们 2025 年挂出的前作 arXiv:2505.06120 "LLMs Get Lost In Multi-Turn Conversation"(Philippe Laban + Hiroaki Hayashi + Yingbo Zhou + Jennifer Neville)于 ICLR 2026 获 Best Paper Award。本篇延续并细化了"evolving / 修订 / 重定向"维度,是研究血脉清晰的连续两棒。

大模型在多轮对话里到底输在哪里

论文团队的核心贡献是一个可复用的评测框架——把现有的"一问一答"静态 Benchmark(single-turn, fully-specified)改写成多轮对话,让用户的意图在对话中演变

  1. 增量披露(incremental reveal):用户不会一次说完,而是拆成多个子问题分轮给出
  2. 修正(revise):第二轮突然说"刚才那个条件改一下,温度从 Celsius 改成 Fahrenheit"
  3. 重定向(redirect):聊到一半完全转向另一个相关任务

然后拿多个模型家族(包括 OpenAI 的 GPT、Anthropic 的 Claude、各种开源 LLM)都跑了一遍。结果:所有模型家族都出现显著性能下降(substantial drops across model families)——一个在静态单轮任务上表现不错的模型,到了动态多轮意图演变场景,性能会大幅回落(abstract 是定性表述"substantial drops",未给出具体百分比数字,需翻 PDF §4 实验细节)。

更深层的原因有三:

  • 过早假设(premature assumption):模型在对话早期就做了一个错误假设,然后就死抱着这个假设不撒手,从不主动修正
  • 语义漂移(semantic drift):意图变化累积后,Context 里新旧信息互相打架,模型分不清哪个是当前真相
  • 意图-执行耦合(intent-execution coupling):模型把"理解用户想干什么"和"完成任务"耦合在一起处理,所以意图一变,整个执行链路就崩了

一个有点反直觉的工程结论

论文团队还发现了一件值得产品经理记住的事:当多轮对话效果不好时,"重开对话"反而比"继续当前对话"更有效

这听起来像废话,但背后的机制是:意图漂移累积到一定程度之后,Context 里的历史信息不再是"资产",反而是"干扰"。继续对话时,模型会反复回去翻那些已经过时的假设,越翻越乱。重开对话虽然丢了历史,但也丢了噪声。

这意味着一个工程师以前觉得"挺蠢"的产品决策——"对话超过 10 轮就提示用户重开"——其实有严谨的研究支撑。

💡 关键工程启示:对于长流程任务(Coding Agent、客服 Agent、复杂研究助手),"分阶段 + 每阶段重开" 比"一次性长对话"更可靠。这与 Claude Opus 5 / OpenAI o3 / Microsoft Agent Framework 1.0 等 2026-Q3 平台层"分阶段代理化"方向高度吻合 —— 是同一趋势的评测层证据。

一个核心方法论贡献:可复用的评测改造 protocol

论文另一个重要贡献是评测方法的可复用性——他们提出了一个把现有静态 Benchmark 改写成动态多轮对话的标准 protocol:

  • 保留原始评测协议:改写后的多轮对话在最终评测时仍按原 benchmark 的指标计算(避免改写失真)
  • 无新标注成本(without new annotation):复用现有 benchmark,无需新标注
  • 跨任务适用:abstract 写"across multiple tasks"(未在 abstract 列出具体任务名,需翻 PDF §4)
  • 跨模型家族适用:GPT / Claude / 开源 LLM 都可作为被测对象

这意味着任何研究团队 / 产品团队都可以零成本地把自家静态评测改成动态评测,立刻发现"自家模型在真实用户手上"的真实弱点。

为什么你应该读这篇论文

如果你在做 AI 产品(不管是 To C 助理、To B 客服 Agent、还是 Coding Agent),这篇论文告诉你一个残酷的事实:你团队花三个月调出来的"单轮 SOTA"模型,到了真实用户手上可能是另一个东西。因为真实用户从来不会给你"一句话完整任务"。

如果你只是 ChatGPT 的重度用户,这篇论文告诉你为什么"长对话里 AI 变笨了"不是玄学,而是结构性问题——下次你打算跟它聊 20 轮做一件复杂事时,主动分阶段重开对话反而比"接着聊"更省时间。

如果你做评测研究,这篇论文给了一个低成本的方法论:把现有静态 Benchmark 改成动态多轮版,零新标注成本,就能暴露当前系统的真实弱点。具体怎么改、改哪些 Benchmark、怎么避免改写失真,论文里都有详细步骤。

如果你关注 2026 年 AI 评测前沿,这团队是 ICLR 2026 Best Paper Award 获奖团队(arXiv:2505.06120 · "LLMs Get Lost In Multi-Turn Conversation"),本篇是其延续工作 —— 研究血脉清晰,值得持续追踪。

⚠️ 几处需要警惕的边界

  • abstract 未给出"跨模型家族下降"具体百分比:仅说"substantial drops across model families",需翻 PDF §4 实验表格获取 GPT-4 / Claude / 开源模型的具体下降数字(abstract 不公布 = 需深入 PDF)。不要凭空给"60 分 vs 90 分"等具体数字——abstract 没这么说。
  • 2026-07-22 刚挂出的 preprint(v1):极新论文,仅 4 天前(截止 7-26),v2/v3 暂无,完整模型列表与补充实验还在路上。
  • 评测任务完整列表 abstract 未点名:abstract 仅"across multiple tasks"未列出具体 benchmark 名(HotpotQA / GSM8K 等常见候选需翻 PDF §4 确认)——不要直接假设是某个具体 benchmark。
  • 代码未开源(截止 7-26):abstract 提及"code will be released"但未给 GitHub URL,HF 页 https://huggingface.co/papers/2607.20734 也未挂代码链接。不要假设有现成 GitHub 仓库可用
  • 评测方法本身的局限:论文主要测"任务完成率",但用户体验还包括对话自然度、错误恢复速度、意图澄清时机这些维度——这些都没纳入指标。
  • 本篇与 arXiv:2505.06120 前作的关系:本篇是同团队延续工作,但评测的具体场景实现、三类意图演变的具体技术细节与前作差异,需对比两篇 PDF 深入分析;旧版提及的 "MT-OSN、TurnWiseEval、Beyond Continuity 等 2026 年文献" 多为同领域后续工作(ACL 2026 findings / arXiv Liu et al. 2026 "Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation" 等),引用细节需翻 PDF References 核实。

谁该读这篇

  • Agent 架构师:意图演变是 Agent 可靠性的关键挑战,不是"多轮对话"的同义词——本文给了你独立评估这个维度的工具。
  • LLM 应用工程师:你需要立刻引入意图演变测试集,否则你的产品评测是不完整的。
  • AI 产品经理:理解"单轮 SOTA ≠ 多轮可用"——为产品能力边界评估提供依据,别在 PR 里吹"我们用 GPT-4 拿了 90 分"就被用户骂。
  • 对话系统评测研究者:本文提供了一个"零新标注"地把静态 Benchmark 动态化的方法论。
  • 关注 2026 评测前沿的研究者:本团队是 ICLR 2026 Best Paper Award 获奖团队,本篇是其延续工作——值得追踪后续 v2/v3 + 顶会接收状态。

一句话总结

当用户意图在多轮对话中演变,所有主流大模型都会出现显著性能下降——这不是个别模型的 bug,而是当前整个范式的结构性缺陷。ICLR 2026 Best Paper Award 获奖团队(Microsoft Research + Purdue)的延续工作给出了一个可立即复用的评测框架,并揭示了一个反直觉的工程结论:对话效果变差时,重开对话比继续聊更有效


三个标题变体(便于分发到不同平台)

  1. 专业向:LLM 在多轮意图演变场景下显著性能下降(substantial drops across model families)—— ICLR 2026 获奖团队的延续工作
  2. 工程向:为什么你的 ChatGPT 聊到第 5 轮就开始装糊涂?—— ICLR 2026 获奖团队 2026-07-22 新论文给出了严谨答案
  3. 科普向:跟 AI 聊复杂任务时,为什么它聊到一半就开始"忘了"——ICLR 2026 获奖团队的研究告诉你这不是你的错觉

小红书风格卡片文案(直接复制)

📌 #你和ChatGPT聊崩的真实原因 #AI冷知识 #干货分享 #ICLR2026获奖团队

你有没有这种感觉: 跟 ChatGPT 聊复杂任务,聊到一半改了主意 它就开始"装糊涂"——只记得你最近两句话 你一开始想要什么,它全忘了 🤯

这不是你的错觉 ✅ ICLR 2026 Best Paper Award 获奖团队 2026 年 7 月最新论文 (arXiv 2607.20734 · 作者 Jihoon Tack¹ + Philippe Laban¹ + Jennifer Neville² ¹Microsoft Research Redmond · ²Purdue University)

证明: 当用户的意图在多轮对话中演变,所有主流大模型都会出现显著性能下降(substantial drops across model families)

什么是"意图演变"? 就是真实用户从来不会一次把任务说清楚: 🔹 先抛大概方向(增量披露 incremental reveal) 🔹 再补充细节 🔹 再推翻前面的想法(修正 revise) 🔹 再转向另一个目标(重定向 redirect)

结果所有模型家族(GPT、Claude、开源 LLM)都崩了 static-setting 表现不错的模型,到 dynamic-evolving-intent 场景性能大幅回落

为什么会这样? 🔸 过早假设:模型死抱着早期错误假设不撒手 🔸 语义漂移:新旧信息互相打架,分不清哪个是当前真相 🔸 意图-执行耦合:意图一变,整个执行链路跟着崩

🌟 论文还发现一个反直觉的工程结论: 当多轮对话效果变差时,"重开对话"反而比"继续聊"更有效 因为意图漂移累积后,历史 Context 不再是资产,是干扰

💡 另一个方法论贡献: 把现有静态 Benchmark 改成动态多轮对话的标准 protocol 保留原始评测协议 · 无新标注成本(without new annotation) 任何团队都可以零成本暴露自家模型在真实用户场景下的真实弱点

💡 这对你有什么用? ✅ 跟 AI 聊复杂任务,10 轮以上主动分阶段重开 ✅ 别再迷信"单轮 SOTA = 多轮可用" ✅ 做 AI 产品评测,立刻引入意图演变测试集 ✅ 这是 ICLR 2026 获奖团队的延续工作,研究血脉清晰,值得追踪

⚠️ 边界提醒: 论文 abstract 未给出"跨模型家族下降"具体百分比,需翻 PDF §4 abstract 未点名具体 benchmark 名 abstract 提及"code will be released"但未给 GitHub URL 评测方法本身主要测"任务完成率",未涵盖对话自然度等维度

📖 原文:https://arxiv.org/abs/2607.20734 📖 DOI:https://doi.org/10.48550/arXiv.2607.20734 📖 HF 页:https://huggingface.co/papers/2607.20734 📖 前作(ICLR 2026 Best Paper Award):https://arxiv.org/abs/2505.06120

LLM评测 #Agent评测 #多轮对话 #ChatGPT #AI产品 #大模型 #人工智能 #用户研究 #产品经理 #AI工程师 #ICLR2026