为什么 ChatGPT 总是"一本正经地胡说"?2023 年这篇综述给出了第一张完整地图

  • 关联论文:2309.01219

你有没有试过问 ChatGPT 一个冷门历史人物的中文译名,它给了一个看起来很权威的答案——结果去维基一查,这个人根本不存在?或者让 GPT-4 总结一篇论文,它言之凿凿地引用了 3 篇文献,但 3 篇都是 AI 编的

这不是个例,而是大模型的系统性缺陷。研究者给它起了个名字——"幻觉"(Hallucination)

幻觉不是偶尔 bug,而是大模型的"出厂设置":因为 LLM 本质上是"下一个 token 的统计预测器",它不知道什么是"真",只知道"什么 token 接在后面最可能流畅"——所以它会自信地说错话,会编造不存在的论文,会在同一段对话里前后矛盾。

2023 年 9 月的一篇综述(Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models,arXiv 2309.01219)第一次把 LLM 幻觉这件事系统地命名、分类、归因,并盘了当时所有的检测方法和缓解方案。这篇综述被引超 1078 次(Semantic Scholar 估算),是 LLM 可靠性领域引用最高的 survey 之一——也是 2023 年所有想做"可信 LLM"工作的人绕不开的母本。

一句话故事

它把 LLM 幻觉分为 Input-Conflicting(输入冲突)、Context-Conflicting(上下文冲突)、Fact-Conflicting(事实冲突) 三大类型,覆盖了所有"AI 说错话"的场景,并梳理了检测、评估、缓解的全链路方法——这是 2023 年整个 LLM 可靠性研究的第一张知识地图。

这件事的真正意义不在"提出新方法",而在"把所有零散工作用一个统一框架串起来"——后来所有做 RAG 优化、幻觉检测、事实核查的论文,几乎都会引用这个三分法。

为什么这件事值得大众关注

你每次用 LLM,都在和幻觉博弈:

  • 🏥 医疗咨询:ChatGPT 给你推荐了一个不存在的药物剂量,出了事谁负责?
  • ⚖️ 法律咨询:AI 引用了 3 个不存在的判例,律师没核实直接引用进诉状
  • 💰 金融分析:AI 给出的财报数据是编的,投资者据此下单
  • 📰 新闻摘要:AI 把"事件 A"和"事件 B"混在一起写,读者误以为是同一件事
  • 💻 代码生成:AI 引用的 API 函数签名根本不存在,开发者调试半天发现 API 是虚构的
  • 🎓 学术研究:AI 帮你写的文献综述里,参考文献全是编的,导师一查发现 5 篇是假的

这些不是"理论风险"——2024-2026 年已经出现过多起真实案例:美国律师用 ChatGPT 写诉状引用 6 个假判例被法官制裁;学生用 AI 写作业引用不存在的论文被开除;医疗 AI 工具给出错误药物相互作用建议。

LLM 幻觉的三个"流派"

这篇综述最被引用的贡献,就是把 LLM 幻觉分为三类:

1. Input-Conflicting(输入冲突)

LLM 的回答和用户给的输入信息不一致。比如用户说"我刚买了 iPhone 15",AI 却回应"你的 iPhone 16 不错"——AI 凭空捏造了用户没说过的话。

2. Context-Conflicting(上下文冲突)

LLM 在同一段对话里自相矛盾,或和提供的上下文文档矛盾。比如让 AI 读一篇 3000 字的文章后总结,前半段说"文章认为 X",后半段说"文章认为 Y"——但文章其实从头到尾只支持一个观点。

3. Fact-Conflicting(事实冲突)⚠️ 最严重

LLM 的输出和外部世界知识矛盾。这是最难解决的,因为: - LLM 的参数化知识本质上是统计关联而非显式事实存储 - 模型不知道"什么是真",只知道"什么词接在后面最流畅" - 知识有截止日期,新事实无法更新 - 某些领域训练数据不足,模型被迫"编造"

Fact-Conflicting 是工业场景最致命的幻觉类型——也是 RAG、知识图谱、事实核查工具主要解决的问题。

幻觉是从哪里来的?

数据层面

  • 预训练语料中的噪声、错误信息、偏见被模型记忆并复现
  • 知识过时:模型知识有截止日期
  • 知识空白:某些领域训练数据不足,模型"被迫编造"

模型层面

  • 过度依赖语言流畅性:流畅的输出掩盖了事实错误
  • Decoder-only 自回归机制:每个 token 的生成是全局分布的 argmax,没有显式的事实核查模块
  • 长上下文 position bias:早期 token 的信息在长序列中被稀释

怎么检测幻觉?4 种主流方法

方法类型 核心思路 优点 缺点
基于事实核查 检索外部知识库比对一致性 直接对标真实世界 检索质量决定上限
基于不确定性 测语义熵、置信度——高不确定=高幻觉 速度快、可内嵌 校准困难
基于一致性 让 LLM 用不同 Prompt 生成多答案,检查是否一致 不需要外部知识 成本 N 倍
基于分类器 训练专用二分类模型 可针对业务定制 需要标注数据

怎么缓解幻觉?3 层技术栈

1. 检索增强(RAG)⭐ 工业界主流

  • 生成时动态检索外部知识,约束 LLM 输出
  • 局限:检索质量决定缓解效果;检索器与生成器的对齐问题;检索结果 top-1 错时 LLM 几乎必然复现这个错

2. 推理时策略

  • Chain-of-Thought(CoT):让模型显式推理,降低随机编造概率。但 token 消耗约 2-3 倍
  • Self-Reflection:让 LLM 在输出后自己检查是否可能出错
  • 约束解码(Constrained Decoding):限制某些 token 序列的生成

3. 模型层面

  • 预训练去噪和事实过滤
  • RLHF/DPO:用人类偏好信号强化事实正确性
  • 多任务学习:同时训练事实核查 + 语言建模

评估基准:4 个绕不开的"考场"

基准 测什么
TruthfulQA 模型在 38 个领域 817 个问题上拒绝错误信息的能力——最佳模型约 65%,意味着最先进 LLM 仍有 1/3 事实错误
HaluEval 大规模幻觉数据集,覆盖多个 LLM 和任务类型
FActScore 按原子事实粒度评估生成内容的事实一致性
SAFE 用 LLM-as-Judge 对长文本做事实核查

为什么这件事现在还重要

3 年过去了,2026 年的 LLM 已经从 GPT-3.5 进化到 GPT-5、Claude 4、Gemini 2.5——但幻觉问题远未解决

  1. RAG 是必要不充分条件:即使引入 RAG,检索结果本身可能含噪声;LLM 可能"忠实于错误的检索结果"
  2. 多步推理放大了幻觉:Agent 工作流里每一步都可能引入幻觉,最终答案偏差指数级放大
  3. 长上下文 vs 检索的边界模糊:Claude 1M token、Gemini 2M token 模型,让"是否还需要 RAG"成为开放问题
  4. 跨语言幻觉更严重:中文幻觉率普遍高于英文(训练数据不均)

但这篇综述也给了我们一个稳定的分类框架——3 年后所有"幻觉"相关工作,几乎都能归到 Input/Context/Fact-Conflicting 这三类之一。这个三分法本身就是这篇综述最持久的贡献

一句话总结

LLM 幻觉不是 bug,而是 feature——是"下一个 token 统计预测器"这个架构的固有属性。2023 年这篇综述没有发明新技术,而是给整个混乱的领域画了一张第一张地图:3 类幻觉、4 种检测、3 层缓解、4 个基准。3 年后所有做"可信 LLM"的工作,几乎都在这张地图上展开。

你下次看到 AI 言之凿凿地编故事时,可以问自己三件事: 1. 它和我的输入矛盾吗?(Input-Conflicting) 2. 它自己前后矛盾吗?(Context-Conflicting) 3. 它和真实世界矛盾吗?(Fact-Conflicting)⚠️

——能问出这三个问题,就比 90% 的 LLM 用户更懂 AI 的边界。


三个标题变体

  1. 数字钩子版:被引 1078 次的"幻觉地图":3 类错误、4 种检测、4 个基准,LLM 可靠性研究都从这里开始
  2. 拟人化版:为什么 ChatGPT 总是"一本正经地胡说"?2023 年这篇综述给出了第一张完整地图
  3. 类比版:LLM 像一个"流畅但会编故事"的朋友——2023 年有群研究者决定认真给它列个"病历表"

小红书风格卡片文案(可直接发布)

🤖 为什么 ChatGPT 总是"一本正经地胡说"?

它不是偶尔 bug,而是出厂设置——LLM 本质上是"下一个 token 的统计预测器",不知道"什么是真",只知道"什么词接在后面最流畅"。

2023 年这篇综述(Siren's Song)第一次给 LLM 幻觉系统命名 + 分类,被引 1078 次,是所有"可信 LLM"工作的母本👇

🎯 3 类幻觉(最重要的一张图)

1️⃣ Input-Conflicting:和你说的不一致
例:你说"我买了 iPhone 15",AI 却说"你的 iPhone 16 不错"

2️⃣ Context-Conflicting:自己前后矛盾
例:让 AI 总结一篇 3000 字文章,前半说"文章认为 X",后半说"文章认为 Y"

3️⃣ Fact-Conflicting:和真实世界矛盾 ⚠️ 最严重
例:AI 编造不存在的论文/判例/药物剂量/财报数据

🔍 4 种检测方法

方法 思路
事实核查 检索外部知识库比对
不确定性 测语义熵——高不确定=高幻觉
一致性 让 AI 用不同 Prompt 生成多答案比对
分类器 训练专用二分类模型

🛠️ 3 层缓解技术栈

🧠 RAG(检索增强):工业界主流,但检索错时 AI 会"忠实复现错误"
💭 CoT(思维链):让模型显式推理,但 token 消耗 2-3 倍
🎯 RLHF/DPO:用人类偏好强化事实正确性

📊 4 个绕不开的评估基准

  • TruthfulQA:38 个领域 817 题,最佳模型仅 65% 准确——意味着最先进 LLM 仍有 1/3 事实错误
  • HaluEval / FActScore / SAFE

💡 最关键的洞察:3 年后所有"幻觉"相关工作,几乎都能归到这 3 类之一。这个三分法本身就是这篇综述最持久的贡献

⚠️ 别急着信 AI:美国律师用 ChatGPT 写诉状引用 6 个假判例被制裁;学生用 AI 写作业引用不存在的论文被开除——这些都是 Fact-Conflicting 的真实代价。

📌 下次你看到 AI 言之凿凿时,问自己 3 个问题: 1. 它和我的输入矛盾吗? 2. 它自己前后矛盾吗? 3. 它和真实世界矛盾吗?⚠️

能问出这三个问题,就比 90% 的 LLM 用户更懂 AI 的边界。

LLM幻觉 #ChatGPT #大模型 #RAG #可信AI #AI安全 #FactChecking #arXiv230901219 #每天学点AI