为什么 ChatGPT 总是"一本正经地胡说"?2023 年这篇综述给出了第一张完整地图
- 关联论文:2309.01219
你有没有试过问 ChatGPT 一个冷门历史人物的中文译名,它给了一个看起来很权威的答案——结果去维基一查,这个人根本不存在?或者让 GPT-4 总结一篇论文,它言之凿凿地引用了 3 篇文献,但 3 篇都是 AI 编的?
这不是个例,而是大模型的系统性缺陷。研究者给它起了个名字——"幻觉"(Hallucination)。
幻觉不是偶尔 bug,而是大模型的"出厂设置":因为 LLM 本质上是"下一个 token 的统计预测器",它不知道什么是"真",只知道"什么 token 接在后面最可能流畅"——所以它会自信地说错话,会编造不存在的论文,会在同一段对话里前后矛盾。
2023 年 9 月的一篇综述(Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models,arXiv 2309.01219)第一次把 LLM 幻觉这件事系统地命名、分类、归因,并盘了当时所有的检测方法和缓解方案。这篇综述被引超 1078 次(Semantic Scholar 估算),是 LLM 可靠性领域引用最高的 survey 之一——也是 2023 年所有想做"可信 LLM"工作的人绕不开的母本。
一句话故事
它把 LLM 幻觉分为 Input-Conflicting(输入冲突)、Context-Conflicting(上下文冲突)、Fact-Conflicting(事实冲突) 三大类型,覆盖了所有"AI 说错话"的场景,并梳理了检测、评估、缓解的全链路方法——这是 2023 年整个 LLM 可靠性研究的第一张知识地图。
这件事的真正意义不在"提出新方法",而在"把所有零散工作用一个统一框架串起来"——后来所有做 RAG 优化、幻觉检测、事实核查的论文,几乎都会引用这个三分法。
为什么这件事值得大众关注
你每次用 LLM,都在和幻觉博弈:
- 🏥 医疗咨询:ChatGPT 给你推荐了一个不存在的药物剂量,出了事谁负责?
- ⚖️ 法律咨询:AI 引用了 3 个不存在的判例,律师没核实直接引用进诉状
- 💰 金融分析:AI 给出的财报数据是编的,投资者据此下单
- 📰 新闻摘要:AI 把"事件 A"和"事件 B"混在一起写,读者误以为是同一件事
- 💻 代码生成:AI 引用的 API 函数签名根本不存在,开发者调试半天发现 API 是虚构的
- 🎓 学术研究:AI 帮你写的文献综述里,参考文献全是编的,导师一查发现 5 篇是假的
这些不是"理论风险"——2024-2026 年已经出现过多起真实案例:美国律师用 ChatGPT 写诉状引用 6 个假判例被法官制裁;学生用 AI 写作业引用不存在的论文被开除;医疗 AI 工具给出错误药物相互作用建议。
LLM 幻觉的三个"流派"
这篇综述最被引用的贡献,就是把 LLM 幻觉分为三类:
1. Input-Conflicting(输入冲突)
LLM 的回答和用户给的输入信息不一致。比如用户说"我刚买了 iPhone 15",AI 却回应"你的 iPhone 16 不错"——AI 凭空捏造了用户没说过的话。
2. Context-Conflicting(上下文冲突)
LLM 在同一段对话里自相矛盾,或和提供的上下文文档矛盾。比如让 AI 读一篇 3000 字的文章后总结,前半段说"文章认为 X",后半段说"文章认为 Y"——但文章其实从头到尾只支持一个观点。
3. Fact-Conflicting(事实冲突)⚠️ 最严重
LLM 的输出和外部世界知识矛盾。这是最难解决的,因为: - LLM 的参数化知识本质上是统计关联而非显式事实存储 - 模型不知道"什么是真",只知道"什么词接在后面最流畅" - 知识有截止日期,新事实无法更新 - 某些领域训练数据不足,模型被迫"编造"
Fact-Conflicting 是工业场景最致命的幻觉类型——也是 RAG、知识图谱、事实核查工具主要解决的问题。
幻觉是从哪里来的?
数据层面
- 预训练语料中的噪声、错误信息、偏见被模型记忆并复现
- 知识过时:模型知识有截止日期
- 知识空白:某些领域训练数据不足,模型"被迫编造"
模型层面
- 过度依赖语言流畅性:流畅的输出掩盖了事实错误
- Decoder-only 自回归机制:每个 token 的生成是全局分布的 argmax,没有显式的事实核查模块
- 长上下文 position bias:早期 token 的信息在长序列中被稀释
怎么检测幻觉?4 种主流方法
| 方法类型 | 核心思路 | 优点 | 缺点 |
|---|---|---|---|
| 基于事实核查 | 检索外部知识库比对一致性 | 直接对标真实世界 | 检索质量决定上限 |
| 基于不确定性 | 测语义熵、置信度——高不确定=高幻觉 | 速度快、可内嵌 | 校准困难 |
| 基于一致性 | 让 LLM 用不同 Prompt 生成多答案,检查是否一致 | 不需要外部知识 | 成本 N 倍 |
| 基于分类器 | 训练专用二分类模型 | 可针对业务定制 | 需要标注数据 |
怎么缓解幻觉?3 层技术栈
1. 检索增强(RAG)⭐ 工业界主流
- 生成时动态检索外部知识,约束 LLM 输出
- 局限:检索质量决定缓解效果;检索器与生成器的对齐问题;检索结果 top-1 错时 LLM 几乎必然复现这个错
2. 推理时策略
- Chain-of-Thought(CoT):让模型显式推理,降低随机编造概率。但 token 消耗约 2-3 倍
- Self-Reflection:让 LLM 在输出后自己检查是否可能出错
- 约束解码(Constrained Decoding):限制某些 token 序列的生成
3. 模型层面
- 预训练去噪和事实过滤
- RLHF/DPO:用人类偏好信号强化事实正确性
- 多任务学习:同时训练事实核查 + 语言建模
评估基准:4 个绕不开的"考场"
| 基准 | 测什么 |
|---|---|
| TruthfulQA | 模型在 38 个领域 817 个问题上拒绝错误信息的能力——最佳模型约 65%,意味着最先进 LLM 仍有 1/3 事实错误 |
| HaluEval | 大规模幻觉数据集,覆盖多个 LLM 和任务类型 |
| FActScore | 按原子事实粒度评估生成内容的事实一致性 |
| SAFE | 用 LLM-as-Judge 对长文本做事实核查 |
为什么这件事现在还重要
3 年过去了,2026 年的 LLM 已经从 GPT-3.5 进化到 GPT-5、Claude 4、Gemini 2.5——但幻觉问题远未解决:
- RAG 是必要不充分条件:即使引入 RAG,检索结果本身可能含噪声;LLM 可能"忠实于错误的检索结果"
- 多步推理放大了幻觉:Agent 工作流里每一步都可能引入幻觉,最终答案偏差指数级放大
- 长上下文 vs 检索的边界模糊:Claude 1M token、Gemini 2M token 模型,让"是否还需要 RAG"成为开放问题
- 跨语言幻觉更严重:中文幻觉率普遍高于英文(训练数据不均)
但这篇综述也给了我们一个稳定的分类框架——3 年后所有"幻觉"相关工作,几乎都能归到 Input/Context/Fact-Conflicting 这三类之一。这个三分法本身就是这篇综述最持久的贡献。
一句话总结
LLM 幻觉不是 bug,而是 feature——是"下一个 token 统计预测器"这个架构的固有属性。2023 年这篇综述没有发明新技术,而是给整个混乱的领域画了一张第一张地图:3 类幻觉、4 种检测、3 层缓解、4 个基准。3 年后所有做"可信 LLM"的工作,几乎都在这张地图上展开。
你下次看到 AI 言之凿凿地编故事时,可以问自己三件事: 1. 它和我的输入矛盾吗?(Input-Conflicting) 2. 它自己前后矛盾吗?(Context-Conflicting) 3. 它和真实世界矛盾吗?(Fact-Conflicting)⚠️
——能问出这三个问题,就比 90% 的 LLM 用户更懂 AI 的边界。
三个标题变体
- 数字钩子版:被引 1078 次的"幻觉地图":3 类错误、4 种检测、4 个基准,LLM 可靠性研究都从这里开始
- 拟人化版:为什么 ChatGPT 总是"一本正经地胡说"?2023 年这篇综述给出了第一张完整地图
- 类比版:LLM 像一个"流畅但会编故事"的朋友——2023 年有群研究者决定认真给它列个"病历表"
小红书风格卡片文案(可直接发布)
🤖 为什么 ChatGPT 总是"一本正经地胡说"?
它不是偶尔 bug,而是出厂设置——LLM 本质上是"下一个 token 的统计预测器",不知道"什么是真",只知道"什么词接在后面最流畅"。
2023 年这篇综述(Siren's Song)第一次给 LLM 幻觉系统命名 + 分类,被引 1078 次,是所有"可信 LLM"工作的母本👇
🎯 3 类幻觉(最重要的一张图)
1️⃣ Input-Conflicting:和你说的不一致
例:你说"我买了 iPhone 15",AI 却说"你的 iPhone 16 不错"
2️⃣ Context-Conflicting:自己前后矛盾
例:让 AI 总结一篇 3000 字文章,前半说"文章认为 X",后半说"文章认为 Y"
3️⃣ Fact-Conflicting:和真实世界矛盾 ⚠️ 最严重
例:AI 编造不存在的论文/判例/药物剂量/财报数据
🔍 4 种检测方法
| 方法 | 思路 |
|---|---|
| 事实核查 | 检索外部知识库比对 |
| 不确定性 | 测语义熵——高不确定=高幻觉 |
| 一致性 | 让 AI 用不同 Prompt 生成多答案比对 |
| 分类器 | 训练专用二分类模型 |
🛠️ 3 层缓解技术栈
🧠 RAG(检索增强):工业界主流,但检索错时 AI 会"忠实复现错误"
💭 CoT(思维链):让模型显式推理,但 token 消耗 2-3 倍
🎯 RLHF/DPO:用人类偏好强化事实正确性
📊 4 个绕不开的评估基准
- TruthfulQA:38 个领域 817 题,最佳模型仅 65% 准确——意味着最先进 LLM 仍有 1/3 事实错误
- HaluEval / FActScore / SAFE
💡 最关键的洞察:3 年后所有"幻觉"相关工作,几乎都能归到这 3 类之一。这个三分法本身就是这篇综述最持久的贡献。
⚠️ 别急着信 AI:美国律师用 ChatGPT 写诉状引用 6 个假判例被制裁;学生用 AI 写作业引用不存在的论文被开除——这些都是 Fact-Conflicting 的真实代价。
📌 下次你看到 AI 言之凿凿时,问自己 3 个问题: 1. 它和我的输入矛盾吗? 2. 它自己前后矛盾吗? 3. 它和真实世界矛盾吗?⚠️
能问出这三个问题,就比 90% 的 LLM 用户更懂 AI 的边界。