AI 读完你的财报说"12.4 亿"——但它指给你看的证据,根本不是那行

  • 关联论文:2607.24651

你有没有遇到过这种场景 🧾:

把一份年报、发票、学术海报丢给 AI,让它回答"2024 年营收是多少"。 AI 答得很干脆——"12.4 亿"

但当你想确认它到底是从哪里看出来的,AI 给你画了一个框——框在了完全不相关的地方

更可怕的是:这种错误根本不会被普通评测抓到。答案对了,证据错了,系统给你打 100 分。

2026 年 7 月的 arXiv 2607.24651 揭开了这个一直被忽略的问题,还顺手给出了解法。


一、AI 看文档有一个藏得很深的失败模式

视觉文档理解(读 PDF、读财报、读发票、读 PPT)是 AI 的核心战场。但大多数系统只关心一件事——答案对不对

这套评估有个致命盲区:

答案正确,但证据指错——归因幻觉(Attribution Hallucination) 🎭

具体长这样:

任务:表格 3 中 2024 年的营收是多少?

普通 AI(坐标接口):
✅ 答案:12.4 亿
❌ 证据框:[(312, 88, 460, 124)]  ← 框在了"营业成本"那一行

这种失败的恐怖之处:它在所有传统评估指标里都是"成功"的。 QA 准确率 100%,审计通过,上线——然后在合规、医疗、法律、学术场景里出大事。

作者用了一个尖锐的判断:

这种失败不是模型"不会"归因,而是"用坐标表达归因"这件事,超出了 AI 的能力。


二、传统做法的根本问题:逼 AI 做它不擅长的事

传统方法叫做坐标接口——除了给答案,还要 AI 输出一组 bounding box 坐标,标出"我是从这里看出来的"。

听起来很合理对吧?

但实际有三个问题 🔧:

1. 表达力不匹配 AI 擅长"读语言",不擅长"精确定位像素坐标"。逼它做坐标预测,等于让它在弱项上打比赛。

2. 标注成本爆炸 教 AI 画框,需要人工在每个版面上画几千个框——一张财报几十页,一页几十个数字,一次训练几万次点击。贵到不可持续

3. 细粒度证据丢失 AI 想说"证据是『2024年 12.4亿』这几个字",坐标接口逼它输出 [x1,y1,x2,y2]——语义完全丢了


三、新做法:让 AI 用"引用"代替"画框"

arXiv 2607.24651 提出一个替换方案——语言接口(Language Interface):

# 传统坐标接口
Q: 表格 3 中 2024 年的营收是多少?
A: 12.4 亿
Evidence: [(312, 88, 460, 124)]   ← 4 个数字

# 新语言接口(ARI)
Q: 表格 3 中 2024 年的营收是多少?
A: 12.4 亿
Evidence:
  "2024年 12.4亿"        ← 直接引用原文短语
  "净利润 1.2亿"
  → 由版面检索器自动定位到坐标

核心切换: - ❌ AI 不再输出坐标 - ✅ AI 输出"我引用了哪句话" - ✅ 独立的版面检索器负责把引文在版面上圈出来

这就把 AI 的任务从"画框"简化成了"引用文本"——这是 AI 真正擅长的事


四、效果:数字说话

论文在 6 个开源 VLM 上做了对照实验(覆盖不同规模、不同架构):

指标 坐标接口 语言接口(ARI)
证据召回率 ≤8 26–47
归因幻觉率 基准 近乎腰斩
答案准确率 基准 基本不变

关键数字: - 证据召回从个位数拉到 26–47(3-5 倍提升) - 幻觉率直接砍掉一半 - 答案质量不受影响——证据对了,答案也没变差

跨 6 个模型一致有效——不是单一模型的特例,是架构无关的趋势


五、更狠的一招:不用人工画框,也能训练归因

光改推理接口还不够。能不能训练 AI 更好地做归因,而且不需要任何区域级标注?

论文给出答案:,用的是 GRPO + LLM-as-judge 组合。

训练循环长这样:

for epoch in range(num_epochs):
    # 1. 学生模型生成引文(不画框,只引用)
    quotes = student_model.generate(batch_docs)

    # 2. 检索器把引文反查回版面区域
    retrieved_crops = retriever.locate(quotes)

    # 3. 强 VLM 当评委,综合"答案 + 证据"打分
    rewards = judge_vlm.score(
        gold_answer,         # 答案对不对
        retrieved_crops      # 证据区对不对
    )

    # 4. GRPO 用相对优势优化学生模型
    student_model.update_GRPO(quotes, rewards)

实战效果:

  • 8B 模型基线归因准确率:22.4%
  • GRPO 训练后:33.8%(+11.4 个绝对点)
  • 训练数据:零区域标签——只需要"答案 + 引文 + 检索"

这等于把"画框"的人工成本彻底消除了——以前要几万个 bounding box,现在只要几万个自然语言引文,而引文可以用检索器自动生成。


六、为什么这件事每个做 AI 文档的人都该关心

这不是学术圈的自嗨——直接影响生产系统:

1. 文档问答 / RAG over PDF 你们做 PDF 检索问答时,如果只给答案不给证据,用户根本不敢用。语言接口直接产出可点击的证据高亮,审计、合规、合同审查场景直接受益。

2. 财报 / 发票 / 合同抽取 传统 OCR + LLM 抽取,答案对了就完事。没人验证证据位置——一旦数据出错,根本定位不到源头。语言接口把"答案 + 证据"绑死,出错能立刻溯源。

3. 学术海报 / 论文图问答 CiteVQA 场景下,模型经常答对问题但指错证据——学术引用、文献综述 AI 助手是高危区。归因幻觉在学术场景下尤其危险,因为它直接误导研究判断。

4. 评估方法论升级 任何需要"判断 AI 做得对不对"的场景,都应该双轨监控: - ✅ 答案准确率 - ✅ 证据准确率 - ⚠️ 只盯答案会漏掉归因幻觉这种危险但隐形的失败模式


七、立刻能用的工程方案

层级 1(今天就能做):换接口 - 如果你的 VLM 在归因任务上"答案对但证据错",先怀疑接口,不是模型。 - 给 VLM 加上"输出引文 + 检索器反查"的流程,比换更大模型便宜得多。

层级 2(2 周可上):补 retriever - 版面解析器(YOLOX / LayoutParser / Azure DI)+ 文本索引是基础设施。 - 文本检索推荐 hybrid(BM25 + dense),版面场景 ColBERT 比纯 bi-encoder 稳定。

层级 3(1-2 个月):上 GRPO 训练 - 8B 模型 + LLM-as-judge + GRPO,无需任何区域标注,归因准确率能拉 +11 个绝对点。 - Judge 必须用 VLM(同时看答案文本和证据裁剪图),temperature=0,prompt 固定不变。

5 个必踩的坑 🚧:

  • 🔴 Retriever 质量是上限 — 语言接口把"画框"压力转嫁给 retriever,retriever recall < 80% 整个系统就废了
  • 🟠 表格归因粒度粗 — caption 引用策略对"年报第 5 行第 3 列"这种细粒度需求不满足
  • 🟠 Judge 偏差在 RL 里被放大 — Judge 偏差会在 GRPO 训练里持续放大,必须定期人工抽检
  • 🟡 长文档分页处理 — 20+ 页 PDF 要分页建索引,不能全文档级检索
  • 🟡 跨语言要双语 embedding — 中英混排文档别用纯英文 embedding(BGE-m3 / Jina-v2)

总结

2607.24651 的核心价值不在"6 个 VLM + 证据召回 26-47"这些数字,而在三件事:

  1. 重新定义了归因任务——从"输出坐标"升级为"引用文本 + 检索反查",问题边界变了,解法空间打开了;
  2. 证明了"无区域标签训练归因"的可行性——GRPO + LLM-as-judge 把稀缺的人工标注换成"判读自然语言",训练成本结构变了;
  3. 戳破了"答案对了就行"的评估幻觉——必须双轨监控答案准确率与证据准确率,只看答案会漏掉归因幻觉这种隐形失败。

对做文档智能、财报问答、合同审查、RAG over PDF、AI 审计的团队,这都是一个值得认真读+认真复现的工作——尤其是你已经在生产环境被"AI 答案看起来对但出处乱指"坑过的场景。


三个标题变体

  1. AI 读完你的财报说"12.4 亿"——但它指给你看的证据,根本不是那行
  2. AI 答案对了就算成功?2026 这篇论文揭开了一个被忽略的失败模式
  3. 归因幻觉:你的 AI 看起来靠谱,但证据指向完全错的地方

小红书风格卡片文案(可直接发布)

🤖 AI 答对了但证据指错——这件事每个做 AI 的人都该警惕 ⚠️

2026 年 7 月这篇论文(arXiv 2607.24651) 讲了一个被忽略的危险现象:

归因幻觉(Attribution Hallucination) AI 答案对了,但证据指错地方——传统评估根本测不出来 🎭

听起来很熟悉对吧 🧾:

Q: 表格 3 中 2024 年的营收是多少?

❌ 普通 AI:
✅ 答案:12.4 亿
❌ 证据框:[(312, 88, 460, 124)]  ← 框在了"营业成本"那一行

恐怖之处:QA 准确率 100%,审计通过,上线——然后在合规、医疗、法律、学术场景出大事 💥

为什么出问题 🔧:

1️⃣ 表达力不匹配 — 逼 AI 输出坐标,等于让它在弱项打比赛 📏 2️⃣ 标注成本爆炸 — 教 AI 画框,人工画几万次,贵到不可持续 💸 3️⃣ 细粒度证据丢失 — AI 想说"证据是『2024年 12.4亿』",坐标表达不了语义 🈳

新做法:语言接口(Language Interface)✨

✅ AI 输出"我引用了哪句话"
✅ 独立检索器把引文在版面上圈出来
✅ AI 的任务从"画框"简化成"引用文本"——这是 AI 真正擅长的事 🎯

实测效果 📊(6 个开源 VLM 跨架构一致):

指标 坐标接口 语言接口
证据召回率 ≤8 26–47
幻觉率 基准 近乎腰斩
答案准确率 基准 基本不变

更狠的一招 💪:不用人工画框,也能训练归因

# GRPO + LLM-as-judge 训练循环
quotes = student_model.generate(batch_docs)       # 学生模型生成引文
retrieved_crops = retriever.locate(quotes)        # 检索器反查版面
rewards = judge_vlm.score(gold_answer, crops)     # 强 VLM 当评委
student_model.update_GRPO(quotes, rewards)        # GRPO 优化

8B 模型归因准确率:22.4% → 33.8%(+11.4 绝对点) 零区域标签,只需要"答案 + 引文 + 检索" 🎉

为什么每个做 AI 文档的人都该关心 🛠️:

1️⃣ 文档问答 / RAG over PDF — 用户敢不敢用,看证据可不可信 📑 2️⃣ 财报 / 发票 / 合同抽取 — 出错能立刻溯源,审计闭环 💼 3️⃣ 学术海报 / 论文图问答 — 学术引用 AI 助手是高危区,归因幻觉直接误导研究判断 🎓 4️⃣ 评估方法论升级 — 必须双轨监控"答案准确率 + 证据准确率",只看答案会漏掉归因幻觉 🎯

⚠️ 必须警惕的边界:

  • 🔴 Retriever 质量是上限 — 语言接口把"画框"压力转嫁给 retriever,recall < 80% 整个系统就废了 📉
  • 🟠 表格归因粒度粗 — caption 引用对"年报第 5 行第 3 列"不满足 🔍
  • 🟠 Judge 偏差在 RL 里被放大 — 必须定期人工抽检 Judge 决策 👤
  • 🟡 长文档分页处理 — 20+ 页 PDF 必须分页建索引 📚
  • 🟡 跨语言要双语 embedding — BGE-m3 / Jina-v2 别用纯英文模型跑中文 🌐

立刻能用的工程路线 💡:

✅ 层级 1(今天):换接口——输出引文 + 检索反查
✅ 层级 2(2 周):补 retriever——版面解析器 + hybrid 文本检索
✅ 层级 3(1-2 个月):上 GRPO 训练——8B 模型 + LLM-as-judge

📎 论文 ID:2607.24651

💬 评论区聊聊:你被"AI 答案看起来对但出处乱指"坑过吗?愿意试试语言接口吗?🤔

AI科普 #文档智能 #视觉语言模型 #归因幻觉 #论文分享 #RAG #财报问答 #合同审查 #VLM #多模态 #GRPO #工程实践