AI 看图答题答对了,但推理过程全是"幻觉"——arXiv 2607.28374 给每一步加了"证据锁"
- 关联论文:2607.28374
你有没有想过一件事 🔍:
当 AI 给你看一张图、问"车牌号是多少?",它回答"7XAJ492"——
你怎么知道它是真的"看见了"车牌,还是"猜对了"?
更糟的情况:它说"根据图中的车牌区域 7XAJ492,我判断车主是……"——但你回头查它的推理日志,它压根没调用 OCR 工具,那段"7XAJ492"是从语言模型的语料库里蒙的。
这就是多模态 Agent 最大的隐患——Phantom Grounding(引用幻觉):嘴上报了来源,实际上没引用。
arXiv 2607.28374 (LedgerMind) 提出一个形式化解法:
把整条推理轨迹抽象成"来源受限状态机"——所有工具输出必须写入一份结构化证据账本,每条推理结论必须引用账本中的活跃条目,且"修复"不允许凭空生成新内容——从此"幻觉"在结构上就无法被放大。
为什么这事值得大众关注
过去两年,多模态大模型(MLLM)的评估一直是"最终答案对不对"——你问它"图里有几只猫?",它说"3 只",你给它打勾。
但这个评估线有四个致命盲区:
- 中间推理无证据:模型可能跳过工具直接答对,但没人知道为什么对;
- 引用幻觉(Phantom Grounding):嘴上报了"根据 X",但 X 跟工具返回的内容其实对不上;
- 过度推理:简单问题被强行多步、多工具调用,浪费算力还把对的答错;
- 修补放大(repair-time amplification):在"自我纠错"环节把幻觉越纠越多。
这四点合起来——只看 final accuracy 的 benchmark,根本无法区分"真的会推理的 agent"与"会押题的语言模型"。
对普通用户意味着什么?你用 AI 看医疗影像、看法律合同、看财务报表——它答对了,但你不知道它是怎么答对的,你就不知道能不能信它。
一句话核心
LedgerMind 把多模态 Agent 的整条推理轨迹抽象为"结构化证据账本(SEL)",所有推理 claim 必须引用活跃 evidence,引用须经 entity-level 与 numeric-level grounding 校验,修复只允许带类型的状态迁移且不引入无来源内容——在多个多模态推理基准上同时提升答案准确率与轨迹级忠实度。
三个洞察
洞察 1:不只看"答案",还要看"推理账本"——SEL 让幻觉无处藏身。
传统 Agent 的中间状态是"自然语言日志"——LLM 自由发挥,没人审计。
LedgerMind 把这条日志换成结构化证据账本(Structured Evidence Ledger, SEL)——每条 evidence 是一条带 schema 的 JSON 记录:
{
"id": "ev_042",
"source_tool": "ocr",
"bounding_box": [112, 340, 220, 380],
"text": "License Plate: 7XAJ492",
"entities": ["7XAJ492"],
"numerics": [],
"confidence": 0.93,
"status": "active"
}
下游推理 claim 必须先 cite 一个 active 条目,否则视为无效输出。
这相当于给 AI 的推理过程装了一个会计系统——每一笔"花销"(claim)都必须有"凭证"(evidence),凭证必须来自"银行流水"(tool output),不能凭空开票。
洞察 2:三层 grounding 协议——entity、numeric、(temporal/relational)逐步加严。
不是引用一次就过——必须过三层校验:
- Entity-level grounding:声明的实体(人名、车型、化学式)必须在某条 active evidence 里字面或归一化形式包含;
- Numeric-level grounding:声明的数字(坐标、数量、价格)必须可在 evidence 中以同单位比对;
- Temporal/Relational grounding:声明的时间关系、空间关系必须可从 evidence 推导。
任何一层不通过,要么触发 repair,要么被舍弃——这就是 LedgerMind 相对传统 RAG 的关键升级:RAG 只管"检索到没有",LedgerMind 管"引用对不对"。
洞察 3:"修复不能放大幻觉"——这是论文里最值钱的不变量。
传统 Agent 的"自我纠错"循环有个隐藏陷阱:修一次不对再修,每次都引入新假设,幻觉越纠越多。
LedgerMind 做了一个形式化保证——provenance non-amplification guarantee:
修复(repair)永远只能引用既有的 evidence 条目做 typed transition,不能引入没有 tool-produced provenance 的新内容。
翻译成人话:纠错可以,但纠错不能凭空编新事实——这条不变量从结构上杜绝了"幻觉越纠越多"的可能。
这是把"防幻觉"从工程经验升级为形式化保证的关键一步。
真正牛在哪
大多数"防幻觉"论文只解决一个点:要么只检测不修复,要么只修复不约束来源。
LedgerMind 牛在把四件事用一份形式化状态机串起来:
- 轨迹状态 = 账本(SEL);
- claim 必须引用账本(来源受限);
- 引用必须过三层 grounding(实体+数值+关系);
- 修复不放大幻觉(non-amplification guarantee)。
并且显式覆盖四种典型失败模式:
- unsupported intermediate reasoning(中间推理无证据)
- Phantom Grounding(引用幻觉)
- over-reasoning(过度推理)
- repair-time amplification(修补放大)
更牛的是:dual-path dispatcher 让简单问题不再走冤枉路——可一步查证的走 fast path(轻感知+单工具+直接推理),需要多步交叉验证的才走 deep path(完整 agentic 轨迹 + SEL + 校验)。
这意味着平均 token 成本比纯 agentic baseline 低很多——工业部署真金白银的收益。
落地前的硬约束 ⚠️
1. "准确率与轨迹忠实度同时提升"是方向性结论,具体数字未披露
摘要只说"有提升",没说提升多少百分点。引用前必须查正文 Table 与 Appendix——摘要级判断不能直接当 KPI。
2. 调度器的"轻量分类器"具体架构未明
fast/deep path 分类器是 ML 模型、规则、还是 prompt-based?落地实现前需要查 §4/§5 确认。工程兜底:tool 数 ≤ 2 走 fast,> 2 走 deep。
3. grounding 协议的第三层未在摘要独立列出
entity + numeric 两层摘要明确,第三层 temporal/relational 是语义推断——引用时建议注明"第三层原文未明确"。
4. OCR 错字会触发大量 numeric grounding 失败
车牌、仪表盘识别场景下,OCR 错字率直接影响 numeric grounding 的 false positive。解法:numeric grounding 前加 OCR confidence filter,只对 > 0.9 的结果做严格校验。
5. SEL schema 强依赖任务域,跨域迁移成本高
OCR 任务的 schema(包含 bounding_box、text、entities)迁移到 VQA、表格推理场景需要重新设计——不是一套 schema 走天下。
6. 多轮对话中 SEL 重置会导致引用链断裂
对话轮次间 SEL 必须持久化——每轮对话从持久化状态恢复,否则会失去上一轮的证据链。这是落地最容易踩的坑。
7. 修复循环可能形成死循环
grounding 失败 → repair → repair 后再次 grounding → 又失败……必须设最大 repair 次数(建议 2 次),超过则降级为"无法回答"并附置信度。
一句话总结
LedgerMind 用结构化证据账本 + 三层 grounding 校验 + provenance non-amplification 不变量,把多模态 Agent 的"防幻觉"从工程经验升级为形式化保证——从此 AI 不只能答对,还能让你审计它为什么答对。
三个标题变体
- 极简数据型:AI 答题答对了,但推理过程全是幻觉——arXiv 2607.28374 用"证据账本"把每一步锁死
- 场景代入型:"根据图中车牌 7XAJ492,我判断……"——但 AI 根本没调用 OCR——arXiv 2607.28374 让引用幻觉无处藏身
- 产业落地型:把"AI 防幻觉"从工程经验升级为形式化保证:arXiv 2607.28374 让 Agent 的推理过程可审计、可追溯、可信任
小红书风格卡片文案
🔍 AI 看图答题答对了,但推理过程是幻觉?
它说"根据图中车牌 7XAJ492"——但它根本没调用 OCR 工具。
这段车牌号是从语言模型语料库蒙的。
arXiv 2607.28374 (LedgerMind) 给了形式化解法:
结构化证据账本(SEL)——所有推理 claim 必须引用工具输出的 evidence,不能凭空。
📐 三个核心机制:
1️⃣ SEL 结构化账本:工具输出强制 JSON 化,每条带唯一 id + schema
2️⃣ 三层 grounding 校验:entity(实体)+ numeric(数值)+ temporal/relational(时空关系),任何一层不过就 repair 或舍弃
3️⃣ non-amplification 不变量:修复不能凭空引入新事实——形式化杜绝"幻觉越纠越多"
🎯 覆盖四种失败模式:
❌ 中间推理无证据 → SEL 强制引用 ❌ 引用幻觉(Phantom Grounding) → entity grounding 校验 ❌ 过度推理 → dual-path dispatcher(简单问题走 fast path) ❌ 修补放大 → non-amplification guarantee
⚙️ 工业价值:
✅ dual-path 让 token 成本比纯 agentic baseline 低很多 ✅ 轨迹可审计、可追溯、可信任 ✅ 部署可分阶段(SEL → grounding → 完整状态机)
⚠️ 但落地前有四个硬约束:
• "准确率提升"是方向性结论,具体数字未披露 • OCR 错字会触发大量 numeric grounding 失败 • SEL schema 强依赖任务域,跨域迁移成本高 • 多轮对话中 SEL 必须持久化,否则引用链断裂
🔥 一句话:让 AI 不只能答对,还能让你审计它为什么答对。