AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4%
- 关联论文:2609.14302
想象一下这个场景:
你打开一个金融 AI 助手,给它一张贵州茅台过去半年的 K 线图,问"现在能不能买"。它信心十足地回你一句「强烈推荐买入,技术面与基本面双重共振」。
你大概率以为:这句话的背后,要么是基于真实财务数据的客观判断,要么是模型在胡说八道——总归能分出来。
但 2026 年 EMNLP Findings 接收的一篇论文 E2A-Bench(arXiv 2609.14302)撕开了一个尴尬的真相:
现有金融 VLM 评测只看"声明是否被支持",完全忽略了"证据→推理→置信度→最终行动"这条链路上的塌方。一个模型可以 UCR(未支撑声明率)极低、看似严谨,却在 93.6% 的方向性查询上选择沉默——scalar 幻觉分数会把这种"沉默式失败"包装成"靠谱"。
换句话说:金融 AI 看上去最老实的时候,可能恰恰是它最不顶用的时候。
一、为什么这件事对普通投资者很关键
你可能不炒股,但你一定被这种画面刷到过——
- 「XX 股票 AI 大模型预测下周涨 18%,附 5 大技术指标共振信号」
- 「AI 选股神器,三年回测年化 35%,模型已开源」
- 「把基金报告喂给 AI,让它告诉你能不能加仓」
这些产品绝大多数跑在一个共识上:「幻觉率低 = 金融 AI 靠谱」。
但 E2A-Bench 的研究者发现,这个共识经不起一个具体追问——
「当你给模型一张 K 线图 + 一个方向性问题(买/卖/持有)时,它到底是在用证据回答,还是在回避困难问题?」
两者在 scalar 幻觉分数下看起来一模一样:模型都没说错话。但前者是真本事,后者是「挑简单的答、难的直接不答」。
对个人投资者:用一个看似严谨、实则在熊市预测这种硬问题上 100% 沉默的 AI,等于用了一个 "复读机 + 风险免责声明发生器"——它不骗你,但它也帮不了你。
对机构:把这种 VLM 接入量化流水线,等于在源头上就引入了 结构性多头偏好——E2A-Bench 的实证发现,金融领域微调后的 VLM 给出"买入"vs"卖出"的比例,比基座模型高出 4.21~4.68 倍。这个偏向不是 bug,是训练数据里就有的(卖方研报天然唱多),但被微调放大了。
二、E2A-Bench 到底干了什么——一套"四件套"评测
1. 数据集:969 道真实题,覆盖 323 只 HS300 成份股
E2A-Bench 没有用合成数据。它直接抓取沪深 300 成份股的真实历史 OHLCV(开高低收 + 成交量)数据,由确定性算法派生证据锚——避免人工标注偏差。这意味着每一道题的"正确答案"不是人拍脑袋说的,而是数学逻辑能验证的。
323 只 × 约 3 道/股 = 969 道,覆盖大盘蓝筹里最具代表性的样本。
2. 评测对象:20 个 VLM(含通用 + 金融微调)
论文显式评测了 20 个 VLM,既有 GPT-4V / Claude 这类通用多模态大模型,也有 FinGPT / 各类金融 fine-tuned 变体——这是首次在同一 benchmark 内做"通用 vs 金融微调"的严格配对对照。
3. 关键创新:四项指标替代单一分数
E2A-Bench 提出 UCR / RCI / ECI / NDR 四件套:
| 缩写 | 全称 | 测什么 |
|---|---|---|
| UCR | Unverified Claim Rate | grounding:未支撑声明率 |
| RCI | Reasoning-Consistency Index | 推理-行动一致性 |
| ECI | Evidence-Confidence Index | 证据-置信度校准 |
| NDR | Directional Reliability | 覆盖率感知的证据→行动可靠性(不是 PnL!) |
注意:NDR 测的是「模型在做出 BUY/SELL/HOLD 时,证据是否真的支持这个方向 + 覆盖率是否充分」,不评估真实交易表现——这是评测可靠性,不是评测盈利能力。
4. 三组反直觉结论
论文用这套指标打出了三个让行业诟病方的发现:
发现 1:UCR 最低 ≠ NDR 最佳
某个模型 UCR 几乎最低(基本不胡说),但 NDR 排名垫底——原因:它只在 6.4% 的方向性查询上给出有效回答,其余 93.6% 全部弃答或不答。
scalar 分数看:这是优秀选手。
NDR 看:这是 回避困难问题的懦夫。
发现 2:Oracle-aided 验证的两面性
让模型在回答时调用"oracle 验证"(某种 ground-truth 查证工具)能降低未支撑声明率,但 会显著压缩回答覆盖率——模型变得过度保守,宁可不答也不犯错。
可靠性 vs 覆盖率,是金融 VLM 部署的核心 trade-off——scalar 幻觉分数根本不暴露这件事。
发现 3:金融 fine-tuning 放大 BUY:SELL 比例 4.21~4.68 倍
基座模型的 BUY:SELL 接近 1:1(市场中性),金融微调后变成 BUY 偏多 4.21~4.68 倍——结构性多头偏好。
意味着金融领域微调引入了系统性偏向——可能是数据污染(卖方研报天然唱多)、损失函数对"HOLD"的弱化,或训练时间窗口的市场偏差。
三、为什么这件事对所有人都重要
这套评测范式的真正意义是:
它把"AI 是否靠谱"这个问题从单一分数升级为全链路审计。
这件事的影响范围远不止金融领域——医疗、法律、自动驾驶、任何"AI 决策有下游代价"的场景都适用。
举个生活中的例子:
- 你让医疗 AI 看 CT 片,它说"未发现异常"——但其实它对这类问题只敢答 5% 的样本(剩下 95% 全部"建议人工复核")。UCR 看:非常严谨。NDR 看:完全没法用。
- 你让法律 AI 审合同,它说"条款合理"——但它的 BUY/SELL 等价物是"对所有模糊条款都说没问题"。scalar 看:幻觉率低。NDR 看:风险全被吞掉了。
单一幻觉分数的时代,正在结束。
四、给普通人和从业者的硬约束
- 金融 AI 上线前必查 BUY:SELL:任何金融 VLM 部署前必须自测"对市场中性查询的 BUY/SELL 比率",>2 倍即视为"有结构性偏向",需人工校正。
- NDR 必须配合最低覆盖率门槛:单独使用 NDR 会被"沉默式失败"绕过,必须 ≥50% 覆盖率门槛作合规前置。
- Oracle-aided 验证的成本-收益:当模型对困难问题过度弃答时,可调高 oracle 调用阈值,但需监控覆盖率塌方。
- Base vs fine-tuned 严格配对:评估 fine-tuning 副作用时,必须做"仅训练数据不同"的配对实验,否则归因错误。
六、一句话总结
现有金融 VLM 评测只看"声明是否被支持",E2A-Bench 用四件套指标 + 969 道真实题,把"行动可靠性"做成了一等公民,并揭示出 scalar 分数掩盖的三类系统性失败——其中 BUY:SELL 4.21~4.68 倍的多头偏好,是每个想用 AI 选股的人都该警惕的硬数据。
GitHub(已公开):https://github.com/wanng-ide/E2A-Bench
三个标题变体
反直觉版:AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4% 数字钩子版:测了 20 个 AI 模型后,这群研究者发现了金融 AI 的三个反常识塌方 类比版:金融 AI 的「高考体检」来了:UCR/RCI/ECI/NDR 四件套,单一幻觉分数正式退休
📱 小红书风格卡片文案(可直接发布)
🤖 金融 AI 的"高考体检",这次真的来了
还在用单一幻觉分数判断金融 AI 靠不靠谱?
EMNLP Findings 接的 E2A-Bench 告诉你—— scalar 分数的时代结束了。
🔍 这套论文干了什么? - 969 道基于沪深 300 成份股的真实查询(OHLCV 派生证据锚) - 测了 20 个 VLM(通用 + 金融微调) - 4 件套指标替代单一分数:UCR / RCI / ECI / NDR
💡 三个让行业诟病方的发现: 1️⃣ UCR 最低的模型,NDR 排垫底——它只在 6.4% 的方向性查询上答,其余全沉默 2️⃣ Oracle-aided 验证 = 可靠性 ↑ + 覆盖率 ↓(过度保守,宁可不答) 3️⃣ 金融微调后 BUY:SELL 偏 4.21~4.68 倍——结构性多头偏好,不是 bug
⚠️ 普通人避坑指南: - 任何金融 VLM 上线前自测 BUY:SELL,>2 倍即视为结构性偏向 - NDR 必须配合 ≥50% 覆盖率门槛,否则会被"沉默式失败"绕过 - 评测体系从 scalar 升级到 vector——医疗 / 自动驾驶同样适用
📌 GitHub 公开:https://github.com/wanng-ide/E2A-Bench
🎓 会议背书:EMNLP Findings