AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4%

  • 关联论文:2609.14302

想象一下这个场景:

你打开一个金融 AI 助手,给它一张贵州茅台过去半年的 K 线图,问"现在能不能买"。它信心十足地回你一句「强烈推荐买入,技术面与基本面双重共振」。

你大概率以为:这句话的背后,要么是基于真实财务数据的客观判断,要么是模型在胡说八道——总归能分出来。

但 2026 年 EMNLP Findings 接收的一篇论文 E2A-Bench(arXiv 2609.14302)撕开了一个尴尬的真相:

现有金融 VLM 评测只看"声明是否被支持",完全忽略了"证据→推理→置信度→最终行动"这条链路上的塌方。一个模型可以 UCR(未支撑声明率)极低、看似严谨,却在 93.6% 的方向性查询上选择沉默——scalar 幻觉分数会把这种"沉默式失败"包装成"靠谱"。

换句话说:金融 AI 看上去最老实的时候,可能恰恰是它最不顶用的时候。

一、为什么这件事对普通投资者很关键

你可能不炒股,但你一定被这种画面刷到过——

  • 「XX 股票 AI 大模型预测下周涨 18%,附 5 大技术指标共振信号」
  • 「AI 选股神器,三年回测年化 35%,模型已开源」
  • 「把基金报告喂给 AI,让它告诉你能不能加仓」

这些产品绝大多数跑在一个共识上:「幻觉率低 = 金融 AI 靠谱」。

但 E2A-Bench 的研究者发现,这个共识经不起一个具体追问——

「当你给模型一张 K 线图 + 一个方向性问题(买/卖/持有)时,它到底是在用证据回答,还是在回避困难问题?」

两者在 scalar 幻觉分数下看起来一模一样:模型都没说错话。但前者是真本事,后者是「挑简单的答、难的直接不答」。

对个人投资者:用一个看似严谨、实则在熊市预测这种硬问题上 100% 沉默的 AI,等于用了一个 "复读机 + 风险免责声明发生器"——它不骗你,但它也帮不了你。

对机构:把这种 VLM 接入量化流水线,等于在源头上就引入了 结构性多头偏好——E2A-Bench 的实证发现,金融领域微调后的 VLM 给出"买入"vs"卖出"的比例,比基座模型高出 4.21~4.68 倍。这个偏向不是 bug,是训练数据里就有的(卖方研报天然唱多),但被微调放大了。

二、E2A-Bench 到底干了什么——一套"四件套"评测

1. 数据集:969 道真实题,覆盖 323 只 HS300 成份股

E2A-Bench 没有用合成数据。它直接抓取沪深 300 成份股的真实历史 OHLCV(开高低收 + 成交量)数据,由确定性算法派生证据锚——避免人工标注偏差。这意味着每一道题的"正确答案"不是人拍脑袋说的,而是数学逻辑能验证的。

323 只 × 约 3 道/股 = 969 道,覆盖大盘蓝筹里最具代表性的样本。

2. 评测对象:20 个 VLM(含通用 + 金融微调)

论文显式评测了 20 个 VLM,既有 GPT-4V / Claude 这类通用多模态大模型,也有 FinGPT / 各类金融 fine-tuned 变体——这是首次在同一 benchmark 内做"通用 vs 金融微调"的严格配对对照。

3. 关键创新:四项指标替代单一分数

E2A-Bench 提出 UCR / RCI / ECI / NDR 四件套:

缩写 全称 测什么
UCR Unverified Claim Rate grounding:未支撑声明率
RCI Reasoning-Consistency Index 推理-行动一致性
ECI Evidence-Confidence Index 证据-置信度校准
NDR Directional Reliability 覆盖率感知的证据→行动可靠性(不是 PnL!)

注意:NDR 测的是「模型在做出 BUY/SELL/HOLD 时,证据是否真的支持这个方向 + 覆盖率是否充分」,不评估真实交易表现——这是评测可靠性,不是评测盈利能力。

4. 三组反直觉结论

论文用这套指标打出了三个让行业诟病方的发现:

发现 1:UCR 最低 ≠ NDR 最佳

某个模型 UCR 几乎最低(基本不胡说),但 NDR 排名垫底——原因:它只在 6.4% 的方向性查询上给出有效回答,其余 93.6% 全部弃答或不答。

scalar 分数看:这是优秀选手。
NDR 看:这是 回避困难问题的懦夫。

发现 2:Oracle-aided 验证的两面性

让模型在回答时调用"oracle 验证"(某种 ground-truth 查证工具)能降低未支撑声明率,但 会显著压缩回答覆盖率——模型变得过度保守,宁可不答也不犯错。

可靠性 vs 覆盖率,是金融 VLM 部署的核心 trade-off——scalar 幻觉分数根本不暴露这件事。

发现 3:金融 fine-tuning 放大 BUY:SELL 比例 4.21~4.68 倍

基座模型的 BUY:SELL 接近 1:1(市场中性),金融微调后变成 BUY 偏多 4.21~4.68 倍——结构性多头偏好。

意味着金融领域微调引入了系统性偏向——可能是数据污染(卖方研报天然唱多)、损失函数对"HOLD"的弱化,或训练时间窗口的市场偏差。

三、为什么这件事对所有人都重要

这套评测范式的真正意义是:

它把"AI 是否靠谱"这个问题从单一分数升级为全链路审计。

这件事的影响范围远不止金融领域——医疗、法律、自动驾驶、任何"AI 决策有下游代价"的场景都适用。

举个生活中的例子:

  • 你让医疗 AI 看 CT 片,它说"未发现异常"——但其实它对这类问题只敢答 5% 的样本(剩下 95% 全部"建议人工复核")。UCR 看:非常严谨。NDR 看:完全没法用。
  • 你让法律 AI 审合同,它说"条款合理"——但它的 BUY/SELL 等价物是"对所有模糊条款都说没问题"。scalar 看:幻觉率低。NDR 看:风险全被吞掉了。

单一幻觉分数的时代,正在结束。

四、给普通人和从业者的硬约束

  1. 金融 AI 上线前必查 BUY:SELL:任何金融 VLM 部署前必须自测"对市场中性查询的 BUY/SELL 比率",>2 倍即视为"有结构性偏向",需人工校正。
  2. NDR 必须配合最低覆盖率门槛:单独使用 NDR 会被"沉默式失败"绕过,必须 ≥50% 覆盖率门槛作合规前置。
  3. Oracle-aided 验证的成本-收益:当模型对困难问题过度弃答时,可调高 oracle 调用阈值,但需监控覆盖率塌方。
  4. Base vs fine-tuned 严格配对:评估 fine-tuning 副作用时,必须做"仅训练数据不同"的配对实验,否则归因错误。

六、一句话总结

现有金融 VLM 评测只看"声明是否被支持",E2A-Bench 用四件套指标 + 969 道真实题,把"行动可靠性"做成了一等公民,并揭示出 scalar 分数掩盖的三类系统性失败——其中 BUY:SELL 4.21~4.68 倍的多头偏好,是每个想用 AI 选股的人都该警惕的硬数据。

GitHub(已公开):https://github.com/wanng-ide/E2A-Bench


三个标题变体

反直觉版:AI 看完 K 线图喊「买入」——它的真实可靠性可能只有 6.4% 数字钩子版:测了 20 个 AI 模型后,这群研究者发现了金融 AI 的三个反常识塌方 类比版:金融 AI 的「高考体检」来了:UCR/RCI/ECI/NDR 四件套,单一幻觉分数正式退休


📱 小红书风格卡片文案(可直接发布)

🤖 金融 AI 的"高考体检",这次真的来了

还在用单一幻觉分数判断金融 AI 靠不靠谱?
EMNLP Findings 接的 E2A-Bench 告诉你—— scalar 分数的时代结束了。

🔍 这套论文干了什么? - 969 道基于沪深 300 成份股的真实查询(OHLCV 派生证据锚) - 测了 20 个 VLM(通用 + 金融微调) - 4 件套指标替代单一分数:UCR / RCI / ECI / NDR

💡 三个让行业诟病方的发现: 1️⃣ UCR 最低的模型,NDR 排垫底——它只在 6.4% 的方向性查询上答,其余全沉默 2️⃣ Oracle-aided 验证 = 可靠性 ↑ + 覆盖率 ↓(过度保守,宁可不答) 3️⃣ 金融微调后 BUY:SELL 偏 4.21~4.68 倍——结构性多头偏好,不是 bug

⚠️ 普通人避坑指南: - 任何金融 VLM 上线前自测 BUY:SELL,>2 倍即视为结构性偏向 - NDR 必须配合 ≥50% 覆盖率门槛,否则会被"沉默式失败"绕过 - 评测体系从 scalar 升级到 vector——医疗 / 自动驾驶同样适用

📌 GitHub 公开:https://github.com/wanng-ide/E2A-Bench
🎓 会议背书:EMNLP Findings

AI #金融AI #机器学习 #多模态 #大模型 #量化投资 #EMNLP #VLM #AI评测 #干货分享