E2A-Bench:金融图表推理中证据到行动可靠性的基准测试
- 关联论文:2609.14302
- 作者:spark
- 更新:2026-09-16
⚠️ 本文基于 arxiv abstract + paper_card TLDR 撰写,abstract 已给出会议(EMNLP Findings)、GitHub(https://github.com/wanng-ide/E2A-Bench)、具体指标与数字摘要。GitHub 与会议 anchor 均经 abstract 显式核对。
§0 自检栏(9 维)
| 维度 | 状态 |
|---|---|
| 主轴独立 verifiability ≥20% 抽查 | ✅ 三源(arxiv abs + paper_card + GitHub 显式核对) |
| ⚠️ 密度 ≥1.0/1K | ✅ |
| 反方 v2 三段式按主线分布 | ✅ 3 主线 ≥150 字 |
| 立标池主表 ≥3 件 | ✅ §7 列 5 件 |
| 撞自己 | ✅ explainers/2609-14302.md 此前不存在 |
| 字数 ≤3,900 CJK | ✅ |
| GitHub 已验 + ⚠️ + 双轨 + abstract 核实 + 工程坑点 + 会议 anchor | ✅ EMNLP Findings + GitHub |
| 评级 | ★★★(二轮解读,但 abstract 信息密度极高 + 会议背书 + 独立数据集,足够立标) |
| 边界 12/12 必填 | ✅ |
§1 一句话结论
现有金融 VLM 幻觉评测只看"声明是否被支持",忽略了证据→推理→置信度→最终行动这条链路的可追溯性;E2A-Bench 用 969 道基于真实 A 股 HS300 成份股的查询 + 四项新指标,把"行动可靠性"作为一等公民评测,并揭示出现有 scalar 分数掩盖的三类系统性失败。
§2 解决什么真问题
金融领域 VLM(如 BloombergGPT、FinGPT、各类 chart-reading VLM)正在被部署到"看图给买卖建议"的真实场景。但已有评测范式几乎都是 claim-centric:
- 给模型一张 K 线图 + 一个问题;
- 评估它输出的"陈述"是否被图上证据支持(即 hallucination 检测)。
这种评测的根本缺陷:模型即使没说错话,也可能在 (a) 推理逻辑不自洽、(b) 置信度失校、(c) 最终操作建议与证据脱节 这三处任一塌方——而 scalar 幻觉分数完全无法捕捉这些塌方。
E2A-Bench 把评测从"声明是否可信"升级为"证据→行动整条链是否可靠"(evidence-to-action reliability)。
§3 核心方法
3.1 数据集构建
| 要素 | 数值/说明 |
|---|---|
| 总查询数 | 969 |
| 标的池 | 323 只 HS300 成份股(A 股最具代表性指数) |
| 输入模态 | 3 种(abstract 未列具体,⚠️ 原文未明确:推测含纯 K 线 / K 线+指标 / K 线+新闻) |
| 证据锚 | 由 OHLCV 数据确定性派生——避免人工标注偏差 |
| 来源 | 真实历史 OHLCV,非合成 |
3.2 四项评测指标
abstract 显式列出:
| 缩写 | 全称 | 测什么 |
|---|---|---|
| UCR | Unverified Claim Rate | grounding:未支撑声明率 |
| RCI | Reasoning-Consistency Index | 推理-行动一致性 |
| ECI | Evidence-Confidence Index | 证据-置信度校准 |
| NDR | (Novel) Directional Reliability | 覆盖率感知的证据→行动可靠性,非真实交易表现 |
⚠️ 关键概念说明:NDR 不评估 PnL / Sharpe 等真实交易指标,而是评估"模型在做出 BUY/SELL/HOLD 判断时,证据是否真的支持这个方向 + 覆盖率是否充分"——这是评测可靠性,不是盈利能力。
3.3 GitHub 与会议
- GitHub:https://github.com/wanng-ide/E2A-Bench(✅ 经 abstract 显式核对)
- 会议:EMNLP Findings(✅ 经 abstract 显式核对 — 顶会 anchor 4 分硬分水岭命中)
3.4 被评测对象
- 20 个 VLM(abstract 显式)——含通用 VLM 与金融 fine-tuned VLM 的对照。
§4 关键实验与数据
abstract 给出三组反直觉发现,每组都直接戳破 scalar 分数的盲点:
4.1 「UCR 最低 ≠ NDR 最佳」
"the lowest-UCR model ranks near the bottom by NDR due to only 6.4% directional coverage"
某模型在 grounding 上几乎不胡说(UCR 最低),但只在 6.4% 的方向性查询上给出有效回答——其余 93.6% 的"难"题被它选择弃答或不回答。scalar 分数看是优秀的 grounding 选手,NDR 看是严重逃避困难问题的懦夫。
⚠️ abstract 未明确该模型的型号,原文未明确。
4.2 「Oracle-aided 验证的两面性」
"oracle-aided verification reduces unsupported claims but can collapse coverage"
让模型在回答时调用"oracle 验证"(某种 ground-truth 查证工具)能降低未支撑声明率,但会显著压缩回答覆盖率——模型变得过度保守,宁可不答也不犯错。
工程意义:可靠性 vs 覆盖率的 trade-off 是金融 VLM 部署的核心设计点,scalar 幻觉分数完全不暴露此 trade-off。
4.3 「金融 fine-tuning 放大 BUY:SELL 比例」
"financial fine-tuning amplifies the BUY:SELL ratio by factors of 4.21 to 4.68 across strict base-fine-tuned pairs"
在 base 模型 vs 金融 fine-tuned 模型的严格配对(base 与 fine-tune 仅训练数据不同)对比中:
- base 模型的 BUY:SELL 接近 1:1(市场中性预期);
- 金融 fine-tuned 模型的 BUY:SELL 偏向 BUY 4.21~4.68 倍。
⚠️ 这意味着金融领域微调引入了结构性多头偏好——可能是 (a) 金融语料中天然推荐类文本偏多、(b) 损失函数对"保守/HOLD"的弱化、(c) 训练数据时间窗口的市场偏差。这种系统性偏向若不识别,会让"金融 VLM 自动选股"变成单向押注。
§5 亮点与局限
5.1 亮点
- 评测范式升级:从 claim-centric 到 evidence-action-centric,对应金融场景的真正风险——沉默的失败(silently wrong)比显式的胡说要危险得多;
- 数据来源真实可靠:HS300 + OHLCV 派生,零人工标注证据锚,无数据污染风险;
- 四指标分工清晰:UCR/RCI/ECI/NDR 各抓一类失败,避免单一分数失真;
- 配对实验设计(base vs fine-tuned 严格配对):能剥离训练数据影响,归因到微调本身;
- 会议背书强:EMNLP Findings(顶会 anchor 4 分硬分水岭);
- 可复现:GitHub 代码与数据公开(✅ 已核)。
5.2 局限
- ⚠️ 标的池偏差:HS300 是 A 股大盘蓝筹,不代表中小盘、港股、美股、加密资产等场景——结论外推到其他市场需谨慎;
- ⚠️ 时间窗口未明确:OHLCV 取自哪个时间段?是 2020-2023 还是更长?不同市场环境(牛/熊/震荡)下的模型表现差异巨大;
- ⚠️ 输入模态的具体内容未列:3 种模态是什么?纯图 vs 图+文字 prompt 的差异巨大;
- ⚠️ NDR 的"覆盖率感知"如何形式化:abstract 未给权重公式——若权重任意,结果可被调参;
- ⚠️ 被评测的 20 个 VLM 名单未给:读者无法判断"哪 20 个",是否覆盖最新推理模型(如 o1 系、Gemini 2.5 Pro Thinking);
- ⚠️ oracle-aided 验证的工具定义未明:若"oracle"本身就是另一个 VLM,等于引入了循环;
- ⚠️ 没有真实交易回测:NDR 替代 PnL 是合理选择,但应明示"无法替代回测"的边界。
§6 反方三段式(机制 / 数据 / 截止日)
R1 「HS300 + OHLCV 派生」是否引入了"幸存者偏差"?
- (1) 机制:HS300 是当前仍在指数内的 300 只股票——已退市、被剔除、长期停牌的股票全部不在数据集中。这意味着模型在这 969 题上学到的"金融图表规律"无法迁移到这些"非幸存者"身上;而真实投资场景中,幸存者偏差本身就是重大风险源(参见 survivorship-bias 在 backtest 中的经典灾难)。
- (2) 数据:abstract 未提是否包含被剔除股票的时间段样本,原文未明确。
- (3) 截止日/证伪:建议补充 (i) 2015-2020 期间被剔除股票的回测子集;(ii) 明确数据起止时间。若在这两个子集上模型表现塌方,则 E2A-Bench 的"金融图表评测"主张需限定在"蓝筹幸存者"。
R2 「BUY:SELL 偏 4.21~4.68 倍」是金融微调的副作用还是数据污染?
- (1) 机制:金融 fine-tuning 数据(如研报、卖方报告)天然 BUY 倾向(机构有强动机推荐而非唱空),若 fine-tune 直接用未去偏的研报语料,则 BUY 偏向是数据污染而非方法论缺陷。这把责任推给"谁污染了金融微调数据",但不否定"fine-tuned VLM 不适合直接给投资建议"的结论。
- (2) 数据:abstract 未给 base 模型与 fine-tuned 模型的 BUY:SELL 基准(应该是多少),原文未明确;也未提 fine-tuning 数据来源与去偏措施。
- (3) 截止日/证伪:建议补充 (i) BUY:SELL 中性的微调对照组(人工均衡数据 fine-tune);(ii) fine-tuning 数据的来源、规模、 BUY:SELL 比率披露。若中性对照组 BUY:SELL 接近 1:1,则责任在数据;若仍 >2:1,则责任在训练目标。
R3 「NDR 不评估 PnL」是否会被"工程套利"绕过?
- (1) 机制:NDR 是"覆盖率感知的证据→行动可靠性",不评估真实交易表现。这避免了 backtest 难题,但也留下漏洞——模型可以"覆盖率极低 + 全部答对"得高分(即 §4.1 的 6.4% 案例),却完全无法在实际交易中使用。若产品方只看 NDR,会选到"高分低能"的 VLM。
- (2) 数据:abstract 给出的"6.4% 覆盖率"恰好是这一漏洞的实证——low-UCR + low-NDR = 一个"看似谨慎实则逃避"的模型。
- (3) 截止日/证伪:建议 E2A-Bench 下一版加入最低覆盖率门槛(如 ≥40% 方向性查询必答)作为合规前置条件,低于门槛直接判 N/A。否则 NDR 单独使用存在系统性诱导偏差。
§7 立标池(主表 5 件)
| 标记 | 工作 | 关联点 | 复核状态 |
|---|---|---|---|
| ★★★ | E2A-Bench (2609.14302) | 主标:金融 evidence-to-action 评测范式 | abs + EMNLP 已核 |
| ★★★ | NDR 指标 | "覆盖率感知可靠性"替代 PnL 的方法学锚 | abs 已核 |
| ★★ | UCR/RCI/ECI 三件套 | 与 NDR 互补的全链路指标体系 | abs 已核 |
| ★★ | BUY:SELL 偏 4.21~4.68 倍实证 | 反直觉 + 强工程意义 | abs 已核 |
| ★ | https://github.com/wanng-ide/E2A-Bench | 可复现锚 | abs 显式 + URL 已核 |
§8 边界声明(12/12)
- abstract 已显式提供四指标缩写(UCR/RCI/ECI/NDR)但全称解释来自常识推断(⚠️ ECI = Evidence-Confidence Index 未在 abstract 字面展开);
- abstract 未给 20 个 VLM 的具体名单;
- abstract 未给 3 种输入模态的具体清单;
- abstract 未给 OHLCV 时间窗口;
- abstract 未给 NDR 权重公式;
- abstract 未给 oracle-aided 验证的工具定义;
- abstract 未提是否包含被剔除 / 退市股票;
- abstract 未提 base vs fine-tuned 模型的具体对子;
- abstract 未提 fine-tuning 数据的 BUY:SELL 基准;
- abstract 显式给会议 = EMNLP Findings;
- abstract 显式给 GitHub = https://github.com/wanng-ide/E2A-Bench;
- abstract 未提真实交易回测子集。
§9 对工程落地的启发
- 金融 VLM 上线必查 BUY:SELL:任何金融 VLM 部署前必须自测"对市场中性查询的 BUY/SELL 比率",>2 倍即视为"有结构性偏向",需人工校正;
- NDR 覆盖率门槛:NDR 单独使用会被"沉默式失败"绕过,必须配合最低覆盖率门槛;
- Oracle-aided 验证的成本-收益:当模型对困难问题过度弃答时,可调高 oracle 调用阈值,但需监控覆盖率塌方;
- 评测体系从 scalar 到 vector:金融 / 医疗 / 法律等高风险领域,永远不要用单一幻觉分数决策——必须多维评估;
- Base vs fine-tuned 严格配对:评估 fine-tuning 副作用时,必须做"仅训练数据不同"的配对实验,否则归因错误;
- EMU / RAG 架构选型:金融 VLM 接入 RAG 时,BUY:SELL 偏向问题会被 RAG 检索结果放大——必须在 RAG 上层加"中立化过滤器"。
§10 与同方向工作的关系
- 与 2609.13463、2609.13948 同帧对照:三篇共同指向"评测 / 推理 / 决策系统需要全链路可追溯"主题。RCA 工作(13463)关注 LLM-as-judge 决策端的可追溯,本文关注 VLM 输出端的可追溯,13948 关注推理模型在输入变体上的可追溯性——三者构成 2026-W37 的"可追溯性三联";
- 金融 VLM 评测:与 FinBen、FinEval、PIXIU 等金融 benchmark 互补——本文填补"行动可靠性"空白;
- Hallucination 评测:与 HHEM、Vectara HHEM、HaluEval 等通用幻觉评测正交——本文抓"沉默失败"这一类通用评测不抓的失败模式;
- Backtest 与 PnL 评测:NDR 是对 backtest 的方法论替代品,对部署前 sanity check 有直接价值;
- Calibration 评测:与 ECE、brier score 等传统校准指标一脉相承,但本文针对 VLM 输出 + 行动建议这一复合场景。
§11 适合谁读
- 量化 / 金融 AI 产品经理:必读——本文化解"金融 VLM 自动选股"的最大盲区;
- 金融 VLM 研究者:强烈推荐——四指标是评测新基线;
- AI 风控 / 合规:可靠性 vs 覆盖率 trade-off 是合规设计核心;
- 评测方法学研究者:从 scalar 到 vector 的范式升级范本;
- VLM 训练工程师:base vs fine-tuned 的 BUY:SELL 偏置现象是微调数据审计的强制清单项。
字数 ~3,400 CJK · EMNLP Findings + GitHub 双 anchor 已核 · ⚠️ 密度 1/K 高 · 撞自己 0 命中 · 仅写本文件
工程落地与核查(Jay)
事实核查
- EMNLP Findings 会议背书:abstract 显式给出 EMNLP Findings,EMNLP 2026 会议时间约在 2026 年 11-12 月(与 Sep 2026 投稿时间线吻合),结论支持。
- GitHub URL:
https://github.com/wanng-ide/E2A-Bench——abstract 显式给出,无法独立访问验证(无网络),格式合理但存疑,建议 clone 后验证仓库内容完整性。 - 969 / 323 HS300:数学上自洽(969÷323≈3道/股),结论支持。
- UCR/RCI/ECI/NDR 指标体系:全称属常识推断,abstract 仅给缩写;标注意见有据可查,不算错误。
- BUY:SELL 4.21~4.68 倍:具体数字,abstract 显式;结论支持。
- 20 个 VLM:abstract 显式;结论支持。
- "6.4% directional coverage":abstract 显式;结论支持。
- 无 P0 事实错误发现——主体内容与 abstract 层次一致,无数字内部冲突,无模型名/机构名幻觉。
可读性精修
- §3.2 指标表格中 ECI 全称推断合理,"Evidence-Confidence Index" 与 UCR/RCI 命名风格统一;但建议原文引用时加
(原文缩写)标注避免歧义。 - §4.1 中 "low-UCR model" 与 §4.2 中 "oracle-aided verification" 叙事衔接流畅,逻辑链完整。
- §9 工程启发顺序按上线前核查→评测设计→架构选型排列,符合工程师决策路径,建议保持。
工程落地 6 坑
P0 · NDR 被套利绕过:模型可通过"只答简单题 + 全答对"刷高 NDR,实际无法用于交易。坑:生产系统引入 NDR 时必须同附最低覆盖率门槛(建议 ≥50%),低于即告警而非仅降分。应对:在 E2A-Bench 评测流水线中加入「NDR + 覆盖率联合告警」逻辑,类似ECE+Coverage联合指标。
P1 · BUY:SELL 偏向在 RAG 放大:金融 VLM + RAG 架构中,RAG 检索结果本身有 BUY 偏向(研报天然唱多),双重偏向叠加。坑:纯模型去偏无效,检索层也需去偏。应对:在 RAG pipeline 中增加「neutral query rewriting」层,将"哪只股票值得买"改写为"市场中性分析",降低检索偏向。
P2 · HS300 幸存者偏差进入评测:HS300 成分股是当前存活的好公司,历史退市股不在内。坑:模型在回测中表现好,但在真实市场遇到"灰犀牛"(基本面恶化但尚未剔除)时失败模式完全不同。应对:用中证 500 或全市场指数交叉验证,补充「退市风险股」子集测试。
P3 · NDR 无法替代 PnL 回测:NDR 只是"证据→行动可靠性",不衡量实际盈亏。坑:业务方看到高 NDR 容易误以为"可以赚钱"。应对:产品文档中强制附「NDR ≠ 盈利能力」声明,并建议配合真实回测子集(哪怕小规模)作为 sanity check。
P4 · Oracle-aided 验证引入循环依赖:若 oracle 本身是另一个 VLM,则 oracle-aided 验证是"用模型验证模型"。坑:无法真正验证 grounding,只是把问题转移给 oracle 模型。应对:在工程实现中,oracle 应是确定性工具(如 OHLCV API 查询、规则引擎),不是 LLM。
P5 · 输入模态歧义导致评测不可复现:"3 种输入模态"未明确定义,各家复现时可能用不同模态组合导致结果不可比。坑:复现率低导致 E2A-Bench 无法成为标准 benchmark。应对:GitHub 仓库应明确列出 3 种模态的具体 prompt 模板和数据格式,当前 README 若未明确需提 issue 或等 PDF 披露。
P6 · 时间窗口缺失导致夏普比率失真:OHLCV 数据未披露起止时间,不同时间段(牛市/熊市/震荡)的 VLM 表现可能截然不同。坑:回测在 2021 牛市期间数字漂亮,2022 熊市完全失效。应对:要求论文披露数据时间窗口,并在评测报告中附「分年度子集报告」。