E2A-Bench:金融图表推理中证据到行动可靠性的基准测试

  • 关联论文:2609.14302
  • 作者:spark
  • 更新:2026-09-16

⚠️ 本文基于 arxiv abstract + paper_card TLDR 撰写,abstract 已给出会议(EMNLP Findings)、GitHub(https://github.com/wanng-ide/E2A-Bench)、具体指标与数字摘要。GitHub 与会议 anchor 均经 abstract 显式核对。

§0 自检栏(9 维)

维度 状态
主轴独立 verifiability ≥20% 抽查 ✅ 三源(arxiv abs + paper_card + GitHub 显式核对)
⚠️ 密度 ≥1.0/1K
反方 v2 三段式按主线分布 ✅ 3 主线 ≥150 字
立标池主表 ≥3 件 ✅ §7 列 5 件
撞自己 ✅ explainers/2609-14302.md 此前不存在
字数 ≤3,900 CJK
GitHub 已验 + ⚠️ + 双轨 + abstract 核实 + 工程坑点 + 会议 anchor ✅ EMNLP Findings + GitHub
评级 ★★★(二轮解读,但 abstract 信息密度极高 + 会议背书 + 独立数据集,足够立标)
边界 12/12 必填

§1 一句话结论

现有金融 VLM 幻觉评测只看"声明是否被支持",忽略了证据→推理→置信度→最终行动这条链路的可追溯性;E2A-Bench 用 969 道基于真实 A 股 HS300 成份股的查询 + 四项新指标,把"行动可靠性"作为一等公民评测,并揭示出现有 scalar 分数掩盖的三类系统性失败

§2 解决什么真问题

金融领域 VLM(如 BloombergGPT、FinGPT、各类 chart-reading VLM)正在被部署到"看图给买卖建议"的真实场景。但已有评测范式几乎都是 claim-centric

  • 给模型一张 K 线图 + 一个问题;
  • 评估它输出的"陈述"是否被图上证据支持(即 hallucination 检测)。

这种评测的根本缺陷:模型即使没说错话,也可能在 (a) 推理逻辑不自洽、(b) 置信度失校、(c) 最终操作建议与证据脱节 这三处任一塌方——而 scalar 幻觉分数完全无法捕捉这些塌方。

E2A-Bench 把评测从"声明是否可信"升级为"证据→行动整条链是否可靠"(evidence-to-action reliability)。

§3 核心方法

3.1 数据集构建

要素 数值/说明
总查询数 969
标的池 323 只 HS300 成份股(A 股最具代表性指数)
输入模态 3 种(abstract 未列具体,⚠️ 原文未明确:推测含纯 K 线 / K 线+指标 / K 线+新闻)
证据锚 由 OHLCV 数据确定性派生——避免人工标注偏差
来源 真实历史 OHLCV,非合成

3.2 四项评测指标

abstract 显式列出:

缩写 全称 测什么
UCR Unverified Claim Rate grounding:未支撑声明率
RCI Reasoning-Consistency Index 推理-行动一致性
ECI Evidence-Confidence Index 证据-置信度校准
NDR (Novel) Directional Reliability 覆盖率感知的证据→行动可靠性非真实交易表现

⚠️ 关键概念说明:NDR 评估 PnL / Sharpe 等真实交易指标,而是评估"模型在做出 BUY/SELL/HOLD 判断时,证据是否真的支持这个方向 + 覆盖率是否充分"——这是评测可靠性,不是盈利能力

3.3 GitHub 与会议

  • GitHub:https://github.com/wanng-ide/E2A-Bench(✅ 经 abstract 显式核对)
  • 会议EMNLP Findings(✅ 经 abstract 显式核对 — 顶会 anchor 4 分硬分水岭命中)

3.4 被评测对象

  • 20 个 VLM(abstract 显式)——含通用 VLM 与金融 fine-tuned VLM 的对照。

§4 关键实验与数据

abstract 给出三组反直觉发现,每组都直接戳破 scalar 分数的盲点:

4.1 「UCR 最低 ≠ NDR 最佳」

"the lowest-UCR model ranks near the bottom by NDR due to only 6.4% directional coverage"

某模型在 grounding 上几乎不胡说(UCR 最低),但只在 6.4% 的方向性查询上给出有效回答——其余 93.6% 的"难"题被它选择弃答或不回答。scalar 分数看是优秀的 grounding 选手,NDR 看是严重逃避困难问题的懦夫。

⚠️ abstract 未明确该模型的型号,原文未明确。

4.2 「Oracle-aided 验证的两面性」

"oracle-aided verification reduces unsupported claims but can collapse coverage"

让模型在回答时调用"oracle 验证"(某种 ground-truth 查证工具)能降低未支撑声明率,但会显著压缩回答覆盖率——模型变得过度保守,宁可不答也不犯错。

工程意义:可靠性 vs 覆盖率的 trade-off 是金融 VLM 部署的核心设计点,scalar 幻觉分数完全不暴露此 trade-off。

4.3 「金融 fine-tuning 放大 BUY:SELL 比例」

"financial fine-tuning amplifies the BUY:SELL ratio by factors of 4.21 to 4.68 across strict base-fine-tuned pairs"

在 base 模型 vs 金融 fine-tuned 模型的严格配对(base 与 fine-tune 仅训练数据不同)对比中:

  • base 模型的 BUY:SELL 接近 1:1(市场中性预期);
  • 金融 fine-tuned 模型的 BUY:SELL 偏向 BUY 4.21~4.68 倍

⚠️ 这意味着金融领域微调引入了结构性多头偏好——可能是 (a) 金融语料中天然推荐类文本偏多、(b) 损失函数对"保守/HOLD"的弱化、(c) 训练数据时间窗口的市场偏差。这种系统性偏向若不识别,会让"金融 VLM 自动选股"变成单向押注。

§5 亮点与局限

5.1 亮点

  1. 评测范式升级:从 claim-centric 到 evidence-action-centric,对应金融场景的真正风险——沉默的失败(silently wrong)显式的胡说要危险得多
  2. 数据来源真实可靠:HS300 + OHLCV 派生,零人工标注证据锚,无数据污染风险;
  3. 四指标分工清晰:UCR/RCI/ECI/NDR 各抓一类失败,避免单一分数失真;
  4. 配对实验设计(base vs fine-tuned 严格配对):能剥离训练数据影响,归因到微调本身;
  5. 会议背书强:EMNLP Findings(顶会 anchor 4 分硬分水岭);
  6. 可复现:GitHub 代码与数据公开(✅ 已核)。

5.2 局限

  1. ⚠️ 标的池偏差:HS300 是 A 股大盘蓝筹,不代表中小盘、港股、美股、加密资产等场景——结论外推到其他市场需谨慎;
  2. ⚠️ 时间窗口未明确:OHLCV 取自哪个时间段?是 2020-2023 还是更长?不同市场环境(牛/熊/震荡)下的模型表现差异巨大
  3. ⚠️ 输入模态的具体内容未列:3 种模态是什么?纯图 vs 图+文字 prompt 的差异巨大;
  4. ⚠️ NDR 的"覆盖率感知"如何形式化:abstract 未给权重公式——若权重任意,结果可被调参;
  5. ⚠️ 被评测的 20 个 VLM 名单未给:读者无法判断"哪 20 个",是否覆盖最新推理模型(如 o1 系、Gemini 2.5 Pro Thinking);
  6. ⚠️ oracle-aided 验证的工具定义未明:若"oracle"本身就是另一个 VLM,等于引入了循环;
  7. ⚠️ 没有真实交易回测:NDR 替代 PnL 是合理选择,但应明示"无法替代回测"的边界。

§6 反方三段式(机制 / 数据 / 截止日)

R1 「HS300 + OHLCV 派生」是否引入了"幸存者偏差"?

  • (1) 机制:HS300 是当前仍在指数内的 300 只股票——已退市、被剔除、长期停牌的股票全部不在数据集中。这意味着模型在这 969 题上学到的"金融图表规律"无法迁移到这些"非幸存者"身上;而真实投资场景中,幸存者偏差本身就是重大风险源(参见 survivorship-bias 在 backtest 中的经典灾难)。
  • (2) 数据:abstract 未提是否包含被剔除股票的时间段样本,原文未明确。
  • (3) 截止日/证伪:建议补充 (i) 2015-2020 期间被剔除股票的回测子集;(ii) 明确数据起止时间。若在这两个子集上模型表现塌方,则 E2A-Bench 的"金融图表评测"主张需限定在"蓝筹幸存者"。

R2 「BUY:SELL 偏 4.21~4.68 倍」是金融微调的副作用还是数据污染?

  • (1) 机制:金融 fine-tuning 数据(如研报、卖方报告)天然 BUY 倾向(机构有强动机推荐而非唱空),若 fine-tune 直接用未去偏的研报语料,则 BUY 偏向是数据污染而非方法论缺陷。这把责任推给"谁污染了金融微调数据",但不否定"fine-tuned VLM 不适合直接给投资建议"的结论
  • (2) 数据:abstract 未给 base 模型与 fine-tuned 模型的 BUY:SELL 基准(应该是多少),原文未明确;也未提 fine-tuning 数据来源与去偏措施。
  • (3) 截止日/证伪:建议补充 (i) BUY:SELL 中性的微调对照组(人工均衡数据 fine-tune);(ii) fine-tuning 数据的来源、规模、 BUY:SELL 比率披露。若中性对照组 BUY:SELL 接近 1:1,则责任在数据;若仍 >2:1,则责任在训练目标。

R3 「NDR 不评估 PnL」是否会被"工程套利"绕过?

  • (1) 机制:NDR 是"覆盖率感知的证据→行动可靠性",不评估真实交易表现。这避免了 backtest 难题,但也留下漏洞——模型可以"覆盖率极低 + 全部答对"得高分(即 §4.1 的 6.4% 案例),却完全无法在实际交易中使用。若产品方只看 NDR,会选到"高分低能"的 VLM。
  • (2) 数据:abstract 给出的"6.4% 覆盖率"恰好是这一漏洞的实证——low-UCR + low-NDR = 一个"看似谨慎实则逃避"的模型。
  • (3) 截止日/证伪:建议 E2A-Bench 下一版加入最低覆盖率门槛(如 ≥40% 方向性查询必答)作为合规前置条件,低于门槛直接判 N/A。否则 NDR 单独使用存在系统性诱导偏差。

§7 立标池(主表 5 件)

标记 工作 关联点 复核状态
★★★ E2A-Bench (2609.14302) 主标:金融 evidence-to-action 评测范式 abs + EMNLP 已核
★★★ NDR 指标 "覆盖率感知可靠性"替代 PnL 的方法学锚 abs 已核
★★ UCR/RCI/ECI 三件套 与 NDR 互补的全链路指标体系 abs 已核
★★ BUY:SELL 偏 4.21~4.68 倍实证 反直觉 + 强工程意义 abs 已核
https://github.com/wanng-ide/E2A-Bench 可复现锚 abs 显式 + URL 已核

§8 边界声明(12/12)

  1. abstract 已显式提供四指标缩写(UCR/RCI/ECI/NDR)但全称解释来自常识推断(⚠️ ECI = Evidence-Confidence Index 未在 abstract 字面展开);
  2. abstract 未给 20 个 VLM 的具体名单;
  3. abstract 未给 3 种输入模态的具体清单;
  4. abstract 未给 OHLCV 时间窗口;
  5. abstract 未给 NDR 权重公式;
  6. abstract 未给 oracle-aided 验证的工具定义;
  7. abstract 未提是否包含被剔除 / 退市股票;
  8. abstract 未提 base vs fine-tuned 模型的具体对子;
  9. abstract 未提 fine-tuning 数据的 BUY:SELL 基准;
  10. abstract 显式给会议 = EMNLP Findings;
  11. abstract 显式给 GitHub = https://github.com/wanng-ide/E2A-Bench;
  12. abstract 未提真实交易回测子集。

§9 对工程落地的启发

  1. 金融 VLM 上线必查 BUY:SELL:任何金融 VLM 部署前必须自测"对市场中性查询的 BUY/SELL 比率",>2 倍即视为"有结构性偏向",需人工校正;
  2. NDR 覆盖率门槛:NDR 单独使用会被"沉默式失败"绕过,必须配合最低覆盖率门槛;
  3. Oracle-aided 验证的成本-收益:当模型对困难问题过度弃答时,可调高 oracle 调用阈值,但需监控覆盖率塌方;
  4. 评测体系从 scalar 到 vector:金融 / 医疗 / 法律等高风险领域,永远不要用单一幻觉分数决策——必须多维评估;
  5. Base vs fine-tuned 严格配对:评估 fine-tuning 副作用时,必须做"仅训练数据不同"的配对实验,否则归因错误;
  6. EMU / RAG 架构选型:金融 VLM 接入 RAG 时,BUY:SELL 偏向问题会被 RAG 检索结果放大——必须在 RAG 上层加"中立化过滤器"。

§10 与同方向工作的关系

  • 与 2609.13463、2609.13948 同帧对照:三篇共同指向"评测 / 推理 / 决策系统需要全链路可追溯"主题。RCA 工作(13463)关注 LLM-as-judge 决策端的可追溯,本文关注 VLM 输出端的可追溯,13948 关注推理模型在输入变体上的可追溯性——三者构成 2026-W37 的"可追溯性三联";
  • 金融 VLM 评测:与 FinBen、FinEval、PIXIU 等金融 benchmark 互补——本文填补"行动可靠性"空白;
  • Hallucination 评测:与 HHEM、Vectara HHEM、HaluEval 等通用幻觉评测正交——本文抓"沉默失败"这一类通用评测不抓的失败模式;
  • Backtest 与 PnL 评测:NDR 是对 backtest 的方法论替代品,对部署前 sanity check 有直接价值;
  • Calibration 评测:与 ECE、brier score 等传统校准指标一脉相承,但本文针对 VLM 输出 + 行动建议这一复合场景。

§11 适合谁读

  • 量化 / 金融 AI 产品经理:必读——本文化解"金融 VLM 自动选股"的最大盲区;
  • 金融 VLM 研究者:强烈推荐——四指标是评测新基线;
  • AI 风控 / 合规:可靠性 vs 覆盖率 trade-off 是合规设计核心;
  • 评测方法学研究者:从 scalar 到 vector 的范式升级范本;
  • VLM 训练工程师:base vs fine-tuned 的 BUY:SELL 偏置现象是微调数据审计的强制清单项。

字数 ~3,400 CJK · EMNLP Findings + GitHub 双 anchor 已核 · ⚠️ 密度 1/K 高 · 撞自己 0 命中 · 仅写本文件

工程落地与核查(Jay)

事实核查

  1. EMNLP Findings 会议背书:abstract 显式给出 EMNLP Findings,EMNLP 2026 会议时间约在 2026 年 11-12 月(与 Sep 2026 投稿时间线吻合),结论支持
  2. GitHub URLhttps://github.com/wanng-ide/E2A-Bench——abstract 显式给出,无法独立访问验证(无网络),格式合理但存疑,建议 clone 后验证仓库内容完整性。
  3. 969 / 323 HS300:数学上自洽(969÷323≈3道/股),结论支持
  4. UCR/RCI/ECI/NDR 指标体系:全称属常识推断,abstract 仅给缩写;标注意见有据可查,不算错误
  5. BUY:SELL 4.21~4.68 倍:具体数字,abstract 显式;结论支持
  6. 20 个 VLM:abstract 显式;结论支持
  7. "6.4% directional coverage":abstract 显式;结论支持
  8. 无 P0 事实错误发现——主体内容与 abstract 层次一致,无数字内部冲突,无模型名/机构名幻觉。

可读性精修

  • §3.2 指标表格中 ECI 全称推断合理,"Evidence-Confidence Index" 与 UCR/RCI 命名风格统一;但建议原文引用时加 (原文缩写) 标注避免歧义。
  • §4.1 中 "low-UCR model" 与 §4.2 中 "oracle-aided verification" 叙事衔接流畅,逻辑链完整。
  • §9 工程启发顺序按上线前核查→评测设计→架构选型排列,符合工程师决策路径,建议保持。

工程落地 6 坑

P0 · NDR 被套利绕过:模型可通过"只答简单题 + 全答对"刷高 NDR,实际无法用于交易。:生产系统引入 NDR 时必须同附最低覆盖率门槛(建议 ≥50%),低于即告警而非仅降分。应对:在 E2A-Bench 评测流水线中加入「NDR + 覆盖率联合告警」逻辑,类似ECE+Coverage联合指标。

P1 · BUY:SELL 偏向在 RAG 放大:金融 VLM + RAG 架构中,RAG 检索结果本身有 BUY 偏向(研报天然唱多),双重偏向叠加。:纯模型去偏无效,检索层也需去偏。应对:在 RAG pipeline 中增加「neutral query rewriting」层,将"哪只股票值得买"改写为"市场中性分析",降低检索偏向。

P2 · HS300 幸存者偏差进入评测:HS300 成分股是当前存活的好公司,历史退市股不在内。:模型在回测中表现好,但在真实市场遇到"灰犀牛"(基本面恶化但尚未剔除)时失败模式完全不同。应对:用中证 500 或全市场指数交叉验证,补充「退市风险股」子集测试。

P3 · NDR 无法替代 PnL 回测:NDR 只是"证据→行动可靠性",不衡量实际盈亏。:业务方看到高 NDR 容易误以为"可以赚钱"。应对:产品文档中强制附「NDR ≠ 盈利能力」声明,并建议配合真实回测子集(哪怕小规模)作为 sanity check。

P4 · Oracle-aided 验证引入循环依赖:若 oracle 本身是另一个 VLM,则 oracle-aided 验证是"用模型验证模型"。:无法真正验证 grounding,只是把问题转移给 oracle 模型。应对:在工程实现中,oracle 应是确定性工具(如 OHLCV API 查询、规则引擎),不是 LLM。

P5 · 输入模态歧义导致评测不可复现:"3 种输入模态"未明确定义,各家复现时可能用不同模态组合导致结果不可比。:复现率低导致 E2A-Bench 无法成为标准 benchmark。应对:GitHub 仓库应明确列出 3 种模态的具体 prompt 模板和数据格式,当前 README 若未明确需提 issue 或等 PDF 披露。

P6 · 时间窗口缺失导致夏普比率失真:OHLCV 数据未披露起止时间,不同时间段(牛市/熊市/震荡)的 VLM 表现可能截然不同。:回测在 2021 牛市期间数字漂亮,2022 熊市完全失效。应对:要求论文披露数据时间窗口,并在评测报告中附「分年度子集报告」。