让 AI 真正读懂 Excel:那个跑赢 SOTA 32 个百分点的「会自己翻表的代理」到底做对了什么

  • 关联论文:2603.06503

你有没有被这种场面劝退过:把一份几百兆的 Excel 工作簿扔给 ChatGPT,让它「帮我算一下各区域上季度的折扣后毛利,并标出异常单元格」。结果它要么说「我没法读取文件」,要么给你一段看起来很专业、但其实和你表格里的公式完全对不上的「幻觉答案」。

这不是你的 Excel 太刁钻,而是过去两年几乎所有「AI 读表格」的工具,都栽在同一个根上——它们只会「一次性抓行」,根本不会「自己翻」

最近 arXiv 上的一篇论文,把这个死结解开了。它叫 BRTR(Beyond Rows to Reasoning),核心思路一句话:别让模型只看一次,让它像真人一样,在表格里反复翻、反复算、反复校对

一个数字就让 CFO 坐不住了

研究团队把这个「会自己翻表的代理」丢进了三个业内公认的电子表格基准测试。结果是:

  • FRTR-Bench 上比上一代最好成绩高出 +25 个百分点
  • SpreadsheetLLM(微软出的题)上高出 +7 个百分点
  • FINCH(财务专用)上高出 +32 个百分点

+32 不是「又快了一点」,而是「错题率几乎砍半」。在财务、审计、运营这种「错一个数字就要赔钱」的场景,这就是从「不敢用」到「敢放进生产」的差别。

它做对了哪三件事

第一,把「单轮检索」换成「多轮试探」。

旧式做法是「扫描所有行,挑出最像的几行,塞进 prompt」——一旦问题跨多个 sheet、跨多张图表,或者涉及跨单元格公式,这一步就漏了 80% 的关键证据。BRTR 不一次性下结论,而是先看题面,再决定去哪儿看、看什么——和人类查账的思路一模一样。

第二,把「压缩信息」换成「按需取片段」。

另一种主流做法是「把整张表压成 token 编码塞进上下文」——好处是快,坏处是精度丢失。BRTR 不压缩,而是真要看哪几格,就精确取哪几格。所以它算出来的数字,和 Excel 自己 SUM 出来的数字对得上。

第三,每一步都留「审计痕迹」。

这是 BRTR 最被低估的亮点。它每做一步检索、每调用一次工具,都会生成一条显式的 trace(调用记录)。事后监管想查「它为什么改了这一格公式」,可以像查 git log 一样回放全过程。

对于要在金融、医疗、合规场景上 AI 的团队来说,可追溯比「准确率高 5%」值钱得多——因为出问题时你得有东西可交代。

谁会需要这个

  • 财务、审计、运营团队:把 AI 真正接进 Excel 工作流,而不只是「把 Excel 截图丢进对话框」。
  • Agent 平台架构师:这套「多模态检索 + 工具调用循环 + 全程 trace」的模式可以直接搬到 Notion、Airtable、Google Sheets、ERP 报表上。
  • AI 合规负责人:很多企业的红线就是「AI 的决策必须可回放」,BRTR 把这条线从口号变成了标配。
  • 多模态 RAG 研究者:论文横向评测了 5 种 embedding 模型 × 9 种 LLM 的组合,是难得的「组件级」实验数据,直接告诉你哪对搭档最稳。

现实里它还不是「开箱即用」

也得说几个不能忽略的现实:

  • 成本贵:每问一次大约要烧掉 $0.15 到 $0.40(GPT-5.2 级别),复杂工作簿会更高。
  • 不能改公式就放心:它自己往表格里写公式这一步,目前还必须配沙箱(先在副本上跑、人工确认后再写入真实表),否则一次迭代偏差就能污染整个工作簿。
  • 没在「非电子表格」场景验证过:数据库、ERP、CRM 这些更广义的表格数据,还没看到实验数据。

一句话总结

BRTR 不是又一篇「AI 读表格更准」的论文,它真正厉害的地方,是把「AI 操作 Excel」这件事,做成了有节奏、有 trace、有审计的工程——这才是大模型从「玩具」走到「生产力工具」之间差的那一截。

如果你正在评估「AI 能不能进我们的财务/审计/运营流水线」,这篇值得花一个下午精读。


三个标题变体

  1. 「+32 个百分点」背后:那个终于让 AI 学会「自己翻 Excel」的代理到底做对了什么
  2. Excel 里藏着的 AI 难题,被这篇论文用一个「会自己翻表的代理」解开了
  3. 从「AI 看不懂 Excel」到「能审计每一格」:BRTR 给企业 AI 落地补上了最关键的一环

小红书风格卡片文案(可直接发布)

🤖 AI 终于「看懂」Excel 了,但更牛的是它会自己翻表 🤖

你有没有过这种崩溃时刻——把几百兆的 Excel 甩给 AI,让它算「各区域上季度折扣后毛利」,结果它要么装死,要么给你编一个看起来很专业的假数字 😭

最近 arXiv 上这篇论文(2603.06503,BRTR)把这个坑填了。

它做对了一件事:别让 AI 一次性扫表,让它像真人审计师一样—— ✨ 先看题,决定去哪几格查 ✨ 边查边算,边算边核对 ✨ 每一步都留「调用记录」,事后可回放

实测三个基准 +32 / +25 / +7 个百分点,FINCH 财务卷直接砍错一半 📉

最戳中财务/合规人的点:每一格写入都能追溯——出问题时,不用解释「AI 黑箱做了什么」,直接调 trace 就行 ✅

适合正在评估「AI 能不能进生产」的团队、Agent 架构师、还有被 Excel 折磨过的每一个运营人 🙋‍♀️

📎 论文 ID:2603.06503 💬 评论区聊聊:你团队 AI 进 Excel 的最大卡点是啥?

AI办公 #Excel技巧 #人工智能 #大模型应用 #财务数字化 #AI落地 #RAG #智能体 #Agent #数据审计 #办公效率 #科技前沿