让 AI 真正读懂 Excel:那个跑赢 SOTA 32 个百分点的「会自己翻表的代理」到底做对了什么
- 关联论文:2603.06503
你有没有被这种场面劝退过:把一份几百兆的 Excel 工作簿扔给 ChatGPT,让它「帮我算一下各区域上季度的折扣后毛利,并标出异常单元格」。结果它要么说「我没法读取文件」,要么给你一段看起来很专业、但其实和你表格里的公式完全对不上的「幻觉答案」。
这不是你的 Excel 太刁钻,而是过去两年几乎所有「AI 读表格」的工具,都栽在同一个根上——它们只会「一次性抓行」,根本不会「自己翻」。
最近 arXiv 上的一篇论文,把这个死结解开了。它叫 BRTR(Beyond Rows to Reasoning),核心思路一句话:别让模型只看一次,让它像真人一样,在表格里反复翻、反复算、反复校对。
一个数字就让 CFO 坐不住了
研究团队把这个「会自己翻表的代理」丢进了三个业内公认的电子表格基准测试。结果是:
- FRTR-Bench 上比上一代最好成绩高出 +25 个百分点
- SpreadsheetLLM(微软出的题)上高出 +7 个百分点
- FINCH(财务专用)上高出 +32 个百分点
+32 不是「又快了一点」,而是「错题率几乎砍半」。在财务、审计、运营这种「错一个数字就要赔钱」的场景,这就是从「不敢用」到「敢放进生产」的差别。
它做对了哪三件事
第一,把「单轮检索」换成「多轮试探」。
旧式做法是「扫描所有行,挑出最像的几行,塞进 prompt」——一旦问题跨多个 sheet、跨多张图表,或者涉及跨单元格公式,这一步就漏了 80% 的关键证据。BRTR 不一次性下结论,而是先看题面,再决定去哪儿看、看什么——和人类查账的思路一模一样。
第二,把「压缩信息」换成「按需取片段」。
另一种主流做法是「把整张表压成 token 编码塞进上下文」——好处是快,坏处是精度丢失。BRTR 不压缩,而是真要看哪几格,就精确取哪几格。所以它算出来的数字,和 Excel 自己 SUM 出来的数字对得上。
第三,每一步都留「审计痕迹」。
这是 BRTR 最被低估的亮点。它每做一步检索、每调用一次工具,都会生成一条显式的 trace(调用记录)。事后监管想查「它为什么改了这一格公式」,可以像查 git log 一样回放全过程。
对于要在金融、医疗、合规场景上 AI 的团队来说,可追溯比「准确率高 5%」值钱得多——因为出问题时你得有东西可交代。
谁会需要这个
- 财务、审计、运营团队:把 AI 真正接进 Excel 工作流,而不只是「把 Excel 截图丢进对话框」。
- Agent 平台架构师:这套「多模态检索 + 工具调用循环 + 全程 trace」的模式可以直接搬到 Notion、Airtable、Google Sheets、ERP 报表上。
- AI 合规负责人:很多企业的红线就是「AI 的决策必须可回放」,BRTR 把这条线从口号变成了标配。
- 多模态 RAG 研究者:论文横向评测了 5 种 embedding 模型 × 9 种 LLM 的组合,是难得的「组件级」实验数据,直接告诉你哪对搭档最稳。
现实里它还不是「开箱即用」
也得说几个不能忽略的现实:
- 成本贵:每问一次大约要烧掉 $0.15 到 $0.40(GPT-5.2 级别),复杂工作簿会更高。
- 不能改公式就放心:它自己往表格里写公式这一步,目前还必须配沙箱(先在副本上跑、人工确认后再写入真实表),否则一次迭代偏差就能污染整个工作簿。
- 没在「非电子表格」场景验证过:数据库、ERP、CRM 这些更广义的表格数据,还没看到实验数据。
一句话总结
BRTR 不是又一篇「AI 读表格更准」的论文,它真正厉害的地方,是把「AI 操作 Excel」这件事,做成了有节奏、有 trace、有审计的工程——这才是大模型从「玩具」走到「生产力工具」之间差的那一截。
如果你正在评估「AI 能不能进我们的财务/审计/运营流水线」,这篇值得花一个下午精读。
三个标题变体
- 「+32 个百分点」背后:那个终于让 AI 学会「自己翻 Excel」的代理到底做对了什么
- Excel 里藏着的 AI 难题,被这篇论文用一个「会自己翻表的代理」解开了
- 从「AI 看不懂 Excel」到「能审计每一格」:BRTR 给企业 AI 落地补上了最关键的一环
小红书风格卡片文案(可直接发布)
🤖 AI 终于「看懂」Excel 了,但更牛的是它会自己翻表 🤖
你有没有过这种崩溃时刻——把几百兆的 Excel 甩给 AI,让它算「各区域上季度折扣后毛利」,结果它要么装死,要么给你编一个看起来很专业的假数字 😭
最近 arXiv 上这篇论文(2603.06503,BRTR)把这个坑填了。
它做对了一件事:别让 AI 一次性扫表,让它像真人审计师一样—— ✨ 先看题,决定去哪几格查 ✨ 边查边算,边算边核对 ✨ 每一步都留「调用记录」,事后可回放
实测三个基准 +32 / +25 / +7 个百分点,FINCH 财务卷直接砍错一半 📉
最戳中财务/合规人的点:每一格写入都能追溯——出问题时,不用解释「AI 黑箱做了什么」,直接调 trace 就行 ✅
适合正在评估「AI 能不能进生产」的团队、Agent 架构师、还有被 Excel 折磨过的每一个运营人 🙋♀️
📎 论文 ID:2603.06503 💬 评论区聊聊:你团队 AI 进 Excel 的最大卡点是啥?