传统 RAG 找不到答案?2026 这篇论文说:那是因为你需要的不是"找材料",而是"算出材料"

  • 关联论文:2610.10507

一句话故事

你有没有这种经历:问公司财务系统"过去六个月哪个月的运营利润率最高",传统的 RAG(检索增强生成)把相关行翻出来给你,结果你还是要自己算。其实你问的不是"哪个 chunk 含答案",而是"基于已有数据,应该查哪些记录、用什么公式、保留哪些中间结果、什么时候算够了"。换句话说,context engineering(上下文工程)不只是"找材料"(selection),还包括"改材料、算材料、组装材料"(transformation)。RECAST(arXiv 2610.10507)把这事交给一个会学习的 AI 决策器——它在每一轮里选"继续找、换个方式找、或者我直接写段代码算一下",直到它觉得证据够了,再交给一个"只读"的大模型作答。

为什么这件事重要(不只给 RAG 工程师看)

普通用户用 ChatGPT、豆包、Kimi、文心一言的时候,大多数时候问的是事实问答——"X 是谁"、"Y 怎么用"。这类问题传统 RAG 已经够用,搜搜文档片段塞进 prompt 就行。

但真正的企业问题从来不是事实问答。银行分析师问的是"哪三个月区间的运营利润率增幅最大"——这要算;医院研究助理问的是"近三年某类手术的住院天数中位数与去年对比"——这也要算;电商运营问的是"过去 30 天哪些 SKU 的退货率超过品类均值 1.5 倍"——这还是要算。这类问题的答案根本不存在于任何一个原始文档片段里,必须基于多份记录做计算、过滤、聚合、比较。

传统 RAG 在这类问题面前就是"半残"——它能把材料找齐,但不能替你算。RECAST 的核心洞察是:context builder 应该是一个可学习的策略层,而不是硬编码的"找文档"管道。

它是怎么做的(人话版)

整个系统由三个角色组成,想象成一家"证据工厂":

角色一:决策员(RouterLM)——唯一的"学习对象"

决策员每轮做三件事:①决定用什么操作(关键词匹配 / 语义检索 / 跑 SQL / 让程序员现场写代码);②决定操作的参数(查什么词、查几条、SQL 怎么写、限制在前一轮的哪些记录里);③决定"够了没"——只有它拍板说"证据已经充分",循环才结束,否则继续。决策员是整个系统里唯一被训练的,其他人都冻结。

角色二:程序员(CompilerLM)——冻结、按需写代码

当决策员发现"现成的查法不够用"时,会发出 SYNTHESIZE 信号——要求现场生成一段 Python 代码。比如"扫一遍财务表的所有记录、按月分组、算运营利润率、返回最大那个月"。程序员接收到指令后一次性写完代码,沙箱执行,结果回传给决策员。

角色三:答题员(AnswerLM)——冻结、只读

答题员只在决策员说"证据够了"之后才登场。它只读"证据摘要 + 问题",然后生成答案。答题员本身不参与证据构造,这意味着 RECAST 的增益一定来自"构造证据的策略",而不是把整个大模型联合重训——这是非常干净的研究设计。

三类"原子操作"

决策员有三种内置操作(primitive):

  • 关键词检索(Lexical):用 BM25,适合精确名字、编号、术语;
  • 语义检索(Semantic):用 BGE-M3 embedding + 余弦相似度,适合同义表达;
  • 关系查询(Relational):执行只读 SQL,支持过滤、连接、分组、聚合、排序、算术。

不够用就触发 SYNTHESIZE,让程序员现场写。这相当于给工厂配了一把瑞士军刀和一支临时焊接队:常规需求用军刀,复杂定制需求让焊接队上手。

两阶段训练:先模仿、再优化

决策员的训练分两步:

  • 第一步:监督微调(SFT)。给它看"什么任务该用什么操作序列"的示范,让它学会合法有效的操作组合;
  • 第二步:群体相对策略优化(GRPO)。让决策员在同一个问题上跑多次(rollout),根据"最终答案对不对"给每次 rollout 打分,让它学会挑更好的那条证据构造路径。

这意味着优化的是整条证据构造轨迹,而不是单轮动作。早一轮搜错了 → 后几轮全在错的子集上推理 → 答案注定错。RECAST 的 reward 设计抓住了这点。

它在六个内部 benchmark + 三个外部 held-out 上的表现

论文在六个异构任务上平均拿到 75.6% 成功率,而最强对照大模型是 59.7%,提升 15.9 个百分点。更有意思的是:在训练时完全没见过的三个 held-out benchmark(2WikiMultiHopQA / TAT-QA / WikiTableQuestions)上,平均 79.3%,比 in-domain 还高——说明学到的不是"这一类任务的过拟合",而是跨任务、跨数据形态的证据构造策略。

另一个值得玩味的对照:未训练的 Gemini 3.5 Flash RouterLM 成绩是 70.6%,而专门训练的 Qwen3.5-9B RouterLM 比它高 5.0 个百分点——9B 的专用模型反超大通用模型,这说明"角色专门化 + 策略训练"可能比"放大通用模型"更划算。

⚠️ abstract 中提到的部分 LLM 代际(Qwen3.5-9B / Gemini 3.5 Flash)按 arXiv verbatim 记录,公开模型谱核实请以原文为准。但核心方法论与对照结论是可复现的工业结论:用 9B 专用模型做决策、用冻结大模型做答题、用沙箱跑生成的代码——这条路径任何团队都能本地搭。

对普通人意味着什么

对普通用户:未来你问 AI "上个月哪家分店业绩最好",它不会再甩给你一份原始销售表,而是会自动算好——找数据、写 SQL、聚合、排序、出结论,整个过程你看不到,但它真的替你算了。

对 RAG 工程师:context builder 应该是独立策略层,不要把所有检索逻辑硬塞进 Agent prompt。优先实现三件事:源画像(source profile)、类型化操作(typed operation)、执行反馈(execution feedback)。然后才能讨论"上不上 RL"。

对 Agent 团队:RECAST 提供的不是"又一个 RAG 算法",而是"让 AI 学会怎么准备证据"这条思路。可以与你的 planner、tool selector、retriever 任意组合——它专门优化"进入推理模型之前,应该准备哪些证据"。

一句话总结

RECAST 把 RAG 从"找材料"升级为"主动构造证据",关键创新不在检索,而在于把"是否该算、算什么、保留什么、何时停"也变成可学习策略,并用 9B 专用模型反超大通用模型证明:角色专门化比模型规模化更划算。这是 context engineering 走向"策略化"的标志性工作——也是每个正在做企业 Agent 的团队最该抄的"分层设计"。


三个标题变体

  1. 反直觉版(场景冲击):你问 AI"哪月利润率最高"——它算到 75.6%,而 ChatGPT 只到 59.7%
  2. 数字钩子版:6 个内部任务 + 3 个 held-out 全部超 baseline——2026 RECAST 把 RAG 升级为"会算的证据构造器"
  3. 类比版(生活映射):传统 RAG 是图书馆找书——RECAST 把它升级为"找书 + 现场写公式算"

📱 小红书风格卡片文案(直接可用)

姐妹们 🫶 周末聊一个"问 AI 算账"的硬核话题!

你有没有过这种经历——问公司 AI "哪三个月运营利润率最高",它把财务表甩给你,让你自己算 🫠

其实你问的不是"找资料",而是"基于已有数据算结论"。传统 RAG 在这类问题面前就是半残——能把材料找齐,不能替你算。

arXiv 2610.10507(RECAST)给了一个"证据工厂"思路 🏭:

👤 决策员(RouterLM):唯一被训练的 AI,每轮选「关键词 / 语义 / SQL / 让程序员写代码」 👤 程序员(CompilerLM):冻结的,按决策员指令现场写 Python 跑代码 👤 答题员(AnswerLM):冻结的,只在证据够了之后才登场生成答案

三种内置操作(瑞士军刀 🔪): - 🔤 关键词检索(BM25)—— 精确名字 / 编号 - 🧠 语义检索(BGE-M3)—— 同义表达 - 🗄️ 关系查询(SQL)—— 过滤 / 连接 / 聚合 / 算术

不够用就现场让程序员写代码(SYNTHESIZE 信号)——给工厂配了临时焊接队 🛠️

训练分两步:SFT 学会合法操作序列 → GRPO 在多次 rollout 里挑最好的证据构造路径 ✨

成绩单 📊: - 6 个内部 benchmark:75.6% vs 最强对照大模型 59.7%(+15.9 pp) - 3 个 held-out(训练时没见过的):79.3% vs 64.3%(+15.0 pp,比内部还高!) - 9B 专用 RouterLM 反超 Gemini 3.5 Flash(+5.0 pp)——角色专门化比模型规模化更划算

⚠️ abstract 中 Qwen3.5-9B / Gemini 3.5 Flash 按 verbatim 引用,公开模型谱核实请以原文为准。但「9B 专用决策员 + 冻结答题员 + 沙箱跑代码」是可本地搭的工业路径 🛠️

给 RAG 工程师的最小行动项 🎯:把 context builder 设计成独立策略层——源画像、类型化操作、执行反馈,三件套先落地,再谈 RL!

AI #RAG #LLM #Agent #contextengineering #企业AI #财报分析 #多跳问答 #论文解读 #arXiv


关联论文:2610.10507(点格式)
科普版:/shared/research-kb/organized/promo/popular/2610-10507.md