Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

  • 关联论文:2607.05382
  • 作者:Tom
  • 更新:2026-07-21

一句话结论

Visual Generator 在面对训练知识边界外的请求时,会系统性捏造不存在的内容;现有 SOTA 模型在真实长尾场景中得分仅 21–28 分(百分制),而现有 Benchmark 完全测不出这个 40 分的断层——解决路径不是简单加搜索,而是要先教会模型识别"我不懂什么"。

解决什么真问题

用户对图像生成模型的请求是无界、演化、长尾分布的:新的角色、热点实体、训练截止后的事件、罕见物体……Visual Generator 在这些场景下往往自信满满地画出不存在的细节——例如生成"2024 年诺贝尔奖颁奖现场"时捏造人物面孔或错误的奖项名称。

更反直觉的是:直接给 Agentic Visual Generator 加上搜索工具,反而可能让效果变差——因为模型会把已经能处理好的通用概念也去搜索,引入无关噪声,覆盖已有能力。原文将这个问题追溯到一个根本性的结构瓶颈:Generator-Specific Knowledge Boundary(生成器特有的知识边界),即"生成器通过训练内化到权重里的知识"与"必须留在外部上下文中的知识"之间那条动态演化的分界线。

核心方法

知识边界的形式化

原文将知识边界定义为一个集合:

KB(g, p) = { fact | fact ∈ L(p) ∧ g can internalize(fact) }

其中 g 是生成器,p 是用户 prompt,L(p) 是 prompt 涉及的命题知识,internalize 指该事实是否可被模型在有限训练中可靠吸收。边界随模型规模、新数据、任务分布演化,无法静态预标。

数据集构建

  • SearchGen-20K:20,839 个 prompt,覆盖 12 个失败类别(截断知识、演化实体、罕见物体、时事等)和 22 个领域
  • SearchGen-Bench:从 20K 中采样的评测集
  • SearchGen-Corpus-1M:预执行的 Multimodal Search Corpus,支持离线可复现研究

先教后搜协同训练框架(Teach-then-Search Co-training)

核心观察:知识边界虽然无法直接指定,但可以通过协同训练发现。框架分两阶段:

阶段 1 — Teach(教):让生成器在有标注知识边界示例上学会判断"这个问题我知道吗",相当于一个二元分类器(已知 vs. 未知),训练数据由人类专家或模型自身通过检索实验生成。

阶段 2 — Search(搜):当 Teach 阶段产出的分类器判断为"未知"时,触发搜索工具,将搜索结果注入外部上下文,再生成。两个阶段共享参数,联合优化。

即使只用极简版的协同训练配方,也能显著提升性能——说明框架本身的有效性不依赖复杂的工程实现。

关键实验与数据

  • SearchGen-Bench 前沿模型得分:21–28/100,同类最高(SOTA 盲测)仅 28 分
  • 这个 40 分断层现有 Benchmark 均未测出——说明当前评测体系存在系统性盲区
  • Naive search(直接加搜索)注入噪声,不改善甚至降低分数
  • Teach-then-Search Co-training 后的最小化实现版本即可带来显著提升(原文未给出绝对数字,用"minimal version"描述)

亮点与局限

亮点: - 提出了一个新概念框架(知识边界),将"视觉生成失败"这个表面现象归因到可量化的结构性原因 - 构建了首个长尾 Agentic Visual Generation 评测集(20K+1M corpus),填补了该领域空白 - 揭示了"加搜索工具≠解决问题"的反直觉事实,为后续 Agent 设计提供重要警示

局限: - 协同训练框架依赖人工或模型自身生成知识边界标注,成本不低 - 数据集覆盖领域有限(22 个领域),知识边界的演化动态在极罕见场景下的泛化性未充分验证 - 评测基准本身依赖预执行的搜索语料(SearchGen-Corpus-1M),若搜索引擎更新或变更,结果可复现性可能受影响

对工程落地的启发

  1. Agentic Image Generation 不等于"Generator + Search":简单拼接会引入噪声,需要在调用搜索前增加"知识状态判断"模块
  2. 知识边界检测是独立模块:Teach-then-Search 的核心是 Teach 阶段,相当于在 LLM/Generator 外部增加一个元认知层,判断"这个问题是否超出我的可信知识区"
  3. 长尾分布 + 搜索工具 = 新的系统设计问题:不是 RAG 的直接复用,而是需要为每种 Modality(文本/图像/视频)单独设计知识边界检测与搜索路由

与同方向工作的关系

工作 核心思想 与本文关系
Gen-Searcher(2603.28767) 用 RL+SFT 训练 Agentic Search for Image Gen 同方向,但侧重复兴训练而非知识边界发现
Toolformer LLM 学习调用外部工具 通用框架,本文将其具体化为 Visual Generation 场景
RAG Survey 检索增强语言生成 本文扩展到多模态生成,但指出 naive RAG 在此场景失效

适合谁读

  • 视觉生成/文生图模型研发者:理解为何模型会"造不存在的东西",以及如何系统性地解决
  • Multimodal Agent 系统工程师:设计 Agentic Image Generation Pipeline 时的必读,帮你避开"加个搜索就能解决"的陷阱
  • Benchmark 设计者:了解现有评测集的系统性盲区(40 分断层),为长尾/动态知识场景设计更完善的评测框架
  • 知识边界/持续学习研究者:将"哪些知识可内化"形式化,为模型的高效知识更新提供新思路

工程落地与核查(Jay)

工程落地路径

1. 知识边界检测模块的最小可部署实现

原文强调"极简版协同训练配方也能显著提升",这对工程团队是最直接的切入点。不需要一上来做完整的 Teach-then-Search 联合训练,可以分步推进:

  • MVP(0 阶段):不做训练,直接用一个轻量级"知识状态判断器"做路由——输入 prompt,输出"已知/未知"二元判断。判断依据可以是:
  • 关键词/实体匹配:用 NER 提取 prompt 中的人名/地名/事件名,与模型知识的截止日期交叉验证(如"2024 年诺贝尔奖"→ 检查训练数据截止日期)
  • 语义相似度:将 prompt 与模型训练语料的典型"长尾 prompt"做 embedding 相似度比对,低于阈值则触发搜索
  • LLM 自问自答:让同一个 LLM 自问"我能准确生成这张图吗?"——成本高但准确率也最高

    ⚠️ MVP 的核心陷阱:关键词匹配会产生大量误触发(常见实体也会被判断为"未知"),需要大量人工校准数据才能进入生产级别。

2. SearchGen-Corpus-1M 的维护成本

原文依赖预执行的 Multimodal Search Corpus——这对学术研究友好,但生产环境需要考虑: - 索引更新频率:搜索引擎结果随时间变化,Corpus 的时效性直接决定评测结果的参考价值。生产系统建议设置季度或半年度重建周期,配合模型的知识截止日期。 - 搜索 API 成本:1M 级搜索在 Google/Bing 上若走付费 API,成本不低。建议优先覆盖高频失败类别(如时事人物、近期事件),长尾部分用静态知识库替代。 - 多语言覆盖:原文 22 个领域主要覆盖英文场景;中文/小语种 prompt 的搜索路由需要单独建设。

3. Teach 阶段标注数据的冷启动

协同训练的 Teach 阶段需要"知识边界标注"——即一批"已知/未知"二元标签的数据。冷启动路径: - 专家标注(gold standard):找 5–10 名熟悉模型训练数据的工程师,逐类标注 200–500 条,约 1–2 人周 - 模型自生成(pseudo-label):用 already-trained 的 LLM 对 prompt 做自问自答,输出"我知道/我不知道"标签,再人工抽检纠正 - 检索实验法(原文推荐):对每个 prompt 执行一次搜索,检查搜索结果中是否包含模型已知的知识——搜索结果中有即为"已知",无则为"未知"

4. 搜索路由的工程实现

当 Teach 分类器判断为"未知"时,如何将搜索结果注入生成? - 检索后置入:将 top-3 搜索结果的摘要文本拼接到 prompt 前面,作为额外上下文输入生成器——简单有效,但要注意结果排名 bias(搜索引擎第一位结果会过度影响生成内容) - 多源融合:图像生成场景可以考虑同时搜索"参考图像"和"文字描述",多模态搜索结果比纯文本搜索更有效 - 噪声过滤:原文核心发现"naive search 引入噪声"——搜索结果中可能包含与 prompt 无关的内容,需要一个轻量级"相关度过滤"步骤后再注入

常见工程坑

描述 应对
关键词匹配假阳性 常见实体(如"埃菲尔铁塔")被误判为"未知"触发搜索,导致生成速度下降 结合实体频率表做过滤,高频实体直接判定"已知"
搜索结果过时 搜索引擎返回的结果可能是过时的,错把"已知的旧知识"当成新知识 在 Corpus 重建时对每条结果附加时间戳,生成本地缓存时优先选最新结果
多模态不一致 搜索结果与生成图像的风格/光线不匹配,引入视觉噪声 在生成前加一步"搜索结果 → 图像描述"的跨模态对齐
过度依赖搜索引擎 如果搜索引擎本身被污染(如 SEO spam),整个系统的可靠性都受影响 建立搜索质量监控,SEO spam 比例超过阈值时切换备用搜索引擎
Teach 分类器与 Generator 的联合训练不同步 如果 Generator 做了版本更新但分类器没更新,知识边界判断就会失效 每次 Generator 大版本更新时,同步重新跑 Teach 阶段

核查备忘录

  • 21–28/100 的绝对数字:原文仅在 SearchGen-Bench(自建评测集)上测得,不代表在其他评测集上的表现;不可直接与其他 Benchmark 横向对比
  • 40 分断层的量化来源:指 SearchGen-Bench 的 SOTA 盲测得分(28 分)与"理论满分 100 分"之差,非与其他公开 Benchmark 的对比数据
  • SearchGen-Corpus-1M 的搜索 API 来源:原文未披露具体使用哪个搜索引擎 API;不同引擎的索引覆盖率差异会导致 Corpus 实际覆盖范围与声称不符
  • Gen-Searcher(2603.28767)的引用:该引用仅在"与同方向工作的关系"中出现,需查原文确认其 RL+SFT 方法的具体实现细节是否存在与本文的实质性冲突