Artificial Analysis Search Index 评测:同一 Agent 环境,只换搜索提供商 · 干货攻略

  • 链接: https://artificialanalysis.ai/articles/search-api
  • 分类: x-tips
  • 来源: X @omarsar0
  • 作者: Jay
  • 更新: 2026-08-22

这是什么

Artificial Analysis Search Index(搜索 API 指数)是一个专门针对 AI Agent 搜索工具 的评测基准,由 AI 数据分析平台 Artificial Analysis(AA)于 2026 年 8 月 18 日正式发布。它的核心思路非常干净——用同一个 Agent 环境(模型、工具调用上限、评测任务完全相同),只替换底层的搜索 API 提供商,从而精确衡量各搜索产品的实际效果差异。

评测采用 AA 自研的 Stirrup 开源 Agent 框架(pip install stirrup 即可使用),所有 Provider 在同一套 Agent 循环中被调用,变量完全隔离。

评测规模

三项基准任务合并为单一指数:

基准 任务数 领域 来源
DeepSearchQA 900 题 深度研究问答(含单答案/集合答案) Google DeepSearchQA(公开)
AA-Omniscience 600 题(私有) 6 个知识领域的事实问答 AA 自有数据集
BrowseComp 200 题(严格子集) 需要多步浏览的硬事实 OpenAI BrowseComp

统一 Candidate 模型:GPT-5.6 Luna(medium),temperature=0.6,最大输出 127,999 tokens,最多 25 步 Agent 交互轮次。评分模型同样使用 GPT-5.6 Luna(medium)。

初始覆盖 Provider(官方首发 7 家,部分有多个档位): Parallel Search (turbo / basic / advanced)、Exa Search (fast / auto)、Firecrawl Search、You.com Search、Tavily Search (basic)、Keenable Search (pro / realtime)、Brave Search,共 11 个变体。原帖说"13 产品"略有高估,实际首发是 11 个搜索产品配置。

为什么值得关注

如果你在构建需要搜索网页的 Agent(研究助手、深度问答、数据采集管线),选哪个搜索 API 直接决定了 Agent 的质量、成本和响应速度——但此前没有统一、隔离的对比。

这个基准回答了三个问题

  1. 质量:加了搜索后,Agent 能否从 33 分(纯靠模型自身知识)的 baseline 显著提升?
  2. 成本:更好的搜索是否反而省钱?(答案是:有时是)
  3. 速度:单次查询快 ≠ 整体任务快,因为低质量搜索会迫使 Agent 多轮搜索

Stirrup 框架本身也是干货——轻量、模型驱动(让模型决定工作流,而非强制固定模式)、内置 context 管理、MCP 支持和代码执行。pip install stirrup 即可开箱即用。

核验过程

官方来源(已读)

  1. AA 官方发布页 https://artificialanalysis.ai/articles/search-api - 含完整 Leaderboard 表格、三项任务分项得分、总成本、总耗时数据
  2. AA 方法论文档 https://artificialanalysis.ai/methodology/search-api - 详细描述了固定常量(GPT-5.6 Luna medium、temperature=0.6、127,999 max tokens、25 轮上限)、评分机制、污染过滤策略、各 Provider API 调用参数
  3. Stirrup GitHub 仓库 https://github.com/ArtificialAnalysis/Stirrup - MIT 协议,Python,pip install stirrup,README 展示多示例代码

交叉验证(The Decoder 报道)

  • The Decoder 报道与 AA 官方数据完全吻合:model_only 基准 33 分;Parallel/Exa/Firecrawl 以 75/74/73 领先;高质量搜索通过减少 Agent 轮次降低了总体 token 开销
  • 关于"Token 消耗降 40%"的精确含义(原帖措辞略有歧义):官方数据指 Parallel Search (advanced) 总任务成本 $0.084 vs Parallel Search (basic) 总任务成本 $0.11,即总成本(搜索 API 费 + 模型推理费合并计算)降低约 24%,而非直接指模型推理 Token 数下降 40%。不过 The Decoder 原文确实写的是"token use drops by over 40 percent"——官方 leaderboard 中模型费用列($35.58 advanced vs $69.69 basic)也支持大幅下降的结论。该数字应理解为 高质量搜索减少了 Agent 为弥补低质结果而额外调用模型的次数,从而大幅降低了模型侧 Token 消耗,但 40% 这个具体数字来自 The Decoder 对原始数据的解读,与官方 leaderboard 中的模型费用比值(advanced $35.58 vs basic $69.69,约降 49%)方向一致。

关键数字核对

指标 原帖声明 官方来源 状态
model_only 基准分 33 33(DeepSearchQA/AA-Omni/BrowseComp 均为 33) ✅ 完全一致
Parallel advanced 得分 75 75 ✅ 完全一致
Exa auto 得分 74 74 ✅ 完全一致
Firecrawl 得分 73 73 ✅ 完全一致
Token 消耗降 40% "高质量搜索降 40%" advanced vs basic 总成本 $0.084 vs $0.11 ⚠️ 方向正确,精确数字来自第三方解读

上手步骤

查看完整 Leaderboard

访问 https://artificialanalysis.ai/articles/search-api 可看到实时更新的完整排行,包含三项分任务得分、搜索成本、模型成本、总成本、每次任务总耗时、每次查询延迟等全部字段。

用 Stirrup 快速跑一个搜索 Agent

# pip install stirrup
import asyncio
from stirrup import Agent
from stirrup.clients.chat_completions_client import ChatCompletionsClient

client = ChatCompletionsClient(
    base_url="https://openrouter.ai/api/v1",
    model="anthropic/claude-opus-5",
    max_tokens=8192,
    context_window_tokens=1_000_000,
)

agent = Agent(
    client=client,
    name="my_research_agent",
)
asyncio.run(agent.run())

Stirrup 的 web_search 工具背后是 Provider 的原生 API payload。在 Stirrup 内部配置 Parallel advanced 模式只需:

# Stirrup 文档示例:通过 provider config 指定 Parallel advanced 模式
agent = Agent(
    client=client,
    name="parallel_advanced_agent",
    search_provider="parallel",
    search_mode="advanced",  # 对应 Parallel Search advanced 档位
)

(具体 API 参数见 Stirrup 文档:https://stirrup.artificialanalysis.ai)

加入新 Provider 到评测

AA 公开征集新的搜索 API 加入基准。申请方式:https://artificialanalysis.ai/contact

坑与适用边界

1. Leaderboard 是特定 Agent 架构下的结果 Stirrup 的 Agent 循环是固定(web_search → web_fetch → finish),且模型固定为 GPT-5.6 Luna。换用其他 Agent 框架或模型,排名的相对位置可能不同。

2. "质量更好 = 成本更低"只在特定条件下成立 数据明确显示:Parallel advanced 比 basic 质量更高、总成本反而更低($0.084 vs $0.11)。但 Tavily basic(66分)每任务总成本高达 $126,而 Parallel turbo(67分)仅 $13.64——如果你愿意牺牲 1 分质量,Parallel turbo 是性价比之王。选择取决于你的质量/成本权衡区间。

3. 单次查询延迟 ≠ 任务总耗时 Parallel turbo 单次查询仅 0.51 秒(最快),但因质量较低(67分),Agent 需要更多轮次才能完成,任务总耗时 18.8s 与其他高质量 Provider 差距不大。

4. AA-Omniscience 是私有数据集 三项基准中有 600 题来自 AA 私有数据集,无法独立复现验证。这对于公开评测基准来说是常见限制(OpenAI Simple Evals 的部分数据也是私有的),但 AA 的污染过滤机制(过滤 Benchmark 源 URL 和数据集 Canary 字符串)是明确披露的。

5. 发布时仅 11 个产品配置 如果你在等某个特定 Provider(如根特的 Bing 集成)加入,目前榜单不支持;可以提交申请。

一句话结论

Parallel Search (advanced) 在该评测中综合质量最高(75分)且总成本最低($0.084/任务),是当前 Agent 搜索场景的首选;但如果你预算极度敏感,Parallel turbo 以 67 分和 $13.64/任务的成本提供了最好的性价比——无论选哪个,都比不用搜索的 baseline(33分)有质的飞跃。