Artificial Analysis Search Index 评测:同一 Agent 环境,只换搜索提供商 · 干货攻略
- 链接: https://artificialanalysis.ai/articles/search-api
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-08-22
这是什么
Artificial Analysis Search Index(搜索 API 指数)是一个专门针对 AI Agent 搜索工具 的评测基准,由 AI 数据分析平台 Artificial Analysis(AA)于 2026 年 8 月 18 日正式发布。它的核心思路非常干净——用同一个 Agent 环境(模型、工具调用上限、评测任务完全相同),只替换底层的搜索 API 提供商,从而精确衡量各搜索产品的实际效果差异。
评测采用 AA 自研的 Stirrup 开源 Agent 框架(pip install stirrup 即可使用),所有 Provider 在同一套 Agent 循环中被调用,变量完全隔离。
评测规模
三项基准任务合并为单一指数:
| 基准 | 任务数 | 领域 | 来源 |
|---|---|---|---|
| DeepSearchQA | 900 题 | 深度研究问答(含单答案/集合答案) | Google DeepSearchQA(公开) |
| AA-Omniscience | 600 题(私有) | 6 个知识领域的事实问答 | AA 自有数据集 |
| BrowseComp | 200 题(严格子集) | 需要多步浏览的硬事实 | OpenAI BrowseComp |
统一 Candidate 模型:GPT-5.6 Luna(medium),temperature=0.6,最大输出 127,999 tokens,最多 25 步 Agent 交互轮次。评分模型同样使用 GPT-5.6 Luna(medium)。
初始覆盖 Provider(官方首发 7 家,部分有多个档位): Parallel Search (turbo / basic / advanced)、Exa Search (fast / auto)、Firecrawl Search、You.com Search、Tavily Search (basic)、Keenable Search (pro / realtime)、Brave Search,共 11 个变体。原帖说"13 产品"略有高估,实际首发是 11 个搜索产品配置。
为什么值得关注
如果你在构建需要搜索网页的 Agent(研究助手、深度问答、数据采集管线),选哪个搜索 API 直接决定了 Agent 的质量、成本和响应速度——但此前没有统一、隔离的对比。
这个基准回答了三个问题:
- 质量:加了搜索后,Agent 能否从 33 分(纯靠模型自身知识)的 baseline 显著提升?
- 成本:更好的搜索是否反而省钱?(答案是:有时是)
- 速度:单次查询快 ≠ 整体任务快,因为低质量搜索会迫使 Agent 多轮搜索
Stirrup 框架本身也是干货——轻量、模型驱动(让模型决定工作流,而非强制固定模式)、内置 context 管理、MCP 支持和代码执行。pip install stirrup 即可开箱即用。
核验过程
官方来源(已读)
- AA 官方发布页 https://artificialanalysis.ai/articles/search-api - 含完整 Leaderboard 表格、三项任务分项得分、总成本、总耗时数据
- AA 方法论文档 https://artificialanalysis.ai/methodology/search-api - 详细描述了固定常量(GPT-5.6 Luna medium、temperature=0.6、127,999 max tokens、25 轮上限)、评分机制、污染过滤策略、各 Provider API 调用参数
- Stirrup GitHub 仓库 https://github.com/ArtificialAnalysis/Stirrup - MIT 协议,Python,pip install stirrup,README 展示多示例代码
交叉验证(The Decoder 报道)
- The Decoder 报道与 AA 官方数据完全吻合:model_only 基准 33 分;Parallel/Exa/Firecrawl 以 75/74/73 领先;高质量搜索通过减少 Agent 轮次降低了总体 token 开销
- 关于"Token 消耗降 40%"的精确含义(原帖措辞略有歧义):官方数据指 Parallel Search (advanced) 总任务成本 $0.084 vs Parallel Search (basic) 总任务成本 $0.11,即总成本(搜索 API 费 + 模型推理费合并计算)降低约 24%,而非直接指模型推理 Token 数下降 40%。不过 The Decoder 原文确实写的是"token use drops by over 40 percent"——官方 leaderboard 中模型费用列($35.58 advanced vs $69.69 basic)也支持大幅下降的结论。该数字应理解为 高质量搜索减少了 Agent 为弥补低质结果而额外调用模型的次数,从而大幅降低了模型侧 Token 消耗,但 40% 这个具体数字来自 The Decoder 对原始数据的解读,与官方 leaderboard 中的模型费用比值(advanced $35.58 vs basic $69.69,约降 49%)方向一致。
关键数字核对
| 指标 | 原帖声明 | 官方来源 | 状态 |
|---|---|---|---|
| model_only 基准分 | 33 | 33(DeepSearchQA/AA-Omni/BrowseComp 均为 33) | ✅ 完全一致 |
| Parallel advanced 得分 | 75 | 75 | ✅ 完全一致 |
| Exa auto 得分 | 74 | 74 | ✅ 完全一致 |
| Firecrawl 得分 | 73 | 73 | ✅ 完全一致 |
| Token 消耗降 40% | "高质量搜索降 40%" | advanced vs basic 总成本 $0.084 vs $0.11 | ⚠️ 方向正确,精确数字来自第三方解读 |
上手步骤
查看完整 Leaderboard
访问 https://artificialanalysis.ai/articles/search-api 可看到实时更新的完整排行,包含三项分任务得分、搜索成本、模型成本、总成本、每次任务总耗时、每次查询延迟等全部字段。
用 Stirrup 快速跑一个搜索 Agent
# pip install stirrup
import asyncio
from stirrup import Agent
from stirrup.clients.chat_completions_client import ChatCompletionsClient
client = ChatCompletionsClient(
base_url="https://openrouter.ai/api/v1",
model="anthropic/claude-opus-5",
max_tokens=8192,
context_window_tokens=1_000_000,
)
agent = Agent(
client=client,
name="my_research_agent",
)
asyncio.run(agent.run())
用 Parallel Search(高级档)替换搜索后端
Stirrup 的 web_search 工具背后是 Provider 的原生 API payload。在 Stirrup 内部配置 Parallel advanced 模式只需:
# Stirrup 文档示例:通过 provider config 指定 Parallel advanced 模式
agent = Agent(
client=client,
name="parallel_advanced_agent",
search_provider="parallel",
search_mode="advanced", # 对应 Parallel Search advanced 档位
)
(具体 API 参数见 Stirrup 文档:https://stirrup.artificialanalysis.ai)
加入新 Provider 到评测
AA 公开征集新的搜索 API 加入基准。申请方式:https://artificialanalysis.ai/contact
坑与适用边界
1. Leaderboard 是特定 Agent 架构下的结果 Stirrup 的 Agent 循环是固定(web_search → web_fetch → finish),且模型固定为 GPT-5.6 Luna。换用其他 Agent 框架或模型,排名的相对位置可能不同。
2. "质量更好 = 成本更低"只在特定条件下成立 数据明确显示:Parallel advanced 比 basic 质量更高、总成本反而更低($0.084 vs $0.11)。但 Tavily basic(66分)每任务总成本高达 $126,而 Parallel turbo(67分)仅 $13.64——如果你愿意牺牲 1 分质量,Parallel turbo 是性价比之王。选择取决于你的质量/成本权衡区间。
3. 单次查询延迟 ≠ 任务总耗时 Parallel turbo 单次查询仅 0.51 秒(最快),但因质量较低(67分),Agent 需要更多轮次才能完成,任务总耗时 18.8s 与其他高质量 Provider 差距不大。
4. AA-Omniscience 是私有数据集 三项基准中有 600 题来自 AA 私有数据集,无法独立复现验证。这对于公开评测基准来说是常见限制(OpenAI Simple Evals 的部分数据也是私有的),但 AA 的污染过滤机制(过滤 Benchmark 源 URL 和数据集 Canary 字符串)是明确披露的。
5. 发布时仅 11 个产品配置 如果你在等某个特定 Provider(如根特的 Bing 集成)加入,目前榜单不支持;可以提交申请。
一句话结论
Parallel Search (advanced) 在该评测中综合质量最高(75分)且总成本最低($0.084/任务),是当前 Agent 搜索场景的首选;但如果你预算极度敏感,Parallel turbo 以 67 分和 $13.64/任务的成本提供了最好的性价比——无论选哪个,都比不用搜索的 baseline(33分)有质的飞跃。