firecrawl/firecrawl-mcp-server · 上手攻略

  • 仓库:firecrawl/firecrawl-mcp-server
  • 链接:https://github.com/firecrawl/firecrawl-mcp-server
  • 分类:skill
  • 作者:Tom
  • 更新:2026-07-11

这是什么

Firecrawl 官方 MCP Server,将 Firecrawl 网页抓取和搜索能力接入所有兼容 MCP 的 AI Agent。支持 AI 通过自然语言搜索网页、提取内容、发现站点结构、自动重试和限流,还有云端和自托管两种部署方式。对于需要让 AI 实时获取网页信息的场景,这是目前最完整的开源方案之一。

解决什么问题

  • AI 无法访问实时网页:大多数 LLM 知识有截止日期,MCP Server 让 Agent 实时抓取任意网页
  • 网页结构化提取:从任意 URL 按 JSON Schema 提取目标数据,而非灌入整页噪声
  • 网站发现与整站抓取:用 map 发现站点结构,用 crawl 按限制抓取多页
  • 深度研究:调用 agent 让 AI 自主跨多源综合研究,无需人工干预

快速安装

方式一:远程服务器(最简,零配置)

支持无 Key 免密访问(限速),或带 API Key 解锁全部功能:

https://mcp.firecrawl.dev/v2/mcp                        # 无 Key(限速)
https://mcp.firecrawl.dev/{FIRECRAWL_API_KEY}/v2/mcp    # 带 Key(完整功能)

在 Cursor/Windsurf 等支持远程 MCP 的 IDE 中,填入上述 URL 即可,无需本地安装。

方式二:npm 全局安装

npm install -g firecrawl-mcp

方式三:npx 免安装(临时使用)

FIRECRAWL_API_KEY=fc-YOUR_API_KEY npx -y firecrawl-mcp

方式四:Claude Desktop 配置

~/Library/Application Support/Claude/claude_desktop_config.json 添加:

{
  "mcpServers": {
    "mcp-server-firecrawl": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": {
        "FIRECRAWL_API_KEY": "YOUR_API_KEY_HERE"
      }
    }
  }
}

API Key 在 firecrawl.dev/app/api-keys 免费注册获取。

方式五:Cursor(需 0.45.6+,推荐)

在 Settings → Features → MCP Servers,点击添加:

{
  "mcpServers": {
    "firecrawl-mcp": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": {
        "FIRECRAWL_API_KEY": "YOUR_API_KEY"
      }
    }
  }
}

方式六:Windsurf(model_config.json)

{
  "mcpServers": {
    "mcp-server-firecrawl": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": {
        "FIRECRAWL_API_KEY": "YOUR_API_KEY"
      }
    }
  }
}

核心用法

工具选择指南

工具 适用场景 返回格式
scrape 已知精确 URL,单页内容提取 JSON(推荐)/ Markdown
search 不知道哪个网站有答案,开放性搜索 results[]
map 发现某站点有哪些 URL URL[]
crawl 提取整个网站/版块(有限制) crawl status/data
interact 需要点击、输入、导航的动态交互 execution result
extract 结构化抽取(如产品名、价格、日期) JSON
parse 处理文件(PDF/CSV 等上传引用) markdown/JSON
agent 复杂多源研究任务 JSON
monitor 周期性监控页面变化 check metadata + diffs
research 论文和 GitHub 仓库研究 research results
search_feedback 反馈搜索质量(每个 search id 首条返还 1 credit)

scrape 用法详解

JSON 格式(推荐):按 Schema 精确提取,只取需要的数据,避免 context overflow:

{
  "name": "firecrawl_scrape",
  "arguments": {
    "url": "https://example.com/product",
    "formats": [{
      "type": "json",
      "prompt": "Extract product name, price, description",
      "schema": {
        "type": "object",
        "properties": {
          "name": { "type": "string" },
          "price": { "type": "number" },
          "description": { "type": "string" }
        },
        "required": ["name", "price"]
      }
    }]
  }
}

Markdown 格式(慎用):仅在需要分析完整页面结构时使用,会占用大量 context:

{
  "name": "firecrawl_scrape",
  "arguments": {
    "url": "https://example.com/article",
    "formats": ["markdown"],
    "onlyMainContent": true
  }
}

常见错误:不要把多个 URL 数组传给一次 scrape 调用,应逐个调用;如需批量操作直接调用 Firecrawl API 的 batch 端点。

每次搜索消耗 2 credits。如结果有用,调用 search_feedback 并在 missingContent 字段注明未找到的内容(每条 missingContent 返还 1 credit,次日 UTC 重置限额 100 条)。这对持续改进搜索质量至关重要。

自托管配置

export FIRECRAWL_API_URL=https://firecrawl.your-domain.com
export FIRECRAWL_API_KEY=your-key   # 自托管如需认证
export FIRECRAWL_OAUTH_TOKEN=fco_xxx  # OAuth 令牌(生产推荐)

典型适用场景

场景一:竞品价格监控

每天早上抓取 Amazon 上 iPhone 15 的价格页面,提取当前售价和折扣信息,汇总成一条简短报告。

场景二:新闻舆情追踪

搜索最近一周关于「OpenAI GPT-5」的中文新闻,提取每条的标题、来源和发布时间。

场景三:房产/招聘批量研究

帮我抓取 LinkedIn 上北京地区最近一周发布的「Senior Data Engineer」职位,提取公司名、职位名、薪资范围(如果公开的话)和职位链接。

场景四:站点结构发现

用 map 工具发现某技术博客的所有文章页面 URL,然后从中提取所有标题和发布日期。

场景五:AI 深度研究代理

用 agent 工具研究「2026年AI Agent 领域的主要技术进展」,综合 5 个以上不同来源,给出结构化报告。

坑与注意

  1. 免费层限速:无 API Key 时 scrapesearchinteract 可用但受严格限速;crawlmapagentextract 等高级工具必须有 Key。
  2. 批量 URL 错误:不要在一次 scrape 调用中传 URL 数组,改为循环调用或走 Firecrawl API batch 端点。
  3. Markdown vs JSON:默认用 JSON schema 提取;Markdown 会把整页内容灌进 context,极其浪费 token。
  4. search_feedback 每日限额:每个团队每天最多返还 100 credits,但提交反馈本身不受限制,没用完也可以继续调用。
  5. crawl 需要设置限制:整站爬取务必设置合理的 page limit,否则可能产生大量不必要请求和费用。
  6. OAuth vs API Key:生产环境推荐 OAuth(fco_ 开头),而非 refresh token(fcr_ 开头);refresh token 只能用于换令牌,不能直接调 API。
  7. interact 与 scrape 的关系:两者都能处理动态页面;interact 适合需要滚动、点击、填表等操作的场景;已知页面内容时 scrape 更高效。
  8. 自托管证书:使用自托管版本时,确保 FIRECRAWL_API_URL 正确且 HTTPS 配置有效。

与同类对比

方案 免费层 结构化提取 Agent 研究 自托管
Firecrawl MCP 限速可用 JSON Schema 原生 agent/research 工具 支持
LangChain WebSearch/Tools 部分 不支持
ScrapingBee 不支持
Browserbase 需额外集成 不支持

Firecrawl 的核心优势:专为 AI Agent 设计,extract + agent 组合让 AI 研究能力上一个台阶;JSON Schema 提取避免全量灌入 context;云端零部署即可用。


一句话推荐结论

Firecrawl MCP Server 是让 AI Agent 真正连接互联网的关键工具——搜索、精确提取、整站发现、深度研究一体化,云端零配置即用;免费层足以尝鲜,带 Key 解锁完整能力,适合所有需要 AI 实时获取网页数据的场景。