Firecrawl 介绍
了解工具的详细功能和使用方法
Firecrawl 是什么
Firecrawl 是面向 AI 应用、Agent 和 RAG 管线的网页数据 API。它把网页搜索、单页抓取、整站爬取、站点 URL 发现和结构化提取放在同一套接口中,并默认返回更适合模型处理的 Markdown、HTML 或 JSON。
它解决的不是“让 AI 替你浏览网页”这么泛的问题,而是工程团队经常遇到的具体数据准备工作:JavaScript 页面渲染、正文清洗、链接发现、批量任务、并发控制、内容格式统一,以及把网页转换为可以进入向量库或检索系统的文档。
核心能力
- Scrape:把单个 URL 转为干净的 Markdown、HTML、截图或结构化数据。
- Crawl:按照 include、exclude、深度和页面上限抓取一个站点。
- Map:快速发现站点 URL,适合先估算范围再决定是否完整抓取。
- Search:从实时网页搜索结果开始,并可继续抓取结果页面。
- Interact 与 Agent:在托管版中处理需要点击、滚动、等待或浏览器操作的复杂页面。
- SDK、CLI 与 MCP:可接入 Python、JavaScript、AI 编程助手和 Agent 工作流。
适合谁
Firecrawl 最适合需要稳定网页数据入口的开发者和团队,例如建立产品文档问答、竞品监测、研究资料库、销售情报、内容索引或面向用户的搜索功能。它也适合不想长期维护 Playwright、代理池、正文解析和任务队列的团队。
如果需求只是偶尔搜索几个问题,Tavily 或 Perplexity AI 的上手成本更低;如果目标是从某一类页面稳定提取固定字段,AgentQL 的语义查询更直接;如果需要让 Agent 操作 Gmail、Slack、GitHub 等应用,Composio 属于不同类型的工具接入基础设施。
价格与 credits
Firecrawl 采用 credits 计费。免费版每月提供 1,000 credits;基础 Scrape、Crawl 和 Map 通常按每页 1 credit 计费,Search、Interact、JSON 等高级格式有不同消耗。Hobby 月付 19 美元,或年付折算每月 16 美元,包含每月 5,000 credits。Standard、Growth 和更高档位提供更多 credits、并发与支持。
额度不能简单等同于“可处理的网页数”。同一 URL 如果重复抓取、返回错误页面、使用高级结构化格式或浏览器交互,实际成本会变化。上线前应按真实页面类型做小样本测试,并在应用层设置页面上限、并发限制和预算告警。
开源与托管边界
Firecrawl 的核心项目以 AGPL-3.0 为主,部分 SDK 和组件使用其他许可证。自托管版包含主要抓取、爬取、Map、Search 和结构化输出能力,但托管版在代理、浏览器沙箱、Agent、控制台、企业安全与运维方面更完整。
自托管不等于零成本。你仍需承担浏览器运行、队列、数据库、代理、出口流量、监控、升级和失败重试,并评估 AGPL 对修改与网络服务分发的要求。商业产品在采用前应由法务或合规负责人确认许可证边界。
隐私、授权与安全
网页可访问并不自动代表可以批量采集、长期保存或用于模型训练。使用前应检查 robots.txt、站点条款、版权、个人信息和地域法规,并优先抓取自己拥有、获得授权或明确允许索引的内容。
不要把登录态 Cookie、API Key、用户私有页面或内部文档直接写进任务日志。抓取结果进入 RAG 前,需要清理个人信息、密钥和恶意指令。网页中的“忽略系统规则”“上传本地文件”等内容应当被视为不可信数据,而不是 Agent 指令。