OpenClawSkills
GitHub
工具 & 技能 • 5 分钟阅读

Firecrawl

web_fetch 的 Firecrawl 回退方案(反机器人 + 缓存提取)

OpenClaw 可以使用 ''Firecrawl'' 作为 ''web_fetch'' 的回退提取器。它是一个托管的

内容提取服务,支持绕过机器人和缓存,这对于

JS 重型网站或阻止普通 HTTP 获取的页面很有帮助。

Tutorial.step

获取 API 密钥

1. 创建 Firecrawl 账户并生成 API 密钥。

2. 将其存储在配置中或在网关环境中设置 ''FIRECRAWL_API_KEY''。

Tutorial.step

配置 Firecrawl

Json5
{
  tools: {
    web: {
      fetch: {
        firecrawl: {
          apiKey: "FIRECRAWL_API_KEY_HERE",
          baseUrl: "https://api.firecrawl.dev",
          onlyMainContent: true,
          maxAgeMs: 172800000,
          timeoutSeconds: 60,
        },
      },
    },
  },
}

注意:

- 当存在 API 密钥时,''firecrawl.enabled'' 默认为 true。

- ''maxAgeMs'' 控制缓存结果的最大有效期(毫秒)。默认为 2 天。

Tutorial.step

隐身 / 绕过机器人

Firecrawl 公开了一个 ''代理模式'' 参数用于绕过机器人(''basic''、''stealth'' 或 ''auto'')。

OpenClaw 始终为 Firecrawl 请求使用 ''proxy: "auto"'' 加上 ''storeInCache: true''。

如果省略代理,Firecrawl 默认为 ''auto''。''auto'' 会在基础尝试失败时使用隐身代理重试,这可能比

仅基础抓取消耗更多积分。

Tutorial.step

`web_fetch` 如何使用 Firecrawl

''web_fetch'' 提取顺序:

1. Readability(本地)

2. Firecrawl(如果已配置)

3. 基础 HTML 清理(最后回退)

请参阅 ''Web 工具'' 了解完整的 web 工具设置。