工具 & 技能 • 5 分钟阅读
Firecrawl
web_fetch 的 Firecrawl 回退方案(反机器人 + 缓存提取)
OpenClaw 可以使用 ''Firecrawl'' 作为 ''web_fetch'' 的回退提取器。它是一个托管的
内容提取服务,支持绕过机器人和缓存,这对于
JS 重型网站或阻止普通 HTTP 获取的页面很有帮助。
Tutorial.step
获取 API 密钥
1. 创建 Firecrawl 账户并生成 API 密钥。
2. 将其存储在配置中或在网关环境中设置 ''FIRECRAWL_API_KEY''。
Tutorial.step
配置 Firecrawl
Json5
{
tools: {
web: {
fetch: {
firecrawl: {
apiKey: "FIRECRAWL_API_KEY_HERE",
baseUrl: "https://api.firecrawl.dev",
onlyMainContent: true,
maxAgeMs: 172800000,
timeoutSeconds: 60,
},
},
},
},
}注意:
- 当存在 API 密钥时,''firecrawl.enabled'' 默认为 true。
- ''maxAgeMs'' 控制缓存结果的最大有效期(毫秒)。默认为 2 天。
Tutorial.step
隐身 / 绕过机器人
Firecrawl 公开了一个 ''代理模式'' 参数用于绕过机器人(''basic''、''stealth'' 或 ''auto'')。
OpenClaw 始终为 Firecrawl 请求使用 ''proxy: "auto"'' 加上 ''storeInCache: true''。
如果省略代理,Firecrawl 默认为 ''auto''。''auto'' 会在基础尝试失败时使用隐身代理重试,这可能比
仅基础抓取消耗更多积分。
Tutorial.step
`web_fetch` 如何使用 Firecrawl
''web_fetch'' 提取顺序:
1. Readability(本地)
2. Firecrawl(如果已配置)
3. 基础 HTML 清理(最后回退)
请参阅 ''Web 工具'' 了解完整的 web 工具设置。