Pular para o conteúdo

f5xc-firecrawl

O plugin f5xc-firecrawl fornece raspagem web local auto-hospedada por meio do motor open-source firecrawl. Sem chaves de API, sem assinaturas, sem dependência de nuvem. Todas as operações são executadas contra a instância local do firecrawl em localhost:3002 dentro do devcontainer.

v1.1.0 Produtividade
/plugin install f5xc-firecrawl@f5-sales-demo-marketplace

Raspa uma única URL e extrai o conteúdo como markdown.

/scrape https://docs.example.com/getting-started
/scrape https://example.com --format markdown,links --wait 2000

Raspa múltiplas URLs de uma vez.

/batch-scrape https://example.com https://example.org https://example.net

Rastreia múltiplas páginas a partir de uma URL inicial.

/crawl https://docs.example.com --limit 20 --depth 2
/crawl https://docs.example.com --include /api/* --exclude /blog/*

Descobre todas as URLs de um site.

/map https://docs.example.com
/map https://docs.example.com --search api --subdomains

Pesquisa na web e, opcionalmente, raspa os resultados.

/search "firecrawl web scraping" --limit 10
/search "AI tools 2026" --scrape --time month

Extração de dados estruturados com base em LLM a partir de páginas web.

/extract https://example.com "Extract the main heading and any links"
/extract https://example.com/pricing --schema '{"plans": [{"name": "string", "price": "string"}]}'

Gera um arquivo llms.txt para um site.

/llmstxt https://docs.example.com

Ativa-se automaticamente quando você solicita raspar uma URL, rastrear um site, mapear URLs de um site, pesquisar na web, extrair dados estruturados, gerar llms.txt, raspar múltiplas URLs em lote ou converter uma página web para markdown. Delega imediatamente ao agente firecrawl-operator.

Agente autônomo de raspagem web que executa sequências de curl + jq contra a API local do firecrawl. Suporta 11 protocolos cobrindo todos os endpoints v1. Agente somente leitura (sem ferramentas de Escrita, Edição ou Agente).

ProtocoloEndpointTipo
HEALTHGET /Síncrono
SCRAPEPOST /v1/scrapeSíncrono
BATCH_SCRAPEPOST /v1/batch/scrapeAssíncrono
CRAWLPOST /v1/crawlAssíncrono
CRAWL_CANCELDELETE /v1/crawl/:idSíncrono
CRAWL_ACTIVEGET /v1/crawl/activeSíncrono
CRAWL_ERRORSGET /v1/crawl/:id/errorsSíncrono
MAPPOST /v1/mapSíncrono
SEARCHPOST /v1/searchSíncrono
EXTRACTPOST /v1/extractAssíncrono
LLMSTXTPOST /v1/llmstxtAssíncrono

O plugin requer a pilha do firecrawl em execução no devcontainer:

ComponentePortaFinalidade
Firecrawl API3002Todos os endpoints de scrape/crawl/map/search/extract
Playwright3000Motor de renderização JavaScript
Redis6379Backend de fila de jobs
PostgreSQLsocketPersistência de jobs de crawl/batch
LiteLLM proxyOPENAI_BASE_URLBackend LLM para extract (opcional)

A pilha inicia automaticamente quando ENABLE_FIRECRAWL=true (o padrão). Um hook SessionStart verifica se a API está acessível e emite um aviso caso o serviço esteja inativo.

Este plugin utiliza a versão open-source auto-hospedada:

  • Sem autenticação ou chaves de API necessárias para raspagem
  • Sem limites de crédito ou limitação de taxa
  • Utiliza endpoints da API v1 (não v2)
  • Sessões de navegador e pesquisa profunda não estão disponíveis
  • Extract utiliza seu próprio proxy LLM em vez de modelos hospedados
  • Executa inteiramente dentro da rede do container local