Firecrawl MCP: Extrair e Clonar Qualquer Site
Firecrawl MCP conecta o Cursor AI diretamente a qualquer site pela URL. Da pra extrair estrutura, conteudo e estilos e converter em codigo React/Next.js em minutos. Esse tutorial
Clonar um site pela URL costumava ser trabalhoso. Voce abria o DevTools, ia na aba Elements, tentava entender a estrutura, copiava blocos de HTML, perdia o contexto dos estilos, repetiia isso pra cada secao da pagina. Era um processo manual e lento.
Com Firecrawl MCP no Cursor, o processo muda completamente. Voce manda a URL, o AI extrai a estrutura inteira, converte em codigo React e entrega o componente pronto. Em casos simples, isso leva menos de 5 minutos. Esse tutorial mostra como fazer direito.
O Firecrawl MCP e um dos servidores mais usados no fluxo de clonar sites com IA, mas tem particularidades que precisam de atencao. Vou cobrir instalacao, uso pratico, limitacoes reais e aspectos legais que voce nao pode ignorar.
O que e Firecrawl e como funciona
Firecrawl e uma API de web scraping desenvolvida especificamente pra uso com IA. A diferenca de um scraper comum e que o Firecrawl nao so extrai o HTML bruto. Ele renderiza o JavaScript da pagina, processa o conteudo e retorna tudo num formato limpo e estruturado que modelos de linguagem conseguem processar muito bem.
O output padrao do Firecrawl e Markdown. Isso e uma escolha inteligente: Markdown mantem a hierarquia do conteudo (headings, listas, links) sem toda a verbosidade do HTML. Um AI que recebe o conteudo de uma pagina em Markdown entende a estrutura muito melhor do que se recebesse o HTML cheio de divs e atributos.
Modos de operacao do Firecrawl
O Firecrawl tem quatro modos principais. Scrape pega uma unica URL. Crawl navega por um site inteiro, seguindo links internos ate um limite que voce define. Map gera um mapa de todos os URLs de um dominio. Search faz busca por conteudo dentro do site. Para clonar um layout especifico, o modo Scrape e o mais usado. Para entender a estrutura de navegacao de um site inteiro, o Map e o ponto de partida.
Firecrawl vs Puppeteer MCP
Firecrawl MCP conecta o Cursor AI diretamente a qualquer site pela URL. Da pra extrair estrutura, conteudo e estilos e converter em codigo React/Next.js em minutos. Esse tutorial mostra como fazer isso direito.
Instalando Firecrawl MCP no Cursor
A instalacao segue o mesmo padrao de qualquer MCP Server no Cursor. Voce precisa de uma API key do Firecrawl (o cadastro e gratuito em firecrawl.dev) e do Cursor na versao 0.43+. Se nao configurou MCP antes, ve o guia completo de MCP Server no Cursor primeiro.
- Acesse firecrawl.dev e crie uma conta gratuita
- No dashboard do Firecrawl, gere uma API key em Settings > API Keys
- Copie a API key. Nao compartilhe e nao coloque em arquivo publico
- No seu sistema operacional, adicione a variavel de ambiente FIRECRAWL_API_KEY com o valor da sua chave
- No Mac/Linux: adicione 'export FIRECRAWL_API_KEY=sua-chave' no ~/.zshrc ou ~/.bashrc e recarregue o shell
- Abra o Cursor e va em Settings > MCP > Add new global MCP server
- Adicione o servidor no mcp.json com command 'npx', args ['-y', 'firecrawl-mcp'] e env com FIRECRAWL_API_KEY referenciando sua variavel
- Salve o arquivo e verifique o icone verde ao lado de 'firecrawl-mcp' nas Settings do Cursor
- Teste com: 'Use o Firecrawl para extrair o conteudo de example.com e me mostre o resultado em Markdown'
Extraindo um site completo pela URL
Com o servidor rodando, o fluxo de extracao e direto. Voce manda a URL no chat do Cursor com uma instrucao clara. O AI chama o Firecrawl por baixo, recebe o conteudo processado e usa isso pra gerar o codigo.
O prompt faz toda a diferenca. 'Raspe o site X' e muito vago. O AI nao sabe o que voce quer fazer com os dados. Um prompt que funciona bem: 'Use o Firecrawl para extrair a estrutura e conteudo da pagina [URL]. Analise o layout e identifique as secoes principais: hero, features, pricing, footer. Depois converta cada secao num componente React com Tailwind CSS.'
Extraindo multiplas paginas
Pra extrair mais de uma pagina, use o modo crawl do Firecrawl. Instrucao: 'Use o Firecrawl em modo crawl para mapear as URLs de [dominio] com limite de 20 paginas. Liste todas as URLs encontradas.' Depois voce escolhe quais URLs extrair de forma mais detalhada.
Focando em partes especificas da pagina
Às vezes voce quer apenas uma secao da pagina, nao tudo. O Firecrawl aceita seletores CSS para incluir ou excluir partes do conteudo. Isso e util para pular navegacao, anuncios e footers que nao interessam. Na instrucao pro AI, voce pode pedir: 'Use o Firecrawl pra extrair apenas o conteudo dentro do seletor .main-content ou main da pagina [URL].'
Convertendo a extracao em codigo React/Next.js
Depois da extracao, o AI tem o conteudo da pagina. O proximo passo e a conversao em codigo. Aqui e onde muita gente erra: manda um prompt generico e recebe um componente gigante sem estrutura.
O melhor e pedir a conversao em etapas. Primeiro: 'Com base no conteudo extraido, liste os componentes que precisamos criar para replicar esse layout.' Segundo: 'Comece pelo componente [Nome] e crie o codigo React completo com Tailwind.' Terceiro: repete pra cada componente identificado.
Diferenca entre conteudo e estrutura
Ao clonar, voce tem duas escolhas: clonar o conteudo (textos, imagens reais do site) ou clonar apenas a estrutura (layout, estilos, componentes) com conteudo placeholder. Para fins de estudo e desenvolvimento, clonar so a estrutura e mais util e evita questoes de direitos autorais sobre o conteudo.
Tratando imagens e assets
O Firecrawl extrai URLs de imagens, mas nao baixa os arquivos. Para um clone de estudo, voce pode usar os placeholders do Tailwind (bg-gray-200, etc) ou servicos como picsum.photos. Para um projeto real onde voce quer usar os mesmos tipos de imagem, documente as dimensoes e use imagens proprias do mesmo formato.
Lidando com sites dinamicos: SPA e React
Sites construidos com React, Angular ou Vue carregam o conteudo via JavaScript apos o HTML inicial. Um scraper simples pega o HTML vazio. O Firecrawl renderiza o JavaScript antes de extrair, entao funciona com a maioria dos SPAs. Mas tem casos onde nao funciona bem.
Quando o Firecrawl falha em SPAs
Sites que exigem autenticacao pra mostrar qualquer conteudo nao funcionam. Sites com anti-bot agressivo (Cloudflare em modo agressivo, DataDome) podem bloquear o Firecrawl. Sites que carregam conteudo infinito via scroll podem retornar apenas o conteudo inicial.
Pra esses casos, o Puppeteer MCP e a alternativa. Ele controla um browser real, entao pode lidar com interacoes mais complexas. A troca e que e mais lento e mais complexo de configurar. Teste o Firecrawl primeiro. Se nao funcionar, ai voce parte pro Puppeteer.
Dica para sites com lazy loading
Muitos sites carregam secoes so quando o usuario rola ate elas. O Firecrawl tem uma opcao de aguardar alguns segundos antes de extrair (waitFor). Instrua o AI a usar essa opcao: 'Use o Firecrawl com waitFor de 3000ms para dar tempo do conteudo lazy load ser renderizado antes da extracao.'
Limites do plano gratuito vs pago
O plano gratuito do Firecrawl da 500 creditos por mes. Cada crawl de uma URL usa 1 credito. Pra uso educacional e projetos pequenos, 500 requisicoes sao suficientes. Pra uso profissional intenso, voce vai precisar do plano pago.
Plano Free
500 creditos/mes, ideal pra aprendizado e projetos pequenos. Rate limit de 10 req/min. Sem crawling de sites grandes. Suficiente pra testar o workflow e fazer projetos de estudo.
Plano Hobby (~$19/mes)
3000 creditos/mes, sem rate limit rigido. Crawling de sites medios. Bom pra freelancers que usam o fluxo algumas vezes por semana em projetos de clientes.
Plano Standard (~$83/mes)
100000 creditos/mes. Para agencias e times que usam scraping como parte do workflow produtivo. Inclui suporte prioritario e SLA.
Uma dica pra economizar creditos: use o modo Map primeiro pra entender quais URLs o site tem. Ai voce extrai so as que realmente precisa, em vez de fazer crawl cego no site inteiro.
Aspectos legais de web scraping no Brasil
Web scraping e uma area cinza juridicamente. Antes de extrair qualquer site, confira se ha termos de uso proibindo scraping. Muitos sites tem clausulas especificas sobre isso. Tecnicamente voce pode raspar, mas juridicamente pode estar violando o contrato de uso do servico.
Para projetos de estudo e aprendizado, o risco e muito baixo. Para projetos comerciais onde voce vai usar conteudo ou dados extraidos de terceiros, consulte um advogado especializado. O artigo sobre legalidade de clonar sites no Brasil cobre isso em muito mais detalhe.
Antes de raspar qualquer site
- Leia o robots.txt do site (dominio.com/robots.txt) e respeite as restricoes
- Verifique os Termos de Uso do site por mencoes a scraping ou crawling
- Nao extraia dados pessoais de usuarios (viola LGPD)
- Nao sobrecarregue o servidor com muitas requisicoes simultaneas
- Use o conteudo extraido para estudo e referencia, nao para publicar identicamente
- Para projetos comerciais, consulte um advogado antes de usar dados raspados
Perguntas frequentes
Firecrawl MCP e gratuito?
Tem plano gratuito com 500 requisicoes por mes. Para uso casual e aprendizado e suficiente. Para uso intenso em projetos (raspar dezenas de paginas frequentemente), o plano pago comeca em torno de 19 dolares por mes.
Firecrawl funciona em sites com JavaScript?
Sim. O Firecrawl renderiza JavaScript antes de extrair o conteudo. Funciona em SPAs React, Angular e Vue. Porem sites que exigem login, CAPTCHA ou carregam conteudo via WebSocket podem ter limitacoes.
Qual a diferenca entre Firecrawl e um scraper comum?
Um scraper comum pega o HTML bruto da pagina. O Firecrawl renderiza o JavaScript, limpa o HTML (remove ads, menus, footers), converte pra Markdown estruturado e extrai metadados. O conteudo que chega pro AI ja esta pre-processado e muito mais util.
O que e Firecrawl e como funciona
Firecrawl e uma API de web scraping desenvolvida especificamente pra uso com IA. A diferenca de um scraper comum e que o Firecrawl nao so extrai o HTML bruto. Ele renderiza o JavaScript da pagina, processa o conteudo e retorna tudo num formato limpo e estruturado que modelos de linguagem conseguem processar muito bem. O output padrao do Firecrawl e Markdown. Isso e uma escolha inteligente: Markdown mantem a hierarquia do conteudo (headings, listas, links) sem toda a verbosidade do HTML. Um AI que recebe o conteudo de uma pagina em Markdown entende a estrutura muito melhor do que se recebesse o HTML cheio de divs e atributos. O Firecrawl tem quatro modos principais. Scrape pega uma unica URL. Crawl navega por um site inteiro, seguindo links internos ate um limite que voce define. Map gera um mapa de todos os URLs de um dominio. Search faz busca por conteudo dentro do site. Para clonar um layout especifico, o modo Scrape e o mais usado. Para entender a estrutura de navegacao de um site inteiro, o Map e o ponto de partida.