UMA raspador envia uma Pedido HTTP para uma página web, lê o código HTML retrém, extrai os dados pretendidos e, em seguida, armazena-os. O princípio é o mesmo de um navegador clássico, mas totalmente automatizado e sem interface gráfica.
Eis como este processo se desenrola na prática, passo a passo.

Etapa 1: Envio da solicitação HTTP
Durante o raspagem da web, o scraper começa por enviar uma solicitação HTTP (muitas vezes do tipo GET) na’URL da página a extrair. É exatamente o mesmo mecanismo que um navegador clássico, só que tudo é automatizado, sem que apareça nenhuma janela e sem que tenhas de clicar em nada.
Para evitar ser bloqueado, o scraper pode adicionar cabeçalhos HTTP. Por exemplo, um User-Agent que imita o de Chrome Onde Firefox, ou cookies. Em resumo, ele faz-se passar por um navegador normal aos olhos do servidor de destino.
Apesar de tudo, muitos sites detetam estas solicitações automáticas, através de limitação de taxa ou alguns captchas, para impedir o web scraping.
Etapa 2: Receção e análise do conteúdo HTML
Em resposta à solicitação, o site retorna o código HTML conteúdo completo da página: títulos, textos, imagens, links, preço, opiniões dos clientes. O scraper não “vê” este conteúdo da mesma forma que tu. Ele trabalha diretamente no valor bruto, sem qualquer interface gráfica.
Na prática, o scraper vai analisar a estrutura HTML para identificar as informações que lhe interessam. Esta análise baseia-se nas etiquetas e nas classes CSS ou, por vezes, do JavaScript.
Etapa 3: Extração de dados
Depois de analisar o código HTML, o scraper identifica os elementos a extrair : títulos de artigos, preços de um produto, avaliações dos clientes. O objetivo é simples: fazer uma seleção e ficar apenas com os dados úteis.
O método mais comum utiliza sélecteurs CSS, que permitem selecionar elementos específicos de acordo com as suas classes, os seus identificadores ou a sua posição na hierarquia do site. Vejamos um exemplo concreto com este código HTML:
<h1>Calçado desportivo</h1>
<span>79,99 €</span>
Para recolher estas informações, o scraper utiliza os seguintes seletores:
- .product-title para o título do produto
- .price pelo preço
Para estruturas mais complexas (com base na posição de um elemento ou no seu texto), o scraper pode recorrer ao método XPath, que permite uma segmentação mais precisa quando os seletores CSS não são suficientes.
No sites dinâmicos que carregam o seu conteúdo através de JavaScript, é necessário um software adicional: um navegador em modo headless. Nesse caso, controlas um navegador real em segundo plano com Puppeteer (uma biblioteca Node.js que controla Chrome) ou Playwright (um framework de automatização desenvolvido por Microsoft). O navegador executa o JavaScript, apresenta a página na íntegra e, em seguida, o scraper lê todos os dados.
Existem, assim, vários tipos de scrapers conforme o processo em questão: um scraper simples para sites estáticos, um scraper headless para sites dinâmicos e um scraper que recorre a uma API, quando o site disponibiliza uma.
Etapa 4: Armazenamento de dados
Depois de extraídos os dados, o scraper... guardar em diferentes formatos. Esta é a última etapa do processo. Consoante as tuas necessidades, podes escolher entre estas opções:
- Ficheiro CSV : parece uma tabela do Excel, perfeita para uma utilização simples.
- JSON : um formato mais flexível, frequentemente preferido pelos programadores.
- Base de dados : ideal quando o volume de informação é elevado.
Podes, em seguida, analisar, ordenar ou visualizar esses dados como quiseres. Na prática, este armazenamento transforma os dados brutos num conjunto de dados utilizável, pronto para um estudo de mercado ou uma análise da concorrência.
Qual é a função de um scraper?
A função de um scraper é’extrair e armazenar dados automaticamente extraídas de páginas da Internet, sem que tenhas de copiar cada informação uma a uma. Trata-se de um programa ou de um bot que faz todo o trabalho por ti.
Na prática, o scraper percorre um site, lê o seu conteúdo e, em seguida, recolhe as informações pretendidas. Com raspadores potentes, como os propostos por Dados brilhantes, podes obter preços, artigos, dados empresariais e muitas outras informações ainda.
Também podes extrair dados de um site diretamente a partir do teu navegador, graças a extensões específicas.
Eis alguns exemplos de aplicações concretas:
- Monitorização da concorrência : recolher os preços dos produtos dos teus concorrentes para ajustar a tua estratégia, por exemplo, através de raspagem na Amazon.
- Análise de mercado : recolher dados sobre as tendências e os novos hábitos de compra.
- Agregação de conteúdos : criar um feed de notícias a partir de vários sites.
- Prospeção comercial : criar uma base de contactos, nomeadamente através de recolha de dados no Google Maps.
- Investigação científica : recolher dados públicos para estudos.
Na prática, o scraper permite-te poupar bastante tempo sempre que é necessário processar uma grande quantidade de dados rapidamente.
Como fazer scraping gratuitamente?
Tens um projeto de web scraping, mas o orçamento é apertado? Vários software gratuito permitem recolher dados sem custos, quer se trate de ferramentas prontas a utilizar, extensões de navegador ou bibliotecas de código.
Aqui estão três opções fiáveis, de acordo com o teu perfil:
- Beautiful Soup : uma biblioteca Python gratuita e de código aberto. Ela analisa o código HTML de um site e ajuda-te a extrair as informações. Ideal para começares com páginas simples.
- Scrapy : um framework Python gratuito e de código aberto, mantido por Zyte. Ele gere projetos de web scraping mais complexos e grandes volumes de dados em inúmeras páginas.
- Octoparse : um software sem código com um plano gratuito. A sua versão gratuita inclui até 10 tarefas e 50 000 linhas exportadas por mês, ideal se não quiseres programar.
Também podes utilizar a extensão Rastreador de dados instantâneo diretamente no teu navegador, sem qualquer instalação nem uma única linha de código.
Para aprofundar o assunto, abordamos cada opção em pormenor no nosso artigo sobre o web scraping gratuito.
Qual é a diferença entre API e scraper?
Ambos servem para extrair dados online, mas não funcionam da mesma forma.
A API
A API é uma interface que um site disponibiliza voluntariamente. Esta devolve dados estruturados (muitas vezes em JSON), que podem ser utilizadas diretamente. Recolhes apenas as informações que o site autoriza, dentro de um âmbito definido pelo próprio site. É um processo simples, estável e perfeitamente legal, mas estás limitado ao conteúdo que a API disponibiliza.
O scraper
Um scraper, por sua vez, lê diretamente o código HTML de um site, tal como um navegador faria. Por isso, consegue recuperar dados mesmo quando não existe nenhuma API. Por outro lado, continuas sujeito às Termos e Condições Gerais de Utilização do site, no RGPD e aos mecanismos anti-bot. O ficheiro robots.txt não é uma obrigação jurídica, mas sim uma convenção técnica que os scrapers que respeitam as regras sigam.
Na prática, utilizas uma API quando esta existe e satisfaz as tuas necessidades. Passas para o raspagem da web quando os dados só estão acessíveis nas páginas visíveis do site.
Se estás a dar os primeiros passos, podes começar por extrair dados com o Excel : é simples e prático, apesar de algumas limitações. E tu? Conheces algum scraper que funcione de forma diferente? Partilha a tua experiência nos comentários.






