Le web scraping n’est pas illégal en soi. Extraire des données publiques sur internet est une pratique légale, à condition de respecter les CGU du site, le RGPD et les droits d’auteur.
Voici les règles à connaître avant de te lancer.

Le web scraping est-il légal ? Ce que dit le droit
Le web scraping consiste à extraire automatiquement des données depuis des pages web. Concrètement, un outil parcourt un site, lit le code des pages et récupère les informations qui t’intéressent. En règle générale, cette pratique est légale tant que tu te limites à des données publiques accessibles sur internet.
La légalité dépend surtout de trois éléments : les conditions générales d’utilisation du site, le RGPD et le droit d’auteur. Le scraping devient illégal quand tu touches à des informations privées, à des données personnelles sans base légale, ou quand tu contournes une protection technique.
Sur le plan du droit d’auteur, le code de la propriété intellectuelle encadre la collecte, le stockage et l’utilisation des données. Le producteur d’une base de données bénéficie en plus d’un droit sui generis (article L342-3 du code de la propriété intellectuelle), qui interdit d’extraire une partie substantielle d’une base, même si les informations y sont accessibles publiquement.
Dès que tu collectes des données personnelles, tu entres dans le champ du RGPD. Peu importe que la donnée soit publique : tu dois disposer d’une base légale (consentement ou intérêt légitime), respecter le principe de minimisation et informer les personnes concernées. C’est le point que beaucoup oublient avant de se lancer.
Quels sont les facteurs qui rendent le web scraping illégal ?
Quatre facteurs reviennent le plus souvent : les CGU, les droits d’auteur, le RGPD et l’atteinte au bon fonctionnement du site. Voici ce que tu dois vérifier avant toute extraction de données, que tu fasses du scraping de prix ou de toute autre information.
Conditions générales d’utilisation (CGU)
Les sites web ont le droit de fixer leurs propres règles sur l’accès à leurs pages. Tu les trouves dans les conditions générales d’utilisation (CGU). Ces documents font office de contrat juridique entre le site et ses utilisateurs.
Si le document interdit explicitement le web scraping, ta collecte de données peut t’exposer sur le plan contractuel. En droit français, violer les CGU relève surtout du droit contractuel, pas automatiquement du pénal, mais c’est un premier signal fort. Consulte donc les conditions générales avant de lancer ton extraction.
Droits de propriété intellectuelle
Le droit d’auteur protège les créations originales, y compris certains contenus et bases de données. Si un site est protégé par des droits d’auteur, extraire son contenu sans autorisation peut constituer une infraction.
En France, le Code de la propriété intellectuelle va plus loin avec le droit sui generis du producteur de base de données (article L.342-3). Ce droit protège l’investissement du créateur d’une base, indépendamment du droit d’auteur classique. Concrètement, une extraction substantielle de données peut être illégale même si ces données sont publiques. C’est le point le plus souvent ignoré.
Données personnelles et RGPD
En Europe, le scraping de données personnelles (noms, emails, profils LinkedIn, comptes sur les réseaux sociaux…) est strictement encadré par le RGPD, et cela vaut même pour des données accessibles librement sur internet. Dès que tu collectes une information qui identifie une personne, tu réalises un traitement de données personnelles et tu dois disposer d’une base légale : consentement, intérêt légitime ou obligation légale.
Le RGPD impose aussi des obligations positives : respecter la minimisation, informer les personnes concernées et fixer une durée de conservation limitée. Sans base légale claire, ta collecte revient à du web scraping illégal. La CNIL peut alors sanctionner, avec des amendes allant jusqu’à 20 millions d’euros ou 4 % du chiffre d’affaires annuel mondial, selon le montant le plus élevé.
Atteinte au bon fonctionnement du site
Même sur un site qui tolère le web scraping, un scraping intensif peut devenir illégal. Ce type d’extraction automatisée surcharge le serveur et peut empêcher son bon fonctionnement, ce qui est alors assimilé à une attaque par déni de service (DoS).
En France, l’article 323-2 du Code pénal punit le fait d’entraver un système de traitement automatisé de données, avec des sanctions allant jusqu’à 5 ans de prison et 150 000 euros d’amende. Des outils professionnels comme Bright Data proposent des solutions encadrées pour éviter ce type de dérive.
Quelles sont les bonnes pratiques pour un web scraping légal ?
Faire du scraping en toute légalité repose sur quelques règles simples. Elles te protègent des risques juridiques et respectent les conditions générales d’utilisation des sites. Si tu veux comprendre pourquoi faire du scraping, autant le faire dans les règles dès le départ.
1. Respecter le fichier robots.txt
La plupart des sites web incluent un fichier robots.txt, qui indique quelles pages peuvent être explorées par des robots, scrapers compris. Si ce fichier interdit l’accès à une section, tu ne la scrapes pas. C’est la base d’une collecte de données respectueuse et conforme.
2. Limiter le taux de requêtes
Pour ne pas perturber le serveur d’un site, tu dois limiter la fréquence de tes requêtes. Des outils adaptés le permettent, notamment ceux utilisés en web scraping Python. Ils te permettent de contrôler les délais entre chaque requête. Un rythme trop agressif peut saturer un serveur et être qualifié pénalement, alors espace bien tes appels.
3. S’identifier clairement via le User-Agent
Lors du scraping, mieux vaut utiliser un User-Agent clair dans tes requêtes HTTP. Cela permet aux administrateurs du site de savoir qu’un script, et non un humain, accède au contenu. Un User-Agent identifiable te permet de :
- Améliorer la transparence de ton activité
- Faciliter le dialogue en cas de problème
- Limiter les risques de blocage
4. Se concentrer sur les données publiques
Pour éviter les risques juridiques, concentre-toi sur les données publiques accessibles librement sur internet, c’est-à-dire les informations visibles par tous sans inscription ni connexion préalable. À l’inverse, évite d’extraire des données personnelles ou des informations protégées par un mot de passe.
5. Utiliser des API si disponibles
De nombreux sites proposent des API de web scraping pour récupérer leurs données de manière légale et structurée. C’est la méthode la plus sûre pour rester en conformité avec le cadre juridique sur le long terme. Ces outils officiels garantissent aussi une meilleure stabilité que le scraping direct. Sers-t’en dès que possible pour tes projets.
Est-ce que le web scraping est légal en France ?
Oui, le web scraping est légal en France, tant que tu respectes le cadre juridique en place. La collecte de données publiques reste autorisée, mais elle doit rester conforme au RGPD, aux conditions générales d’utilisation des sites et aux droits d’auteur.
En cas de non-respect des règles, les conséquences juridiques peuvent être lourdes :
- Sanctions civiles : en cas de violation des CGU ou des droits d’auteur, les détenteurs de droits peuvent te réclamer des dommages et intérêts.
- Sanctions pénales : la collecte illégale de données personnelles est lourdement punie. L’article 226-16 du Code pénal prévoit jusqu’à 5 ans d’emprisonnement et 300 000 euros d’amende pour une collecte déloyale ou frauduleuse.
- Sanctions RGPD : pour une entreprise, une amende peut atteindre 4 % du chiffre d’affaires annuel mondial ou 20 millions d’euros, selon le montant le plus élevé.
Un exemple concret : extraire des profils LinkedIn depuis les réseaux sociaux pour du démarchage, sans base légale ni information des personnes concernées, expose directement à une sanction de la CNIL. C’est l’un des cas les plus fréquents de scraping illégal en pratique.
En cas de doute sur la conformité de ton projet, le mieux reste de consulter un avocat spécialisé en protection des données avant de te lancer.






