Protection des données Scraper le web pour nourrir une IA générative : ce que dit l’EDPB
Date de publication
17 septembre 2026
Entraîner un modèle d’IA générative suppose d’ingérer d’énormes volumes de données souvent collectées automatiquement sur le web.
Le 7 juillet 2026, le Comité européen de la protection des données (« EDPB ») a adopté ses lignes directrices 03/2026 sur le web scraping dans le contexte de l’IA générative afin de clarifier à quelles conditions cette pratique reste compatible avec le RGPD.
L’enjeu est réel : une bonne partie des données ainsi extraites sont des données à caractère personnel généralement collectées sans que les personnes concernées en soient informées.
Le présent article présente les points clés à retenir : le périmètre couvert par ces lignes directrices ainsi que les exigences concrètes imposées par le RGPD applicables aux pratiques de web scraping.
1. De quoi parle-t-on ?
L’IA générative désigne des modèles entraînés à partir de données existantes pour produire de nouveaux contenus : texte, image, audio1. Entraîner ces modèles nécessite une quantité massive de données, ce qui explique le recours généralisé au web scraping aussi bien pour l’entraînement initial que pour le fine-tuning.
Techniquement, le web scraping extrait de façon automatisée un grand nombre de données depuis des sources internet accessibles au public (sites, réseaux sociaux, blogs, registres), que ce soit en interne ou via un prestataire2. Un pipeline type tient en quatre étapes : sélection des sources et des critères de collecte, extraction et stockage brut, nettoyage (suppression des doublons et du superflu) et structuration dans un format exploitable3. Il convient de noter que les lignes directrices ne visent que le web scraping opéré par des entités privées.
Autant dire que le web scraping porte un risque intrinsèque pour les droits et libertés dès lors qu’une bonne part des données extraites sont des données à caractère personnel.
2. Ce que le RGPD exige concrètement
Dès que le scraping touche des données personnelles, le RGPD s’applique à toute la chaîne de traitement (collecte, stockage, récupération), quel que soit le rôle de chaque acteur.
Cinq points méritent l’attention des équipes techniques et juridiques.
2.1. Qui est responsable ? Scraper, développeur d’IA, ou les deux ?
Plusieurs acteurs interviennent dans la constitution d’un jeu de données d’entraînement et leur qualification doit donc s’analyser au cas par cas :
- Scraper sur instructions documentées du développeur d’IA : le scraper agit comme sous-traitant, le développeur reste responsable du traitement.
- Données déjà collectées par un tiers sans instructions : chacun répond de son propre traitement (le scraper pour la collecte, le développeur pour l’entraînement).
- Finalités et moyens définis ensemble : responsabilité conjointe du traitement.
2.2. Les cinq principes RGPD à appliquer en cas de scraping
2.2.1. Transparence
Informer individuellement chaque personne concernée par le web scraping s’avère, en pratique, souvent impossible dès lors que les volumes traités sont considérables4. L’article 14(5)(b) RGPD permet alors de s’en dispenser si l’effort est disproportionné après mise en balance de cet effort avec l’impact pour les personnes concernées (exception à utiliser avec discernement, pas systématiquement). En revanche, une information publique reste toujours exigée : une politique de confidentialité ou un avis dédié précisant les catégories de données concernées, les finalités, la base légale, les sources et les caractéristiques du robot d’indexation utilisé (« crawler »).
2.2.2. Minimisation des données
Ce principe exige de ne collecter que le nécessaire c’est-à-dire qu’il faut, en amont, cadrer les critères de collecte et filtrer ce qui n’est pas utile tandis qu’il faut, pendant et après la collecte, appliquer des filtres pour écarter les données identifiables par leur format (numéro de sécurité sociale, téléphone, etc.) et anonymiser, ou à défaut pseudonymiser, ce qui est conservé5.
2.2.3. Exactitude des données
Pour l’exactitude, l’EDPB recommande de scraper des sources fiables et officielles, d’horodater la collecte et de valider les données avant leur usage – via des contrôles de format et vérifications d’échantillons6.
2.2.4. Base légale: l’intérêt légitime sous conditions strictes
Tout traitement doit reposer sur l’une des six bases de l’article 6 du RGPD. L’intérêt légitime est en pratique la base retenue pour le web scraping à trois conditions cumulatives : un intérêt légitime réel, la nécessité du traitement pour le poursuivre et l’absence de prééminence des droits de la personne concernée après mise en balance (sensibilité des données notamment). L’EDPB liste une série de mesures concrètes pour faire pencher la balance en faveur du responsable de traitement7.
2.2.5. Données sensibles
Santé, origines, opinions politiques ou religieuses, données biométriques sont des catégories de données qui bénéficient d’une protection renforcée. Leur traitement est en principe interdit sauf s’il est possible d’invoquer une exception de l’article 9(2) RGPD et une base légale au sens de l’article 6 RGPD. L’EDPB reconnaît toutefois une difficulté pratique majeure : on ne sait pas toujours à l’avance si le web scraping va aspirer ce type de données avant que cela ne se produise8.
Sur cette base, l’EDPB s’appuie sur l’arrêt GC e.a. (C-136/17) de la CJUE9, rendu en matière de moteurs de recherche : la collecte incidente et résiduelle de données sensibles peut être tolérée si le responsable de traitement agit dans le cadre de ses responsabilités et met en place des mesures techniques et organisationnelles empêchant leur collecte et leur diffusion. Il n’existe toutefois pas d’exemption générale à l’article 9 RGPD et chaque affaire doit être apprécies au cas par cas10.
3. Conclusion
Retenons l’essentiel : l’innovation en IA générative ne dispense pas du respect du RGPD. Documenter ses sources, ses finalités et ses mesures de protection reste la meilleure façon de démontrer, le jour où on vous le demandera, que votre pipeline de web scraping tient la route.
Le RGPD n’est toutefois qu’une pièce du puzzle. Avant de lancer le web scraping sur un site tiers, mieux vaut vérifier aussi trois autres fronts tout aussi exposés : les pratiques du marché (un scraping massif et systématique peut être qualifié de pratique commerciale déloyale ou de concurrence parasitaire), le droit d’auteur et les droits sui generis sur les bases de données (le contenu scrapé est souvent protégé, même accessible publiquement, et les conditions d’utilisation du site peuvent l’interdire expressément) et enfin la sécurité (contourner un CAPTCHA, une authentification ou toute autre mesure technique de protection pour accéder aux données expose à un risque pénal et civil indépendant du RGPD). Une checklist scraping complète doit donc couvrir ces quatre volets.
A noter : la version 1.0 des lignes directrices reste en consultation publique jusqu’au 30 octobre 2026 et le cadre peut encore évoluer.
Notre département IP/IT/DATA est à votre écoute et sera ravi de vous aider en cas de questions ou d’accompagnement sur cette thématique.
Blandine de Lange et Agathe De Mol
Avocates