Donneespersonnelles.fr

Plateforme de veille en conformite numerique

Vendredi 9 octobre 2026
RGPD

Scraping et RGPD : décider avant de collecter

Vérifiez sources, finalité, information et droits avant d’extraire des données personnelles publiques pour la prospection ou l’IA.

Une donnée visible sur internet n’est pas disponible pour n’importe quel usage. Le scraping de données personnelles doit être justifié dès la collecte, puis pour les utilisations qui suivent : enrichissement, prospection, revente ou développement d’un système d’IA.

La bonne décision se prend source par source et finalité par finalité. Une technique d’extraction n’est ni autorisée ni interdite dans l’absolu par son seul nom.

Décrire le projet avant de choisir une base légale

Précisez les sites, champs, volumes, personnes concernées, destinataires et usages. Expliquez pourquoi une collecte plus limitée ou une source moins intrusive ne permettrait pas d’atteindre l’objectif.

Les recommandations CNIL sur la réutilisation de données publiées distinguent plusieurs cas d’usage, dont les fichiers commerciaux. Le contexte de publication et les attentes raisonnables pèsent dans l’analyse.

L’Art. 6(1)(f) peut être mobilisé si ses conditions sont réunies : intérêt légitime, nécessité et mise en balance. Il ne constitue pas une autorisation par défaut. Les autres fondements ne doivent pas être exclus abstraitement ; leur pertinence dépend du projet et de ses conditions. Notre guide sur la réutilisation des données publiques complète cette qualification.

Examiner ce que la source permet réellement

Une coordonnée publiée pour répondre à une annonce n’autorise pas automatiquement son aspiration dans une base commerciale. Relevez le contexte, les restrictions de réutilisation et les oppositions exprimées.

Ne contournez pas des protections ou des restrictions pour élargir silencieusement la collecte. Les règles contractuelles, les droits sur les bases de données et les règles d’accès aux systèmes doivent également être examinés. Une conclusion RGPD favorable ne tranche pas ces autres questions.

Créez une fiche source : date de vérification, catégories collectées, finalité admise, exclusions et mécanisme de mise à jour. Cette fiche doit rester reliée aux données intégrées, afin de retrouver leur origine après un changement de site ou de fournisseur.

Prévoir l’information indirecte

L’Art. 14 du RGPD prévoit notamment l’information sur les catégories de données et leur source. Le paragraphe 3 impose un délai raisonnable d’au plus un mois, ou une information au plus tard lors du premier contact ou de la première communication à un autre destinataire lorsque ces événements interviennent avant.

Une notice publique ne remplace pas automatiquement l’information individuelle. Si vous invoquez l’impossibilité ou les efforts disproportionnés de l’Art. 14(5)(b), justifiez concrètement cette exception et prenez les mesures appropriées prévues par le texte. Le simple volume choisi pour votre projet n’efface pas l’obligation.

Attribuez dès le départ la gestion des demandes, l’identification des enregistrements et les opérations de rectification ou d’effacement. Sans provenance exploitable, ces tâches deviennent difficiles.

Distinguer collecte et droit de prospecter

La licéité de la constitution du fichier ne dispense pas des règles du canal. Selon la CNIL, l’email commercial B2C exige en principe un consentement préalable ; la sollicitation professionnelle pertinente peut relever d’un régime d’information et d’opposition.

Il serait donc inexact de déclarer toute prospection issue de données extraites illicite faute de consentement. Il serait tout aussi incorrect de considérer une adresse professionnelle publique comme une autorisation générale. Examinez séparément la collecte et le message envisagé.

Pour un usage commercial, la grille d’enrichissement du CRM avec traçabilité des sources suit l’origine de chaque champ. Contrôlez aussi les permissions des extensions de prospection, qui peuvent accéder à plus de données que celles que l’utilisateur souhaite extraire.

Traiter les données sensibles et les inférences

L’Art. 9(1) du RGPD interdit en principe certaines catégories de traitements, sous réserve des exceptions du paragraphe 2. La publication manifeste par la personne, prévue à l’Art. 9(2)(e), ne se déduit pas de la seule accessibilité d’une page.

Un commentaire d’un tiers n’équivaut pas à une publication par l’intéressé. Une photographie ne devient pas automatiquement une donnée biométrique au sens de l’Art. 9 : le traitement technique visant l’identification unique compte. Examinez aussi les informations sensibles que le rapprochement permet d’inférer.

Prévoyez des exclusions et un traitement des collectes incidentes. Ne laissez pas une extraction générale accumuler des informations que le projet n’a ni besoin ni droit d’utiliser.

Ajouter les garanties propres au développement d’une IA

La fiche CNIL sur le moissonnage pour l’IA présente des garanties additionnelles lorsque l’intérêt légitime est invoqué. Elle demande notamment de tenir compte des sites qui s’opposent clairement au moissonnage, par exemple au moyen de robots.txt ou de CAPTCHA.

Définissez les sources exclues, les données nécessaires, l’information, les moyens d’opposition et le traitement des données sensibles résiduelles. Évaluez la nécessité d’une AIPD selon les risques ; l’usage d’une IA ne transforme pas une source publique en jeu de données libre de contraintes.

Ce qu’il faut retenir

  • Qualifiez séparément la collecte et chaque réutilisation.
  • Conservez une provenance exploitable et respectez les oppositions.
  • Une notice publique ne remplace pas toujours l’information individuelle.
  • Les règles de prospection et les garanties propres à l’IA s’ajoutent à l’analyse générale.

FAQ

Le scraping est-il interdit par principe ?

Non. Il faut déterminer si le projet satisfait aux règles applicables. Le caractère automatisé de la collecte ne tranche pas seul sa licéité.

Une donnée publique est-elle anonyme ?

Non. Si elle concerne une personne identifiée ou identifiable, sa visibilité ne la fait pas sortir du RGPD.

Peut-on éviter l’information parce que la base est très grande ?

Pas automatiquement. Une exception de l’Art. 14(5) doit être établie et accompagnée des mesures requises ; la taille du fichier ne suffit pas à elle seule.

Recevez nos analyses pratiques sur la conformité : inscrivez-vous à la newsletter.

Thiébaut Devergranne est docteur en droit et fondateur de donneespersonnelles.fr. Il travaille depuis plus de vingt ans sur le droit des technologies et la protection des données personnelles.

Thiébaut Devergranne
Docteur en droit des nouvelles technologies (Paris II)

Docteur en droit, Thiébaut Devergranne travaille en droit des nouvelles technologies et en protection des données personnelles depuis plus de 20 ans. Il a accompagné des centaines d'organisations dans leur mise en conformité RGPD et est le fondateur de Legiscope, logiciel de conformité RGPD.

En savoir plus sur l'auteur →