Données en open data : décider ce qui peut être publié
Avant une publication en open data, vérifiez le cadre légal, les identifiants indirects, les recoupements et les versions du jeu.
Un jeu de données paraît anonyme après retrait des noms. Mais ses adresses, dates et événements rares peuvent permettre de retrouver les personnes dans d’autres sources. L’ouverture au public exige une décision spécifique : un fichier adapté à un cercle de partenaires ne l’est pas nécessairement à une diffusion libre.
Distinguer obligation publique et publication volontaire
Pour les documents relevant du code des relations entre le public et l’administration, l’Art. L. 312-1-2 prévoit notamment l’occultation des mentions protégées et un traitement empêchant l’identification, sous les exceptions prévues. Le texte prévoit aussi des catégories fixées par décret pouvant être publiées sans ce traitement. Il ne faut donc affirmer ni que tout document public est publiable intégralement, ni que toute donnée personnelle doit toujours être retirée. Source : Légifrance.
La CNIL précise l’articulation entre contenu, secrets et publication. Une entreprise privée qui publie volontairement une base ne peut pas s’attribuer les obligations ou exceptions d’une administration sans vérifier leur champ.
Si des données personnelles restent présentes, identifiez le fondement applicable, l’information et les autres conditions du RGPD. Une licence ouverte ne remplace pas cette analyse.
Préparer une fiche de décision par jeu
| Champ | Question à résoudre |
|---|---|
| Origine | Qui a collecté les données et dans quel cadre ? |
| Publication | Obligation précise ou objectif volontaire ? |
| Contenu | Identifiants directs, indirects et mentions protégées ? |
| Transformations | Suppression, regroupement, réduction de précision ? |
| Recoupements | Quelles autres sources rendent une personne reconnaissable ? |
| Actualisations | Les versions successives révèlent-elles des différences individuelles ? |
| Validation | Qui approuve, avec quelles limites et quelle prochaine revue ? |
La fiche conserve le raisonnement, pas seulement une case « anonymisé ». Elle doit porter sur le fichier qui sera effectivement diffusé, y compris les onglets, propriétés et commentaires.
Éprouver les recoupements plausibles
La CNIL distingue individualisation, corrélation et inférence pour apprécier l’anonymisation. Le remplacement d’un nom par un code ne suffit pas lorsque la personne reste identifiable. Source : CNIL, anonymisation.
Exemple hypothétique. Une collectivité veut publier les demandes reçues par équipement. Une ligne comportant une date précise, un quartier et une catégorie rare peut révéler le demandeur à un voisin. Le regroupement dans le temps et l’espace doit être évalué avec l’utilité attendue, plutôt que de conserver chaque ligne par principe.
Les tableaux à petits effectifs illustrent ces risques. Vérifiez aussi les différences entre deux publications : un total mensuel et un total presque identique peuvent dévoiler une information individuelle par soustraction.
Choisir une forme de diffusion adaptée
Le besoin de transparence ou de recherche peut parfois être satisfait par des agrégats, une précision réduite ou un jeu limité. Lorsque des données identifiantes demeurent nécessaires à un projet déterminé, un accès contrôlé peut être préférable à l’ouverture générale, si le cadre juridique le permet.
Le plan d’accès d’un consortium de recherche montre comment limiter les jeux aux missions autorisées. Il ne remplace pas les obligations de publication lorsqu’un texte les impose ; il constitue une option pour d’autres usages.
Organiser la correction après mise en ligne
Conservez les versions publiées et leur date, un point de contact et un mécanisme de retrait ou de correction. Une publication peut être copiée ailleurs : supprimer le fichier source n’assure pas la disparition de toutes les copies.
Si vous découvrez une divulgation non autorisée de données personnelles, analysez les Art. 33 et 34 et prenez les mesures adaptées. N’attendez pas la prochaine version statistique pour traiter un risque identifié. Les contrôles de questionnaire annoncé anonyme sont également utiles pour remonter jusqu’aux données sources.
Ce qu’il faut retenir
- Déterminez le régime de publication avant de préparer le fichier.
- Analysez les identifiants indirects et les versions successives.
- Une licence de réutilisation ne démontre ni l’anonymat ni la licéité.
FAQ
Une donnée déjà sur Internet peut-elle être republiée librement ?
Pas automatiquement. Sa disponibilité ne supprime pas les règles applicables aux traitements personnels, aux secrets et aux conditions de publication.
Le retrait des noms suffit-il ?
Non. Des lieux, dates, événements et combinaisons de valeurs peuvent encore identifier les personnes.
Recevez nos analyses pratiques sur la conformité RGPD dans la newsletter.
Thiébaut Devergranne, docteur en droit et fondateur de donneespersonnelles.fr, travaille depuis plus de vingt ans sur le droit des technologies et la protection des données.