Donneespersonnelles.fr

Plateforme de veille en conformite numerique

Samedi 26 septembre 2026
RGPD

OCR documentaire : limiter les données extraites

Configurer une extraction OCR avec les seuls champs utiles, contrôler les erreurs et décider du sort du document original.

Un outil de reconnaissance optique de caractères transforme un document en texte exploitable. Il peut ainsi extraire beaucoup plus que le numéro ou la date recherchés. La revue RGPD doit porter sur le document envoyé, les champs conservés, les erreurs possibles et les copies créées pendant l’opération.

Ce qu’il faut retenir

  • L’extraction automatique reste un traitement de données personnelles lorsque le contenu en comporte.
  • Définissez les champs utiles avant d’envoyer tous les documents au service.
  • Les valeurs extraites doivent être vérifiées selon les conséquences d’une erreur.
  • La conservation de l’original et celle du résultat OCR répondent à des besoins distincts.

Décrire le document et le résultat nécessaire

Précisez le type de pièce, les pages utiles, les champs attendus et la décision prise à partir du résultat. Une facture, un formulaire et une pièce d’identité ne présentent pas le même contenu ni les mêmes obligations de conservation.

Les articles 5(1)(c) et 5(1)(d) du RGPD imposent minimisation et exactitude. L’article 25(1) appelle à intégrer les mesures appropriées dans la conception du traitement. RGPD.

Le parcours des copies d’identité doit être examiné si cette catégorie de document est concernée ; l’utilisation d’un OCR ne crée pas un droit supplémentaire de la collecter.

Construire une matrice document et champs

Étape Question à résoudre
Entrée Peut-on limiter les pages ou zones envoyées ?
Extraction Quels champs sont nécessaires au processus ?
Données annexes Le texte intégral est-il réellement utile ?
Validation Quelles erreurs doivent être contrôlées avant usage ?
Stockage Où restent le fichier, le texte et les résultats intermédiaires ?
Fin d’opération Que supprimer et que conserver avec justification ?

Exemple hypothétique : une équipe souhaite relever une référence et une date dans un document. Conserver le texte intégral, ses annexes et toutes les coordonnées n’est pas automatiquement nécessaire. Le paramétrage doit refléter le besoin défini, y compris dans les fichiers de diagnostic.

Organiser le contrôle de l’exactitude

Repérez les confusions possibles : caractère mal reconnu, date inversée, montant incomplet ou résultat rattaché au mauvais dossier. Un indicateur technique de confiance peut aider au tri ; il ne prouve pas, à lui seul, l’exactitude de chaque valeur.

Adaptez la vérification aux conséquences. Une information utilisée pour refuser un service ou modifier un dossier important appelle une maîtrise différente d’un classement documentaire réversible. Ce guide ne fixe pas de seuil numérique universel de confiance.

Prévoyez la correction de la valeur source et des copies utilisées ensuite. La rectification des bases dérivées permet de suivre les résultats d’une extraction erronée dans les outils connectés.

Qualifier le fournisseur et les usages du contenu

Si l’OCR est réalisé par un prestataire, examinez son rôle, les instructions, les accès, la conservation et les éventuels usages pour ses propres finalités. Une fonction présentée comme automatique peut impliquer des interventions humaines ou des outils complémentaires à vérifier.

Lorsque le prestataire agit comme sous-traitant, l’article 28(3) encadre le contrat et les obligations correspondantes. L’article 32(1) impose une sécurité adaptée aux données transmises. RGPD, chapitre IV.

La cartographie de la chaîne de sous-traitance aide à identifier les acteurs qui traitent le document, au-delà du seul nom commercial du service.

Décider du sort de l’original

Une extraction réussie ne signifie pas que l’original peut toujours être supprimé : des obligations ou besoins probatoires peuvent subsister. À l’inverse, conserver un original justifié ne rend pas nécessaire la conservation indéfinie de toutes les versions techniques.

Définissez séparément les durées du document, du texte extrait, des résultats intermédiaires et des traces. Protégez les accès à l’ensemble, puis vérifiez que la suppression prévue fonctionne chez chaque acteur concerné.

FAQ

L’OCR rend-il le document anonyme ?

Non. Il transforme sa représentation. Le texte extrait peut contenir les mêmes informations personnelles et être plus facile à rechercher ou à croiser.

Peut-on supprimer automatiquement le texte intégral après extraction ?

Cela peut être une mesure pertinente si le texte n’est plus nécessaire et si aucune obligation ne s’y oppose. Définissez le processus et vérifiez les copies intermédiaires.

Une relecture humaine est-elle obligatoire pour chaque résultat ?

Le RGPD impose notamment l’exactitude et des mesures adaptées, sans règle générale de relecture de chaque champ OCR. Organisez les contrôles selon les risques, les erreurs constatées et les conséquences de l’utilisation.

Recevez nos analyses pratiques sur la conformité RGPD dans la newsletter.

Thiébaut Devergranne, docteur en droit et fondateur de donneespersonnelles.fr, travaille depuis plus de vingt ans sur le droit des technologies et la protection des données.

Thiébaut Devergranne
Docteur en droit des nouvelles technologies (Paris II)

Docteur en droit, Thiébaut Devergranne travaille en droit des nouvelles technologies et en protection des données personnelles depuis plus de 20 ans. Il a accompagné des centaines d'organisations dans leur mise en conformité RGPD et est le fondateur de Legiscope, logiciel de conformité RGPD.

En savoir plus sur l'auteur →