Donneespersonnelles.fr

Plateforme de veille en conformite numerique

Mardi 29 septembre 2026
AI Act

Données synthétiques et IA : prouver la protection

Les données synthétiques ne sont pas toujours anonymes. Évaluez leur confidentialité, leur utilité et les garanties avant de les partager.

Remplacer un fichier client par un jeu de données artificielles peut réduire l’exposition des personnes. Mais le mot synthétique décrit une méthode de production, pas une garantie juridique d’anonymat. Le résultat peut conserver ou révéler des informations sur les individus présents dans les données sources.

La bonne question est donc double : le jeu produit protège-t-il suffisamment les personnes, et reste-t-il utile pour l’usage prévu ? Ces deux dimensions doivent être documentées avant un partage ou un entraînement.

Définir le jeu réellement produit

Certaines méthodes génèrent entièrement de nouveaux enregistrements ; d’autres ne remplacent que des variables ou combinent plusieurs procédés. La synthèse peut reposer sur un modèle statistique appris à partir de données réelles ou sur un modèle théorique de la situation étudiée. Cette différence compte pour déterminer quelles données personnelles interviennent dans la chaîne. Source : laboratoire de la CNIL, présentation des données synthétiques.

Cas d’usage Question préalable
Démonstration d’un logiciel Des cas fictifs conçus sans fichier réel suffisent-ils ?
Évaluation d’un traitement Quelles erreurs et situations rares faut-il représenter ?
Entraînement d’un modèle Quelles propriétés doivent être conservées pour la tâche visée ?
Partage externe Que peut apprendre le destinataire sur les personnes sources ?

N’exigez pas une reproduction très fidèle d’un fichier réel si le besoin consiste seulement à montrer une interface. À l’inverse, ne présentez pas un jeu conçu pour une démonstration comme une preuve de performance sur une population réelle.

Séparer le statut des sources, du générateur et des sorties

Si la génération utilise des données personnelles, leur collecte et leur traitement restent soumis au RGPD. Il faut donc justifier la finalité, la base légale, les données nécessaires, les accès et la conservation. Une sortie anonyme ne rend pas rétroactivement licite une collecte qui ne l’était pas. Sources : RGPD, Art. 4(1), 4(2), Art. 5(1), 6(1) et 6(4).

Le générateur peut aussi présenter un risque distinct du jeu exporté. Un accès libre au modèle, des requêtes répétées ou la publication de plusieurs jeux peuvent modifier ce qu’un tiers est en mesure d’apprendre. La qualification du modèle d’IA au regard du RGPD doit donc être examinée séparément de celle d’un fichier produit. Source : CNIL, statut du modèle.

Les données pseudonymisées restent des données personnelles. L’anonymisation suppose que l’identification ne soit plus raisonnablement possible dans le contexte considéré. La synthèse peut contribuer à un processus d’anonymisation, mais elle n’est ni toujours distincte de celui-ci ni automatiquement suffisante. Source : CNIL, anonymisation des données personnelles.

Évaluer les risques de confidentialité

Le laboratoire de la CNIL relève notamment des possibilités d’inférence d’appartenance et d’attributs à partir de données synthétiques. Le risque dépend des données, du procédé et des accès disponibles. Une affirmation générale de confidentialité du fournisseur ne permet donc pas de qualifier tous ses résultats d’anonymes. Source : laboratoire de la CNIL, risques des données synthétiques.

Préparez une analyse adaptée au destinataire et au contexte :

  • rechercher la reproduction d’enregistrements ou de passages sources ;
  • examiner les combinaisons rares qui pourraient isoler une personne ;
  • évaluer les rapprochements possibles avec des informations accessibles ailleurs ;
  • examiner si la présence d’une personne ou une caractéristique peut être inférée ;
  • tenir compte des accès au générateur et des publications cumulées.

Ces examens sont des moyens d’étayer l’analyse ; aucun résultat isolé ne constitue un certificat juridique. L’absence de doublon exact, par exemple, ne répond pas à toutes les possibilités d’inférence. Indiquez ce qui a été étudié et les limites de l’évaluation.

La CNIL retient les critères d’individualisation, de corrélation et d’inférence pour apprécier les procédés d’anonymisation. Elle demande également une veille pour préserver l’efficacité de la protection dans le temps. Un jeu partagé dans un cercle fermé et le même jeu publié en accès libre n’appellent pas nécessairement la même appréciation. Source : CNIL, anonymisation.

Comprendre ce que garantit la confidentialité différentielle

La confidentialité différentielle apporte un cadre mathématique pour borner la perte de confidentialité liée à la contribution aux données. Sa garantie dépend notamment de ses paramètres, de l’unité protégée et de la composition des analyses. Un même epsilon ne permet pas de comparer sans précaution des mécanismes dont les hypothèses diffèrent. Source : NIST SP 800‑226 final, sections 2.2 à 2.5.

Demandez au prestataire quelle unité est protégée — par exemple une personne ou un événement —, quels paramètres sont appliqués et comment les utilisations répétées sont prises en compte. Vérifiez aussi que l’implémentation correspond à la garantie annoncée. Le NIST souligne les risques pratiques qui peuvent apparaître entre un cadre mathématique et un produit logiciel.

Cette méthode ne constitue pas une dispense RGPD automatique ni un seuil légal universel d’anonymisation. La conclusion juridique doit rester liée au contexte, aux moyens d’identification et aux garanties effectivement mises en œuvre. Les données sources et leurs accès doivent rester protégés même si les sorties bénéficient d’un mécanisme de confidentialité différentielle.

Mesurer l’utilité sur la tâche visée

La ressemblance statistique globale ne suffit pas. Un jeu peut reproduire correctement une moyenne tout en représentant mal les cas rares ou les relations utiles à la décision. Le NIST relève que les procédés synthétiques peuvent ajouter de l’incertitude ou dégrader la précision pour certaines sous-populations. Source : NIST SP 800‑226, section 3.6.

Fixez donc les usages autorisés et des critères d’acceptation : variables utiles, situations couvertes, erreurs tolérables et populations représentées. Comparez le comportement du système sur des données d’évaluation appropriées dont la provenance et l’utilisation sont licites. Ne supposez pas qu’augmenter le nombre d’enregistrements artificiels augmente nécessairement la diversité réelle des situations.

Distinguez aussi la protection de la confidentialité et la qualité du modèle. Une méthode protectrice peut produire un jeu peu utile ; un jeu très performant peut rester risqué à partager. Ces dimensions doivent apparaître séparément dans votre audit algorithmique.

Appliquer le cadre de l’AI Act au bon périmètre

L’Art. 10 de l’AI Act prévoit, pour les systèmes à haut risque qui entraînent des modèles à l’aide de données, des exigences de gouvernance et de qualité des jeux d’entraînement, de validation et de test. L’Art. 10(3) vise notamment leur pertinence et leur représentativité suffisante, avec une absence d’erreurs et une complétude dans toute la mesure du possible. Le recours à des données synthétiques n’efface pas ces exigences. Source : AI Act, Art. 10(1) à 10(4).

Au 26 septembre 2026, il faut tenir compte du calendrier modifié : les sections 1 à 3 du chapitre III, sauf l’Art. 6(5), s’appliquent le 2 décembre 2027 aux systèmes de l’annexe III et le 2 août 2028 à ceux de l’annexe I. La documentation et les évaluations peuvent être préparées avant ces échéances, sans présenter toutes ces exigences comme déjà applicables à tout projet. Source : règlement 2026/1744, Art. 1(40).

Le même règlement introduit un article 4 bis sur certains traitements exceptionnels de données sensibles pour détecter et corriger les biais. Il faut notamment établir que l’objectif ne peut pas être atteint efficacement avec d’autres données, dont des données synthétiques ou anonymisées. Cela ne constitue pas une obligation générale de fabriquer des données sensibles artificielles ni une autorisation générale d’utiliser des données sensibles réelles. Source : règlement 2026/1744, Art. 1(6).

Préparer le dossier de partage

Avant de remettre un jeu à un destinataire, réunissez une fiche comportant :

  1. La finalité, la source et la méthode de génération.
  2. Le statut retenu pour les sources, le générateur et les sorties.
  3. Les risques d’identification examinés, les résultats et les limites.
  4. Les usages pour lesquels l’utilité a été vérifiée.
  5. Les destinataires, les accès, les restrictions et la durée retenue.
  6. Les circonstances imposant un réexamen ou un retrait du jeu.

Lorsque la génération est confiée à un prestataire agissant pour votre compte, le contrat de sous-traitance IA doit encadrer les instructions, la sécurité, les autres intervenants et le sort des données sources. Une clause disant « propriété des données synthétiques au client » ne règle pas ces obligations. Source : RGPD, Art. 28(3).

Déterminez aussi si une AIPD est nécessaire pour le traitement des sources : l’obligation dépend des risques et des critères applicables, pas de la seule présence d’un générateur. Gardez la documentation technique cohérente avec le jeu effectivement utilisé, notamment après un changement de méthode ou de destinataire.

Ce qu’il faut retenir

  • « Synthétique » ne signifie pas automatiquement « anonyme ».
  • Évaluez séparément sources, générateur, sorties et conditions de partage.
  • Documentez les garanties techniques sans les transformer en exemption juridique.
  • Mesurez l’utilité pour une tâche précise et réexaminez les risques lorsque le contexte change.

FAQ

Peut-on utiliser des données synthétiques hors du RGPD ?

Oui si elles ne constituent pas des données personnelles dans le contexte considéré. Cette conclusion doit être justifiée ; le traitement de données personnelles en amont reste soumis au règlement.

Retirer les noms puis générer de nouvelles lignes suffit-il ?

Non. Des attributs rares, des rapprochements ou des inférences peuvent encore révéler des informations sur les personnes. Il faut examiner le procédé et les accès possibles.

La confidentialité différentielle garantit-elle juridiquement l’anonymat ?

Elle peut apporter une garantie technique importante, sous ses hypothèses et paramètres. Elle ne remplace pas l’analyse juridique du contexte ni la vérification de l’implémentation.

Recevez nos analyses pratiques de conformité dans la newsletter.

À propos de l’auteur. Thiébaut Devergranne est docteur en droit privé, titulaire du CAPA et fondateur de Legiscope. Il travaille depuis plus de vingt ans sur le droit des technologies et la protection des données.

Thiébaut Devergranne
Docteur en droit des nouvelles technologies (Paris II)

Docteur en droit, Thiébaut Devergranne travaille en droit des nouvelles technologies et en protection des données personnelles depuis plus de 20 ans. Il a accompagné des centaines d'organisations dans leur mise en conformité RGPD et est le fondateur de Legiscope, logiciel de conformité RGPD.

En savoir plus sur l'auteur →