IA générative et données personnelles : mode d’emploi
Prompts, documents, entraînement et réponses : identifiez les traitements de l’IA générative et préparez les garanties RGPD adaptées.
- Cartographier cinq emplacements de données
- Qualifier les acteurs pour chaque finalité
- Choisir une base légale sans confondre accès public et libre réutilisation
- Limiter les données envoyées et les connexions ouvertes
- Informer les personnes au bon niveau
- Prévenir les erreurs et organiser les droits
- Articuler le projet avec l’AI Act
- Décider si le projet peut démarrer
- Ce qu’il faut retenir
- FAQ
Une entreprise souhaite résumer des dossiers clients avec une IA générative. Le traitement ne se limite pas au prompt : les pièces jointes, les documents recherchés, la réponse, les journaux et une éventuelle réutilisation pour entraîner le modèle doivent aussi être examinés. La conformité se décide à partir de ces flux et de leurs finalités.
Il faut distinguer l’organisation qui utilise un service, celle qui développe un modèle et les prestataires qui interviennent pour leur compte. Une promesse d’absence d’entraînement est utile, mais ne répond pas à toutes les questions de protection des données.
Cartographier cinq emplacements de données
| Emplacement | Vérification à effectuer |
|---|---|
| Corpus d’apprentissage | Provenance, finalité, licéité, durée et droits des personnes |
| Paramètres du modèle | Présence éventuelle de données personnelles mémorisées et possibilités d’extraction |
| Prompts et pièces jointes | Données nécessaires, personnes concernées, destinataires |
| Base documentaire ou recherche externe | Sources consultées, habilitations et mise à jour |
| Réponses et journaux | Exactitude, accès, conservation et éventuelle réutilisation |
Le RGPD s’applique lorsqu’une opération porte sur des informations relatives à une personne identifiée ou identifiable. Une information fausse sur une personne peut également être une donnée personnelle : l’inexactitude ne la fait pas sortir du règlement. Le cadre général de l’IA et du RGPD doit donc être décliné pour chaque opération. Source : RGPD, Art. 4(1) et 4(2).
Un modèle entraîné avec des données personnelles n’est pas nécessairement lui-même un traitement de données personnelles dans tous les cas. Mais son anonymat ne se présume pas : la CNIL demande une analyse des moyens raisonnablement susceptibles d’être utilisés pour extraire ou obtenir ces données. Il faut distinguer le modèle de l’ensemble du système qui l’entoure. Source : CNIL, statut d’un modèle d’IA.
Qualifier les acteurs pour chaque finalité
L’entreprise qui choisit de résumer ses dossiers détermine généralement cette finalité. Le prestataire peut agir sur ses instructions pour fournir la fonction demandée, tout en ayant d’autres finalités propres pour certains traitements. La qualification doit être vérifiée dans les faits et dans les documents contractuels.
Le développement d’un modèle n’implique pas automatiquement que le développeur soit responsable autonome de tout entraînement. Un prestataire peut entraîner un système pour le compte d’un client, selon ses instructions. À l’inverse, une réutilisation pour constituer son propre produit appelle une analyse distincte. Sources : RGPD, Art. 4(7) et 4(8), Art. 28(10).
Le dossier de sous-traitance d’un service d’IA doit préciser les opérations couvertes, les instructions, les sous-traitants ultérieurs, les accès d’assistance, la suppression et l’assistance aux droits. Le rôle affiché dans un contrat ne dispense pas d’examiner les usages réels.
Choisir une base légale sans confondre accès public et libre réutilisation
L’entraînement, l’utilisation d’un dossier dans un prompt et la conservation des conversations peuvent poursuivre des finalités différentes. Identifiez une base légale pour chacune ; lorsqu’une nouvelle finalité est envisagée, examinez aussi les conditions de sa compatibilité ou le fondement autorisant ce nouveau traitement. Source : RGPD, Art. 5(1)(b), 6(1) et 6(4).
L’intérêt légitime peut être envisageable, mais il n’est pas une autorisation générale d’entraîner une IA sur le web. Il faut établir l’intérêt, la nécessité et la mise en balance des droits. Le contexte de publication, les attentes des personnes, les mesures de minimisation et les possibilités d’opposition comptent. La CNIL demande notamment de tenir compte des obstacles explicites au moissonnage, comme les dispositifs d’exclusion et les CAPTCHA. Source : CNIL, intérêt légitime et développement d’IA.
Les données sensibles appellent une exception de l’Art. 9(2) en plus de la base légale. L’exception des données manifestement rendues publiques par la personne elle-même, Art. 9(2)(e), ne couvre pas toute donnée accessible sur internet. Les données relatives aux infractions et condamnations relèvent du cadre particulier de l’Art. 10. Source : RGPD, Art. 9 et 10.
Limiter les données envoyées et les connexions ouvertes
Pour chaque usage autorisé, définissez les champs nécessaires. Un outil chargé de reformuler une réponse commerciale n’a pas nécessairement besoin du dossier complet du client. Retirer son nom ne suffit pas si un numéro, un historique ou une combinaison rare permet encore de le reconnaître.
Vérifiez aussi les connecteurs : recherche documentaire, messagerie, stockage, navigation et outils externes. Leurs accès peuvent étendre le périmètre au-delà de la conversation visible. Un système RAG, qui fournit au modèle des extraits documentaires, demande notamment une maîtrise des habilitations de recherche.
L’Art. 25 impose la protection des données dès la conception et par défaut ; l’Art. 32 requiert des mesures de sécurité adaptées. Conservez une configuration de référence, limitez les comptes administrateurs et définissez les actions à entreprendre si une donnée confidentielle est introduite par erreur. Source : RGPD, Art. 25(1), 25(2) et 32(1).
Un hébergement européen ne suffit pas à décrire les transferts : examinez les destinataires, les accès depuis l’étranger et les sous-traitants. Si un transfert vers un pays tiers existe, appliquez les conditions du chapitre V du RGPD au flux concerné. Source : RGPD, Art. 44.
Informer les personnes au bon niveau
L’information RGPD porte notamment sur les finalités, les bases légales, les destinataires, la conservation et les droits. Elle ne se réduit pas à la formule « nous utilisons de l’IA ». Pour une collecte indirecte, une dispense d’information individuelle suppose de remplir les conditions de l’Art. 14(5), notamment l’impossibilité ou les efforts disproportionnés dans le cas visé au point b. Le volume du corpus ne suffit pas, à lui seul, à présumer cette dispense. Source : RGPD, Art. 13, 14(1) à 14(3) et 14(5)(b).
La CNIL détaille les circonstances à apprécier et les mesures d’information générale à prévoir lorsque la dispense est justifiée. Si vous disposez de moyens de contact utiles, ne les ignorez pas sans analyse. Source : CNIL, information des personnes.
Prévenir les erreurs et organiser les droits
Une réponse générée n’est pas une preuve de la véracité d’un fait. Avant de l’intégrer à un dossier ou de l’utiliser contre une personne, vérifiez ses sources et les informations déterminantes. L’Art. 5(1)(d) impose des mesures raisonnables pour rectifier ou effacer sans tarder les données inexactes, compte tenu des finalités. Source : RGPD, Art. 5(1)(d).
Pour traiter une demande, localisez les données : corpus, modèle, document externe, prompt, journal ou réponse conservée. La suppression du document d’origine n’efface pas nécessairement ses autres copies ou ses effets sur le modèle.
La CNIL distingue les droits sur les corpus et sur les modèles soumis au RGPD. Elle décrit le réentraînement et, subsidiairement lorsqu’il est impossible ou disproportionné, des filtres dont l’efficacité et la robustesse doivent être démontrées. Un filtre empêche certains effets du modèle ; il ne signifie pas que les données ont été supprimées de ses paramètres. Expliquez à la personne ce qui a réellement été fait. Source : CNIL, exercice des droits en matière d’IA.
Les droits obéissent à leurs conditions propres ; ni leur refus systématique pour difficulté technique ni la promesse d’un effacement intégral instantané ne conviennent. Préparez un point de contact et une coopération avec les prestataires avant de recevoir les premières demandes.
Articuler le projet avec l’AI Act
Le fournisseur d’un modèle d’IA à usage général doit examiner l’Art. 53 : documentation technique, informations aux fournisseurs en aval, politique de respect du droit d’auteur et résumé public suffisamment détaillé du contenu d’entraînement. Les dispenses prévues pour certains modèles sous licence libre ne couvrent pas toutes ces obligations et ne s’appliquent pas aux modèles à risque systémique dans les mêmes conditions. Source : AI Act, Art. 53(1) et 53(2).
L’entreprise qui utilise un modèle ne devient pas automatiquement son fournisseur. Elle doit toutefois qualifier le système qu’elle met en œuvre et son propre rôle. Les obligations GPAI s’appliquent depuis le 2 août 2025, avec la transition de l’Art. 111(3) jusqu’au 2 août 2027 pour les modèles mis sur le marché avant cette première date. Source : AI Act, calendrier officiel.
L’Art. 50 distingue plusieurs obligations : information sur l’interaction avec une IA, marquage technique par les fournisseurs de systèmes générant des contenus, information par les déployeurs dans les cas des hypertrucages et de certains textes d’intérêt public. Les exceptions sont propres à chaque cas. Pour le marquage de l’Art. 50(2), le règlement 2026/1744 accorde jusqu’au 2 décembre 2026 aux systèmes déjà mis sur le marché avant le 2 août 2026 ; cette transition n’exempte pas globalement toutes les obligations de transparence. Sources : AI Act, Art. 50, règlement 2026/1744, Art. 1(39).
Décider si le projet peut démarrer
Pour une PME, le dossier de décision peut réunir le cas d’usage, la cartographie des flux, les bases légales, le contrat, les paramètres, la notice d’information, les durées et la procédure de droits. Déterminez si une AIPD est requise selon le risque du traitement ; l’étiquette « IA générative » ne rend pas, à elle seule, l’analyse obligatoire pour toute utilisation. Source : RGPD, Art. 35(1) et 35(3).
Préparez enfin les usages permis et interdits dans une charte d’utilisation de l’IA. Donnez aux salariés des exemples concrets de documents admis, de données à retirer et de situations nécessitant un avis préalable. Une charte signée ne remplace pas les garanties techniques et contractuelles.
Ce qu’il faut retenir
- Examinez séparément les données d’entraînement, le modèle, les entrées et les sorties.
- Qualifiez les rôles et les bases légales pour chaque finalité.
- Préparez la correction des réponses et les droits sur chaque emplacement des données.
- Les obligations de l’AI Act complètent le RGPD sans rendre licite un traitement qui ne l’est pas.
FAQ
L’absence de réutilisation pour l’entraînement suffit-elle ?
Non. Il reste à examiner la finalité du service, les destinataires, la conservation, la sécurité, les droits et les éventuels transferts.
Une information inventée sur une personne relève-t-elle du RGPD ?
Elle peut constituer une donnée personnelle dès lors qu’elle se rapporte à une personne identifiable. Son exactitude et ses conséquences doivent être examinées selon la finalité du traitement.
Faut-il effacer seulement le corpus d’apprentissage ?
Il faut déterminer où les données sont présentes et quels droits s’appliquent. Une action sur le corpus ne résout pas automatiquement leur présence dans un modèle ou une base documentaire distincte.
Recevez nos analyses pratiques de conformité dans la newsletter.
À propos de l’auteur. Thiébaut Devergranne est docteur en droit privé, titulaire du CAPA et fondateur de Legiscope. Il travaille depuis plus de vingt ans sur le droit des technologies et la protection des données.