RAG et RGPD : sécuriser la base et les réponses
RAG et RGPD : qualifiez les acteurs, limitez les documents, appliquez les habilitations et organisez la suppression dans toute la chaîne.
- Décomposer les traitements sans multiplier artificiellement les finalités
- Identifier qui décide des usages
- Justifier la finalité et sélectionner les documents
- Appliquer les habilitations avant la transmission au modèle
- Choisir un hébergement en fonction des flux réels
- Organiser la suppression et la rectification dans toute la chaîne
- Contrôler les réponses et les décisions qui en découlent
- Préparer la décision de mise en service
- Ce qu’il faut retenir
- FAQ
Un assistant documentaire peut révéler une information qu’un salarié ne pouvait pas consulter dans l’application d’origine. Le risque apparaît lorsque la recherche du RAG utilise des accès trop larges ou lorsque les extraits récupérés circulent au-delà du périmètre autorisé. Connecter une base documentaire à un modèle exige de maîtriser chaque copie et chaque accès.
Le RAG, ou génération augmentée par récupération, apporte au modèle des informations recherchées dans une source externe. Il facilite l’actualisation des connaissances, mais ne constitue ni une garantie d’exactitude ni une dispense du RGPD.
Décomposer les traitements sans multiplier artificiellement les finalités
Un dispositif peut extraire les documents, les découper, créer un index, rechercher des passages, les transmettre au modèle puis conserver une réponse ou des traces. Certaines architectures utilisent des représentations vectorielles ; d’autres combinent différents modes de recherche.
Dès lors que ces opérations portent sur des données personnelles, elles entrent dans la définition du traitement. Cela ne signifie pas que chaque opération technique exige nécessairement une finalité autonome ou une ligne séparée dans le registre : décrivez un ensemble cohérent et suffisamment précis. Source : RGPD, Art. 4(2).
| Composant | Données et accès à examiner |
|---|---|
| Documents sources | Contenu, personnes concernées, version et autorisations |
| Index et fragments | Texte copié, métadonnées, vecteurs et liens avec la source |
| Requête enrichie | Question de l’utilisateur et passages transmis au modèle |
| Réponse | Informations reproduites, sources affichées et destinataires |
| Historique et journaux | Copies conservées, accès techniques, durée et suppression |
Les vecteurs ne sont pas anonymes du seul fait qu’ils ne sont pas lisibles directement. Analysez ce qu’ils permettent d’apprendre avec les fragments, les métadonnées et les autres moyens disponibles. La qualification dépend de la possibilité de se rapporter à une personne identifiable. Source : RGPD, Art. 4(1).
Identifier qui décide des usages
La CNIL indique que l’organisme qui connecte un système à sa propre base de connaissances devient responsable du traitement de cette base lorsqu’elle contient des données personnelles. Ce rôle doit être articulé avec les autres opérations du système. Source : CNIL, questions-réponses sur l’IA générative, question 9.
Le fournisseur du modèle, l’hébergeur et l’intégrateur peuvent agir pour votre compte, mais leur qualification ne découle pas automatiquement de l’usage d’une API. Une réutilisation pour une finalité propre peut faire du prestataire un responsable autonome ; elle ne crée pas nécessairement une responsabilité conjointe. Cette dernière suppose une détermination conjointe des finalités et moyens. Source : RGPD, Art. 26(1), 28(3) et 28(10).
Préparez une matrice des opérations et vérifiez le contrat de sous-traitance IA pour celles effectuées sur instructions. Décrivez les autres traitements séparément, avec leurs destinataires et leurs fondements.
Justifier la finalité et sélectionner les documents
« Rendre toute l’entreprise interrogeable » est une finalité trop vague pour décider quelles données sont nécessaires. Préférez un usage délimité : retrouver les procédures validées du service client ou assister une équipe dans la recherche de clauses contractuelles.
L’intérêt légitime peut être envisagé selon le contexte, à condition de démontrer intérêt, nécessité et mise en balance. La base contractuelle suppose une nécessité objective pour le contrat avec la personne concernée ; elle n’est pas automatiquement applicable à tout chatbot client. Les données sensibles appellent en plus l’analyse de l’Art. 9. Source : RGPD, Art. 6(1)(b), 6(1)(f) et 9(2).
Sélectionnez les sources utiles, retirez les doublons et limitez les métadonnées. Un dossier RH ne doit pas être indexé parce qu’il se trouve dans le même espace qu’un guide d’accueil. Examinez la compatibilité d’une réutilisation avec la finalité initiale et adaptez l’information lorsque nécessaire. Source : RGPD, Art. 5(1)(b), 5(1)(c) et 6(4).
Appliquer les habilitations avant la transmission au modèle
Le contrôle doit empêcher qu’un extrait non autorisé entre dans le contexte envoyé au modèle. Demander ensuite au modèle de « ne pas révéler les secrets » ne constitue pas un contrôle d’accès fiable.
Concrètement, reliez l’identité de l’utilisateur aux autorisations de recherche, traitez les changements de droits et contrôlez les comptes techniques. Un compte de connexion partagé peut disposer de droits plus larges que ceux de l’utilisateur final : cette différence doit être prise en compte.
L’ANSSI distingue les données d’apprentissage des données additionnelles en production, sur lesquelles des droits peuvent être appliqués. Ses recommandations R7 et R8 demandent de cartographier les données et de traiter le besoin d’en connaître dès la conception. Il s’agit de recommandations de sécurité, à adapter au système. Source : ANSSI, guide du 29 avril 2024, recommandations R7 et R8.
Préparez des scénarios de vérification : un salarié change d’équipe, un contrat devient confidentiel, un document est retiré, un utilisateur demande des informations concernant un autre service. Examinez aussi les titres, liens et messages d’erreur : ils peuvent révéler une information même si le texte principal est masqué.
Choisir un hébergement en fonction des flux réels
La CNIL recommande de privilégier une solution sur site pour certains usages impliquant des données personnelles ou stratégiques, tout en admettant le recours à une infrastructure distante correctement encadrée. Ce choix doit tenir compte des ressources et des risques. Source : CNIL, questions-réponses, question 5.
Une base vectorielle en Europe ne signifie pas que les fragments restent en Europe : ils peuvent être envoyés à un modèle distant. Inversement, la nationalité du fournisseur ne suffit pas à décrire chaque flux. Vérifiez les lieux de traitement, l’assistance, les sous-traitants et les outils connectés, puis appliquez le chapitre V lorsqu’un transfert existe. Source : RGPD, Art. 44 à 46.
Un modèle ouvert installé localement peut réduire certains flux externes. Il ne supprime pas, par lui-même, les accès d’administration, la télémétrie ou les interconnexions. Documentez la configuration réellement retenue.
Organiser la suppression et la rectification dans toute la chaîne
Le RAG récupère des informations pendant l’utilisation ; cette opération ne modifie pas, par elle-même, les poids du modèle. Il peut néanmoins coexister avec une mémoire conversationnelle, des journaux ou une réutilisation pour un entraînement ultérieur. Une API dite sans état ne prouve donc pas l’absence de toute conservation chez le prestataire.
Lorsqu’une suppression est requise, examinez le document source, ses fragments, les représentations associées, les index secondaires, les caches et les réponses conservées. Prévenez une réintroduction lors de la prochaine synchronisation. La durée de chaque copie doit être justifiée par sa finalité ; elle ne doit pas survivre sans raison au besoin initial. Sources : RGPD, Art. 5(1)(e), Art. 16 et 17.
La CNIL souligne qu’une réponse contenant une information personnelle peut provenir de la base de connaissances plutôt que des paramètres du modèle. Il faut identifier ce composant pour traiter la demande auprès du bon responsable. Source : CNIL, exercice des droits en matière d’IA.
Maintenez une traçabilité proportionnée entre les extraits et leurs sources. Elle aide à corriger les données, traiter un droit d’accès et retrouver les versions. Elle n’autorise pas à conserver indéfiniment toutes les conversations ni à collecter davantage d’identifiants que nécessaire.
Contrôler les réponses et les décisions qui en découlent
Un passage retrouvé peut être obsolète, incomplet ou mal interprété. Vérifiez les sources citées et distinguez ce que le document établit de ce que le modèle ajoute. L’audit algorithmique doit couvrir les erreurs utiles au métier et les limites de la recherche, ainsi que les habilitations.
Si une réponse déclenche une décision automatisée significative, examinez l’article 22 et ses exceptions. La simple présence de documents dans le contexte ne rend pas licite une décision exclusivement automatisée. Source : RGPD, Art. 22(1) à 22(4).
Déterminez si une AIPD est nécessaire selon les risques, les listes applicables et les caractéristiques du traitement. Le fait d’utiliser un RAG ne suffit pas à rendre l’AIPD quasi systématiquement obligatoire. Consignez la justification, qu’elle conduise ou non à la réaliser. Source : RGPD, Art. 35(1), 35(3) et 35(4).
Préparer la décision de mise en service
Le dossier devrait réunir le périmètre documentaire, les rôles, la base légale, les contrats, les habilitations, les durées, la procédure de droits et les résultats des vérifications. Ajoutez les limites connues et les conditions de suspension du service. Les règles générales de l’IA générative et des données personnelles restent applicables à ce dispositif particulier.
Ce qu’il faut retenir
- Le RAG peut multiplier les copies et les destinataires d’un document.
- Appliquez les habilitations avant de transmettre les passages au modèle.
- Qualifiez les prestataires et les flux, sans déduire les rôles de l’architecture seule.
- Préparez la rectification et la suppression sur les sources, index, caches et réponses concernés.
FAQ
Le RAG modifie-t-il les poids du modèle ?
La récupération documentaire, à elle seule, ne les modifie pas. Vérifiez toutefois si le service conserve les données ou les réutilise pour d’autres opérations, notamment un entraînement ultérieur.
Une base vectorielle est-elle automatiquement anonyme ?
Non. Il faut examiner les vecteurs avec les fragments, les métadonnées et les moyens de rapprochement disponibles. Leur format numérique ne suffit pas à écarter le RGPD.
Une AIPD est-elle obligatoire pour tout RAG ?
Non. L’obligation dépend du risque du traitement et des cas prévus par les textes. Une analyse documentée doit précéder cette conclusion.
Recevez nos analyses pratiques de conformité dans la newsletter.
À propos de l’auteur. Thiébaut Devergranne est docteur en droit privé, titulaire du CAPA et fondateur de Legiscope. Il travaille depuis plus de vingt ans sur le droit des technologies et la protection des données.