Aller au contenu

IA encadrée

Un modèle hérite de toutes les obligations de vos données

Ajouter une fonction d'IA ne crée pas un nouveau régime de conformité. Cela déplace des données personnelles dans un composant plus difficile à inspecter, et les obligations suivent.

La question qui bloque les fonctions d'IA dans les organisations régulées est rarement « est-ce que ça marche ». C'est « que se passe-t-il quand quelqu'un demande l'effacement de ses données, et qu'une partie est passée dans un prompt il y a huit mois ».

Cette question a une réponse. Elle est simplement plus facile à donner quand on a conçu pour elle que quand on la reconstitue sous contrainte de calendrier.

La frontière est là où la donnée sort de votre contrôle

Tracez une ligne : le point où une donnée personnelle passe dans quelque chose que vous ne pouvez plus inspecter après coup. Un modèle hébergé est de l'autre côté. Un magasin de vecteurs que vous n'avez pas configuré aussi. Un pipeline de logs qui capture les corps de requête complets également.

Tout ce qui est de l'autre côté demande une réponse à quatre questions :

  1. Ce qui est envoyé — la liste des champs, pas « le contexte de l'utilisateur »
  2. Où c'est traité — juridiction, et sous quel contrat
  3. Combien de temps c'est conservé — chez eux, pas chez vous
  4. Ce qui se passe à l'effacement — y compris pour tout ce qui en est dérivé

Si une question n'a pas de réponse, c'est ça, le constat. Notez-le comme un manque, pas comme un risque à évaluer plus tard.

La recherche vectorielle est une copie, et une copie a sa propre durée de vie

Ce que les équipes sous-estiment le plus systématiquement, c'est la partie récupération. Un document indexé en embeddings est une copie dérivée. Supprimer la ligne source ne supprime pas le vecteur, et un vecteur qui renvoie toujours les bons voisins porte toujours l'information — ce qu'un régulateur appelle précisément une donnée personnelle.

Le motif qui fonctionne est ennuyeux :

  • Indexer par référence et jamais par valeur, pour que le fragment porte un identifiant et non le texte
  • Reconstruire plutôt que corriger quand la source change, parce qu'une mise à jour partielle laisse des orphelins
  • Donner à l'index la même horloge de rétention que la source, appliquée par le même job

Les jeux d'évaluation sont aussi des données personnelles

Une suite de tests constituée à partir de vraies conversations est un jeu de données de vraies personnes, posé dans un dépôt, copié sur chaque poste qui le clone. Il demande le même traitement que la production, ou il doit être synthétique. Choisissez délibérément ; l'accident, c'est de ne choisir ni l'un ni l'autre.

Ce qu'il faut écrire avant le premier prompt en production

QuestionOù ça se range
Quels champs atteignent le modèleCartographie des flux
Quel sous-traitant, sous quelles conditionsRegistre des traitements
Rétention de leur côtéContrat, puis registre
Chemin d'effacement, copies dérivées comprisesRunbook, testé
Ce que coûte une mauvaise réponseAnalyse de risque

Rien de tout cela ne ralentit une bonne fonctionnalité. Cela ralentit celle qui allait être arrêtée en revue de toute façon — et la ralentit plus tôt, quand changer la conception coûte encore peu.

Toutes les notes

À lire ensuite

Un modèle hérite de toutes les obligations de vos données — ISNDEV