Ir al contenido

IA gobernada

Un modelo hereda todas las obligaciones que ya tenían sus datos

Añadir una función de IA no crea un régimen de cumplimiento nuevo. Mueve datos personales a un componente más difícil de inspeccionar, y las obligaciones viajan con ellos.

La pregunta que frena las funciones de IA en organizaciones reguladas rara vez es «¿funciona?». Es «¿qué pasa cuando alguien pide que borremos sus datos y parte de ellos entró en un prompt hace ocho meses?».

Esa pregunta tiene respuesta. Solo que es mucho más fácil darla si se diseñó pensando en ella que si se reconstruye contra una fecha límite.

La frontera está donde el dato sale de su control

Trace una línea: el punto en el que un dato personal pasa a algo que ya no puede inspeccionar. Un modelo alojado está al otro lado. También un almacén de vectores que usted no configuró. También un pipeline de logs que captura cuerpos de petición completos.

Todo lo que está al otro lado necesita respuesta a cuatro preguntas:

  1. Qué se envía — la lista de campos, no «el contexto del usuario»
  2. Dónde se procesa — jurisdicción, y bajo qué contrato
  3. Cuánto se conserva — en su lado, no en el suyo
  4. Qué ocurre al borrar — incluido todo lo derivado

Si una pregunta no tiene respuesta, ese es el hallazgo. Anótelo como una carencia, no como un riesgo a evaluar más adelante.

La recuperación es una copia, y una copia tiene su propia vida

Lo que los equipos modelan peor es la recuperación. Un documento indexado en embeddings es una copia derivada. Borrar la fila de origen no borra el vector, y un vector que sigue devolviendo los vecinos correctos sigue portando la información — que es exactamente lo que un regulador entiende por dato personal.

El patrón que funciona es aburrido:

  • Indexar por referencia y nunca por valor, para que el fragmento lleve un identificador y no el texto
  • Reconstruir en lugar de parchear cuando cambia el origen, porque una actualización parcial deja huérfanos
  • Dar al índice el mismo reloj de retención que al origen, aplicado por el mismo proceso

Los conjuntos de evaluación también son datos personales

Una batería de pruebas montada con conversaciones reales es un conjunto de datos de personas reales, guardado en un repositorio y copiado a cada portátil que lo clona. Necesita el mismo tratamiento que producción, o necesita ser sintético. Elija a conciencia; el accidente es no elegir ninguna de las dos.

Qué dejar por escrito antes del primer prompt en producción

PreguntaDónde va
Qué campos llegan al modeloMapa de flujos de datos
Qué encargado, con qué condicionesRegistro de tratamientos
Retención en su ladoContrato, luego registro
Vía de borrado, copias derivadas incluidasRunbook, probado
Qué cuesta una respuesta malaAnálisis de riesgo

Nada de esto frena una buena funcionalidad. Frena la que iba a pararse en revisión de todos modos, y la frena antes, cuando cambiar el diseño todavía es barato.

Todas las notas

Leer a continuación

Un modelo hereda todas las obligaciones que ya tenían sus datos — ISNDEV