El problema
- PII en bruto en cada prompt de IA.Principio de minimización del RGPD Art. 5 vulnerado.
- El proveedor retiene los datos del prompt.Datos personales almacenados por un tercero.
- Sin trazabilidad de datos personales.Solicitudes DSAR imposibles de atender.
La solución
Los datos personales nunca llegan al modelo.
PII extraído y reemplazado con tokens en el edge antes de que el prompt llegue a ningún LLM. El modelo ve [PERSONA_1] y [EMAIL_1] — nunca "Juan García" ni "[email protected]". Tokenización reversible: la respuesta se de-anonimiza automáticamente.
GDPR Art. 5(1)(c)
"Personal data shall be adequate, relevant and limited to what is necessary in relation to the purposes for which they are processed — the data minimisation principle."
Cada identificador reemplazado por un token consistente y reversible. El modelo razona, nunca expone.
Preguntas frecuentes
¿Esto es anonimización o seudonimización?
Técnicamente seudonimización (RGPD Art. 4(5)): los tokens son reversibles mediante un mapa que reside en tu infraestructura. La anonimización real (Considerando 26) es irreversible. El modelo solo ve tokens seudonimizados, nunca identidades reales.
¿El LLM sigue dando respuestas útiles sin nombres reales?
Sí. La PII se sustituye por tokens consistentes ([PERSONA_1], [EMAIL_2]), preservando la gramática y las relaciones, y la respuesta se des-anonimiza en el camino de vuelta para que tus usuarios vean los valores reales.
¿Cómo cumple la minimización de datos (Art. 5)?
El proveedor recibe solo lo que la tarea necesita — nunca identificadores directos — lo que es minimización de datos aplicada en la capa de arquitectura en lugar de por política.
¿Dónde se almacena el mapa token↔PII?
En tu propia infraestructura. Nunca se transmite al modelo, así que la clave de re-identificación permanece bajo tu control exclusivo.