Definición en una oración
Para esta guía, los datos sensibles son un término práctico para la información que puede causar daño a la privacidad, seguridad, negocio o personal si se expone, se malutiliza o se comparte sin los controles adecuados.
Respuesta rápida
Los datos sensibles son más amplios que la información de identificación personal. Pueden incluir datos personales, credenciales, registros financieros, información de salud, detalles de empleo, documentos comerciales confidenciales, comunicaciones privadas, registros de clientes, código propietario, hallazgos de seguridad y detalles del sistema interno.
El significado legal exacto de los datos sensibles varía según la jurisdicción, la política, el sector y el contexto. Este artículo no es asesoría legal. Ofrece una perspectiva práctica para la seguridad en el uso de IA: antes de pegar, subir, recuperar o generar alrededor de información, pregúntese si la exposición podría dañar a una persona, cliente, empleador, socio, producto o sistema.
¿Por qué es importante
Las herramientas de IA hacen que el intercambio de datos se sienta informal. Un usuario puede pegar un contrato, un ticket de soporte, una hoja de cálculo, un archivo de origen, una nota médica o un mensaje privado en un cuadro de chat en segundos. Esa velocidad es útil, pero puede saltarse las comprobaciones normales que aplicarían a la misma información en correo electrónico, almacenamiento, análisis o sistemas de clientes.
NIST considera la gestión de riesgos de privacidad como parte de la gestión del riesgo empresarial, prestando atención a cómo los datos sobre individuos fluyen a través de sistemas, productos y servicios [1]. La IA generativa agrega más preguntas de flujo de trabajo: qué datos entran en la herramienta, qué puede recuperar la herramienta, qué se retiene, quién puede ver los registros y si la salida podría revelar algo privado o confidencial [2].
OWASP describe la divulgación de información sensible como un riesgo importante para aplicaciones de LLM y de IA generativa, incluyendo información personal, detalles financieros, registros médicos, datos comerciales confidenciales, credenciales de seguridad y documentos legales [3]. Esos ejemplos son útiles, pero no son la lista completa. El hábito más seguro es pensar en términos de posible daño y autorización.
Cómo funciona
El riesgo de datos sensibles puede ingresar en un flujo de trabajo de IA en varios puntos. Un usuario puede pegar datos en una consulta. Un producto puede recuperar documentos privados. Una herramienta puede llamar a una base de datos. Los registros pueden almacenar la solicitud. La salida del modelo puede revelar detalles de la fuente. Un compañero puede compartir la salida más ampliamente de lo permitido originalmente.
La buena práctica comienza con la minimización de datos. Usa la menor cantidad de información necesaria para la tarea. Elimina nombres, números de cuenta, secretos, direcciones exactas, IDs internos y secciones innecesarias de documentos cuando no sean necesarios. El Marco de Privacidad de NIST describe la gestión de datos de forma consistente con la estrategia de riesgo organizacional y identifica explícitamente la minimización de datos como un principio de privacidad [1].
Las herramientas aprobadas importan. Los diferentes productos de IA tienen diferentes términos, configuraciones de retención, controles de administrador, opciones de uso de entrenamiento, comportamiento de registro y acuerdos de procesamiento de datos. Los usuarios no deben afirmar que todos los proveedores entrenan con prompts, y no deben afirmar que ningún proveedor nunca lo hace. La pregunta correcta es: ¿qué permite este producto aprobado, plan, configuración y contrato hoy?
Los controles de acceso también son importantes. Un asistente de recuperación aumentada no debe recuperar documentos que un usuario no esté autorizado a ver. Un asistente de programación no debe exponer secretos de un repositorio. Una herramienta de soporte no debe revelar otro registro de cliente. La compartición por necesidad de saber aplica a los flujos de trabajo de IA tal como aplica a otros software.
Ejemplo de flujo completo
Imagina que un gerente quiere que un asistente de IA resuma comentarios de empleados. El archivo sin procesar incluye nombres, problemas de rendimiento, notas de licencia médica, preocupaciones salariales y quejas privadas. Pegar el archivo completo en una herramienta general es riesgoso incluso si el objetivo es inofensivo.
Un mejor flujo de trabajo comienza verificando si la herramienta está aprobada para esa clase de datos. El gerente elimina nombres y detalles innecesarios, mantiene solo los temas necesarios para el resumen, almacena el archivo original en el sistema aprobado y solicita un resumen agregado que no revele historias individuales. Incluso así, una persona debe revisar la salida en busca de pistas de reidentificación antes de compartirla.
Mito común
Una creencia común es que la censura garantiza la seguridad. La censura puede reducir el riesgo, pero puede fallar si los detalles restantes identifican a una persona, cliente, empresa, incidente o sistema. La pseudonimización también reduce la identificación directa, pero no garantiza la anonimidad cuando quedan otras pistas.
Otra equivocación es pensar que los datos sensibles solo significan datos personales. Una clave de API privada, una cartera de producto no revelada, un contrato de cliente, un informe de vulnerabilidad, un fragmento de código propietario, una cartera de ventas o una investigación interna pueden ser sensibles incluso si no contienen ningún nombre de persona.
Riesgos y limitaciones
Los errores con datos sensibles pueden provocar daño a la privacidad, compromiso de cuentas, pérdida de confianza de los clientes, exposición de propiedad intelectual, daño laboral, revisión reguladora o incidentes de seguridad. El riesgo puede provenir de la consulta, documentos recuperados, salida generada, registros, complementos, enlaces compartidos o resúmenes copiados.
La reducción de riesgos no es una garantía. Las herramientas aprobadas, controles de acceso, supresión, pseudonimización, configuraciones de retención y controles contractuales todos ayudan, pero no hacen que cada uso sea seguro. Cuando los datos son altamente sensibles o las reglas son poco claras, la elección más segura podría ser evitar usar una herramienta de IA hasta que el propietario apruebe el flujo de trabajo.
Lista de verificación de juicio práctico
Antes de usar datos con IA, pregúntese: ¿Esta herramienta está aprobada para estos datos? ¿Necesita la tarea los datos sin procesar? ¿Puedo eliminar identificadores o detalles? ¿Podría la salida exponer a una persona, cliente, secreto, contrato, código o sistema? ¿Quién puede ver los registros y las conversaciones compartidas? ¿Qué configuraciones de retención y uso de entrenamiento aplican?
Para uso en el lugar de trabajo, sigue la regla más estricta cuando haya dudas. Usa herramientas aprobadas, acceso con privilegios mínimos, compartición basada en necesidad de conocer, y retención documentada. No pases credenciales, secretos, registros privados de clientes o documentos confidenciales en sistemas no aprobados. Cuando haya dudas, pregunta al propietario de los datos o al líder de seguridad o privacidad antes de compartir.