Data poisoning & ataques al modelo
Más allá del prompt, los sistemas de ML/IA se atacan en su ciclo de vida: envenenando los datos de entrenamiento, robando o invirtiendo el modelo, o engañándolo con entradas adversarias. Estos ataques son la cara “clásica” de la seguridad del machine learning.
Taxonomía de ataques a ML
Sección titulada «Taxonomía de ataques a ML»Poisoning (envenenamiento) manipular los datos de ENTRENAMIENTO -> modelo con backdoor/sesgoEvasion (adversarial) entradas manipuladas que engañan al modelo EN INFERENCIAModel extraction/stealing reconstruir el modelo consultándolo (robo de propiedad intelectual)Model inversion / membership inferir datos de entrenamiento (privacidad) desde el modeloData poisoning
Sección titulada «Data poisoning»- inyectar ejemplos malos en el dataset -> degradar el modelo o insertar un BACKDOOR (p. ej. "si ve el trigger T, clasifica como benigno")- especialmente viable con datos de fuentes abiertas/colaborativas o reentrenamiento continuo- riesgo en la CADENA DE SUMINISTRO de datos y modelos (ver ai-llm LLM05)Ataques adversarios (evasión)
Sección titulada «Ataques adversarios (evasión)»- perturbaciones pequeñas e imperceptibles que cambian la clasificación (la imagen del "panda" que el modelo ve como "gibón")- en seguridad: malware adversario que evade un clasificador ML de AV/EDR- transferibilidad: un adversarial contra un modelo a menudo funciona contra otroRobo e inversión del modelo
Sección titulada «Robo e inversión del modelo»Extraction muchas consultas -> entrenar un modelo "clon" que imita al originalInversion reconstruir datos sensibles de entrenamiento desde las salidasMembership inference saber si un dato concreto estuvo en el entrenamiento (privacidad)-> riesgos de propiedad intelectual y de PRIVACIDAD (datos personales, grc-rgpd)Defensas
Sección titulada «Defensas»Poisoning validar/curar datos, procedencia y firma de datasets, detección de anomalías, entrenamiento robusto; controlar quién aporta datosEvasion adversarial training, detección de entradas adversarias, ensemblesRobo/priv. rate limiting y monitorización de consultas, privacidad diferencial, marcas de agua en el modelo, limitar detalle de las salidasGobernanza NIST AI RMF; inventario de modelos/datos y su cadena de suministroBlue Team / MLSecOps
Sección titulada «Blue Team / MLSecOps»- Proteger la cadena de suministro de datos y modelos: procedencia, firma, curación, quién aporta.
- Adversarial training y detección de entradas anómalas para clasificadores de seguridad (AV/EDR ML).
- Rate limiting + monitorización de consultas contra extracción/inversión; privacidad diferencial para datos sensibles.
- Gobernanza con NIST AI RMF; inventario de modelos/datasets y evaluación de riesgo (Gestión de riesgos).
Casos reales
Sección titulada «Casos reales»- Tay (Microsoft, 2016): envenenamiento por interacción pública degradó el bot en horas.
- Backdoors en modelos publicados (p. ej. pickles maliciosos en model hubs) → cargar un modelo ejecuta código.
- Investigación consolidada sobre adversarial examples que evaden clasificadores de imagen y de malware.
Checklist de prueba
Sección titulada «Checklist de prueba»- Evaluar la cadena de suministro de datos y modelos (procedencia/firma)
- Probar poisoning si hay reentrenamiento con datos externos
- Probar evasión adversaria (sobre todo en clasificadores de seguridad)
- Evaluar extracción/inversión/membership (privacidad e IP)
- Rate limiting y monitorización de consultas
- Defensas: adversarial training, detección de anomalías, DP
- Gobernanza y mapeo a ATLAS / NIST AI RMF