Saltearse al contenido

Data poisoning & ataques al modelo

Más allá del prompt, los sistemas de ML/IA se atacan en su ciclo de vida: envenenando los datos de entrenamiento, robando o invirtiendo el modelo, o engañándolo con entradas adversarias. Estos ataques son la cara “clásica” de la seguridad del machine learning.

Poisoning (envenenamiento) manipular los datos de ENTRENAMIENTO -> modelo con backdoor/sesgo
Evasion (adversarial) entradas manipuladas que engañan al modelo EN INFERENCIA
Model extraction/stealing reconstruir el modelo consultándolo (robo de propiedad intelectual)
Model inversion / membership inferir datos de entrenamiento (privacidad) desde el modelo
- inyectar ejemplos malos en el dataset -> degradar el modelo o insertar un BACKDOOR
(p. ej. "si ve el trigger T, clasifica como benigno")
- especialmente viable con datos de fuentes abiertas/colaborativas o reentrenamiento continuo
- riesgo en la CADENA DE SUMINISTRO de datos y modelos (ver ai-llm LLM05)
- perturbaciones pequeñas e imperceptibles que cambian la clasificación
(la imagen del "panda" que el modelo ve como "gibón")
- en seguridad: malware adversario que evade un clasificador ML de AV/EDR
- transferibilidad: un adversarial contra un modelo a menudo funciona contra otro
Extraction muchas consultas -> entrenar un modelo "clon" que imita al original
Inversion reconstruir datos sensibles de entrenamiento desde las salidas
Membership inference saber si un dato concreto estuvo en el entrenamiento (privacidad)
-> riesgos de propiedad intelectual y de PRIVACIDAD (datos personales, grc-rgpd)
Poisoning validar/curar datos, procedencia y firma de datasets, detección de anomalías,
entrenamiento robusto; controlar quién aporta datos
Evasion adversarial training, detección de entradas adversarias, ensembles
Robo/priv. rate limiting y monitorización de consultas, privacidad diferencial,
marcas de agua en el modelo, limitar detalle de las salidas
Gobernanza NIST AI RMF; inventario de modelos/datos y su cadena de suministro
  • Proteger la cadena de suministro de datos y modelos: procedencia, firma, curación, quién aporta.
  • Adversarial training y detección de entradas anómalas para clasificadores de seguridad (AV/EDR ML).
  • Rate limiting + monitorización de consultas contra extracción/inversión; privacidad diferencial para datos sensibles.
  • Gobernanza con NIST AI RMF; inventario de modelos/datasets y evaluación de riesgo (Gestión de riesgos).
  • Tay (Microsoft, 2016): envenenamiento por interacción pública degradó el bot en horas.
  • Backdoors en modelos publicados (p. ej. pickles maliciosos en model hubs) → cargar un modelo ejecuta código.
  • Investigación consolidada sobre adversarial examples que evaden clasificadores de imagen y de malware.
  • Evaluar la cadena de suministro de datos y modelos (procedencia/firma)
  • Probar poisoning si hay reentrenamiento con datos externos
  • Probar evasión adversaria (sobre todo en clasificadores de seguridad)
  • Evaluar extracción/inversión/membership (privacidad e IP)
  • Rate limiting y monitorización de consultas
  • Defensas: adversarial training, detección de anomalías, DP
  • Gobernanza y mapeo a ATLAS / NIST AI RMF