Entrada
#Divulgación

Contenido educativo 3 – INCIBE – Anomalías y aprendizaje automático

5 octubre, 2025
AnomalíasAprendizaje automáticoCiberseguridadINCIBE

La detección de anomalías en Inteligencia Artificial (IA) es un campo de estudio fundamental dentro del aprendizaje automático y se relaciona con la identificación de patrones inusuales o anormales en grandes volúmenes de datos.

¿Qué es una anomalía en IA?

Una anomalía, también conocida como valor atípico (outlier) o rareza, es un elemento, suceso u observación que se desvía significativamente de la mayoría de los datos y no se ajusta a una noción bien definida de comportamiento normal.

En términos simples, cuando un sistema de IA analiza datos, intenta decidir si una nueva observación pertenece a la distribución esperada (es un inlier o dato normal) o si es diferente y debe considerarse un outlier. Estas desviaciones son importantes porque pueden indicar que el dato fue generado por un mecanismo distinto al habitual.

Por ejemplo, mientras que un aumento promedio en el tráfico de un sitio web se consideraría normal, un pico de tráfico inesperado y muy superior a la media es una anomalía, la cual podría indicar tanto una ciberamenaza como una campaña de marketing exitosa.

¿Qué tipos de anomalías existen? (Enfoques de Detección)

Las técnicas de detección de anomalías se clasifican generalmente en tres grandes categorías, dependiendo de cómo estén etiquetados los datos de entrenamiento:

  1. Detección No Supervisada (Outlier Detection):
    • Este es el enfoque más común, ya que los datos no están etiquetados.
    • Se asume que las anomalías ya están presentes, o «contaminan», el conjunto de datos de entrenamiento.
    • Los algoritmos intentan ajustarse a las regiones donde la mayoría de los datos están concentrados (el comportamiento normal), ignorando las observaciones desviadas.
    • Se espera que las anomalías se encuentren en regiones de baja densidad de datos.
  2. Detección Semisupervisada (Novelty Detection):
    • Se utiliza cuando el conjunto de datos de entrenamiento está «limpio» y no está contaminado por anomalías.
    • El objetivo es construir un modelo robusto que represente únicamente el comportamiento normal o regular.
    • Una vez entrenado, el sistema busca detectar si una nueva observación (o novelty) es significativamente diferente de la distribución normal aprendida, es decir, si cae fuera de la frontera definida.
  3. Detección Supervisada:
    • Este enfoque requiere que los datos estén completamente etiquetados como «normales» o «anormales».
    • Implica el entrenamiento de un clasificador que aprende a distinguir entre ambas clases.
    • Este método se usa con menos frecuencia en la práctica debido a la escasez general de datos de anomalías etiquetados y a la naturaleza inherentemente desequilibrada de las clases (las anomalías son mucho menos comunes que los datos normales).

¿Cómo se estudian y para qué?

1. Propósito (¿Para qué se estudian las anomalías?)

Las anomalías se estudian por varias razones cruciales, especialmente porque las propias anomalías a menudo representan las observaciones más importantes o deseables de encontrar en un conjunto de datos:

  • Ciberseguridad y Detección de Fraudes: La detección de anomalías es fundamental para identificar actividades ilícitas y amenazas como la detección de intrusos en la red, ciberataques (inyección SQL, denegación de servicio), o fraude financiero (como el robo de identidad o el blanqueo de capitales).
  • Mantenimiento Predictivo: En la industria y la fabricación, se utiliza para monitorizar el estado de los sistemas (como motores de buques o maquinaria) y detectar degradaciones o fallos en fases incipientes. Esto permite programar el mantenimiento de forma óptima antes de que ocurra una avería crítica.
  • Diagnóstico y Salud: En medicina, la IA puede analizar datos hospitalarios o imágenes para identificar anomalías que puedan señalar condiciones médicas, ineficiencias o fraudes.
  • Preprocesamiento de Datos: Históricamente, las anomalías se buscaban para eliminarlas o corregirlas, asegurando que las estadísticas y los modelos de aprendizaje automático fueran más precisos y no se vieran influenciados por valores desviados.

2. Metodología (¿Cómo se estudian las anomalías?)

Para estudiar y detectar las anomalías, los profesionales utilizan diversas técnicas de aprendizaje automático, implementadas mediante modelos que aprenden de los datos y asignan puntuaciones o etiquetas a las observaciones.

Técnicas y Algoritmos Populares:

Enfoque de DetecciónAlgoritmos / Métodos Comunes (Ejemplos)Descripción Breve
No Supervisado (Outlier Detection)Isolation Forest, Local Outlier Factor (LOF), Elliptic Envelope.El Isolation Forest aísla las anomalías al ser «pocas y diferentes», requiriendo menos particiones para separarlas del resto de datos. El LOF calcula una puntuación basada en la desviación de la densidad local de un punto con respecto a sus vecinos.
Semi-supervisado (Novelty Detection)One-Class Support Vector Machine (One-Class SVM), Autoencoder.El One-Class SVM aprende una frontera alrededor de las observaciones normales. Los Autoencoders (un tipo de red neuronal) se entrenan para reconstruir datos normales; si reciben una anomalía, el error de reconstrucción es alto y se usa para detectarla.
Multiclase (General)K-Vecinos más Próximos (KNN), Random Forest.Algoritmos de clasificación que se pueden usar para clasificar un punto de datos como normal o anómalo, especialmente si el problema de desbalanceo de clases se corrige previamente.

Proceso de Clasificación:

Una vez que un estimador (algoritmo) es entrenado con los datos, las nuevas observaciones pueden clasificarse con un método de predicción. Generalmente, a los datos normales o inliers se les asigna la etiqueta 1, mientras que a las anomalías u outliers se les asigna la etiqueta -1.

El rendimiento de un método en particular depende del conjunto de datos y los parámetros utilizados, ya que no hay una única técnica que funcione mejor sistemáticamente en todos los casos.


Para entender la diferencia entre los dos principales enfoques de detección (Outlier vs. Novelty), imagina un control de calidad en una fábrica de pelotas de tenis:

  • Detección de valores atípicos (No Supervisada): Recoges todas las pelotas de una caja, sabiendo que algunas podrían ser defectuosas. Intentas identificar cuáles están mal (son muy diferentes o están solas) solo observando dónde se concentran las pelotas buenas.
  • Detección de novedades (Semisupervisada): Solo te dan una caja de pelotas que sabes que son perfectas. Con ellas, aprendes exactamente qué es una «pelota normal». Luego, si te dan una pelota nueva, puedes decir si es un objeto totalmente nuevo o si coincide con la definición de «perfecta» que aprendiste.

Esta publicación de material divulgativo es parte del Proyecto Estratégico IAFER-Cib (C074/23), fruto del convenio de colaboración suscrito entre el Instituto Nacional de Ciberseguridad (INCIBE) y la Universidad de Granada. Esta iniciativa se lleva a cabo en el marco de los fondos del Plan de Recuperación, Transformación y Resiliencia, financiados por la Unión Europea (Next Generation).

#ProyectosCiber #PlanDeRecuperación #NextGenerationEU

Noticias relacionadas
Escuela Internacional de Verano: IA responsable en la era de la IA generativa y agéntica (colaboración ADIA Lab-DaSCI-UGR. 3ª Ed.)
Ocho doctorandos de la UGR contarán su tesis en menos de tres minutos en la final del concurso 3MT
Un nuevo método basado en IA, liderado por la UGR, acerca la identificación rápida de subespecies de ‘Mycobacterium abscessus’ a la práctica clínica
X Jornadas de Bio-informática