Evento
#Seminarios DaSCI

La regresión de cresta prevalidada como sustituto altamente eficiente de la regresión logística para datos de alta dimensión

Resumen: Los modelos lineales se utilizan mucho en clasificación, y son especialmente eficaces para datos de alta dimensión en los que los límites de decisión lineales / hiperplanos de separación suelen ser eficaces para separar clases, incluso para datos complejos. Un ejemplo reciente de una técnica que utiliza eficazmente clasificadores lineales es la familia de clasificadores ROCKET para la clasificación de series temporales. Una de las razones por las que la familia ROCKET es tan rápida se debe a que utiliza un clasificador lineal basado en la regresión de cresta de error cuadrático estándar. Ajustar un modelo lineal basado en el error cuadrático es mucho más rápido y estable que ajustar una regresión logística multinomial regularizada estándar basada en la pérdida logarítmica (es decir, máxima verosimilitud regularizada), ya que en este último caso las soluciones sólo pueden encontrarse mediante una búsqueda numérica. Aunque es rápida, una desventaja de la regresión de cresta con error cuadrático es que no puede producir predicciones probabilísticas. Demostraré algunos trabajos muy recientes sobre cómo utilizar la regresión de cresta regular para entrenar modelos de regresión logística multinomial regularizados con L2 para un gran número de características, incluida la elección de un grado adecuado de regularización, con una complejidad temporal que no es mayor que un ajuste por mínimos cuadrados ordinario. Esto contrasta con la regresión logística, que requiere un reajuste completo para cada valor del parámetro de regularización considerado y cada pliegue utilizado para la validación cruzada. Nuestro nuevo enfoque permite que los modelos basados en la tecnología de clasificación lineal proporcionen predicciones probabilísticas bien calibradas con una sobrecarga computacional adicional mínima. Si el tiempo lo permite, también expondré algunas ideas sobre cuándo cabe esperar un buen rendimiento de estos clasificadores lineales.

Ponente: Daniel Schmidt es profesor asociado de Informática en el Departamento de Ciencia de Datos e Inteligencia Artificial de la Universidad de Monash (Australia). Obtuvo su doctorado en el área de inferencia estadística teórica de la información en 2008 en la Universidad de Monash. De 2009 a 2018 estuvo empleado en la Universidad de Melbourne, trabajando en el campo de la genómica estadística (GWAS, epigenética y cáncer). Desde 2018 trabaja en la Universidad de Monash en un puesto de enseñanza e investigación. Sus intereses de investigación son principalmente la clasificación y predicción de series temporales, particularmente a escala, y la inferencia bayesiana y MCMC, con énfasis en la sparsity y la contracción, la optimización bayesiana y la aproximación bayesiana de funciones. También está muy interesado en las mejores formas de impartir formación en estadística y aprendizaje automático.

GrabaciónLa regresión de cresta prevalidada como sustituto altamente eficiente de la regresión logística para datos de alta dimensión