Selección de modelos

De Enciclopedia Salmantina

La selección de modelos es la tarea de seleccionar un modelo entre varios candidatos sobre la base de un criterio de rendimiento para elegir el mejor.[1] En el contexto del aprendizaje automático y, más generalmente, del análisis estadístico, esto puede referirse a la selección de un modelo estadístico a partir de un conjunto de modelos candidatos, dados unos datos. En los casos más sencillos, se considera un conjunto de datos preexistente. Sin embargo, la tarea también puede implicar el diseño de experimentos de modo que la información recogida sea adecuada para el problema de la selección de modelos. Dados varios modelos candidatos de similar capacidad predictiva o explicativa, el modelo más simple es, con mayor probabilidad, la mejor opción (navaja de Ockham).

Konishi y Kitagawa (2008, p. 75) señalan que «la mayoría de los problemas de la inferencia estadística pueden considerarse problemas relacionados con la modelización estadística». De forma similar, Cox (2006, p. 197) afirmó que «el modo en que se realiza la traducción de un problema conceptual a un modelo estadístico suele ser la parte más crítica de un análisis».

La selección de modelos también puede referirse al problema de seleccionar unos pocos modelos representativos a partir de un gran conjunto de modelos computacionales con el propósito de tomar decisiones u optimizar bajo incertidumbre.[2]

En el aprendizaje automático, los enfoques algorítmicos para la selección de modelos incluyen la selección de características, la optimización de hiperparámetros y la teoría del aprendizaje estadístico.

Introducción[editar | editar código]

El ciclo de observación científica

En sus formas más básicas, la selección de modelos es una de las tareas fundamentales de la investigación científica. Determinar el principio que explica una serie de observaciones suele estar vinculado directamente a un modelo matemático que predice dichas observaciones. Por ejemplo, cuando Galileo realizó sus experimentos con el plano inclinado, demostró que el movimiento de las esferas se ajustaba a la parábola predicha por su modelo[cita requerida].

Entre el número innumerable de posibles mecanismos y procesos que podrían haber producido los datos, ¿cómo se puede empezar a elegir el mejor modelo? El enfoque matemático habitual toma decisiones dentro de un conjunto de modelos candidatos; este conjunto debe ser seleccionado por el investigador. A menudo se utilizan modelos sencillos, como polinomios, al menos inicialmente[cita requerida]. Burnham y Anderson (2002) enfatizan a lo largo de su obra la importancia de elegir modelos basados en principios científicos sólidos, como la comprensión de los procesos o mecanismos fenomenológicos (por ejemplo, reacciones químicas) subyacentes a los datos.

Una vez elegido el conjunto de modelos candidatos, el análisis estadístico permite seleccionar el mejor de ellos. Lo que se entiende por mejor resulta controvertido. Una buena técnica de selección de modelos equilibrará la bondad de ajuste con la simplicidad. Los modelos más complejos podrán adaptar mejor su forma para ajustarse a los datos (por ejemplo, un polinomio de quinto grado puede ajustarse exactamente a seis puntos), pero los parámetros adicionales pueden no representar nada útil (quizá esos seis puntos están simplemente distribuidos al azar alrededor de una línea recta). La bondad de ajuste se determina generalmente mediante un enfoque de razón de verosimilitud, o una aproximación de este, lo que conduce a una prueba de chi-cuadrado. La complejidad se mide por lo general contando el número de parámetros del modelo.

Las técnicas de selección de modelos pueden considerarse estimadores de alguna cantidad física, como la probabilidad de que el modelo produzca los datos dados. El sesgo y la varianza son medidas importantes de la calidad de este estimador; también se suele considerar la eficiencia.

Un ejemplo típico de selección de modelos es el ajuste de curvas, donde, dado un conjunto de puntos y otros conocimientos previos (por ejemplo, que los puntos son resultado de muestras i.i.d.), se debe seleccionar una curva que describa la función que generó dichos puntos.

Dos orientaciones en la selección de modelos[editar | editar código]

Existen dos objetivos principales en la inferencia y el aprendizaje a partir de datos. Uno es para el descubrimiento científico, también llamado inferencia estadística, la comprensión del mecanismo subyacente que genera los datos y la interpretación de la naturaleza de estos. Otro objetivo del aprendizaje a partir de datos es la predicción de observaciones futuras o no observadas, denominada predicción estadística. En el segundo objetivo, al científico de datos no le preocupa necesariamente una descripción probabilística precisa de los datos. Por supuesto, también es posible tener interés en ambas orientaciones.

En consonancia con estos dos objetivos diferentes, la selección de modelos también puede tomar dos direcciones: la selección de modelos para la inferencia y la selección de modelos para la predicción.[3] La primera orientación consiste en identificar el mejor modelo para los datos, el cual proporcione preferiblemente una caracterización confiable de las fuentes de incertidumbre para la interpretación científica. Para este objetivo, es sumamente importante que el modelo seleccionado no sea excesivamente sensible al tamaño de la muestra. En consecuencia, una noción adecuada para evaluar la selección de modelos es la consistencia de la selección, lo que significa que el candidato más robusto será seleccionado de manera consistente si se dispone de suficientes muestras de datos.

La segunda orientación consiste en elegir un modelo como un instrumento para ofrecer un excelente rendimiento predictivo. Para este último propósito, sin embargo, el modelo seleccionado puede ser simplemente un ganador afortunado entre unos pocos competidores muy cercanos y, aun así, el rendimiento predictivo puede ser el mejor posible. De ser así, la selección del modelo es adecuada para el segundo objetivo (predicción), pero el uso del modelo seleccionado para obtener explicaciones e interpretaciones puede ser muy poco confiable y engañoso.[3] Además, en el caso de modelos muy complejos seleccionados de esta manera, incluso las predicciones pueden resultar poco razonables ante datos solo ligeramente diferentes de aquellos con los que se realizó la selección.[4]

Métodos para ayudar a elegir el conjunto de modelos candidatos[editar | editar código]

Criterios[editar | editar código]

A continuación se presenta una lista de criterios para la selección de modelos. Los criterios de información más utilizados son (i) el criterio de información de Akaike y (ii) el factor de Bayes y/o el criterio de información bayesiano (que en cierta medida se aproxima al factor de Bayes); véase Stoica y Selen (2004) para una revisión.

  • Criterio de información de Akaike (AIC), una medida de la bondad de ajuste de un modelo estadístico estimado.
  • Factor de Bayes
  • Criterio de información bayesiano (BIC), también conocido como criterio de información de Schwarz, un criterio estadístico para la selección de modelos.
  • Criterio puente (BC, por sus siglas en inglés: Bridge criterion), un criterio estadístico capaz de alcanzar un mejor rendimiento entre el AIC y el BIC con independencia de la idoneidad de la especificación del modelo.[5]
  • Validación cruzada
  • Criterio de información de la desvianza (DIC), otro criterio de selección de modelos de orientación bayesiana.
  • Tasa de falso descubrimiento
  • Criterio de información focalizado (FIC, por sus siglas en inglés), un criterio de selección que clasifica los modelos estadísticos según su eficacia para un parámetro de interés determinado.
  • Criterio de información de Hannan-Quinn, una alternativa a los criterios de Akaike y bayesiano.
  • Criterio de información de Kashyap (KIC), una potente alternativa al AIC y BIC, ya que utiliza la matriz de información de Fisher.
  • Prueba de la razón de verosimilitud
  • [[Cp de Mallows|Cp de Mallows]]
  • Longitud de descripción mínima
  • Longitud de mensaje mínima (MML)
  • Estadístico PRESS, también conocido como criterio PRESS.
  • Criterio de cuasi-información (QIC), para la selección de modelos donde la log-verosimilitud se sustituye por la cuasi-log-verosimilitud (p. ej., ecuaciones de estimación generalizadas).
  • Minimización del riesgo estructural
  • Regresión paso a paso
  • Criterio de información de Watanabe-Akaike (WAIC), también llamado criterio de información ampliamente aplicable.
  • Criterio de información bayesiano extendido (EBIC), una extensión del criterio de información bayesiano (BIC) habitual para modelos con espacios de parámetros de alta dimensión.
  • Criterio de información de Fisher extendido (EFIC), un criterio de selección de modelos para modelos de regresión lineal.
  • Criterio del mínimo restringido (CMC), un método frecuentista para la selección de modelos de regresión basado en las siguientes observaciones geométricas: en el espacio vectorial de parámetros del modelo completo, cada vector representa un modelo. Existe una bola centrada en el vector de parámetros verdadero del modelo completo en la que el modelo verdadero es el modelo más pequeño (en norma ). A medida que el tamaño de la muestra tiende a infinito, el estimador de máxima verosimilitud (MLE) para el vector de parámetros verdadero converge hacia este y, por lo tanto, atrae la región de confianza decreciente de la razón de verosimilitud hacia el vector verdadero. La región de confianza estará dentro de la bola con una probabilidad que tiende a uno. El CMC selecciona el modelo más pequeño dentro de esta región. Cuando la región captura el vector de parámetros verdadero, la selección del CMC es el modelo verdadero. Por lo tanto, la probabilidad de que la selección del CMC sea el modelo verdadero es mayor o igual que el nivel de confianza.[6]

Entre estos criterios, la validación cruzada suele ser el más preciso y, computacionalmente, el más costoso para los problemas de aprendizaje supervisado.[cita requerida]

Burnham y Anderson (2002, §6.3) señalan lo siguiente:

Existe una variedad de métodos de selección de modelos. Sin embargo, desde el punto de vista del rendimiento estadístico de un método y del contexto previsto para su uso, solo existen dos clases distintas de métodos: los que se han denominado eficientes y los consistentes. (...) Bajo el paradigma frecuentista para la selección de modelos, por lo general se cuenta con tres enfoques principales: (I) optimización de algunos criterios de selección, (II) pruebas de hipótesis y (III) métodos ad hoc.

Véase también[editar | editar código]

Notas[editar | editar código]

  1. Hastie, Tibshirani, Friedman (2009). The elements of statistical learning. Springer. p. 195. 
  2. Shirangi, Mehrdad G.; Durlofsky, Louis J. (2016). «A general method to select representative models for decision making and optimization under uncertainty». Computers & Geosciences 96: 109-123. Bibcode:2016CG.....96..109S. doi:10.1016/j.cageo.2016.08.002. 
  3. 3,0 3,1 Ding, Jie; Tarokh, Vahid; Yang, Yuhong (2018). «Model Selection Techniques: An Overview». IEEE Signal Processing Magazine 35 (6): 16-34. Bibcode:2018ISPM...35f..16D. ISSN 1053-5888. S2CID 53035396. arXiv:1810.09583. doi:10.1109/MSP.2018.2867638. 
  4. Su, J.; Vargas, D.V.; Sakurai, K. (2019). «One Pixel Attack for Fooling Deep Neural Networks». IEEE Transactions on Evolutionary Computation 23 (5): 828-841. Bibcode:2019ITEC...23..828S. S2CID 2698863. arXiv:1710.08864. doi:10.1109/TEVC.2019.2890858. 
  5. Ding, J.; Tarokh, V.; Yang, Y. (junio de 2018). «Bridging AIC and BIC: A New Criterion for Autoregression». IEEE Transactions on Information Theory 64 (6): 4024-4043. Bibcode:2018ITIT...64.4024D. ISSN 1557-9654. S2CID 5189440. arXiv:1508.02473. doi:10.1109/TIT.2017.2717599. 
  6. Tsao, Min (2023). «Regression model selection via log-likelihood ratio and constrained minimum criterion». Canadian Journal of Statistics 52: 195-211. S2CID 236087375. arXiv:2107.08529. doi:10.1002/cjs.11756. 

Referencias[editar | editar código]