Skip to content

Árbol de decisión: divisiones Gini

Decision Tree: Gini Splits

Decision Tree: Gini SplitsRecursive axis-aligned splits minimize weighted Gini impurity at each nodex₁ < 0.44Gini drop 0.18x₂ < 0.50x₂ < 0.65

Un árbol de decisión particiona el espacio de características mediante una secuencia de divisiones binarias alineadas con los ejes, cada una elegida para reducir al máximo una medida de impureza nodal. La impureza de Gini en un nodo es 1 menos la suma de las probabilidades de clase al cuadrado: para un nodo puro es 0,0 y para un nodo de dos clases completamente mezcladas es 0,5. El algoritmo CART evalúa cada umbral posible en cada característica y selecciona el que minimiza el Gini ponderado promedio de los dos nodos hijos, donde los pesos son la fracción de muestras de entrenamiento en cada hijo. Un árbol de profundidad uno (un decision stump) realiza un único corte binario; los árboles más profundos particionan el espacio en regiones rectangulares cada vez más finas. En cada división, la ganancia de información es igual al Gini del nodo padre menos el Gini ponderado de los hijos, y mide cuánta incertidumbre se resuelve.

Sin restricciones, un árbol crecerá hasta que cada hoja sea pura, memorizando perfectamente el conjunto de entrenamiento pero fallando en datos nuevos: esto es el sobreajuste del árbol de decisión. Los principales remedios son la poda previa (limitar max_depth, exigir un número mínimo de muestras para dividir o para existir en una hoja) y la poda posterior (hacer crecer el árbol completo y luego eliminar las hojas que no mejoran la pérdida de validación retenida, ponderada por una penalización de complejidad alfa, como en la poda por coste-complejidad). Un árbol superficial con max_depth de 3 a 5 es interpretable y puede representarse como un diagrama de flujo; sus decisiones son auditables por humanos, lo que lo convierte en uno de los pocos clasificadores genuinamente de caja blanca. Los árboles de decisión son también el aprendiz base de los Bosques Aleatorios (árboles completamente desarrollados con bagging) y del gradient boosting (árboles superficiales ajustados secuencialmente a los residuos), donde el ensamblado recupera la propiedad de bajo sesgo al tiempo que controla la varianza.

English version