Skip to content

Gradient Boosting

Gradient Boosting

Gradient Boosting: Sequential Residual FittingEach tree corrects its predecessor; 3 rounds shrink RMSE by 76% with learning rate 0.3Initial (mean)Δ=10.5After tree 1Δ=8.5After tree 2Δ=6.1After tree 3x1x2x3x4x5x6x7x8Training samples (8 points)+tree1+tree2+tree3Sequentialtrees added in orderResidual fiteach tree targets errorsShrinkageLR 0.3 slows overfittingRMSE drop1.59init (mean baseline)0.86after 3 treesXGBoost and LightGBM extend this with L1/L2 regularisation, histogram binning, and leaf-wise growth

Le gradient boosting construit un ensemble additif en entraînant chaque nouvel arbre à prédire le gradient négatif de la fonction de perte évaluée sur les prédictions de l'ensemble courant, ce qui, pour une régression à erreur quadratique, correspond aux résidus bruts. La prédiction finale est la somme de la constante initiale (typiquement la moyenne des étiquettes) et des contributions de tous les arbres multipliées par un taux d'apprentissage (rétrécissement), généralement compris entre 0,05 et 0,3. Le rétrécissement ralentit délibérément l'apprentissage, de sorte qu'un plus grand nombre d'arbres est nécessaire, mais chaque arbre s'ajuste à un signal plus lisse et moins surajusté, ce qui réduit la variance du modèle final. Le processus est strictement séquentiel : l'arbre k+1 ne peut être construit qu'une fois l'arbre k finalisé, ce qui explique pourquoi le gradient boosting ne se parallélise pas aussi aisément entre arbres que la forêt aléatoire.

XGBoost (2016) a étendu l'algorithme canonique de Friedman en intégrant directement dans l'objectif des termes de régularisation L1 et L2 explicites sur les poids des feuilles et la profondeur des arbres, ainsi qu'un algorithme de recherche de coupures approchée fondé sur des esquisses de quantiles, évitant le tri complet du jeu de données. LightGBM (Microsoft, 2017) a introduit l'échantillonnage unilatéral basé sur le gradient (GOSS), qui conserve toutes les instances à gradient élevé et sous-échantillonne celles à faible gradient, ainsi que le regroupement de caractéristiques exclusives (EFB), qui compresse les caractéristiques creuses mutuellement exclusives dans le même intervalle d'histogramme, atteignant des accélérations d'un facteur 20 sur de grands jeux de données avec une perte de précision minimale. Les deux frameworks prennent en charge nativement les coupures catégorielles, gèrent les valeurs manquantes via une direction par défaut apprise, et produisent des valeurs SHAP pour l'explicabilité globale et locale. Sur les benchmarks de données tabulaires structurées, les modèles de gradient boosting bien réglés remportent la majorité des compétitions de machine learning.

English version