Gradient Boosting
Le gradient boosting construit un ensemble additif en entraînant chaque nouvel arbre à prédire le gradient négatif de la fonction de perte évaluée sur les prédictions de l'ensemble courant, ce qui, pour une régression à erreur quadratique, correspond aux résidus bruts. La prédiction finale est la somme de la constante initiale (typiquement la moyenne des étiquettes) et des contributions de tous les arbres multipliées par un taux d'apprentissage (rétrécissement), généralement compris entre 0,05 et 0,3. Le rétrécissement ralentit délibérément l'apprentissage, de sorte qu'un plus grand nombre d'arbres est nécessaire, mais chaque arbre s'ajuste à un signal plus lisse et moins surajusté, ce qui réduit la variance du modèle final. Le processus est strictement séquentiel : l'arbre k+1 ne peut être construit qu'une fois l'arbre k finalisé, ce qui explique pourquoi le gradient boosting ne se parallélise pas aussi aisément entre arbres que la forêt aléatoire.
XGBoost (2016) a étendu l'algorithme canonique de Friedman en intégrant directement dans l'objectif des termes de régularisation L1 et L2 explicites sur les poids des feuilles et la profondeur des arbres, ainsi qu'un algorithme de recherche de coupures approchée fondé sur des esquisses de quantiles, évitant le tri complet du jeu de données. LightGBM (Microsoft, 2017) a introduit l'échantillonnage unilatéral basé sur le gradient (GOSS), qui conserve toutes les instances à gradient élevé et sous-échantillonne celles à faible gradient, ainsi que le regroupement de caractéristiques exclusives (EFB), qui compresse les caractéristiques creuses mutuellement exclusives dans le même intervalle d'histogramme, atteignant des accélérations d'un facteur 20 sur de grands jeux de données avec une perte de précision minimale. Les deux frameworks prennent en charge nativement les coupures catégorielles, gèrent les valeurs manquantes via une direction par défaut apprise, et produisent des valeurs SHAP pour l'explicabilité globale et locale. Sur les benchmarks de données tabulaires structurées, les modèles de gradient boosting bien réglés remportent la majorité des compétitions de machine learning.