Skip to content

Gradient Boosting

Gradient Boosting

Gradient Boosting: Sequential Residual FittingEach tree corrects its predecessor; 3 rounds shrink RMSE by 76% with learning rate 0.3Initial (mean)Δ=10.5After tree 1Δ=8.5After tree 2Δ=6.1After tree 3x1x2x3x4x5x6x7x8Training samples (8 points)+tree1+tree2+tree3Sequentialtrees added in orderResidual fiteach tree targets errorsShrinkageLR 0.3 slows overfittingRMSE drop1.59init (mean baseline)0.86after 3 treesXGBoost and LightGBM extend this with L1/L2 regularisation, histogram binning, and leaf-wise growth

Gradient Boosting konstruiert ein additives Ensemble, indem jeder neue Baum darauf trainiert wird, den negativen Gradienten der Verlustfunktion bezogen auf die Vorhersagen des aktuellen Ensembles zu schätzen – bei der quadratischen Verlustfunktion entspricht dies den rohen Residuen. Die finale Vorhersage ergibt sich als Summe der initialen Konstante (typischerweise der mittlere Zielwert) und der Beiträge aller Bäume, jeweils multipliziert mit einer Lernrate (Shrinkage), die üblicherweise zwischen 0,05 und 0,3 liegt. Shrinkage verlangsamt das Lernen bewusst, sodass mehr Bäume benötigt werden, aber jeder Baum ein glatteres, weniger überangepasstes Signal approximiert, was die Varianz des Endmodells reduziert. Der Prozess ist streng sequenziell: Baum k+1 kann erst gebaut werden, wenn Baum k abgeschlossen ist – deshalb lässt sich Gradient Boosting nicht so trivial über Bäume hinweg parallelisieren wie Random Forest.

XGBoost (2016) erweiterte den kanonischen Friedman-Algorithmus durch explizite L1- und L2-Regularisierungsterme für Blattgewichte und Baumtiefe direkt in der Zielfunktion sowie durch einen approximativen Split-Finding-Algorithmus auf Basis von Quantil-Sketches, der das vollständige Sortieren des Datensatzes vermeidet. LightGBM (Microsoft, 2017) führte Gradient-based One-Side Sampling (GOSS) ein, das alle Instanzen mit hohem Gradienten beibehält und solche mit niedrigem Gradienten unterabtastet, sowie Exclusive Feature Bundling (EFB), das sich gegenseitig ausschließende spärliche Merkmale in denselben Histogramm-Slot packt – beides zusammen erzielt auf großen Datensätzen bis zu 20-fache Beschleunigungen bei minimalem Genauigkeitsverlust. Beide Frameworks unterstützen nativ kategoriale Splits, behandeln fehlende Werte über eine gelernte Standardrichtung und geben SHAP-Werte für globale und lokale Erklärbarkeit aus. Auf strukturierten tabellarischen Benchmarks gewinnen optimierte Gradient-Boosting-Modelle die Mehrheit der kompetitiven Machine-Learning-Wettbewerbe.

English version