Skip to content

Gradient Boosting

Gradient Boosting

Gradient Boosting: Sequential Residual FittingEach tree corrects its predecessor; 3 rounds shrink RMSE by 76% with learning rate 0.3Initial (mean)Δ=10.5After tree 1Δ=8.5After tree 2Δ=6.1After tree 3x1x2x3x4x5x6x7x8Training samples (8 points)+tree1+tree2+tree3Sequentialtrees added in orderResidual fiteach tree targets errorsShrinkageLR 0.3 slows overfittingRMSE drop1.59init (mean baseline)0.86after 3 treesXGBoost and LightGBM extend this with L1/L2 regularisation, histogram binning, and leaf-wise growth

Il gradient boosting costruisce un insieme additivo addestrando ogni nuovo albero a predire il gradiente negativo della funzione di perdita calcolata sulle previsioni dell'insieme corrente: nel caso della regressione con errore quadratico, questo coincide con i residui grezzi. La previsione finale è la somma della costante iniziale (tipicamente la media delle etichette) più i contributi di tutti gli alberi moltiplicati per un tasso di apprendimento (shrinkage), solitamente compreso tra 0,05 e 0,3. Lo shrinkage rallenta deliberatamente l'apprendimento, richiedendo più alberi, ma fa sì che ciascun albero adatti un segnale più regolare e meno soggetto a sovradattamento, riducendo la varianza del modello finale. Il processo è strettamente sequenziale: l'albero k+1 non può essere costruito prima che l'albero k sia completato, motivo per cui il gradient boosting non si presta a una parallelizzazione tra alberi analoga a quella della Random Forest.

XGBoost (2016) ha esteso l'algoritmo canonico di Friedman aggiungendo termini espliciti di regolarizzazione L1 e L2 sui pesi delle foglie e sulla profondità degli alberi direttamente nell'obiettivo, oltre a un algoritmo approssimato di ricerca delle divisioni basato su sketch quantile che evita l'ordinamento dell'intero dataset. LightGBM (Microsoft, 2017) ha introdotto il campionamento unilaterale basato sul gradiente (Gradient-based One-Side Sampling, GOSS), che conserva tutte le istanze ad alto gradiente e sottocampiona quelle a basso gradiente, e il raggruppamento esclusivo delle feature (Exclusive Feature Bundling, EFB), che comprime feature sparse mutuamente esclusive nello stesso slot dell'istogramma, ottenendo accelerazioni fino a 20 volte su dataset di grandi dimensioni con una perdita di accuratezza minima. Entrambi i framework supportano nativamente le divisioni su variabili categoriche, gestiscono i valori mancanti tramite una direzione di default appresa e producono valori SHAP per l'interpretabilità globale e locale. Sui benchmark tabulari strutturati, i modelli di gradient boosting ottimizzati si aggiudicano la maggioranza delle competizioni di apprendimento automatico.

English version