Skip to content

1、Xgboost介绍

1.1、Xgboost概述

XGBoost是陈天奇等人开发的一个开源机器学习项目,高效地实现了GBDT算法并进行了算法和工程上的许多改进,被广泛应用在Kaggle竞赛及其他许多机器学习竞赛中并取得了不错的成绩。

1.2、青出于蓝

说到XGBoost,不得不提GBDT(Gradient Boosting Decision Tree)。因为XGBoost本质上还是一个GBDT,但是力争把速度和效率发挥到极致,所以叫X (Extreme) GBoosted。两者都是boosting方法。

2、Xgboost树的定义

2.1、构造决策树

先来举个例子,我们要预测一家人对电子游戏的喜好程度,考虑到年轻和年老相比,年轻更可能喜欢电子游戏,以及男性和女性相比,男性更喜欢电子游戏,故先根据年龄大小区分小孩和大人,然后再通过性别区分开是男是女,逐一给各人在电子游戏喜好程度上打分,如下图所示。

2.2、决策树集成

就这样,训练出了2棵树tree1和tree2,类似之前gbdt的原理,两棵树的结论累加起来便是最终的结论,所以小孩的预测分数就是两棵树中小孩所落到的结点的分数相加:2 + 0.9 = 2.9。爷爷的预测分数同理:-1 + (-0.9)= -1.9。具体如下图所示:

恩,你可能要拍案而起了,惊呼,这不是跟之前介绍的GBDT乃异曲同工么?

事实上,如果不考虑工程实现、解决问题上的一些差异,XGBoost与GBDT比较大的不同仅仅在于目标函数的定义。

3、Xgboost目标函数

3.1、目标函数方程

对于Boosting算法我们知道,是将多个弱分类器的结果结合起来作为最终的结果来进行输出。ft(xi)​为第 t 棵树的输出结果,y^i(t)​是模型当前的输出结果,yi​​ 是实际的结果。

那么:

y^i(t)=t=1tft(xi)

y^i(t)=y^i(t1)+ft(xi)

XGBoost的目标函数如下图所示:

Obj(t)=i=1nL(yi,y^i)+i=1tΩ(ft)

  • 训练损失

    i=1nL(yi,y^i)

  • 常见损失函数

  • 树的复杂度

    i=1tΩ(fi)

Xgboost包含多棵树,定义每棵树的复杂度:

Ω(f)=γT+12λj=1Twj2

​ 其中 T 为叶子节点的个数,为叶子节点向量的模 。γ 表示节点切分的难度,λ 表示L2正则化系数。

Obj(t)=i=1nL(yi,y^i(t1)+ft(xi))+i=1tΩ(fi)​​​

Obj(t)=i=1nL(yi,y^i(t1)+ft(xi))+Ω(ft)+i=1t1Ω(fi)​​

Obj(t)=i=1nL(yi,y^i(t1)+ft(xi))+Ω(ft)+constant​​

i=1t1Ω(fi)​ 为前 t-1 棵树的复杂度,是常数项,求导时可忽略。目标函数简化为:

​​

3.2、目标函数泰勒展开

泰勒展开近似目标函数:

f(x+Δx)f(x)+f(x)Δx+12f(x)Δx2

令:

gi=y^(t1)l(y,y^(t1))

hi=y^(t1)2l(y,y^(t1))

则:

​​
  • 方程中的 $$l$$​​ 即为损失函数(比如平方损失函数:$$l(y_i,\hat{y_i}) = (y_i - \hat{y_i})^2$$​​,或者交叉熵Log-loss
  • Ω(ft)​ 的是正则项(包括L1正则、L2正则),防止过拟合,鲁棒性加强。
  • 对于 f(x),XGBoost利用二阶泰勒展开三项,做一个近似。f(x)表示的是其中一颗回归树。

由于在第 t 步时 y^i(t1)其实是一个已知的值,所以 l(yi,y^i(t1))​ 是一个常数,其对函数的优化不会产生影响。因此,去掉全部的常数项,得到目标函数为:

所以我们只需要求出每一步损失函数的一阶导和二阶导的值(由于前一步的 y^(t1) 是已知的,所以这两个值就是常数),然后最优化目标函数,就可以得到每一步的 f(x) ,最后根据加法模型得到一个整体模型。

3.3、定义一棵树

我们重新定义一颗树,包括两个部分:

  • 叶子结点的权重向量 w
  • 实例 ---> 叶子结点的映射关系q(本质是树的分支结构);

一棵树的表达形式定义如下:

3.4、定义树的复杂度

我们定义一颗树的复杂度 Ω,它由两部分组成:

  • 叶子结点的数量;
  • 叶子结点权重向量的L2范数;

3.5、叶结点归组

我们将属于第 j 个叶子结点的所有样本 xi , 划入到一个叶子结点样本集中,数学表示如下:

Ij=i|q(xi)==j

然后,将【3】和【4】中一棵树及其复杂度的定义,带入到【2】中泰勒展开后的目标函数 Obj 中,具体推导如下:

Obj(t)i=1n[gift(xi)+12hift2(xi)]+Ω(ft)=i=1n[giwq(xi)+12hiwq(xi)2]+γT+12λj=1Twj2=j=1T[(iIjgi)wj+12(iIjhi+λ)wj2]+γT

所有的训练样本,按叶子结点进行了分组!

为了进一步简化上式,我们定义:

Gj=iIjgi

Hj=iIjhi

含义如下:

  • Gj :叶子结点 j 所包含样本的一阶偏导数累加和,是一个常量
  • Hj :叶子结点 j 所包含样本的二阶偏导数累加和,是一个常量

GjHj 带入目标式 Obj,得到我们(注意,此时式中的变量只剩下第 t 棵树的权重向量 w)

​​​

3.6、树结构得分

回忆一下高中数学知识。假设有一个一元二次函数,形式如下:

我们可以套用一元二次函数的最值公式轻易地求出最值点:

那么回到XGBoost的最终目标函数上 Obj(t)​ ,该如何求出它的最值呢?

​​

我们先简单分析一下上面的式子:

  • 对于每个叶子结点 ,可以将其从目标函数中拆解出来:

在【3.5、叶结点归组】中我们提到,GjHj 相对于第 t 棵树来说是可以计算出来。那么,这个式子就是一个只包含一个变量叶子结点权重 wj​ 的一元二次函数,我们可以通过最值公式求出它的最值点。也可以参考一元二次方程求根公式

  • 两个不同实根:

  • 两个相等实根:

再次分析一下目标函数 Obj(t)​ ,可以发现,各个叶子结点的目标子式是相互独立的,也就是说,当每个叶子结点的子式都达到最值点时,整个目标函数 Obj(t)​ 才达到最值点。

那么,假设目前树的结构已经固定,套用一元二次函数的最值公式,将目标函数对 wj 求一阶导,并令其等于 0 ,则可以求得叶子结点 j 对应的权值:

所以目标函数可以化简为:

上图给出目标函数计算的例子,求每个节点每个样本的一阶导数 gj 和二阶导数 hj ,然后针对每个节点对所含样本求和得到 GjHj​ ,最后遍历决策树的节点即可得到目标函数。

3.7、XGBoost与GBDT差异

4、Xgboost模型使用

4.1、模型基本使用

参数说明

4.1.1、使用方式一
Python
import numpy as np
import xgboost as xgb
from xgboost import XGBClassifier
from sklearn import datasets
from sklearn import tree
from sklearn.model_selection import train_test_split
X,y = datasets.load_wine(return_X_y=True)
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.2)
model = XGBClassifier(learning_rate =0.1,# 学习率,控制每次迭代更新权重时的步长,默认0.3。值越小,训练越慢。
                      n_estimators=10,# 总共迭代的次数,即决策树的个数
                      max_depth=5, # 深度
                      min_child_weight= 1,# 默认值为1,。值越大,越容易欠拟合;值越小,越容易过拟合
                      gamma=0.3,# 惩罚项系数,指定节点分裂所需的最小损失函数下降值。
                      subsample=0.8,# 训练每棵树时,使用的数据占全部训练集的比例。默认值为1,典型值为0.5-1。防止overfitting。
                      colsample_bytree=0.8,
                      objective= 'binary:logistic',# 目标函数
                      eval_metric = ['merror'],# 验证数据集评判标准
                      nthread=4,)# 并行线程数
eval_set = [(X_test, y_test),(X_train,y_train)]
model.fit(X_train,y_train,eval_set = eval_set,verbose = True)
model.score(X_test,y_test)

XGBoost可视化

Python
xgb.to_graphviz(model,
                condition_node_params={'shape': 'box',
                                       'style': 'filled,rounded',
                                       'fillcolor': '#78bceb'},
                leaf_node_params={'shape': 'box',
                                  'style': 'filled,rounded',
                                  'fillcolor': '#e48038'})
4.1.2、使用方式二
Python
X,y = datasets.load_wine(return_X_y=True)
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.2)
param = {'learning_rate':0.1,
         'n_estimators':10000,
         'max_depth':5,
         'min_child_weight':1,
         'gamma':0.3,
         'subsample':0.8,
         'colsample_bytree':0.8, 
         'verbosity':0,
         'objective':'multi:softprob',
         'eval_metric':'merror',
         'early_stopping_rounds':20}

model = xgb.XGBClassifier(**param)
model.fit(X_train, y_train,eval_set=[(X_test, y_test)])
model.score(X_test,y_test)
4.1.3、使用方式三

DMatrix是XGBoost中使用的数据矩阵。DMatrix是XGBoost使用的内部数据结构,它针对内存效率和训练速度进行了优化

Python
import xgboost as xgb
from sklearn.metrics import accuracy_score
from sklearn import datasets
X,y = datasets.load_wine(return_X_y=True)
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.2)

# 创建数据
dtrain = xgb.DMatrix(data = X_train,label = y_train)
dtest = xgb.DMatrix(data = X_test,label = y_test)

# 指定参数
param = {'learning_rate':0.1,
         'max_depth':5,
         'min_child_weight':1,
         'gamma':0.3,
         'subsample':0.8,
         'eval_metric':['merror','mlogloss'],
         'colsample_bytree':0.1, 
         'verbosity':0,
         'objective':'multi:softmax',
         'num_class':3}
num_round = 1000
evals = [(dtrain,'train'),(dtest,'eval')]
bst = xgb.train(param,
                dtrain,
                num_round,
                evals = evals,
                early_stopping_rounds=10)
# 进行预测
y_ = bst.predict(dtest)
display(y_,accuracy_score(y_test,y_))

Released under the MIT License.