正则化方法¶
正则化方法是一个笼统的概念,其基本思想是在模型训练的时候,增加对参数的惩罚项,以避免模型的过拟合的问题,基本形式是:
\[
\ell - \underbrace{\alpha}_{\text{正则化系数}} \underbrace{f(w)}_{\text{正则化函数}}
\]
用这个形式去替代最原本的训练目标。也就是说,在模型训练的时候约束参数不能取极端值,从而在拟合训练数据和模型复杂度之间做权衡。
值得说明的是:
- 这里的正则化系数是超参数,是人为在训练模型之前确定的,训练者根据需要和问题实际进行调整;
- 正则化函数是多种多样的,典型的形式是
- L1正则化:倾向产生稀疏解,同时起到特征选择的效果
- L2正则化:倾向将系数向零压缩,防止某些特征权重过大。
- 正则化函数不唯一,我们可以在上面的式子中增加多个正则项,在不同维度进行限制。
从经验风险最小化的统一形式理解正则化,参见最优化基础:正则化。