跳转至

正则化方法

正则化方法是一个笼统的概念,其基本思想是在模型训练的时候,增加对参数的惩罚项,以避免模型的过拟合的问题,基本形式是:

\[ \ell - \underbrace{\alpha}_{\text{正则化系数}} \underbrace{f(w)}_{\text{正则化函数}} \]

用这个形式去替代最原本的训练目标。也就是说,在模型训练的时候约束参数不能取极端值,从而在拟合训练数据和模型复杂度之间做权衡。

值得说明的是:

  • 这里的正则化系数是超参数,是人为在训练模型之前确定的,训练者根据需要和问题实际进行调整;
  • 正则化函数是多种多样的,典型的形式是
  • L1正则化:倾向产生稀疏解,同时起到特征选择的效果
  • L2正则化:倾向将系数向零压缩,防止某些特征权重过大。
  • 正则化函数不唯一,我们可以在上面的式子中增加多个正则项,在不同维度进行限制。

从经验风险最小化的统一形式理解正则化,参见最优化基础:正则化。