跳转至

深度神经网络

前一节3.2-神经网络优化中,我们主要是讲模型的架构和训练方式。虽然万能近似定理告诉我们,我们想怎么拟合就怎么拟合,随着模型变得逐渐复杂,网络逐渐变深,会出现诸多问题

梯度消失

直观上,反向传播需要连续乘以各层的局部导数;当这些导数的绝对值长期小于 1 时,梯度会随网络深度呈指数衰减。完整证明可参见课程讲义相关章节,公开仓库不包含原讲义。

改进方式

核心出装:ReLU

残差连接

在深度神经网络里,残差连接的数学形式为

\[ h(x) = \underbrace{x}_{\text{恒等项}} + \underbrace{\left(h(x) - x \right)}_{\text{残差项}} \Rightarrow F(x, \theta) := h(x) - x \]

书中给的例子说明,残差连接使得我们的训练地形更加平滑。

深度神经网络中的归一化

深度神经网络中的初始化