跳转至

梯度下降

梯度下降是最基础的优化算法,沿目标函数梯度的反方向迭代更新参数:

\[ \theta_{t+1}=\theta_t-\eta\nabla_\theta \mathcal{L}(\theta_t), \]

其中 \(\eta\) 是学习率。全批量、随机和小批量梯度下降的区别,在于每次用全部、单个或一批样本估计梯度。