跳转到内容

深度学习优化器

在深度学习中,优化器(Optimizer) 用于更新神经网络的参数(权重和偏置),以最小化损失函数。选择合适的优化算法对于加速模型收敛和提高最终泛化性能至关重要。


随机梯度下降法 是深度学习中最基础的优化算法。在每个步骤中,利用单个样本或小批量样本计算梯度并更新参数。

  • 优点
    • 计算简单,内存开销小。
    • 随机扰动可能有助于跳出局部最小值。
  • 缺点
    • 梯度估计具有高方差,可能导致训练曲线剧烈震荡。
    • 在“鞍点”或“峡谷”地带(某一维度梯度极小,另一维度极高),更新效率较低,收敛缓慢。

通过引入“惯性”来加速梯度下降,特别是在梯度方向持续一致的维度上,累积之前的梯度从而加速收敛,并在方向震荡的维度上起到平滑作用。

Momentum 原理图

2.3. AdaGrad (Adaptive Gradient Algorithm)

Section titled “2.3. AdaGrad (Adaptive Gradient Algorithm)”

自适应学习率算法,通过记录每个参数历史梯度的平方和,为不同的参数分配不同的学习率。稀疏特征对应的参数获得更大的学习率更新,而频繁特征对应的参数学习率则较小。

AdaGrad 原理图

  • 缺点:由于学习率分母累加了历史所有梯度的平方,随着训练迭代,学习率会逐渐衰减到无限接近于 0,导致后期训练提前终止。

目前深度学习中应用最广泛的通用优化器之一,它结合了 Momentum(利用一阶动量估计平滑梯度)与 RMSProp/AdaGrad(利用二阶动量估计自适应调整学习率)的核心优势,既能自适应调学习率,又保留了动量的加速效果。