神经网络架构汇总
本笔记简要梳理并对比了深度学习中最经典的三种深度神经网络(Neural Network)核心基础架构:DNN、CNN 和 RNN,阐述其核心原理与常见适用场景。
2. 核心网络架构
Section titled “2. 核心网络架构”2.1. DNN (Deep Neural Network)
Section titled “2.1. DNN (Deep Neural Network)”深度神经网络(也称多层感知机 MLP)是深度学习的基石架构。
- 核心特点:
- 全连接(Fully Connected):网络中任意一个神经元与前一层的所有神经元相连。
- 通过引入非线性激活函数(如 ReLU、Sigmoid)来赋予网络拟合任意复杂非线性函数的能力。
- 适用场景:分类、回归等常规结构化数据建模。
- 局限性:参数量巨大,缺乏空间或时间维度上的归纳偏置,处理高维数据(如大图)时极易发生过拟合。
2.2. CNN (Convolutional Neural Network)
Section titled “2.2. CNN (Convolutional Neural Network)”卷积神经网络 通过“局部感知”和“参数共享”显著降低了网络复杂度,特别适合处理网格化结构数据。
- 核心组件:
- 卷积层(Convolutional Layer):利用滑动的卷积核(Kernel)提取图像边缘、纹理等局部空间特征。
- 池化层(Pooling Layer):降维并提取平移不变性特征,减少计算量。
- 核心优点:
- 局部连接(Local Connectivity) 与 参数共享(Parameter Sharing) 极大减少了权重数量。
- 适用场景:计算机视觉(CV)领域,如图像分类、目标检测、图像分割。
2.3. RNN (Recurrent Neural Network)
Section titled “2.3. RNN (Recurrent Neural Network)”循环神经网络 引入了“循环反馈反馈”机制,使其拥有记忆能力,特别擅长处理时间序列和变长输入。
- 核心特点:
- 隐状态(Hidden State)沿着时间步进行循环流转,能够捕获历史序列信息。
- 局限性:
- 梯度消失 / 梯度爆炸:当输入序列过长时,反向传播(BPTT)链条过长导致计算不稳定,难以捕获超长上下文依赖。后续演进出改进版本 LSTM 和 GRU。
- 适用场景:自然语言处理(NLP)、语音识别、天气或金融时间序列预测。
3. 架构对比总结
Section titled “3. 架构对比总结”| 网络架构 | 连接特点 | 核心归纳偏置 | 主要适用领域 |
|---|---|---|---|
| DNN | 全连接 | 无特定偏置(通用性强) | 简单结构化特征回归/分类 |
| CNN | 局部连接、权重共享 | 空间局部性、平移不变性 | 图像、视频等二维空间数据 |
| RNN | 沿时间步循环连接 | 时间步前后时序依赖性 | 文本、语音、单维时间序列 |