更新于 2026年7月21日

卷积神经网络#


术语解释#

卷积神经网络(Convolutional Neural Network, CNN) 是深度学习中第一种基于卷积运算的网络结构,主要用于对在相邻空间位置上具有依赖关系的数据(如图像)进行特征提取。

卷积计算示意图
卷积计算示意图

CNN 是一种通过卷积核(扫描器)在输入数据上滑动并执行内积运算来提取特征的神经网络,它完全摒弃了全连接层将图像拉伸为向量的做法,而是保留了图像的原始维度信息。

一个典型的 CNN 通常由卷积层(提取局部特征)、激活层(引入非线性)、池化层(降维与筛选信息)以及最后的全连接层(分类或回归)组成,其核心思想是在空间上共享权重,这使得同一个卷积核可以识别图像中不同位置的相同特征 。


出现动机#

受到生物学中“祖母细胞”概念的启发,研究者希望模型能像人类视觉系统一样,无论物体出现在照片的哪个位置、明暗如何,都能准确识别。对于全连接网络来说,它需要将二维图片展开成一维向量,这会严重丢失像素点在相邻位置上的空间依赖关系。如果训练集中某个特征(如“横折”)只出现在中心,那么当该特征移动到边缘时,模型将无法识别,除非提供涵盖所有位置的大规模训练集

网络训练集
网络训练集

同时,对于高分辨率图片,全连接层会导致权重参数数量爆炸(动辄数亿个),极易造成显存溢出且难以训练


优点缺点#

  • 优点:
    • 擅长空间特征提取:能够有效捕捉图像中的局部相关性,识别物体的轮廓、边缘等空间信息。

    • 参数效率高(权重共享):由于多个位置共享同一个卷积核参数,CNN 的参数量相较于全连接网络呈几何倍数减少,这使得训练深层网络成为可能。

    • 平移不变性:通过卷积扫描和池化操作,模型对物体在图像中的位置变化不敏感,具有更强的鲁棒性。

    • 层级化抽象能力:通过深度卷积,网络能够从底层的边缘特征逐步提取出高层的、极其抽象的语义特征。

  • 缺点:
    • 计算开销依然显著:虽然参数量减少了,但对于超深层网络(如 VGG-19 或 ResNet-152),处理高分辨率图像仍需要巨大的计算资源和显存。

    • 池化导致信息损失:池化操作虽然能防止过拟合并减少计算量,但它本质上是一种信息过滤,过大的池化窗口会导致特征图变得模糊,从而丢失细粒度的细节信息。

    • 结构设计复杂:卷积核大小、步长(Stride)、填充(Padding)以及网络深度的选择往往缺乏统一标准,需要依赖大量实验经验进行调优。

    • 无法处理时序依赖(标准 CNN):传统的 2D CNN 无法建模时间维度上的信息,处理视频等动态数据时需要结合 RNN 或使用 3D 卷积


术语别名#

  • CNN

  • 卷积神经网络


相关术语#

  • CNN

  • 3DCNN

  • RNN

阅读 --

4.1 卷积的概念

在本节内容中,我们首先再次抛出了深度学习的理念,即对输入进行深度特征提取然后再进行后续相关任务;接着我们引出了对于图像处理相关模型来说其应该具备的4种基本特性;最后,通过比较全连接操作与卷积操作在对图片进行特征提取时的不同之处,来介绍了卷积 …

4.2 卷积的计算过程

在上一节内容中,我们详细介绍了卷积操作的核心理念与思想,并通过对比全连接操作与卷积操作在识别同一元素的不同方式,进一步介绍了卷积操作的核心思想。但这仅仅只是对卷积操作有了一个总体的认识,其中仍有许多细节的地方没有进行介绍。例如:什么是多卷积 …