从 ResNet 到 ViT:计算机视觉架构演进全解析

板块:深度学资料 | 发布时间:2026-07-28 19:44:11
计算机视觉是深度学习最早取得突破的领域之一。从 2012 年的 AlexNet 到 2020 年的 Vision Transformer,CV 架构的演进史就是半部深度学习发展史。 ━━━ 一、经典 CNN 时代(2012-2017) ━━━ 【AlexNet(2012)】 ImageNet 竞赛的转折点。AlexNet 首次将深度学习带到 CV 舞台中央: - 5 个卷积层 + 3 个全连接层 - ReLU 激活函数(解决梯度消失) - Dropout 正则化(防止过拟合) - GPU 并行训练(两块 GTX 580) 【VGGNet(2014)】 牛津大学视觉组提出,核心思想极其简单但有效: - 全部使用 3x3 小卷积核 - 通过堆叠小卷积核获得大感受野 - 网络深度达到 16-19 层 - 缺点:参数量巨大,训练很慢 【ResNet(2015)】 何恺明提出的残差网络是 CV 领域最具影响力的工作之一: - 引入残差连接(Skip Connection) - 解决了深层网络的退化问题 - 网络深度达到 152 层(是 VGG 的 10 倍) - 参数量反而比 VGG 更少 残差块的核心公式:y = F(x) + x,让网络可以学习残差 F(x) = H(x) - x,而不是直接学习 H(x)。 ━━━ 二、轻量化与自动化时代(2017-2020) ━━━ 【MobileNet】 专为移动端设计的轻量级网络,核心是深度可分离卷积: - 将标准卷积分解为 Depthwise + Pointwise 两步 - 计算量降低为常规卷积的 1/8 - 1/9 - 精度损失很小 【EfficientNet】 Google 用 NAS(神经架构搜索)找到的最优网络: - 同时缩放深度、宽度、分辨率三个维度 - 用更少的参数达到更高的精度 - 成为迁移学习的首选骨干网络 ━━━ 三、Transformer 时代(2020 至今) ━━━ 【Vision Transformer(ViT,2020)】 Google 团队证明:CV 任务不需要 CNN,纯 Transformer 也能做到。 核心思路: 1. 将图片分割成 16x16 的 Patch 2. 每个 Patch 拉平成一个向量 3. 加上位置编码 4. 输入标准 Transformer Encoder 5. 用 CLS token 做分类 【ViT vs CNN 对比】 - 全局感受野:ViT 一开始就能看到全局,CNN 需要堆叠层数 - 数据需求:ViT 需要更多数据(ImageNet-21k 预训练),CNN 在小数据上表现更好 - 计算量:ViT 在大分辨率下计算量较大 【Swin Transformer(2021)】 微软亚洲研究院提出,在 ViT 基础上引入层级结构和窗口注意力: - 限制注意力在局部窗口内计算,大幅降低计算量 - 通过窗口移动实现跨窗口信息交互 - 在检测和分割任务上全面超越 CNN ━━━ 四、当前趋势与展望 ━━━ 2025-2026 年 CV 领域的几个关键趋势: 1. CNN 与 Transformer 融合:如 ConvNeXt 用 CNN 的方式训练、达到 Transformer 的性能 2. 多模态大模型:CLIP、SAM 等统一了视觉和语言的理解 3. 自监督学习:不需要标注数据,模型自己从数据中学习表征 4. 高效部署:量化、蒸馏、剪枝让大模型可以在手机上运行 从 AlexNet 到 ViT,CV 架构的演进告诉我们:技术没有永恒的王者,只有不断迭代的创新。理解这段历史,能帮你更好地把握未来的方向。