从 ResNet 到 ViT:计算机视觉架构演进全解析
板块:深度学资料 | 发布时间:2026-07-28 19:44:11
计算机视觉是深度学习最早取得突破的领域之一。从 2012 年的 AlexNet 到 2020 年的 Vision Transformer,CV 架构的演进史就是半部深度学习发展史。
━━━ 一、经典 CNN 时代(2012-2017) ━━━
【AlexNet(2012)】
ImageNet 竞赛的转折点。AlexNet 首次将深度学习带到 CV 舞台中央:
- 5 个卷积层 + 3 个全连接层
- ReLU 激活函数(解决梯度消失)
- Dropout 正则化(防止过拟合)
- GPU 并行训练(两块 GTX 580)
【VGGNet(2014)】
牛津大学视觉组提出,核心思想极其简单但有效:
- 全部使用 3x3 小卷积核
- 通过堆叠小卷积核获得大感受野
- 网络深度达到 16-19 层
- 缺点:参数量巨大,训练很慢
【ResNet(2015)】
何恺明提出的残差网络是 CV 领域最具影响力的工作之一:
- 引入残差连接(Skip Connection)
- 解决了深层网络的退化问题
- 网络深度达到 152 层(是 VGG 的 10 倍)
- 参数量反而比 VGG 更少
残差块的核心公式:y = F(x) + x,让网络可以学习残差 F(x) = H(x) - x,而不是直接学习 H(x)。
━━━ 二、轻量化与自动化时代(2017-2020) ━━━
【MobileNet】
专为移动端设计的轻量级网络,核心是深度可分离卷积:
- 将标准卷积分解为 Depthwise + Pointwise 两步
- 计算量降低为常规卷积的 1/8 - 1/9
- 精度损失很小
【EfficientNet】
Google 用 NAS(神经架构搜索)找到的最优网络:
- 同时缩放深度、宽度、分辨率三个维度
- 用更少的参数达到更高的精度
- 成为迁移学习的首选骨干网络
━━━ 三、Transformer 时代(2020 至今) ━━━
【Vision Transformer(ViT,2020)】
Google 团队证明:CV 任务不需要 CNN,纯 Transformer 也能做到。
核心思路:
1. 将图片分割成 16x16 的 Patch
2. 每个 Patch 拉平成一个向量
3. 加上位置编码
4. 输入标准 Transformer Encoder
5. 用 CLS token 做分类
【ViT vs CNN 对比】
- 全局感受野:ViT 一开始就能看到全局,CNN 需要堆叠层数
- 数据需求:ViT 需要更多数据(ImageNet-21k 预训练),CNN 在小数据上表现更好
- 计算量:ViT 在大分辨率下计算量较大
【Swin Transformer(2021)】
微软亚洲研究院提出,在 ViT 基础上引入层级结构和窗口注意力:
- 限制注意力在局部窗口内计算,大幅降低计算量
- 通过窗口移动实现跨窗口信息交互
- 在检测和分割任务上全面超越 CNN
━━━ 四、当前趋势与展望 ━━━
2025-2026 年 CV 领域的几个关键趋势:
1. CNN 与 Transformer 融合:如 ConvNeXt 用 CNN 的方式训练、达到 Transformer 的性能
2. 多模态大模型:CLIP、SAM 等统一了视觉和语言的理解
3. 自监督学习:不需要标注数据,模型自己从数据中学习表征
4. 高效部署:量化、蒸馏、剪枝让大模型可以在手机上运行
从 AlexNet 到 ViT,CV 架构的演进告诉我们:技术没有永恒的王者,只有不断迭代的创新。理解这段历史,能帮你更好地把握未来的方向。