一、核心结构差异
VGG(深度堆叠型):
全由3×3 卷积 +2×2 池化顺序堆叠,无跨层连接;典型为 VGG16/19,末端接3 个大全连接层(前两层各 4096 维),导致参数量高达1.38 亿,深层易梯度衰减 。
GoogLeNet(多尺度并行型):
核心为Inception 模块,同一层内并行执行1×1、3×3、5×5 卷积及 3×3 池化后通道拼接;大量使用1×1 卷积降维控制计算量;末端用全局平均池化(GAP)替代全连接层,参数量仅约500-700 万;含辅助分类器缓解梯度消失 。
.ResNet(残差学习型):
核心为残差块(Residual Block),引入Shortcut 跳跃连接实现 H(x)=F(x)+xH(x)=F(x)+x,允许梯度无损回传;支持18 至 152 层超深结构;深网采用Bottleneck 设计(1×1 降维→3×3 卷积→1×1 升维);末端同样使用 GAP,无 Dropout 。
二、关键指标对比

三、设计哲学演进
VGG证明了小卷积核堆叠可提升性能,但受限于串行结构与庞大参数,难以继续加深 。
GoogLeNet转向“宽度”探索,通过多尺度并行提取特征并利用 1×1 卷积压缩维度,在保持深度的同时大幅降低计算成本 。
ResNet回归“深度”本质,通过恒等映射解决深层网络优化难题,使训练上百层网络成为可能,成为后续架构的基石。
四、典型适用场景
VGG 适用场景
教学演示、基础特征可视化任务,结构简单易理解
算力充足、对推理速度不敏感的离线图像分类任务
作为骨干网络用于部分需要高特征表达能力的目标检测框架
GoogLeNet 适用场景
移动端、嵌入式等算力资源受限的部署环境
实时性要求高、参数量约束严格的轻量图像分类任务
多尺度目标占比高的场景,可同时捕捉不同粒度特征
ResNet 适用场景
高精度要求的工业级图像分类、目标检测、语义分割任务
数据集规模大、需要搭建超深网络的复杂CV任务
各类下游迁移学习任务,是目前最通用的骨干网络选型
扫码申领本地嵌入式教学实录全套视频及配套源码