训练得到的模型往往太重,直接部署到边缘端跑不动。轻量化是从「能训练」到「能落地」的关键一环。
三大手段
1. 知识蒸馏
让一个复杂的教师网络「教」一个轻量的学生网络。学生学到教师软化后的分布,效果往往好于直接训练同等大小的模型。
2. 剪枝
把影响小的权重或通道去掉。有结构化(剪整个通道/层)和非结构化(剪单个权重)之分,结构化剪枝对硬件更友好。
3. 量化
把 FP32 权重压到 INT8。配合 TensorRT 等推理引擎,速度可以翻几倍,精度损失通常可控。
与我校研究的关系
我的 YOLOv8n+P2 项目 在加入 P2 头提升精度后,需要靠蒸馏 + 量化把它「压回」可部署的尺寸,落到 知识集/计算机视觉/边缘端部署。