Computer Vision 计算机视觉是人工智能的一个重要分支,研究如何让计算机“看懂”图片、视频或其他视觉输入,并进行理解、分析与决策。
让计算机拥有类似于人类视觉系统的能力,从静态图像或动态视频中“看到”、“感知”、“理解”世界。
视觉是最重要的感觉器官
目标和任务
- 感知(Perception):捕获图像、视频(用摄像头、传感器等), 预处理(去噪、增强、标准化)
- 理解(Understanding):识别物体、场景、行为;理解图像内容中的语义信息
- 推断(Inference):根据视觉信息推测物体状态、动作趋势,进行预测、决策
| 任务 | 说明 | 举例 |
|---|---|---|
| 图像分类(Image Classification) | 判断一张图属于哪个类别 | 这张图是“猫”还是“狗”? |
| 目标检测(Object Detection) | 找出图中所有感兴趣的物体及其位置(用框标记) | 在照片中找出所有行人、车、红绿灯的位置 |
| 语义分割(Semantic Segmentation) | 为图像中的每个像素分类 | 把马路、人行道、车、树分区域上色 |
| 实例分割(Instance Segmentation) | 不仅分类,还区分同类别的不同个体 | 不只知道有3只狗,还区分出第1只、第2只 |
| 姿态估计(Pose Estimation) | 估计物体/人体关键点的位置 | 比如检测一个人在跳舞时的骨骼节点位置 |
| 三维重建(3D Reconstruction) | 从二维图像恢复出三维场景结构 | 用照片还原房间的立体模型 |
| 视频分析(Video Analysis) | 分析连续帧之间的变化,检测动作、事件 | 监控视频中检测异常行为 |
核心技术
-
特征提取(Feature Extraction) 传统方法:SIFT, SURF, HOG 等手工设计特征,目的是把原始像素变成“有意义的”数据表示
-
深度学习(Deep Learning) 尤其是卷积神经网络(CNN),彻底改变了计算机视觉。 自动学习图像的特征,不再依赖人工经验。 著名网络:AlexNet、VGG、ResNet、YOLO、Mask R-CNN 等。
-
数据集和标注(Datasets and Labeling) 需要大量高质量的数据来训练模型。 经典数据集:ImageNet(分类)、COCO(检测、分割)、Cityscapes(城市场景理解)等。
-
增强技术(Data Augmentation) 通过旋转、缩放、裁剪、加噪声等方法扩充训练数据。 帮助提高模型泛化能力。
-
自监督学习(Self-Supervised Learning) 让模型自己挖掘数据中的结构,不依赖大量人工标注。 未来发展的重要方向。
图像 机器学习和深度学习(Machine Learning and Deep Learning):利用算法提高计算机视觉任务的性能,如卷积神经网络(Convolutional Neural Networks, CNNs)。
| 阶段 | 特点 | 代表技术 |
|---|---|---|
| 1960s-1980s | 早期探索,基于符号处理,关注低级视觉 | 边缘检测(Canny)、模板匹配 |
| 1990s-2000s | 机器学习引入,支持向量机(SVM)等用于图像识别 | 特征工程(SIFT, HOG) |
| 2012之后 | 深度学习爆发,卷积神经网络成主流 | AlexNet,ResNet,YOLO |
| 2020s | 自监督学习、Transformer在CV中兴起 | Vision Transformer(ViT),Segment Anything |