Computer Vision 计算机视觉是人工智能的一个重要分支,研究如何让计算机“看懂”图片、视频或其他视觉输入,并进行理解、分析与决策。

让计算机拥有类似于人类视觉系统的能力,从静态图像或动态视频中“看到”、“感知”、“理解”世界。

视觉是最重要的感觉器官

目标和任务

  1. 感知(Perception):捕获图像、视频(用摄像头、传感器等), 预处理(去噪、增强、标准化)
  2. 理解(Understanding):识别物体、场景、行为;理解图像内容中的语义信息
  3. 推断(Inference):根据视觉信息推测物体状态、动作趋势,进行预测、决策
任务说明举例
图像分类(Image Classification)判断一张图属于哪个类别这张图是“猫”还是“狗”?
目标检测(Object Detection)找出图中所有感兴趣的物体及其位置(用框标记)在照片中找出所有行人、车、红绿灯的位置
语义分割(Semantic Segmentation)为图像中的每个像素分类把马路、人行道、车、树分区域上色
实例分割(Instance Segmentation)不仅分类,还区分同类别的不同个体不只知道有3只狗,还区分出第1只、第2只
姿态估计(Pose Estimation)估计物体/人体关键点的位置比如检测一个人在跳舞时的骨骼节点位置
三维重建(3D Reconstruction)从二维图像恢复出三维场景结构用照片还原房间的立体模型
视频分析(Video Analysis)分析连续帧之间的变化,检测动作、事件监控视频中检测异常行为

核心技术

  1. 特征提取(Feature Extraction) 传统方法:SIFT, SURF, HOG 等手工设计特征,目的是把原始像素变成“有意义的”数据表示

  2. 深度学习(Deep Learning) 尤其是卷积神经网络(CNN),彻底改变了计算机视觉。 自动学习图像的特征,不再依赖人工经验。 著名网络:AlexNet、VGG、ResNet、YOLO、Mask R-CNN 等。

  3. 数据集和标注(Datasets and Labeling) 需要大量高质量的数据来训练模型。 经典数据集:ImageNet(分类)、COCO(检测、分割)、Cityscapes(城市场景理解)等。

  4. 增强技术(Data Augmentation) 通过旋转、缩放、裁剪、加噪声等方法扩充训练数据。 帮助提高模型泛化能力。

  5. 自监督学习(Self-Supervised Learning) 让模型自己挖掘数据中的结构,不依赖大量人工标注。 未来发展的重要方向。

图像 机器学习和深度学习(Machine Learning and Deep Learning):利用算法提高计算机视觉任务的性能,如卷积神经网络(Convolutional Neural Networks, CNNs)。

阶段特点代表技术
1960s-1980s早期探索,基于符号处理,关注低级视觉边缘检测(Canny)、模板匹配
1990s-2000s机器学习引入,支持向量机(SVM)等用于图像识别特征工程(SIFT, HOG)
2012之后深度学习爆发,卷积神经网络成主流AlexNet,ResNet,YOLO
2020s自监督学习、Transformer在CV中兴起Vision Transformer(ViT),Segment Anything