你有没有想过这些问题:手机相册怎么自动把照片分成”人物””风景””动物”?小区门禁怎么”刷脸”开门?医院的 X 光片怎么自动识别肺癌?自动驾驶怎么识别红绿灯和行人?这些应用背后都是同一个技术——计算机视觉(Computer Vision,简称 CV)。
计算机视觉是人工智能的一个分支,让计算机”看懂”图像和视频——这听起来简单,做起来极难。人类大脑识别一只猫只需要 0.1 秒,但要教会计算机做同样的事,人类花了 60 年。
CV 主要解决几类问题:
- 图像分类:给一张图,回答”这是什么”。是猫还是狗?是飞机还是汽车?这是最基本的 CV 任务。
- 目标检测:找出图里所有目标并标记位置。图里有几只猫分别在哪儿?自动驾驶场景里这辆车前面有几个人、几辆车、几个红绿灯?
- 图像分割:把图的每一个像素都分类。医学影像里要标出肿瘤的精确边界,自动驾驶要标出可行驶区域的精确边界。
- 人脸识别:从摄像头画面中找到人脸并识别身份。小区门禁、手机解锁、公安系统都在用。
- 姿态识别:识别人体的姿态——站着、坐着、摔倒、跳舞。体育训练、康复医疗、老人监护都用得上。
- 图像生成:让 AI 自己”画”出新图像。文生图模型(Stable Diffusion、Midjourney、DALL·E)能根据文字描述生成逼真图像。
- 视频理解:不只理解单张图,还理解视频序列——动作识别、异常事件检测、视频摘要。
CV 这 10 年的核心突破是 2012 年的 AlexNet——它第一次用深度学习(CNN 卷积神经网络)在 ImageNet 图像识别大赛上把错误率从 26% 降到 15%,从此开启了深度学习时代。后续的 VGG、ResNet、YOLO 等网络让 CV 能力持续提升,到 2020 年后,CV 在多数任务上已经超过人类水平。
今天,CV 已经渗透到几乎所有行业:
- 消费电子:手机相册分类、拍照美颜、AR 特效。
- 安防:人脸识别门禁、异常行为检测、车牌识别。
- 医疗:CT/MRI 影像诊断、病理切片分析、手术导航。
- 自动驾驶:识别行人、车辆、交通标志、可行驶区域。
- 工业:产品缺陷检测、装配线视觉定位、智能仓储。
- 农业:病虫害识别、果蔬分拣、产量预估。
- 零售:无人商店、智能试衣镜、商品识别。
CV 是 AI 商业化最成熟的领域之一,也是普通人能”看见”AI 的最直接方式——下一次你用手机”刷脸”解锁时,背后的神经网络已经帮你工作了。