一起走进计算机视觉的世界

本文详细介绍了计算机视觉的基本概念、主要任务,包括图像分类、物体检测、物体定位、图像分割、图像标注和图像生成。重点讨论了卷积神经网络(CNN)、Fast R-CNN、YOLO等模型在各个任务中的应用。推荐了学习资源如《数字图像处理与分析》、OpenCV库以及吴恩达的深度学习课程。计算机视觉的发展受益于深度学习技术,未来在自动驾驶领域具有广阔前景。

计算机视觉简介

计算机视觉是一门研究如何使机器“看”的科学,更进一步的说,就是指用摄影机和计算机代替人眼对目标进行识别、跟踪和测量等,并进一步做图像处理,用计算机处理成为更适合人眼观察或传送给仪器检测的图像

计算机图形学和计算机视觉:

可能刚开始学习视觉相关的小伙伴对计算机视觉和计算机图形学的概念有些蒙圈,感觉两者非常像。但其实他们还是有很大区别的,简单的来说,计算机视觉侧重于对图像的识别,得到一些结论,而计算机图形学侧重于如何从其他数据产生到图像。具体来说

计算机图形学(Computer Graphics)讲的是图形,也就是图形的构造方式,是一种从无到有的概念,从数据得到图像。是给定关于景象结构、表面反射特性、光源配置及相机模型的信息,生成图像。

计算机视觉(Computer Vision)是给定图象,从图象提取信息,包括景象的三维结构,运动检测,识别物体等。

主要任务

在现在的计算机视觉研究中,可以主要分类为几个主要的任务

1. 图像分类:分类任务是基础任务,而图像分类问题就是给输入图像分配标签类别的任务,这是计算机视觉的核心问题之一。一般说来,经典的图像分类算法是通过手工特征或者特征学习方法对整个图像进行全局描述,然后使用分类器判断是否存在某类物体。现在更多的是用端到端的深度学习技术。

2.物体检测:物体检测是视觉感知的第一步,也是计算机视觉的一个重要分支。物体检测的目标,就是用框去标出物体的位置,并给出物体的类别。物体检测和图像分类不一样,检测侧重于物体的搜索,而且物体检测的目标必须要有固定的形状和轮廓。图像分类可以是任意的目标,这个目标可能是物体,也可能是一些属性或者场景。

3、物体定位:如果说图像识别解决的是what,那么,物体定位解决的则是where的问题。利用计算视觉技术找到图像中某一目标物体在图像中的位置,即定位。目标物体的定位对于计算机视觉在安防、自动驾驶等领域的应用有着至关重要的意义。

另外,物体定位的延伸目标跟踪,是指在给定场景中跟踪感兴趣的具体对象或多个对象的过程。简单来说,给出目标在跟踪视频第一帧中的初始状态(如位置、尺寸),自动估计目标物体在后续帧中的状态。该技术对自动驾驶汽车等领域显得至关重要。

4. 图像分割:图像分割指的是将数字图像细分为多个图像子区域(像素的集合,也被称作超像素)的过程。图像分割的目的是简化或改变图像的表示形式,使得图像更容易理解和分析。更精确地说,图像分割是对图像中的每个像素加标签的一个过程,这一过程使得具有相同标签的像素具有某种共同视觉特性。

另外,“图像语义分割”是一个像素级别的物体识别,即每个像素点都要判断它的类别。它和检测的区别是,物体检测是一个物体级别的,他只需要一个框,去框住物体的位置,而通常分割是比检测要更难的问题。

5. 图像标注–看图说话:图像标注是一项引人注目的研究领域,它的研究目的是给出一张图片,你给我用一段文字描述它,具体例子如下图所示,近几年,工业界的百度,谷歌和微软 以及学术界的加大伯克利,深度学习研究重地多伦多大学都在做相应的研究。

6. 图像生成–文字转图像:图片标注任务本来是一个半圆,既然我们可以从图片产生描述文字,那么我们也能从文字来生成图片。这个任务也是非常有趣的,特别是在深度学习模型GAN被研发出来之后,这个任务也有更多的方法来解决。

主要模型和技术

  1. 图像分类设计主要的模型-卷积神经网络(CNN)
  2. 目标检测涉及主要模型是Fast R-CNN算法、YOLO、SSD以及R-FCN等等
  3. 基于CNN完成目标跟踪的典型算法是FCNT和MD Net。
  4. 图像分割的经典模型包括FCN模型,Mask R-CNN。
  5. 图像标注的话可以看下谷歌开源的“Show and Tell”
  6. 图像生成在今年来主流的方式是GAN模型和VAE模型,这两个生成模型都值得好好研究。

相关资料推荐

  1. 对于学习基础,我比较推荐的是《数字图像处理与分析》https://www.bilibili.com/video/av43045572和OpenCV这个计算机视觉库,对于OpenCV,这里推荐一本比较基础的介绍资料

《OpenCV_2 Computer Vision Application Programming Cookbook》

2. 然后推荐一些视频,非常推荐大牛Andrew Ng吴恩达的那门《深度学习》专项课程 ,首先这门课也是对入门者非常友好的,然后Ng讲课也非常的深入浅出除了看视频,建议要把作业全部写完,这样才会理解得更加深刻。然后还有斯坦福的《计算机视觉cs231n》这门课,想当年我就是从这节课入的门,这门课也有很多相应的练习,都可以做一下,对巩固深度学习,视觉的知识非常的有好处

3.最后推荐一些书籍 和网站,书籍的话推荐《Deep Learning》和《Computer Vision : Algorithms and Applications》这两本书应该也是非常出名的的,建议研读几遍,内力必定大增。网站的话肯定是arxiv的Computer Vision and Pattern Recognition模块了,这个模块每天都有新的关于计算机视觉的论文,大家可以经常上去看看。

总结及看法

近年来,计算机视觉的发展越来越迅猛,大大小小的应用也越来多,从日常超市条形码检测、上下班指纹考勤、人脸识别考勤、电影特效制作、工业生产自动化检测、 医学影像检测,再到航空天文领域,航空遥感测控地形地貌等等。我觉得首先这得益于深度学习技术的发展和应用,目前为止,相对于自然语言处理,计算机视觉的研究和应用更加的激动人心,更加的贴近人民生活的方方面面。

对于未来计算机视觉的发展,我最感兴趣的是在自动驾驶方面,虽然说这个领域现在有很多的困难和挑战,但是我觉得在知识目标跟踪和检测技术的不断发展前提下,自动驾驶是变得越来越有可能。

最后,现在计算机视觉很火热,这个领域也非常的有趣,也欢迎你们走进计算机视觉的世界~

 

本文首发于我自己的公众号,欢迎大家关注~

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值