![]()
![]()
在墨子沙龙和SELF讲坛联合举办的2016年创新大会上,上海大学仿生视觉与类脑智能研究所所长张晓林,开展了一场题为《让机器人“开眼”看世界》的主题演讲。
![]()
▲张晓林教授近照 来源:新华社
眼睛的出现促使生命大量诞生。人类的眼睛是所有动物中综合性能最高的,我为人类感到骄傲。
各位嘉宾大家好,我从事仿生眼研究二十多年,最初的研究方向是产业机器人的控制。之后从人类眼球的运动构造出发,来探讨工学意义上的眼睛的形态。今天我将和大家分享我的研究。
1
第一部分
一千双眼中的一千个“哈姆雷特”
从寒武纪海洋蠕虫的感光细胞,再到昆虫、蜘蛛、脊椎动物的视觉分化,不同生物的眼睛演化出截然不同的不同的“观察逻辑”——或为规避天敌,或为精准捕猎,或为空间抓取。这些形态各异的视觉系统,共同构建出如同“一千个哈姆雷特”般形态各异的生存“视界”。
寒武纪时期,生命经历了大爆发,许多生命形式在短短几百万年间突然涌现。研究认为,这是因为那时一种名为海洋蠕虫的生物,其大脑细胞产生了感光效应。这些感光细胞逐渐演变成了眼睛,而眼睛的出现则促使生命大量诞生。这种海洋蠕虫名为奇虾。它当时有两只眼睛,现在判断应为复眼。正是因为有了这双眼睛,它才成为了当时的海洋霸主。
![]()
▲第一个近乎完整的奇虾化石 来源:维基百科
由于眼睛的诞生,刚才提到的奇虾所属的节肢动物门,至今依然存在,并且是地球上种类最多的门类。
几乎所有的昆虫都拥有复眼,其中蜻蜓的种类最多,它有两只复眼,两只眼睛里有2万多个小视孔。由于复眼很容易实现立体视觉,因此昆虫等较为简单的动物易采用复眼结构。但人类若使用复眼则会遇到问题,因为如果人的视觉系统采用复眼,其尺寸需要达到直径一米多,才能实现人眼目前的功能。
还有一种眼睛属于蜘蛛,这种蜘蛛叫跳蛛,它不织网,而是在地面奔跑捕食。这种跳蛛有八只单眼,前四后四,因为它的脖子不能转动。
![]()
▲昆虫、节肢动物、软体动物、脊椎动物的眼睛 来源:科学出版社
最终在进化中胜出的是脊椎动物的眼睛。几乎所有的脊椎动物都拥有两只眼睛,且这两只眼睛都是可动的。脊椎动物的眼睛又可分为四种。
第一种是食草性动物,例如兔子,拥有360度的视角,可以全方位观察。但其缺陷在于双眼视野没有交叉,因此不具备立体感。但它不追踪猎物,只是为了防止被肉食性动物捕食,所以视野范围广就足够了。
第二种是食肉性动物,它们的眼睛与人眼较为接近,朝向前方,需要精准测量猎物的距离。因此,其双眼重合的视野部分很大。
第三种,是鹰眼,它能在千米高空发现地面上的小老鼠或蛇。鹰眼与人眼的不同之处在于,它拥有两个以上的中心凹。所谓中心凹,就是我们人眼中央看东西最清晰,而周边则较为模糊的区域。当它在千米高空俯瞰时,会使用深度中心凹来观察远处。当它发现目标后,便会盘旋下降,在接近地面时,使用两个眼睛的近距离中心凹,沿直线俯冲捕捉猎物。
![]()
▲中国科学院上海微系统与信息技术研究所仿生视觉系统实验室基于仿生鹰眼的雪山冰川测量验证。来源:澎湃新闻
第四种,也是我们主要研究的,是人类的眼睛。人类的眼睛是所有动物中综合性能最高的,我为人类感到骄傲。我推测这与人类祖先,如猴子在树木间跳跃有关。它不仅需要单个物体的立体视觉和距离判断,更需要整体的空间视觉能力,以便能准确抓取。因此,它的立体视觉和颜色辨别能力都非常强。由于人类会研究自身疾病,因此对人眼的解剖和功能理解最为透彻。
2
第二部分
当我们谈论人是视觉动物时,我们在谈论什么
人眼接收的信息占人脑从外界接触信息的83%以上。视觉信号在大脑中处理的部分非常大。同时,视觉神经实际上是从脑细胞进化而来的。因此,人眼其实是大脑延伸到体表的一部分,可以说人眼就是大脑。
![]()
▲本次讲座展示的人眼的独特构造 来源:墨子沙龙
人眼有一个中心凹,当眼睛朝上看时,光线到达中心凹,在正负大约十度以内,看到的东西非常清晰。可以看到,中心凹区域的视觉细胞是视锥细胞,数量约有700多万个。而周边区域视锥细胞很少,主要是视杆细胞,数量竟有1.5亿多。视杆细胞具有低通滤波器的功能,它将图像模糊化。通过模糊化处理,其运算速度会提高,精度也会变得更高。这可能在直观上不易理解,相当于“难得糊涂”,这种糊涂反而更容易看清本质。我们的图像处理也是如此,需要将图像模糊化后,再寻找其特征点。
目前机器人视觉中的眼睛大多是固定的,即便偶尔有动的,也只是模仿人眼的运动,而非真正利用其运动。实际上,眼球运动非常关键。它可以实现视交叉,即左眼和右眼的信息交互在一起,只有这样,才能实现立体视觉。
人眼的功能最重要的是检测自身的位置,即自己的移动和转动。其次才是对象物的距离、位置和方向,以及其尺寸。这些都是最基本的功能,几乎所有动物都具备,有些动物甚至没有大脑和小脑,但依然具备视觉功能。
![]()
▲上海黄浦区悖论博物馆的“埃姆斯房间”,让大脑的空间构建与线性透视假设在特定场景下被“欺骗”。它揭示出人类的视觉系统会根据环境自动推测大小、位置、颜色等。 来源:上海黄浦
真正的智能部分在后端,即空间环境感知。动物之所以能回到自己的巢穴,是因为它的大脑会慢慢拼接生成一张空间地图,并知道自己在地图上的位置。这也是我们视觉系统后端的研究将实现的目标。
变色龙的两只眼睛可以分别观察,它在瞬间完成对目标位置的测量。而人眼需要的不是某一个目标,而是整体的空间立体视觉,因此它需要始终保持左眼和右眼的位置关系。
这种位置关系非常微妙。当一个物体逐渐走近或走远时,眼睛会进行相对运动,即不仅会一起动,还可以相对而动,但又不会分开。人眼左右眼的位置关系,即相对位置关系,我们称之为“标准辐辏”,即左右眼之间的上下、旋转以及距离高低等。所有这些都可以通过旋转来保证平行,其精度非常高。
![]()
▲人眼通过多重因素建立立体视觉。来源:清华大学
人眼还有一种功能叫前庭动眼反射。人的耳朵里有半规管和耳石,用来测量头部的旋转和平移运动,这些信号用来控制眼睛。因此人眼的视野非常稳定。无论骑摩托车还是奔跑,看到的景象都非常稳定。当你头部左转时,在黑夜中眼睛会自然向右转。
另一个很重要的功能是跳跃性眼球运动。眼睛会进行高速的跳跃运动,从一个物体跳到另一个物体。其最高速度可达每秒800度。在跳跃过程中,所有图像都会被切断,人是看不见的,即模糊阶段是看不见的。例如,人在跑,对方也在跑,但你想看谁就能看谁,这在机器人上是非常难实现的。
3
第三部分
仿生机器人能否学会“眉来眼去”?
要模仿人眼,主要是模仿三大部分。即“标准辐辏”、前庭动眼反射和跳跃性眼球运动。
首先是眼球的构造要与人眼类似,具有运动控制系统。在人脑的脑干和大脑中处理图像。目前大部分机器人视觉都在做图像处理,而很少有研究眼球运动的。我们正好填补了这份空白。将运动与图像处理慢慢结合,会产生比固定双目视觉更高级的图像。
![]()
▲得益于双目视觉系统,机器人能够与面前的观众进行眼神交流。来源:https://b23.tv/vQmrtTC
我们计划将眼球运动的算法集成到芯片中,再与视觉云和互联网连接,利用大数据等功能,使这双眼睛的功能接近甚至超越人眼。
![]()
▲中国科学院上海微系统与信息技术研究所双目视觉微系统,可有效提升视差预测效率和精度。来源:上海嘉定
我们让机器人基本实现了前庭动眼反射。我们设计了一个陀螺仪和加速度传感器,将它们的信号加入到视觉反馈系统中后,整个眼睛就会变得非常稳定。快速转动也不会跑掉。现在,目标物走近它就会后退,后退它就会跟随。这样,机器人可以跟着主人走,而不会撞到主人身上。
还有就是跳跃性眼球运动,即当对方有两个目标在动,自己也在动时,可以想看谁就能看谁。这在控制上比较复杂,我们花了较长时间,大约在六七年前完成了这项工作。
总的来说,仿生视觉技术的应用比较广泛。利用它,只要给机器人一个地图,它就知道自己在地图上的位置。还可以通过三维重建,将远和近的物体分离开,这样就知道哪里是障碍物。
当仿生眼能够达到人眼的一些基本功能后,在很多方面会超越人眼。
人眼只能对焦不能变焦,而机器人可以实现变焦。而且我们的转角传感器精度高达千分之一度,所以测量精度会高很多。控制速度等可以远远超过人眼。机器人通过大数据和物联网,可以同时进行大量数据处理,这也是人脑所不具备的。
![]()
▲电影《阿凡达》拍摄现场 来源:豆瓣
当我们拍摄3D电影时,两个摄像机的位置需要与人眼完全一致,才不会感到眩晕。这个功能是在《阿凡达》上映后,我们才开始注意到的。而我们在做机器人眼睛时已经有了这个功能,我们开发了一套全自动的3D摄影系统。这个系统目前效果很好,是全球唯一可以自动拍摄3D的系统。机器人视觉的成熟,一定会让机器人物种迎来大爆炸。
文字整理:诗学
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.