你需要知道的数据可视化基础
什么是数据可视化
世界原本没有数据可视化,最终也不再会有数据可视化。
—— 普罗菲特·愚指导
数据可视化是做给人类用的,在人类还没有出现或者说未来人类被人工智能灭绝后就不再需要数据可视化了。
数据是事实或观察的结果,是对客观事物的逻辑归纳,是用于表示客观事物的未经加工的的原始素材。从这个角度来说也可以说是数据本来就是可视化的,说以说我们所说的数据可视化应该是将客观事物的视觉效果优化了一下,使得人类可以更好的识别和获取到它所蕴含的信息。
然而对于机器来说,数据本身就是最好的数据可视化。所以当人工智能统治世界之时,我们现在所说的数据可视化便不复存在了。哎,说到这里还有一丝伤感呢,我这些到时候也就算是白写了。
由于人类自身的能力有限,所以人类感知客观事物的能力有限。人类的感知能力中最强的就是视觉能力了,所以我们通常所说的数据可视化其实是将数据转换为视觉信息让我们自己能够更好的感知。所以从这个角度来说,理论上音乐也算是一种数据可视化,只是说感知方式变成了听觉。
所以数据可视化从这个角度来看可以分为广义的数据可视化,和狭义的数据可视化。这里主要探讨的是狭义的数据可视化,也就是说将数据转换为视觉信息的这一过程。
数据可视化的分类
这里的分类说的是狭义的数据可视化下的分类,按照《数据可视化》一书中所描述的,数据可视化可以分为两大类:科学可视化和信息可视化。
科学可视化(英语:scientific visualization 或 scientific visualisation)是科学之中的一个跨学科研究与应用领域,主要关注的是三维现象的可视化,如建筑学、气象学、医学或生物学方面的各种系统。重点在于对体、面以及光源等等的逼真渲染,或许甚至还包括某种动态成分。
科学可视化其实很贴近于客观事物本身,比如说气象云图的可视化其实同太空中观看地球看到的效果接近。所以科学格式化更像是将客观事物的视觉效果进行了加强,并没有做更多本质上的修改。
科学可视化的理论与方法以及相对成形,也不是这一要探讨的重点。这里要探讨的是和科学可视化相对应的另一分类:信息可视化。
信息可视化(Information visualization)是一个跨学科领域,旨在研究大规模非数值型信息资源的视觉呈现(如软件系统之中众多的文件或者一行行的程序代码)。通过利用图形图像方面的技术与方法,帮助人们理解和分析数据。与科学可视化相比,信息可视化则侧重于抽象数据集,如非结构化文本或者高维空间当中的点(这些点并不具有固有的二维或三维几何结构)。
伴随着信息时代的来临,尤其是最近几年兴起的大数据。人类能获取到的信息越来越多,人们对信息的需求也越来越强烈。但是这些是一些更抽象的信息,比如说股票价格,网站数据,这些都同科学可视化中的数据有着本质的区别。这些信息数据的体量更加庞大,而且没有客观世界的实体映射。这样就越发暴露了人类能力的不足,人类自己无法掌握这些数据中说蕴含的信息,所以急需数据可视化来讲这些数据处理并通过视觉呈现为人类能够很好理解的视觉效果。换一个名词就是对数据进行可视化编码。
数据可视化的基本概念
上面说到了数据可视化本质上是将数据通过视觉的方式呈现出来让人类可以感知,也就是可视化编码。
可视化编码是信息可视化的核心内容,是将数据映射成可视化元素的技术,其通常具有表达直观,易于理解和记忆等特性。数据通常包含了属性和值。因此,类似的,可视化编码由两方面组成:(图像元素)标记和用于控制标记的视觉特征的视觉通道。前者是数据属性到可视化元素的映射,用于客观地代表数据的性质分类;后者是数据的值到标记的视觉表现属性的映射,用于展现数据属性的定量信息,两者的结合可以完整地对数据信息进行可视化表达。
以上是《数据可视化》一书中对信息数据可视化的抽象。不过从数据可视化程序来说还可以进一步的抽象,数据的属性和值都可以看做是数据的属性,至于标记也可以看做是视觉通道。这些在后面几章会再讲到。