我所经历的大数据平台发展史(上)——非互联网时代

李博源 2016-02-18 10:26:00

这个数据平台发展史仅是我自己经历过的由传统数据平台到互联网数据平台发展的一些简单回忆，文章引用了历史项目&平台规划架构，在这里不做更深入描述。

我是从2000年开始接触数据仓库，大约08年开始进入互联网行业，那时在互联网接触到数据平台与传统第三代数据架构还是有很大的类似之处。随着互联网的突飞猛进，每一次的技术变革都带来一场从技术、架构、业务的渐进式变革。直到今天，互联网与非互联网的数据平台架构已经存在着非常大的差异。

回顾早期的企业环境，企业的生产与服务是一个很长周期，导致业务数据呈现一种粗粒度模式。随着互联网的快速渗透从早期的PC终端到“裆下“的移动终端，对用户的需求与服务周期逐渐缩短，业务量级、数据类型多样化与存储的暴增，对应着技术、架构、业务呈现出迅猛发展，相应的数据沉淀与积累也成指数暴涨。

从”数据仓库“ 词开始到现在的“大数据”，中间经历了太多的知识、架构模式的演进与变革，比如说“数据仓库、海量数据、大数据”等。（数据仓库一般指的是：在相当长的时间内堆积数据，仅仅需要处理大量数据请求中的少部分的系统。数据仓库不等同于“海量数据”，恰恰相反，而是其子集。海量数据也包含：通过大量的连接提供每秒百万次服务请求的系统。大数据是海量数据+复杂类型数据基础上的大分析、高宽带、大内容）。

数据仓库在国外发展多年，大约在98-99年左右进入中国，到现在经历了大约十多年发展。到了今天，尤其是在非互联网、互联网企业两个领域的数据平台有着显著的区别，本文将以非互联网时代与互联网时代数据平台发展的角度来讲述。

从传统企业数据平台转到互联网的同学是否有感觉，非互联网企业、互联网企业的数据平台所面向用户群体是不同的？这两类的数据平台建设、使用用户又有什么变化？数据模型设计又有什么不同呢？

我们先来看用户群体的区别，下面整理了两张图来讲述用户群体相关区别。

用户群体的区别

1、非互联网数据平台用户

企业的boss、运营的需求主要是依赖于报表、商业智能团队的数据分析师去各种分析与挖掘探索。

支撑这些人是ETL开发工程师、数据模型建模、数据架构师、报表设计人员，同时这些角色又是数据平台数据建设与使用方。

数据平台的技术框架与工具实现主要有技术架构师、JAVA开发等。

用户面对是结构化生产系统数据源。

2、互联网数据平台用户

互联网企业中员工年龄比非互联网企业的要年轻、受教育程度、对计算机的焦虑程度明显比传统企业要低、还偶遇其它各方面的缘故，导致了数据平台所面对用户群体与非互联网数据平台有所差异化。

互联网数据平台的使用与建设方是来自各方面的人，数据平台又是技术、数据产品推进建设的。

分析师参与数据平台直接建设比重增加。

原有的数据仓库开发与模型架构师的职能也从建设平台转为服务与咨询.

用户面对是数据源多样化，比如日志、生产数据库的数据、视频、音频等非结构化数据。

从用户群体角度来看，非互联网、互联网的数据平台用户差异性非常明显，互联网数据平台中很多理论与名词都是从传统数据平台传递过来的，本文将会分别阐述非互联网、互联网数据平台区别。

非互联网时代

从数据仓库发展至今，基本可分为五个时代、四种架构。（大家可以详细翻一下数据仓库的发展历史，在这里仅作科普性介绍）

约在1991年前的全企业集成
1991年后的企业数据集成EDW时代
1994年-1996年的数据集市
1996-1997年左右的两个架构吵架
1998年-2001年左右的合并年代

五个时代划分是以重要事件或代表人物为标志。比如说，在企业数据集成EDW时代的重要代表人物是Bill Inmon，发表代表作数据仓库一书，提出如何建设数据仓库的指导性意见与原则。他遵循的是自上而下的建设原则，这个导致后来数据仓库在千禧年传到中国后的几年内，几个大实施厂商都是遵守该原则的实施方法，后来的数据仓库之路等各种专业论坛上针对数据仓库ODS-EDW的结构讨论。

在国内项目实施中，IBM、Terdata、埃森哲、菲奈特(被东南收购，东南后来某些原因而倒闭)等很多专业厂商在实施中对ODS层、EDW层都赋予了各种不同的功能与含义。

在数据集市年代，代表人物是Ralph kilmball，他的代表作是”The Data Warehouse Toolkit“，在数据仓库的建设上Ralph kilmball提出的是自下而上的建设方法，刚好与Bill Innmon的建设方法相反，这两种架构方式各有千秋，所以就进入了争吵时代。

我整理了一个表格是这两位大师的优缺点：

随着数据仓库的不断实践与迭代发展，从争吵期进入到了合并的时代，其实争吵的结果要么一方妥协，要么新的结论出现，果然Bill inmon与Ralph kilmball的争吵没有结论，干脆提出一种新的架构包含对方，也就是后来Bill Inmon提出的CIF（corporation information factory）架构模式，这也算是数据仓库的第三代架构，其架构特点是把整个架构划分为不同层次，把每一层次的定义与功能都详细的描述下来。从04年后国内的很多数据仓库架构、甚至互联网刚开始搞数据平台数据仓库架构模式也是这一种。

数据仓库第一代架构

开发时间：2001-2002年。

海尔集团的一个BI项目，架构的ETL使用的是微软的数据抽取加工工具DTS，老人使用过微软的DTS知道有哪些弊端，后便给出了几个DTS的截图。

（1）功能：进销存分析、闭环控制分析、工贸分析等。

（2）硬件环境：

- 业务系统数据库：DB2 for Windows,SQL SERVER2000,ORACLE8I
- 中央数据库服务器：4*EXON,2G,4*80GSCSI
- OLAP 服务器：2*PIV1GHZ,2G,2*40GSCSI

数据仓库第二代架构

这是上海通用汽车的一个数据平台，别看复杂，严格意义上来讲这是一套EDW的架构，在EDS数据仓库中采用的是准三范式的建模方式构建，大约涉及到十几种数据源，建模中按照某一条主线把数据都集成起来。

这个数据仓库平台计划三年的时间构建完毕，第一阶段计划构建统统一生性周期视图、客户统一视图的数据，完成对数据质量的摸底与部分实施为业务分析与信息共享提供基础平台。第二阶段是完成主要业务数据集成与视图统一，初步实现企业绩效管理。第三阶段全面完善企业级数据仓库，实现核心业务的数据统一。

在第一阶段数据仓库中的数据再次通过阶梯型高度聚合进入到数据集市DM（非挖掘集市）中，完成对业务的支撑。

数据的ETL 采用datastage工具开发（大约06年我写了国内最早的版本datastage指南大约190页叫“datastage 学习版文档”。后来没再坚持下来）。

数据集市架构

这个是国内某银行的一套数据集市，这是一个典型数据集市的架构模式，面向客户经理部门的考虑分析。

数据仓库混合性架构(Cif)

这是太平洋保险的数据平台，目前为止我认识的很多人都在该项目中待过，当然是保险类的项目。

回过头来看，该平台架构显然是一个混合型的数据仓库架构。它有混合数据仓库的经典结构，每一个层次功能定义得非常明确。

ODS层支撑单一的客户视图，是一个偏操作行的做唯一客户识别的，同时提供高可用户性客户主信息查询。

EDW层基于IIW（IBM的通用模型去整理与实施）最细粒度、原子、含历史的数据，也支持查询。

各业务数据集市(DM) 面向详细业务，采用雪花/星型模型去做设计的支撑OLAP、Report、仪表盘等数据展现方式。

数据仓库混合性架构(Cif)

OPDM大约是在2011年提出来的，严格上来说，OPDM操作型数据集市（仓库）是实时数据仓库的一种，它更多的是面向操作型数据而非历史数据查询与分析。

在这里很多人会问什么是操作型数据？首先来看操作型数据支持的企业日常运作，比如财务系统、Crm系统、营销系统生产系统，通过某一种机制实时地把这些数据在各孤岛数据按照业务的某个层次有机地自动化整合在一起，提供业务监控与指导。在2016年的今天看来，OPDM在互联网很多企业已经实现了，但在当时的技术上还是稍微有点困难的。

文章来源于 songzi2016订阅号，经作者同意由DBA+社群转发。

作者介绍：李博源