文档章节

胖子哥的大数据之路(三)- 大数据仓库的需求分析该怎么做

张子良
 张子良
发布于 2014/02/20 08:00
字数 1440
阅读 1284
收藏 6

一、引言

  基于大数据技术构建数据仓库平台,源于大数据技术本身的不成熟和普及度问题,以及辅助工具的缺失,注定了其实施过程与传统数据仓库的差异性,和 更大的实施难度。本文针对大数据技术应用与数据仓库类项目需求分析阶段,需要完成的主要工作基于用户需求分析说明书的文档结构进行目录式展现。如需了解更 深层的细节,可以做专项技术交流和咨询服务。

一、项目范围的界定

  没有明确项目边界的项目是一个不可控的项目,如果项目规划阶段就没有界定明确的项目范围,项目实施过程过程中必将陷入万劫不复的境地,慎重慎重。基于大数据基于的数据仓库项目,面临技术和人员等方面的问题,主要包括下面几个方面:

(1)大数据基础平台的成熟度尚不完善:主要是指基于Hive+Hadoop技术的缺陷,需要技术在逐步的完善中;

(2)大数据辅助工具化的缺失:主要针对数据定义,数据处理以及数据可视化管理工具的欠缺;

(3)大数据开发和管理人员技术能力的不成熟:熟悉大数据相关平台管理和开发技术的人员的不足和技术层次参差不齐;

  正是基于以上原因的考虑,导致大数据环境下的数据仓库的实施相对于成熟的传统关系型数据库模式,将会面临更大的压力和更多的需要考虑的问题。项目边界的界定主要需要考虑一下问题:

(1)业务边界:都有哪些业务系统的数据需要接入到数据仓库平台。

(2)数据边界:都有哪些业务数据需要接入数据仓库平台,具体的包括哪些表,表结构如何,表间关系如何(区别于传统模式)。

(3)功能边界:提供哪些功能,不提供哪些功能,必须明确界定,该部分详见需求分析;

二、关键业务流程分析

 业务流程主要考虑包括系统间数据交互的流程、传输模式和针对大数据仓库本身涉及相关数据处理的流程两大部分。系统间的数据交互流程和模式,决定了你的数据仓库平台的架构和设计,因此必须进行专项分析。数据仓库本身需要考虑的问题包括以下几个方面,在此制作目录结构的展示:

2.1 历史数据导入流程

2.2 增量数据导入流程

2.3 数据完整性校验流程

2.4 数据批量导出流程

2.5 数据批量查询流程

三、功能性需求-只做目录结构的展示

3.1.历史数据导入

3.1.1 XX系统数据

3.1.1.1 数据清单... 3

3.1.1.2 关联规则... 3

3.1.1.3 界面... 3

3.1.1.4 输入输出... 3

3.1.1.5 处理逻辑... 3

3.1.1.6 异常处理... 3

3.2 增量数据导入

3.3 数据校验

3.4 数据导出

3.5 数据查询

四、非功能性需求

4.1 性能

4.2 安全性

4.3 可用性

...

五、接口需求

5.1 数据查询接口

5.2 批量任务管理接口

5.3 数据导出接口

六、集群需求

  大数据技术自身的特点,决定项目的实施,必须考虑单独的开发环境和生产环境,否则在后续的项目实施过程中,必将面测试不充分和性能无法测试的窘境,因此前期需求分析阶段,必须根据数据规模和性能需求,构建单独的开发环境和生产环境。

6.1开发环境

6.1.1 查询服务器

6.1.2 命名服务器

6.1.3 数据服务器

6.2 生产环境

6.2.1 查询服务器

6.2.2 命名服务器

6.2.3 数据服务器

七、其他

...

八、写在后面的化

  其实公共数据平台的产品化设计的思想一直影响着我的思维模式,作为数据仓库,其实更多的是考虑规范的应用接口,工具化,但是现实情况确实逼良为娼,无奈之举。实施过程中即要考虑应用的开发,同时还需要考虑工具化的提炼,也许这才是大数据落地实施真正的难度。提供统一的数据数据导入工具,数据可视化工具、数据校验工具、数据导出工具和公共的数据查询接口服务管理工具才是大数据作为数据仓库发展的方向。也许这就是探索者的苦恼吧。未完待续....


© 著作权归作者所有

张子良

张子良

粉丝 47
博文 14
码字总数 36118
作品 1
丰台
项目经理
私信 提问
胖子哥的大数据之路(二)- 大数据结构化数据存储应用模式

一、楔子   胖子哥是我网名,叫了很多年的网名,网名的来历与自己的沧桑和身材有关,不知是IT改变了我,显得苍老,还 是我本就苍老,顺应了IT行业的需要。25岁那面,曾被跟我一样高的漂亮美...

张子良
2014/02/14
352
0
胖子哥大数据之路(一)-数据仓库也需要大数据

一、楔子   大数据传统企业实施,其路漫漫,绝不会如昙花一现,探索大数据在传统行业的实施之路,寻找一条适合传统行业的企业大数据实施方法体系,是我执着坚守的信念,大数据是一种信仰,...

张子良
2014/02/12
3.6K
11
胖子哥的大数据之路(四)- VisualHBase功能需求框架

一、引言   大数据在结构化数据存储方面的应用需求越来越明确,但是大数据环境下辅助开发工具的不完善,给数据库管理人员和开发人员带来的不变难以言表,基 于此创建了开源项目VisualHBase...

张子良
2014/02/20
154
0
胖子哥的大数据之路(五)- 数据资源-垄断的壁垒

一、事件背景   昨天接触到一个客户,政府背景,行业应用,某部委直属的下属企业,算是垄断行业,依托政府资源,手里面掌握着全国XX行业所有的数据。原以为是 大数据平台的一个营销对象,聊...

张子良
2014/02/23
417
0
胖子哥的大数据之路(8)- 数据仓库命名规范

引言:   从对大数据的狂热到理性的回归,项目实施起到了醍醐灌顶的作用,大数据技术只能作为一种IT基础架构(存储+运算),而实际的工程化实施,还是要回归到IT传统技术,最近在整合大数据...

阿尔法胖哥
2014/04/14
0
0

没有更多内容

加载失败,请刷新页面

加载更多

iStatistica Pro for Mac(系统监控工具) v1.1.2

iStatistica Mac破解版推荐给大家!iStatistica Pro Mac是一款功能强大的系统监控工具,实时监控CPU,内存,网络,磁盘卡,帮你轻松删除不需要的文件和文件夹,释放电脑内存,提升运行速度。...

云不若
18分钟前
4
0
Vim和Ctags提示和技巧[关闭]

我刚刚使用我的Vim(或者更确切地说是gVim)安装了Ctags (以帮助进行C ++开发),并希望找到您最喜欢的命令,宏,快捷方式,以及随之而来的提示...... 分享你最好的武器库。 在Vim开发中你会...

技术盛宴
22分钟前
6
0
tensorlfow安装

系统环境 nv-jetson-nano-sd-card-image-r32.3.1.zip 1 基本工具安装 默认安装了python 3.6.8,需要安装如下基本软件 sudo apt updatesudo apt install curlcurl https://bootstrap.pyp...

JosiahMg
22分钟前
3
0
彻底修改maven项目工程的名称

1

观海562
40分钟前
5
0
整数反转(力扣)

整数反转 一、题目描述 给出一个 32 位的有符号整数,你需要将这个整数中每位上的数字进行反转。 示例 1: 输入: 123 输出: 321 示例 2: 输入: -123 输出: -321 示例 3: 输入: 120 输出: 21 ...

迪迪迪王
50分钟前
8
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部