文档章节

大量数据≠大数据

 数据分析师
发布于 2016/07/10 17:24
字数 1352
阅读 6
收藏 0

Intetix Foundation(英明泰思基金会)由从事数据科学、非营利组织和公共政策研究的中国学者发起成立,致力于通过数据科学改善人类社会和自然环境。通过联络、动员中美最顶尖的数据科学家和社会科学家,以及分布在全球的志愿者,我们创造性地践行着我们的使命:为美好生活洞见数据价值。

在大数据时代,人们很容易把一大堆数据定义为“大数据”,比如,大型制造企业和仓库可能存有多年积累下来的存货数据,或许高达几兆兆字节,但这并不能算大数据。同样,1500个PoS机的现金数据、一大份工作表中的数据也不是大数据。

企业需要行之有效的方法去储存、分析、使用数据,如果管理的不是大数据问题,那就没有必要建立数据池、雇佣数据科学家,也没有必要买一堆Hadoop产品去管理。说到底,辨别所管理的是大数据还是大量数据至关重要。以下推出五种辨别方法:

1. 数据是否来源于多种不同渠道?

如果数据来源单一,即使数据量很大,也不太可能是大数据。

职业数据人会考虑大数据的三V(或4V):数量,多样性,速度,(精确性)。本文讨论的就是第二种:多样性。一般来说,大数据往往不是来自于单一源头或系统,而是来自于许多不同的地方,不同的形式,以及不同的变量。例如,PoS数据尽管数量庞大但不是大数据,可是如果把从供应商处取得的数据与其整合以构建供应链,则它们就成了大数据。因此,问题在于是什么形成了大数据,而不是仅仅考虑数量因素。

2. 数据是否需要被实时分析使用?

并不是所有的大数据都一定来源于多种不同渠道,当数据需要被实时分析使用,比如预防欺诈、股票交易,尽管数据缺乏多样性,但仍可被定义为大数据。在信用服务业,用于预防欺诈的数据来源并不复杂,但需要实时分析技术(通常用Spark,有时会同时使用Hadoop和Spark),这样若真的存在欺诈,也会被马上检测出并予以阻止。同样的,股票交易员所依赖的高频交易数据也并不是特别复杂的数据,但需要连续处理以做出买入或卖出股票的决定,Hadoop和Spark是被经常使用的分析工具。

3. 你是否需要询问复杂问题?

当你开始针对数据询问更加复杂的问题的时候,比如确定因果关系,则该数据就成了大数据。当然,在这种情况下,最好还是使用多方面来源的数据。比如,当你想知道女性红色高跟鞋的四月份的市场情况的时候,你所要的数据就不仅仅是你自己的采购记录了,你还要整合社交媒体和其他外部市场数据以得到最佳答案。

4. 数据集是否代表了许多不同的变量?

如果数据代表了一系列不同的难以界定模式和关联性的变量,那么即使数据是由单一系统或小型系统搜集而来,也可认定为是大数据分析。例如,气象数据仅从一些基础的系统取得(气温,气压,风速等),但数据关系却极为复杂,即使是最富经验的气象学家也不一定总能做出准确的气象预测,因此,他们会使用高度专业化的数据分析方法以作出更准确的预测(尽管还是有人会说他们并不比有关节炎的老人更准确)。

5. 数据是未架构的,半架构的,架构的还是以上的综合?

诸如SQL等关系明确的数据库长时间以来成功的处理了组织良好的数据,但如今的多媒体世界为我们呈现了一系列未架构的和半架构的数据,这些数据在SQL中无法得到良好的处理。这些数据包括图像,视频,文本文件,电子邮件交流,社交媒体,音频文件以及其他。NoSQL数据库正在变得更受欢迎,Hadoop和其他大数据工具在处理这些多样化的数据类型的时候显得更为强大,特别是你所做的处理工作不仅仅是保存和找回图像等。

你的数据是大数据吗?如果是,那么就去找寻合适的工具处理你的数据,通过Syncsort你可以找到大数据处理办法;如果你需要处理主机上的大数据,现在Hadoop也能帮你解决这个问题了。

 

----------------------------------------------------------------------------------------------------------------------------

了解更多商业智能行业资讯,BI解决方案以及商业智能软件下载请访问FineBI商业智能官网www.finebi.com

© 著作权归作者所有

粉丝 31
博文 1645
码字总数 2338861
作品 0
邢台
私信 提问
大数据时代数据可视化的概念研究

本文基于对DT时代下数据可视化概念进行解读与分析。在大数据时代大背景下,作为前端工程师,接触数据,使用数据,分析数据的次数会越来越多,开发数据可视化的应用也会越来越多。不管是使用E...

Perkin_
2018/04/02
0
0
电子政务专家、复旦郑教授:政府开放数据的价值与挑战(附PPT)

在7月8日举行的2016DAMS中国数据资产管理峰会上,中国信息协会电子政务专委会委员、复旦大学副教授郑磊分享了《开放数据的价值与挑战》,重点讲述作为公共资产的数据,也就是政府部门与公共部...

郑磊
2016/07/14
0
0
bzoj3143: [Hnoi2013]游走【概率dp+高斯消元】

Description 一个无向连通图,顶点从1编号到N,边从1编号到M。 小Z在该图上进行随机游走,初始时小Z在1号顶点,每一步小Z以相等的概率随机选 择当前顶点的某条边,沿着这条边走到下一个顶点,...

cdsszjj
2018/03/19
0
0
【深度学习系列】用PaddlePaddle和Tensorflow实现GoogLeNet InceptionV2/V3/V4

感谢关注天善智能,走好数据之路↑↑↑ 欢迎关注天善智能,我们是专注于商业智能BI,人工智能AI,大数据分析与挖掘领域的垂直社区,学习,问答、求职一站式搞定! 对商业智能BI、大数据分析挖...

天善智能
2018/05/09
0
0
验证矩阵乘法

如何使用随机性矩阵乘法,随机算法在验证多项式的恒等问题比确定算法要快,而且在准确性上面也是可以接受的。假设有A,B,C三个n*n的矩阵。为了方便起见假定对模2的整数计算。我们想要快速的...

sohu1990
2014/11/17
0
0

没有更多内容

加载失败,请刷新页面

加载更多

教你玩转Linux—添加批量用户

添加和删除用户对每位Linux系统管理员都是轻而易举的事,比较棘手的是如果要添加几十个、上百个甚至上千个用户时,我们不太可能还使用useradd一个一个地添加,必然要找一种简便的创建大量用户...

xiangyunyan
15分钟前
3
0
返回提示信息,如:xxx创建成功!

【服务端】在输出的方法块中,加入要输出的字段(qcm_batch_id) QCMUserType.cs: public struct QCM_Custom_Create_Batch_Out_Tag { public BASCoreType.Cmn_Out_T......

_Somuns
15分钟前
3
0
Aliyun Serverless VSCode Extension v1.12.0 发布

Aliyun Serverless VSCode Extension 是阿里云 Serverless 产品 函数计算 Function Compute 的 VSCode 插件,该插件结合了函数计算 Fun 工具以及函数计算 SDK ,是一款 VSCode 图形化开发调试...

阿里云官方博客
16分钟前
4
0
程序员如何培养解决复杂问题的能力?

今天在上网时候,突然看到了这篇文章,感觉非常的适合现在的自己去思考下,可能也适用在座的读者。程序员不仅仅是敲代码,更是一个复合能力的结合体,也不仅仅停留在技术和代码阶段。你想要成...

哥本哈根的小哥
20分钟前
6
0
市场变化驱动产品思维升级

宜信科技中心财富管理产品部负责人Bob,与大家一起聊聊个性化推荐产品功能的设计和B端产品的功能策划方式。 拓展阅读:回归架构本质,重新理解微服务 智慧金融时代,大数据和AI如何为业务赋能...

宜信技术学院
20分钟前
4
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部