文档章节

一切数据皆为信用数据

灵玖lingjoin
 灵玖lingjoin
发布于 2014/09/30 17:06
字数 1471
阅读 12
收藏 0

目前为止,在大数据领域当中的投资已经越来越热,而且做得公司越来越多。有多少公司到底真正使用的是大数据?我相信几乎没有太多。


大数据在美国金融当中最直接的场景,就是所谓的信用评估体系。美国的信用体系评估很简单,就几样东西:债务历史、债务、信用历史时间、相关的其他因素。这些东西全部加起来形成了美国现有的评分体系。


一般来说,如果变量放得太多了,模型处理起来就会比较麻烦。最主要一点它的深度比广度要重要。所以,过去20年的记录,和最近一年当中才有记录,二者之间是不一样的。


另外,关注用户的历史远远多于现在,也许这个人一开始是个屌丝,最近突然发财了,可能他的偿还能力就会有巨大的改变,但是这样的因素有没有体现在这个里面?很多人不知道。怎样把纵向和横向广度上的东西都放进来,这个就会显得相对来说比较重要一点。


大数据到底在金融当中有什么用处?同样一个人在不同的应用和领域当中也不一样。比如今天在这个公司当中呆了20年,不一定说明他是个好员工,很有可能是他没有能力跳槽。如果你用另外一个角度评判这个人的话,你的评判标准和应用变量应该完全改变。但是非常可惜,没有人从这个角度上衡量一个人。


为什么最终会把风控放到一个这么重要的角度上来?像在中国的P2P公司,6个月或者一年之后,能剩下四分之一都是一个奇迹,很多P2P公司一定会死掉,或者被并购掉。在所有的热潮慢慢退去的时候,风控就会放到最显著的地位上来。


直接征询用户的答案也是很重要的。你可以在一个地方撒谎,你可以在两个地方撒谎,但是如果我大数据采了千千万万的点,很难把千千万万的点在互相不矛盾的情况之下,把它给伪装起来,如果真的能伪装成这样,那就不是一个欺骗的过程,所以很难通过大数据的方法让一个人还能够完全的编造一个不被识破的谎言,很难。


大数据模型理念,一切数据皆为信用数据。所有的那些关键变量,如果单独知道提出来一个,没有太大的用处能够判断出来这个人怎么样,但是如果把所有的这些细小的因素全部结合在一起,就会发现最后是非常强的指向,可以很准确的判断出来这个人到底在做什么。只看关联不看因果,这是一个非常重要的观点。


同样名字听起来很好,机器学习,咱们都会深刻的体会到,实际上是我们很悲催的学习机器,根本不是机器在学习我们。如何能够更好的跟机器进行沟通,我们给他一个方法,或者给他一个事实,他能够更快的从当中提取出来,更多的是一种互动。


大数据的模型之二,我们认为是数据的来源。即使错误信息也是信息,也体现了一个人的素质。


第三点就是所谓的建模,总而言之,大数据当中对所谓特征的变化,特征的提取和最后所谓独立模型细节的建立,最后模型的整合都跟以前传统统计上的理论有很大的区别。


最后这个是比较有意思的事情,这件事情在中国基本上不存在,但是在美国相对比较麻烦,大数据和相关立法之间的关系。相信中国在今后立法越来越完善也会碰到这样的问题,信用评估上有些禁区,这些禁区不能碰的。第一性别绝对不可以用的,来决定这个人到底信用值怎么样,这是绝对不可以的。第二年龄,年龄没有性别那么严重,但是年龄有要求,只能作为一个加分因素,而不能作为减分因素,年龄大家现在很多人也是不用的。第三种族,绝对不能触碰的红线,绝对不能根据是亚洲人、黑人、白人还是拉丁裔,判定你的信用是好是坏。比如在中国你在街上开车或者在美国,墙上写着字告诉你这个地方不能原地掉头,就是因为太多人在这个地方原地掉头了,所以才会树个牌子,如果这个地方窄,你不用写,也不会有人原地掉头。禁止使用的这些东西,其实真正最能体现一个人的本质。实际上从我们模型当中能看得出来,这些不准用的东西,如果用的话,比千千万万的信息加在一起都有用。


大数据另外一个比较奇怪的应用,就是它可以帮助你绕过一些法律上的红线,这并不是打法律的擦边球,而是因为事物的本质就是由这几个因素来决定的,A可以突出C,B又可以突出C,A和B之间必然有相关的。

 

 



© 著作权归作者所有

灵玖lingjoin
粉丝 86
博文 2880
码字总数 4066035
作品 0
东城
私信 提问
加载中

评论(0)

深入理解 Python 的 == 和 is

Case 1 阐述 == 和 is 的区别前,先要明确 Python 的一个概念,一切皆对象,每个对象包含一个 identity、一个 type 和一个 value: Everything in Python is an object. Every object has an...

koala bear
2013/08/10
0
0
数据分析平台 js 具体实现整理

以上是此次开发的基本目录结构。 lib 目录中的所有内容都是引入的网络上的各种js模块,像 jquery, moment.js, lodash.js... app 目录下项目中个人编写的主要部分 基本的实现思路很模仿yii中一...

myzyq
2016/06/07
13
0
央行下了铁命令:今天起,马云正式被“收编”!

来源 | 中国企业家学习网综合自财经内参、鸣金网 1月4日,央行发布公示,宣布受理了百行征信有限公司(筹)的个人征信业务申请。 于无声处听惊雷 1月4日,对于阿里、腾讯等公司旗下的征信机构...

m7720eiosi6oa9
2018/01/06
0
0
大数据与区块链的爱恨情仇,一场技术界相爱相杀的爱恋!

  随着数据量、数据种类的增多,企业由历史数据分析渐渐过渡到基于多源、海量数据的实时分析。   我们都知道商场如战场,谁能在企业运营中做出快速、高效的分析决策,谁就能日益激烈的市...

深度学习
2018/04/09
0
0
汉芯1号、红芯浏览器造假事件不断,区块链要彻底解决信任危机

2003年“汉芯一号”,顶着无数光环获得了上亿元的科研基金,被爆出其实是摩托罗拉的芯片,仅仅是请农民工将原装芯片的痕迹打磨掉。 2018年8月15日“打着国产旗号的”红芯浏览器融资2.5亿元,...

币圈二姐
2018/08/23
0
0

没有更多内容

加载失败,请刷新页面

加载更多

何时使用vs ref vs out

前几天有人问我应该使用参数关键字out而不是ref 。 虽然我(我认为)理解了ref和out关键字之间的差异( 之前已经提到过 ),最好的解释似乎是ref == in and out ,什么是一些(假设的或代码的...

javail
22分钟前
37
0
宜信如何做到既满足远程办公的短时便利性需求,又不丧失安全性

对于IT互联网企业来说远程办公并不陌生,但是疫情的突然爆发,直接大规模的使用远程办公应用,势必会带来一系列的安全问题,尤其是大量隐私数据安全问题,因为此次的疫情,大量的企业内部人员...

宜信技术学院
27分钟前
29
0
如何获得元素的渲染高度?

如何获得元素的渲染高度? 假设您有一个<div>元素,其中包含一些内容。 内部的内容将扩展<div>的高度。 当您没有明确设置高度时,如何获得“渲染的”高度。 显然,我尝试过: var h = docume...

技术盛宴
37分钟前
40
0
zookeeper宕机与dubbo直连

加入zookeeper宕机后,一段时间内consumer依然能够获取provider的服务,实际上使用了本地缓存进行通讯,这也是dubbo健壮性的一种体验。 dubbo健壮性的表现: 1.监控中心宕机,不影响使用,只...

七宝1
38分钟前
44
0
一分钟了解【X-Frame-Options设置】

含义 通过设置X-Frame-Options来控制网页能否被frame或iframe嵌入。 目的 防止出现 点击劫持 :攻击者使用一个透明的iframe,覆盖在一个网页上,然后诱使用户在网页上进行操作,此时用户将在...

crazymus
45分钟前
48
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部