文档章节

机器学习

安艳青
 安艳青
发布于 2017/01/03 18:48
字数 2017
阅读 22
收藏 0

    机器学习,就是让计算机具有像人一样的学习能力的技术,是从堆积如山的数据(也称为大数据)中寻找出有用知识的数据挖掘技术。通过运用机器学习技术,从视频数据库中寻找出自己喜欢的视频资料,或者根据用户的购买记录向用户推荐其他相关产品等成了现实。

一、机器学习的种类

    计算机的学习,根据所需处理的数据种类不同,可以分为监督学习、无监督学习和强化学习等几种类型。

    1、监督学习

    监督学习,是指有求知欲的学生从老师那里获取知识、信息,老师提供对错提示、告知最终答案的学习过程。在机器学习里,学生对应于计算机,老师对应于周围的环境。根据在学习过程中所获得的经验、技能,对没有学习过的问题也可以做出正确解答,使计算机获得这种泛化能力,是监督学习的最终目标。监督学习,在手写文字识别、声音处理、图像处理、垃圾邮件分类与拦截、网页检索、基因诊断以及股票预测等各个方面,都有着广泛的应用。这一类机器学习的典型任务包括:预测数值类型数据的回归、预测分类标签的分类、预测顺序的排序等。

    2、无监督学习

    无监督学习,是指在没有老师的情况下,学生自学的过程。在机器学习里,基本上都是计算机在互联网中自动收集数据,并从中获取有用信息。无监督学习不仅仅局限于解决像监督学习那样的有明确答案的问题,因此,它的学习目标可以不必十分明确。无监督学习在人造卫星故障诊断、视频分析、社交网站解析和声音信号解析等方面大显身手的同时,在数据可视化以及作为监督学习方法的前处理工具方面,也有广泛应用。这一类机器学习的典型任务有聚类、异常检测等。

    3、强化学习

    强化学习,与监督学习类似,也以计算机获得对没有学习过的问题做出正确解答的泛化能力为目标,但是在学习过程中,不设置老师提示对错、告知最终答案的环节。然而,如果真的在学习过程中不能从周围环境中获得任何信息的话,强化学习就变成无监督学习了。强化学习,是指在没有老师提示的情况下,自己对预测的结果进行评估的方法。通过这样的自我评估,学生为了获得老师的最高嘉奖而不断地进行学习。婴幼儿往往会为了获得父母的表扬去做事情,因此,强化学习被认为是人类最主要的学习模式之一。强化学习,在机器人的自动控制、计算机游戏中的人工智能、市场战略的最优化等方面均有广泛应用。在强化学习中经常会用到回归、分类、聚类和降维等各种各样的机器学习算法。

二、机器学习的典型任务

    1、回归

    回归,是指把实函数在样本点附近加以近似的有监督的函数近似问题。这里,我们来考虑下以维实向量作为输入,实数值作为输出的函数的学习问题。在监督学习里,这里的真实函数关系是未知的,作为训练集的输入输出样本是已知的。但是,一般情况下,在输出样本的真实值中经常会观测到噪声。通过这样的设定,输入样本就是学生向老师请教的问题,输出样本是老师对学生的解答,输出样本中包含的噪声则与老师的教学错误或学生的理解错误相对应。老师的知识(无论什么样的问题,都可以做出正确的解答)与真实的函数相对应,使学生获得这个函数就是监督学习的最终目标。如果以来表示学生通过学习而获得的函数,那么学生对没有学习过的问题也可以做出正确的解答的泛化能力的大小,就可以通过比较函数的相似性来进行分析。

    注:回归是对一个或多个自变量和因变量之间的关系进行建模、求解的一种统计方法。

    2、分类

    分类,是指对于指定的模式进行识别的有监督的模式识别问题。在这里,以维实向量作为输入样本,而所有的输入样本,可以被划分为个类别的问题来进行说明。作为训练集的输入输出样本是已知的。但是,分类问题中的输出样本,并不是具体的实数,而是分别代表类别1,2,···,。在这样的任务里,得到输出类别1,2,···,的函数的过程,就是机器学习的过程。因此,分类问题也可以像回归问题那样,被看作是函数近似问题。然而,在分类问题中,并不存在类别1比类别3更接近于类别2这样的说法。分类问题只是单纯地对样本应该属于哪一个类别进行预测,并根据预测准确与否来衡量泛化误差,这一点与回归是不同的。

    3、异常检测

    异常检测,是指寻找输入样本中所包含的异常数据的问题。在已知正常数据与异常数据的例子的情况下,其与有监督的分类问题是相同的。但是,一般情况下,在异常检测任务中,对于什么样的数据是异常的,什么样的数据是正常的,在事先是未知的。在这样的无监督的异常检测问题中,一般采用密度估计的方法,把靠近密度中心的数据作为正常数据,把偏离密度中心的数据作为异常的数据。

    4、聚类

    聚类,与分类问题相同,也是模式识别问题,但是属于无监督学习的一种。即只给出输入样本,然后判断各个样本分别属于1,2,···,中的哪个簇(代表类别)。隶属于相同簇的样本之间具有相似性,不同的样本之间具有不同的性质。在聚类问题中,如何准确地计算样本之间的相似度是很重要的课题。

    5、降维

    降维,是指从高纬度数据中提取关键信息,将其转换为易于计算的低纬度问题进而求解的方法。具体来说,当输入样本的维数非常大的时候,可以把样本转换为较低维度的样本。线性降维的情况下,可以使用横向量T 将其变换为。降维,根据数据种类的不同,可以分为监督学习和无监督学习两种。作为训练集的输入输出样本是已知的时候,属于监督学习,可以把样本转换为较低维度的样本,从而获得较高的泛化能力。与之相对,如果只有输入样本是已知的话,就属于无监督学习,在转换为较低维度的样本之后,应该保持原始输入样本的数据分布性质,以及数据间的近邻关系不发生变化。

© 著作权归作者所有

安艳青
粉丝 2
博文 6
码字总数 9107
作品 0
杭州
程序员
私信 提问

暂无文章

只需一步,在Spring Boot中统一Restful API返回值格式与统一处理异常

统一返回值 在前后端分离大行其道的今天,有一个统一的返回值格式不仅能使我们的接口看起来更漂亮,而且还可以使前端可以统一处理很多东西,避免很多问题的产生。 比较通用的返回值格式如下:...

晓月寒丶
昨天
59
0
区块链应用到供应链上的好处和实际案例

区块链可以解决供应链中的很多问题,例如记录以及追踪产品。那么使用区块链应用到各产品供应链上到底有什么好处?猎头悬赏平台解优人才网小编给大家做个简单的分享: 使用区块链的最突出的优...

猎头悬赏平台
昨天
28
0
全世界到底有多少软件开发人员?

埃文斯数据公司(Evans Data Corporation) 2019 最新的统计数据(原文)显示,2018 年全球共有 2300 万软件开发人员,预计到 2019 年底这个数字将达到 2640万,到 2023 年达到 2770万。 而来自...

红薯
昨天
65
0
Go 语言基础—— 通道(channel)

通过通信来共享内存(Java是通过共享内存来通信的) 定义 func service() string {time.Sleep(time.Millisecond * 50)return "Done"}func AsyncService() chan string {retCh := mak......

刘一草
昨天
58
0
Apache Flink 零基础入门(一):基础概念解析

Apache Flink 的定义、架构及原理 Apache Flink 是一个分布式大数据处理引擎,可对有限数据流和无限数据流进行有状态或无状态的计算,能够部署在各种集群环境,对各种规模大小的数据进行快速...

Vincent-Duan
昨天
60
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部