本系列主要讲解机器学习基础算法的原理,参考书目为周志华老师的《机器学习》(西瓜书)(语言比较简单,因为主要是一个科普作用,方便大家理解,如果需要精确的定义与公式推导过程,可以查阅书本的具体章节)

1.基本概念

首先,什么是机器学习?机器学习主要研究的是在计算机上产生模型的“算法”,有了学习的算法,输入数据之后会产生模型,模型会处理新的数据。简单来说,假如生活中有10000张照片,其中有5000张是"猫“,5000张是”狗“,作为一个人类,你可以清晰地分辨,什么是猫,什么是狗。但是现在,我希望计算机也可以分辨。所以我需要设计一个算法,先用10000张图片训练,让机器学习猫的特征和狗的特征(监督学习),然后我输入10001张图,机器能知道,这是猫,还是狗。机器学习研究的,正是这样的算法。

机器学习中的几个基本概念如下:

(1).数据集:由多个样本组成的集合

(2).样本:每条数据,比如上述例子中的每张图片

(3).属性/特征:每个样本的一些特性,比如狗的毛色,体型大小等等,属性值指的是具体取值,比如,毛色是黄的,黑的。

(4).属性空间/样本空间:把某些属性理解为坐标轴,任何一个样本都有对应的坐标,把一个示例也可以叫做特征向量。

(5).维数:样本的属性个数

(6).学习/训练:从数据中学习得到模型的过程

(7).标记:比如每张照片到底属于“猫”还是“狗”,这个“猫”就是标记

2.学习任务

学习任务的分类,主要可以分为以下两类:

(1).监督学习:训练数据有标记

常见的监督学习:分类(这个好理解)、回归(输出离散值,比如输出,预测的房价、股票价格)

(2).无监督学习:训练数据没有标记

常见的无监督学习:聚类(没有标记,但是机器自动把相似的样本聚成一个簇,比如脑机接口的神经解码过程中,由于我们事先很难清楚地定义每一个大脑的神经信号含义,所以一般是采用聚类的方法区分不同信号)

3.归纳偏好

归纳偏好:机器学习算法对某种类型的偏好,比如更看重哪些因素。比如那个猫和狗的分类,只要看到它的体型较大,我就判定它是狗,所以体型是个比较重要的因素,就是我的偏好。

机器学习中有一个重要的定理,叫做“NFL”,天下没有免费的午餐,简单来说,就是所有学习算法的性能跟随机差不多。下图根据样本点可以拟合出两条曲线,但是真实的,既可能是A,也可能是B。任何算法,脱离了实际问题,是没有意义的。算法,只有在有实际问题的时候,才有性能的好坏之分。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐