机器学习基础
一、人工智能三大概念
1.人工智能(Artificial Intelligence)
定义:就是能像人一样进行合理思考,像人一样合理行动的计算模型。
2.机器学习(Machine Learning)
原理:让模型从一大堆数据里进行学习,获得一定的规律或者方法。再来一些数据,能给出预测。
3.深度学习(Deep Learning)
原理:它通过模拟人脑神经回路的工作机制,利用海量数据和强大的计算资源(如GPU),自动从原始输入数据中逐层提取并抽象出从低级到高级的分布式特征表示,从而实现对复杂模式的高效识别、分类、预测及生成。
4.三者关系
人工智能包含机器学习,机器学习又包含深度学习。
今天要介绍的机器学习,严格上是传统意义的机器学习。
5.AI发展三要素
数据、算法、算力是AI发展的三要素。
数据:它是燃料/原材料,决定了模型的上限。
算法:它是方法,使模型趋近上限。
算力:它是引擎/硬件,是模型训练的基础。
二、机器学习基础
1.分类
1.1分类
按照样本有无标签以及不同学习方式,可以将机器学习分为以下这几类:

1.2监督学习
- 特点:样本数据有标签。
- 核心逻辑:模型通过学习输入特征与输出标签之间的映射关系,来预测未知数据的输出。这就好比学生在老师的指导下学习,老师不仅给题目,还给标准答案,学生通过不断纠错来提升准确率。
- 典型任务:
- 分类:如垃圾邮件识别、图像识别(猫/狗)。
- 回归:如房价预测、股票走势分析。
- 常见算法:
- 回归类:KNN(from sklearn.neighbors import KNeighborsClassifier)、线性回归(from sklearn.linear_model import LinearRegression)、支持向量机(from sklearn.svm import SVC)、集成学习(from sklearn.ensemble import RandomForestClassifier)、决策树(from sklearn.tree import DecisionTreeClassifier)等。
- 分类类:KNN(from sklearn.neighbors import KNeighborsClassifier)、逻辑回归(from sklearn.linear_model import LogisticRegression)、集成学习(from sklearn.ensemble import RandomForestClassifier)、决策树(from sklearn.tree import DecisionTreeClassifier)、朴素贝叶斯(from sklearn.naive_bayes import GaussianNB)等。
1.3无监督学习
- 特点:样本数据没有标签(只有输入数据,没有对应的结果)。
- 核心逻辑:模型需要在没有明确指导的情况下,自主发现数据内部的结构、规律或分布模式。这就像让学生自己阅读一堆资料,然后自己去总结归纳出其中的主题或分类。
- 典型任务:
- 聚类:将相似的数据归为一组,如客户分群。
- 降维:在保留主要信息的前提下减少数据维度,便于可视化或压缩。
- 关联规则:发现数据项之间的有趣联系,如“啤酒与尿布”案例。
- 常见算法:K-Means聚类、DBSCAN等。
1.4半监督学习

- 特点:介于监督学习和无监督学习之间,利用少量有标签数据和大量无标签数据进行训练。
- 核心逻辑:在实际场景中,获取大量精准标注的数据成本极高,而未标注数据却很容易获得。半监督学习试图利用未标注数据中包含的分布信息来辅助提升模型的泛化能力。
- 应用场景:医疗影像分析(标注需要专家,成本高)、语音识别等。
1.5强化学习
- 特点:通过与环境交互,根据反馈的奖励或惩罚信号来优化策略,不需要预先准备好的静态数据集。
- 核心逻辑:智能体在环境中采取行动,环境给予反馈(奖励或惩罚)。智能体的目标是最大化长期的累积奖励。这是一种“试错”的学习过程。
- 典型任务:游戏AI(如AlphaGo)、机器人控制、自动驾驶决策、资源调度。
- 关键组成(“五位一体”):智能体(Agent)、环境(Environment)、状态(Status)、动作(Action)、奖励(Reward)。
2.三种方式对比
| 维度 | 监督学习 | 无监督学习 | 强化学习 |
|---|---|---|---|
| 数据类型 | 有标签数据 (Input + Label) | 无标签数据 (Input only) | 交互序列 (State, Action, Reward) |
| 学习目标 | 预测结果或分类 | 发现数据结构或模式 | 最大化长期累积奖励 |
| 反馈机制 | 直接反馈(对错分明) | 无反馈 | 延迟反馈(奖励/惩罚) |
| 应用场景 | 垃圾邮件过滤、人脸识别 | 客户细分、异常检测 | 游戏对战、机器人导航 |
| 形象比喻 | 有老师辅导做题 | 自学归纳总结 | 在训练中摸爬滚打 |
3.分类任务的模型评估指标
3.1准确率
定义:准确率是模型正确预测的样本数占总样本数的比例
公式:

其中:
TP(True Positive):真正例 —— 实际为正类且被预测为正类
TN(True Negative):真负例 —— 实际为负类且被预测为负类
FP(False Positive):假正例 —— 实际为负类但被预测为正类
FN(False Negative):假负例 —— 实际为正类但被预测为负类
适用场景:适用于类别分布均衡的数据集。当类别不平衡时,准确率可能具有误导性。
3.2精确率
定义:精确率表示在所有被预测为正类的样本中,实际为正类的比例。
公式:

3.3召回率
定义:召回率表示在实际为正类的样本中,被模型正确识别出的比例。
公式:

3.4 F1-score
定义:F1-score 是精确率和召回率的调和平均数,用于综合衡量模型的准确性与完整性。
公式:

4.回归任务的模型评估指标
4.1MSE
公式:

4.2MAE
公式:

4.3RMSE
公式:

总结:
本文为纯手搓,少部分网络搜索。各位观众姥爷如果觉得对你有帮助的话,还希望能一键三连!你的点赞关注是作者持续创作的动力。
更多推荐


所有评论(0)