机器学习里的“分类“,到底是咋回事?
机器学习里的"分类",到底是咋回事?
说实话,我第一次听到"有监督学习"和"无监督学习"这两个词的时候,脑补的画面是:一个老师在旁边盯着你写作业(有监督),和一个老师根本不管你(无监督)。
后来我发现,还真差不多。
什么是分类问题?
一句话:
分类,就是把东西分门别类地归类。
比如你手机收到一封邮件,系统得判断它是正常邮件还是垃圾邮件。再比如,你拍一张照片,AI 得判断里面是猫还是狗。又或者,医生看了你的体检报告,得判断你有没有患病。
这就是分类问题。 给一堆东西,告诉它"这东西属于哪一类"。
就像你整理衣柜——T恤归 T恤,裤子归裤子,袜子归袜子(虽然你的袜子永远少一只,但那不是分类的问题)。
有监督学习:带答案的练习题
有监督学习,就是老师给你发练习题,还附了标准答案。
你做了 100 道选择题,每道题后面都写着"A"、“B”、“C”、“D”。你做多了,慢慢就有感觉了——看到类似的题,就知道大概选啥。
具体到机器学习里:
你给模型一堆已经打好标签的数据。比如:
这张图是猫
这张图是狗
这张图还是猫
这张图又是狗
模型看了成千上万张打标签的图片,学会了分辨猫和狗。
常见的有监督分类方法:
① 逻辑回归(Logistic Regression)
别看名字带"回归",它其实干的是分类的活。简单粗暴——画一条线,线这边是一类,线那边是另一类。适合二分类(是/不是,好/坏,真/假)。
② 决策树(Decision Tree)
就像玩"20 个问题"游戏。“它有毛吗?→ 有。” “它会飞吗?→ 不会。” “它有尾巴吗?→ 有。” → 猫。一层一层问下来,最后得出结论。
③ 支持向量机(SVM)
在数据之间画一个"最大间隔"的分界线,让两边分得越开越好。就像一个强迫症在整理桌子——东西分两边,中间必须留出一条走廊。
④ 随机森林(Random Forest)
种一堆决策树,让它们投票。100 棵树说"是猫",10 棵树说"是狗"——那就判为猫。人多力量大,树多也靠谱。
⑤ 神经网络(Neural Network)
模仿人脑的神经元,一层层传递信息。现在最火的深度学习就是这玩意儿。你给它足够多的数据,它能学到连人类都说不清楚的特征。
无监督学习:没人给答案的自学
无监督学习,就是老师只给你一堆题,不给你答案。你自己琢磨去吧。
模型面对一堆数据,没人告诉它"这是猫"“那是狗”。它只能自己看——哎,这些东西长得有点像,归为一类;那些长得像另一拨,也归一类。
常见的无监督分类方法:
① K-Means 聚类
最简单粗暴的分组方法。先随便挑 K 个点当"中心",然后看每个数据离哪个中心最近,就归到哪一类。归完了,重新算中心,再分,反复迭代,直到稳定。
就像你搬家整理箱子——先把相似的东西大概堆在一起,然后看看每堆的"中心"在哪,再微调。
② 层次聚类(Hierarchical Clustering)
从最小的单位开始,一点一点往上合并。先是每个数据自己一类,然后最像的两个合并成一类,再和下一个最像的合并……最后形成一棵"分类树"。
就像生物分类——种→属→科→目→纲→门→界,一层一层往上归。
③ DBSCAN
按"密度"来聚类。数据密集的地方算一类,稀疏的地方不算。它能自动发现"类别数量",不需要你提前告诉它要分几类。
就像你看夜空——星星密集的地方就是星座,零星散落的就不算。
有监督 vs 无监督:怎么选?
有监督学习 无监督学习有没有标签 有(老师给答案) 没有(自己琢磨)
适用场景 垃圾邮件检测、图像分类、疾病诊断 客户分群、异常检测、数据探索
优点 准确率高,目标明确 不需要标注数据,能发现隐藏模式
缺点 需要大量标注数据,贵且费时间 结果不好评估,可能分得莫名其妙
简单记:
有监督 = 考试题有答案 → 学得快,考得好
无监督 = 自学没答案 → 探索未知,可能有惊喜
总结一下
分类问题,本质就是给东西归类。
有监督学习靠的是带标签的数据,像老师批改作业——你知道什么是对的,慢慢就学会了。
无监督学习靠的是数据本身的相似性,像你自己整理房间——没人告诉你该怎么分,但你看着看着,自然就分出个一二三来了。
机器学习里的分类,跟你每天做选择题没啥区别——有人告诉你答案,你叫"有监督学习";没人告诉你答案,你自己蒙,那叫"无监督学习"。区别只在于,AI 蒙的次数比你多几亿次而已。
更多推荐
所有评论(0)