监督学习与无监督学习-程序员宅基地

技术标签：监督学习无监督学习

一、监督机器学习

1.1 概念理解

监督学习是机器学习的类型，其中机器使用“标记好”的训练数据进行训练，并基于该数据，机器预测输出。标记的数据意味着一些输入数据已经用正确的输出标记。

在监督学习中，提供给机器的训练数据充当监督者，教导机器正确预测输出。它应用了与学生在老师的监督下学习相同的概念。

监督学习是向机器学习模型提供输入数据和正确输出数据的过程。监督学习算法的目的是找到一个映射函数来映射输入变量（x）和输出变量（y）。

在现实世界中，监督学习可用于风险评估、图像分类、欺诈检测、垃圾邮件过滤等。

1.2 监督学习如何运作

在监督学习中，模型使用标记数据集进行训练，其中模型学习每种类型的数据。训练过程完成后，模型会根据测试数据（训练集的子集）进行测试，然后预测输出。

通过以下示例和图表可以很容易地理解监督学习的工作原理：
在这里插入图片描述

1.3 监督学习的步骤

首先确定训练数据集的类型
收集/收集标记的训练数据（一般可能需要手动标记）
将训练数据集拆分为训练数据集、测试数据集和验证数据集。
确定训练数据集的输入特征，这些特征应该有足够的知识使模型能够准确地预测输出。
确定适合模型的算法，如支持向量机、决策树等。
在训练数据集上执行算法。有时我们需要验证集作为控制参数，它们是训练数据集的子集。
通过提供测试集来评估模型的准确性。如果模型预测出正确的输出，这意味着我们的模型是准确的。

1.4 监督机器学习算法的类型

监督学习可以进一步分为两类问题：回归和分类。

1.回归
如果输入变量和输出变量之间存在关系，则使用回归算法。它用于预测连续变量，例如天气预报、市场趋势等。以下是一些流行的回归算法，它们属于监督学习：

线性回归
回归树
非线性回归
贝叶斯线性回归
多项式回归

2.分类
当输出变量是分类时使用分类算法，这意味着有两个类别，例如是 - 否，男性 - 女性，真假等。垃圾邮件过滤，是否为垃圾等。

可能用到的算法：

随机森林
决策树
逻辑回归
支持向量机

1.5 监督学习的优点

在监督学习的帮助下，模型可以根据先前的经验预测输出。
在监督学习中，我们可以对对象的类别有一个准确的认识。
监督学习模型帮助我们解决各种现实问题，例如欺诈检测、垃圾邮件过滤等。

1.6 监督学习的缺点

监督学习模型不适合处理复杂的任务。
如果测试数据与训练数据集不同，监督学习无法预测正确的输出。
训练需要大量的计算时间。
在监督学习中，我们需要足够的关于对象类别的知识。

二、无监督机器学习

在上一个主题中，我们学习了监督机器学习，其中模型在训练数据的监督下使用标记数据进行训练。但是在很多情况下，我们没有标记数据，需要从给定的数据集中找到隐藏的模式。因此，要解决机器学习中的此类案例，我们需要无监督学习技术。

2.1 什么是无监督学习？

顾名思义，无监督学习是一种机器学习技术，其中模型不使用训练数据集进行监督。相反，模型本身会从给定数据中找到隐藏的模式和见解。它可以比作在学习新事物时发生在人脑中的学习。它可以定义为：

监督学习是一种机器学习，其中模型使用未标记的数据集进行训练，并允许在没有任何监督的情况下对该数据进行操作。

无监督学习不能直接应用于回归或分类问题，因为与监督学习不同，我们有输入数据但没有相应的输出数据。无监督学习的目标是找到数据集的底层结构，根据相似性对数据进行分组，并以压缩格式表示该数据集。

示例： 假设给定无监督学习算法的输入数据集，其中包含不同类型的猫和狗的图像。该算法从未在给定的数据集上进行过训练，这意味着它对数据集的特征一无所知。无监督学习算法的任务是自行识别图像特征。无监督学习算法将通过根据图像之间的相似性将图像数据集聚类到组中来执行此任务。
在这里插入图片描述

2.2 为什么要使用无监督学习？

以下是描述无监督学习重要性的一些主要原因：

无监督学习有助于从数据中找到有用的见解。
无监督学习与人类通过自己的经验学习思考非常相似，这使得它更接近真正的人工智能。
无监督学习适用于未标记和未分类的数据，这使得无监督学习更加重要。
在现实世界中，我们并不总是有输入数据和相应的输出，因此为了解决这种情况，我们需要无监督学习。

2. 3 无监督学习的工作原理

下图可以理解无监督学习的工作原理：
在这里插入图片描述
在这里，我们采用了未标记的输入数据，这意味着它没有分类，也没有给出相应的输出。现在，这些未标记的输入数据被输入机器学习模型以对其进行训练。首先，它将解释原始数据以从数据中找到隐藏的模式，然后应用合适的算法，如 k-means 聚类、决策树等。

一旦应用了合适的算法，该算法就会根据对象之间的相似性和差异性将数据对象分组。

2.4 无监督学习算法的类型

无监督学习算法可以进一步分为两类问题：聚类和关联

聚类：聚类是一种将对象分组为聚类的方法，使得具有最多相似性的对象保留在一个组中，并且与另一组的对象具有较少或没有相似性。聚类分析发现数据对象之间的共性，并根据这些共性的存在和不存在对它们进行分类。
关联：关联规则是一种无监督学习方法，用于查找大型数据库中变量之间的关系。它确定在数据集中一起出现的项目集。关联规则使营销策略更加有效。例如购买 X 商品（假设是面包）的人也倾向于购买 Y（黄油/果酱）商品。关联规则的一个典型例子是市场篮子分析。

2.5 无监督学习算法

以下是一些流行的无监督学习算法：

K-means 聚类
KNN（k-最近邻）
层次聚类
异常检测
神经网络
主成分分析
独立成分分析
先验算法
奇异值分解

2.6 无监督学习的优势

与监督学习相比，无监督学习用于更复杂的任务，因为在无监督学习中，我们没有标记的输入数据。
无监督学习更可取，因为与标记数据相比，它更容易获得未标记数据。

2.7 无监督学习的缺点

无监督学习本质上比监督学习更难，因为它没有相应的输出。
无监督学习算法的结果可能不太准确，因为输入数据没有标记，并且算法事先不知道确切的输出。

联系我v：hxgsrubxjogxeeag
如果python基础不好，可以参考学习我的python专栏，进阶可参考我的数学建模专栏，想要跟多的免费刷题练习，推荐使用：牛客网

本文链接：https://blog.csdn.net/weixin_46211269/article/details/125093635

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

使用nginx解决浏览器跨域问题_nginx不停的xhr-程序员宅基地

文章浏览阅读1k次。通过使用ajax方法跨域请求是浏览器所不允许的，浏览器出于安全考虑是禁止的。警告信息如下：不过jQuery对跨域问题也有解决方案，使用jsonp的方式解决，方法如下：$.ajax({ async:false, url: 'http://www.mysite.com/demo.do', // 跨域URL ty..._nginx不停的xhr

在 Oracle 中配置 extproc 以访问 ST_Geometry-程序员宅基地

文章浏览阅读2k次。关于在 Oracle 中配置 extproc 以访问 ST_Geometry，也就是我们所说的使用空间SQL 的方法，官方文档链接如下。http://desktop.arcgis.com/zh-cn/arcmap/latest/manage-data/gdbs-in-oracle/configure-oracle-extproc.htm其实简单总结一下，主要就分为以下几个步骤。..._extproc

Linux C++ gbk转为utf-8_linux c++ gbk->utf8-程序员宅基地

文章浏览阅读1.5w次。linux下没有上面的两个函数，需要使用函数 mbstowcs和wcstombsmbstowcs将多字节编码转换为宽字节编码wcstombs将宽字节编码转换为多字节编码这两个函数，转换过程中受到系统编码类型的影响，需要通过设置来设定转换前和转换后的编码类型。通过函数setlocale进行系统编码的设置。linux下输入命名locale -a查看系统支持的编码_linux c++ gbk->utf8

IMP-00009: 导出文件异常结束-程序员宅基地

文章浏览阅读750次。今天准备从生产库向测试库进行数据导入，结果在imp导入的时候遇到“ IMP-00009:导出文件异常结束” 错误，google一下，发现可能有如下原因导致imp的数据太大，没有写buffer和commit两个数据库字符集不同从低版本exp的dmp文件，向高版本imp导出的dmp文件出错传输dmp文件时，文件损坏解决办法：imp时指定..._imp-00009导出文件异常结束

python程序员需要深入掌握的技能_Python用数据说明程序员需要掌握的技能-程序员宅基地

文章浏览阅读143次。当下是一个大数据的时代，各个行业都离不开数据的支持。因此，网络爬虫就应运而生。网络爬虫当下最为火热的是Python，Python开发爬虫相对简单，而且功能库相当完善，力压众多开发语言。本次教程我们爬取前程无忧的招聘信息来分析Python程序员需要掌握那些编程技术。首先在谷歌浏览器打开前程无忧的首页，按F12打开浏览器的开发者工具。浏览器开发者工具是用于捕捉网站的请求信息，通过分析请求信息可以了解请..._初级python程序员能力要求

Spring @Service生成bean名称的规则（当类的名字是以两个或以上的大写字母开头的话，bean的名字会与类名保持一致）_@service beanname-程序员宅基地

文章浏览阅读7.6k次，点赞2次，收藏6次。@Service标注的bean，类名：ABDemoService查看源码后发现，原来是经过一个特殊处理：当类的名字是以两个或以上的大写字母开头的话，bean的名字会与类名保持一致public class AnnotationBeanNameGenerator implements BeanNameGenerator { private static final String C..._@service beanname

随便推点

二叉树的各种创建方法_二叉树的建立-程序员宅基地

文章浏览阅读6.9w次，点赞73次，收藏463次。1.前序创建#include<stdio.h>#include<string.h>#include<stdlib.h>#include<malloc.h>#include<iostream>#include<stack>#include<queue>using namespace std;typed_二叉树的建立

解决asp.net导出excel时中文文件名乱码_asp.net utf8 导出中文字符乱码-程序员宅基地

文章浏览阅读7.1k次。在Asp.net上使用Excel导出功能，如果文件名出现中文，便会以乱码视之。解决方法： fileName = HttpUtility.UrlEncode(fileName, System.Text.Encoding.UTF8);_asp.net utf8 导出中文字符乱码

笔记-编译原理-实验一-词法分析器设计_对pl/0作以下修改扩充。增加单词-程序员宅基地

文章浏览阅读2.1k次，点赞4次，收藏23次。第一次实验词法分析实验报告设计思想词法分析的主要任务是根据文法的词汇表以及对应约定的编码进行一定的识别，找出文件中所有的合法的单词，并给出一定的信息作为最后的结果，用于后续语法分析程序的使用；本实验针对 PL/0 语言的文法、词汇表编写一个词法分析程序，对于每个单词根据词汇表输出： (单词种类, 单词的值) 二元对。词汇表：种别编码单词符号助记符0beginb..._对pl/0作以下修改扩充。增加单词

android adb shell 权限,android adb shell权限被拒绝-程序员宅基地

文章浏览阅读773次。我在使用adb.exe时遇到了麻烦.我想使用与bash相同的adb.exe shell提示符,所以我决定更改默认的bash二进制文件(当然二进制文件是交叉编译的,一切都很完美)更改bash二进制文件遵循以下顺序> adb remount> adb push bash / system / bin /> adb shell> cd / system / bin> chm..._adb shell mv 权限

投影仪-相机标定_相机-投影仪标定-程序员宅基地

文章浏览阅读6.8k次，点赞12次，收藏125次。1. 单目相机标定引言相机标定已经研究多年，标定的算法可以分为基于摄影测量的标定和自标定。其中，应用最为广泛的还是张正友标定法。这是一种简单灵活、高鲁棒性、低成本的相机标定算法。仅需要一台相机和一块平面标定板构建相机标定系统，在标定过程中，相机拍摄多个角度下（至少两个角度，推荐10~20个角度）的标定板图像（相机和标定板都可以移动），即可对相机的内外参数进行标定。下面介绍张氏标定法（以下也这么称呼）的原理。原理相机模型和单应矩阵相机标定，就是对相机的内外参数进行计算的过程，从而得到物体到图像的投影_相机-投影仪标定

Wayland架构、渲染、硬件支持-程序员宅基地

文章浏览阅读2.2k次。文章目录Wayland 架构Wayland 渲染Wayland的硬件支持简述：　翻译一篇关于和 wayland 有关的技术文章, 其英文标题为Wayland Architecture .Wayland 架构若是想要更好的理解 Wayland 架构及其与 X (X11 or X Window System) 结构；一种很好的方法是将事件从输入设备就开始跟踪, 查看期间所有的屏幕上出现的变化。这就是我们现在对 X 的理解。内核是从一个输入设备中获取一个事件，并通过 evdev 输入_wayland