机器学习处理离散数据_机器学习一:数据预处理

本文介绍机器学习中的数据预处理,重点讨论离散数据的处理。通过学习《机器学习A-Z》中文版,作者分享了数据预处理的实践,包括使用Python的sklearn.preprocessing模块。内容涵盖导入标准库、数据集导入、处理缺失数据等,强调Imputer类在填充缺失值中的应用。

机器学习一:数据预处理

最近一直在学习机器学习的知识,入门很难。之前跟着吴恩达老师的视频在学习,发现还是有很多的知识点难以理解。前不久,《机器学习A-Z》出了中文翻译,老师讲的非常浅显易懂,所以开始跟着学起来了。

为了能更系统的整理到学的知识进行一个整理,也作为一个自我监督,接下来就把较为系统的知识点都整理到博客上。相应的代码也会同步到github上。

下面所有的代码都是使用Python写的,数据预处理主要用到的是sklearn.preprocessing模块 [sklearn.apachecn.org/cn/0.19.0/m…]

目录

439111a0fb1ad217ba029612a10a37b1.png

在机器学习一的这部分,我主要说一下数据的预处理。

1.导入标准库

  • numpy:包含很多机器学习需要用到的数学方法
  • matplotlib.pyplot:主要用于绘图
  • pandas:导入数据集以及对数据集进行一系列的处理
import numpy as npimport matplotlib.pyplot as plt import pandas as pd复制代码

2.导入数据集

iloc数组中参数:逗号左边表示行数,逗号右边表示列数,冒号表示选择所有行或者列

# Import the datasetdataset = pd.read_csv('Data.csv')X = dataset.iloc[:,:-1].valuesy = dataset.iloc[:,3].values复制代码

3.缺失数据

46f19c3a61408a9bd77c2135168d8e90.png

一般处理数据缺失的方法包括平均数填充、中位数填充,众数填充。在Imputer类中的strategy的可选参数中可以进行选择。Imputer这个类主要用于缺失数据的处理 参数axis:

  • axis = 0 取一列的平均值
  • axis = 1 取一行的平均值

参数strategy: strategy : string, optional (default="mean") The imputation strategy.

  • If "mean
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值