pandas-数据清洗

本文详细介绍了使用Pandas进行数据清洗的过程,包括如何判断和处理缺失值,如通过info()、isnull()、notnull()、dropna()和fillna()等方法。同时,还探讨了重复值的发现与删除,利用duplicated()和drop_duplicates()函数进行处理。这些技巧在数据分析中至关重要。


1. 缺失值处理

1.1 判断缺失值

1、info()
2、isnull(),可与any()和all()结合使用
3、notnull()

导入数据:
在这里插入图片描述
使用info()可以查看每一列的相关信息,可以知道每一列有多少个非空数值。
在这里插入图片描述
使用isnull()判断空值,按列判断。
在这里插入图片描述
使用notnull()判断非空,按列判断。
在这里插入图片描述

1.2 丢弃缺失值

对于缺失值,可以丢弃处理(dropna)。
参数:

  • how:指定丢弃缺失值的行为,默认是any(即有缺失值就删除),all。
  • axis:指定丢弃行还是列,默认是axis = 0,丢弃行。
  • thresh:设置当非空值达到多少个时,保留数据。
  • inplace:是否就地修改。

导入数据:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值