学习 day5 的内容
离散特征的独热编码
Q1 对“离散特征”的概念向AI进行提问并学习

Q2 关于“独热编码”:什么是独热编码?


Q3 "独热编码”如何实现?

在py文件中 一次性处理data数据中所有的连续变量和离散变量
1. 读取data数据
自写
#读取数据
import pandas as pd
data = pd.read_csv("data_csv")
#读取所有列名
data.columns
对照无误
学习 关于离散变量名的打印

2. 对离散变量进行one-hot编码
首先须观察数据是否非连续性,已确认可以使用“独热编码”
学习“value_counts()”方法

有些糊涂了,再重新回顾一下[]方括号的使用

现在根据前面已了解到的关于“独热编码的使用”自写一下代码,看看能否写出
自写 对照后发现存在很多问题,说明还是未能理解。
encoded data = pd.get_dummies(data.columns.Home Ownership)
print(encoded data)
正确版本:

通过AI提问,进行逐行学习



总结关于 . 句号的使用

3. 对独热编码后的变量转化为int类型
学习 类型转换
astype()用于将pandas数据框或系列的列转换为指定类型
data['Home Ownership_Have Mortgage'] =data ['Home Ownership_Have Mortgage'].astype(int)
data['Home Ownership_Have Mortgage']
4. 对所有缺失值进行填充
今日先到这里,感觉这一部分学起来有些吃力了,明天把今日剩余的一点内容精进后须将这两日的内容再整体回温一下,所有代码必须亲手再写,确保自己理解每行代码在干什么。之后若有余力,再开始新内容。@浙大疏锦行

940

被折叠的 条评论
为什么被折叠?



