基于逻辑回归的癌症分类预测-良/恶性乳腺癌肿瘤预测

简介:逻辑回归是属于机器学习里面的监督学习,它是以回归的思想来解决分类问题的一种非常经典的二分类分类器。

流程分析:

  1. 获取数据
  2. 数据处理模块(处理缺失值)
  3. 数据集划分
  4. 特征工程(标准化)
  5. 逻辑回归预估器
  6. 模型评估

 该案例本篇令恶性肿瘤为正例,使用jupyter进行编写。

代码为:

import pandas as pd
import numpy as np
#1.读取数据
path = "https://archive.ics.uci.edu/ml/machine-learning-databases/breast-cancer-wisconsin/breast-cancer-wisconsin.data"
column_name = ['Sample code number', 'Clump Thickness', 'Uniformity of Cell Size', 'Uniformity of Cell Shape',
                   'Marginal Adhesion', 'Single Epithelial Cell Size', 'Bare Nuclei', 'Bland Chromatin',
                   'Normal Nucleoli', 'Mitoses', 'Class']
data = pd.read_csv(path,names=column_name)
data.head()

#2.缺失值处理
#1)替换-》np.nan
data = data.replace(to_replace="?",value=np.nan)
#w)删除缺失样本
data.dropna(inplace=True)
data.isnull().any()  #不存在缺失值

#3.划分数据集
from sklearn.model_selection import train_test_split
#筛选特征值和目标值
x = data.iloc[:,1:-1]
y = data["Class"]
x.head()

y.head()

#4.特征工程
from sklearn.preprocessing import StandardScaler
transfer = StandardScaler()
x_train = transfer.fit_transform(x_train)
x_test = transfer.transform(x_test)

from sklearn.linear_model import LogisticRegression
#5.预估器流程
estimator = LogisticRegression()
estimator.fit(x_train,y_train)

#逻辑的模型参数:回归系数和偏置
estimator.coef_

estimator.intercept_

#6.模型评估
#方法1 直接比对真实值和预测值
y_predict = estimator.predict(x_test)
print("y_predict:\n",y_predict)
print("直接比对真实值和预测值:\n",y_test==y_predict)

#方法2 计算准确率
score = estimator.score(x_test,y_test)
print("准确率为:\n",score)

 

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

lc_MVP

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值