机器学习实践(一)

📅 2026/7/28 19:13:27
机器学习实践(一)
这里写自定义目录标题数据导入数据描述数据的可视化数据预处理数据特征的选择数据导入(1)python标准类库导入(2)用numpy模块导入(3)用pandas导入frompandasimportread_csv filenamepima-indians-diabetes.csvnames[preg,plas,pres,skin,test,mass,pedi,age,class]dataread_csv(filename,namesnames)数据描述(1)描述性统计frompandasimportset_optionset_option(precision,4)print(data.describe())(2)数据的分组分布print(data.groupby(class).size())(3)数据属性的相关性使用皮尔逊相关系数1表示正相关-1表示负相关set_option(display.width,100)set_option(precision,2)print(data.corr(methodpearson))数据的可视化(1)直方图显示data.hist()plt.show()(2)密度图显示data.plot(kinddensity,subplotsTrue,layout(3,3),sharexFalse)plt.show()(3)散点图显示scatter_matrix(data)plt.show()数据预处理(1)调整数据的尺度fromnumpyimportset_printoptionsfromsklearn.preprocessingimportMinMaxScaler transformerMinMaxScaler(feature_range(0,1))newXtransformer.fit_transform(X)set_printoptions(precision3)print(newX)将所有数据的值调整在0,1之间。(2)正态化数据transformerStandardScaler().fix(X)newXtransformer.fit_transform(X)set_printoptions(precision3)print(newX)(3)标准化数据transformerNormalizer().fix(X)newXtransformer.fit_transform(X)set_printoptions(precision3)print(newX)(4)二值化数据transformerBinarizer(threshold0.0).fix(X)newXtransformer.fit_transform(X)set_printoptions(precision3)print(newX)数据特征的选择(1)单变量特征选定卡方检验testSelectKBest(score_funcchi2,k4)fittest.fit(X,Y)set_printoptions(precision3)print(fit.scores_)featuresfit.transform(X)print(features)这里的数值越大表示对结果影响最大的因素可作为特征选择的参考值。(2)递归特征消除RFE对此方法的理解不够需要使用时再仔细研究(3)主要成分分析PCA通常被称作数据降维pcaPCA(n_components3)fitpca.fit(X)print(解释方差%s,fit.explained_variance_ratio_)print(fit.components_)下一章就到模型的选择了设计模型评价等点。