所有课程

数据概览分析入门

章节 1: 数据初步分析的原理

什么是数据初步分析？

数据初步分析流程

EDA 的工具：Python 库简介

设置您的环境

第 1 章测验

章节 2: 数据加载、检查与初步清理

从多种来源加载数据（CSV、Excel、JSON）

数据初步观察：形状、头部、尾部

理解数据类型（dtypes）

处理缺失数据：识别

缺失数据的处理策略：填充与删除

检测和处理重复记录

动手实践：数据加载与初步整理

第 2 章测验

章节 3: 单变量分析：理解单个变量

分析数值变量：集中趋势

数值变量分析：离散程度

数值变量可视化：直方图

数值变量的可视化：箱线图

分析分类变量：频数统计

可视化分类变量：柱状图

使用统计方法识别异常值

练习：单变量数据分析

第 3 章测验

章节 4: 双变量分析：考察变量间的关系

数值变量与数值变量：散点图

数值变量与数值变量：相关性分析

相关性可视化：热力图

数值型与分类型：比较图表

分类变量与分类变量：交叉制表

分类变量间的可视化：堆叠条形图与分组条形图

动手实践：双变量分析

第 4 章测验

章节 5: 高级数据可视化与特征工程入门

多元数据可视化：对图

自定义图表以提高清晰度（标题、标签、图例）

特征工程思想介绍

从现有特征生成新特征

基本数据转换：缩放与归一化

处理分类特征：编码方法

降维思路介绍

汇总和报告EDA结果

实践操作：特征创建与归纳

第 5 章测验

缺失数据的处理策略：填充与删除

这部分内容有帮助吗？

参考文献

Data Mining: Concepts and Techniques, Jiawei Han, Micheline Kamber, and Jian Pei, 2011 (Elsevier) - 详细介绍了数据预处理方法的综合性教科书，包括处理缺失数据的策略、优点和缺点。
Missing Data Analysis: A Practical Guide to Multiple Imputation, John W. Graham, 2012 (Springer) DOI: 10.1007/978-1-4614-4018-5 - 讨论缺失数据分析，介绍了缺失数据机制的理论背景以及简单删除和填充方法的局限性。
Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow, Aurélien Géron, 2022 (O'Reilly Media) - 处理数据预处理步骤，包括管理缺失数据，并在机器学习项目中提供策略和考量。
Missing Data, Paul D. Allison, 2001 Quantitative Applications in the Social Sciences, Vol. 136 (SAGE Publications, Inc.) DOI: 10.4135/9781412984183 - 一部经典指南，提供了对缺失数据问题和基本处理方法的理解。

© 2025 ApX Machine Learning用心打造