本书共7章,重点介绍三方面的内容:数据挖掘的基础知识,包括数据挖掘的概念、标准过程模型、数据预处理、分类、关联分析、聚类分析等;数据挖掘工具,包括Python基础、NumPy工具包、Pandas工具包、Matplotlib绘图库和 Scikit-Learn工具包;数据挖掘案例,包括分类、关联分析、聚类分析三个应用主题,每个案例都系统地展示了一个数据挖掘项目的具体过程和分析细节(其中一个案例还给出了Python的实现方法与代码)。
本书为融媒体新形态教材,从教学需求出发,为使用本书作为教材的教师提供教学课件、例题代码、习题参考答案、实验的步骤与代码等配套资源。关于本书配套数字资源:图片可手机扫码在线浏览;扫描zip文件二维码后,请复制邮箱内的文件下载链接,在新浏览器页面打开下载,避免邮箱拦截链接。
本书可作为本科生数据挖掘课程的教材,也可作为数据挖掘爱好者和相关从业人员的参考书。
本书遵循教育部教指委相关指导文件和高等院校学生学习规律编写而成。践行四新理念,融入思政元素,注重理论与实践相结合。
前言
在人工智能与大数据技术快速发展的时代背景下,国家层面已将数据确立为新型生产要素和战略资源。从中共中央、国务院2022年12月19日发布《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》对数据基础制度的顶层设计,到2023年2月27日印发《数字中国建设整体布局规划》对经济社会发展全面赋能的部署,再到人工智能+行动的明确提出,均表明释放数据价值已成为我国未来发展的核心政策目标。数据挖掘作为连接海量数据与智能价值的核心引擎,是实现这一目标不可或缺的技术手段。
本书在重视基础理论介绍的同时,也重视理论的运用和实践,旨在提供一份全面且实用的指南,帮助读者系统掌握数据挖掘的基本概念、方法、工具和应用。
希望本书能为高等院校的学生、对数据挖掘感兴趣的学习者、希望在业务分析中运用数据挖掘解决问题的专业人士提供有价值的知识和案例参考。
本书重点介绍三方面的内容:数据挖掘的基础知识,包括数据挖掘的概念、标准过程模型、数据预处理、分类、关联分析、聚类分析等;数据挖掘工具,包括Python基础、NumPy工具包、Pandas工具包、Matplotlib绘图库和Scikit-Learn工具包;数据挖掘案例,包括分类、关联分析、聚类分析三个应用主题,每个案例都系统展示了一个数据挖掘项目的具体过程和分析细节(其中一个案例还给出了Python的实现方法与代码),目的是将所学的数据挖掘理论和方法落到实处,为读者模仿、修改、创新及运用数据挖掘理论解决实际应用问题提供原型。
本书的主要特色是在重点关注数据挖掘理论、方法与算法的同时,兼顾了数据挖掘的实现工具及应用,并将三者进行了适当的融合。章末配有习题和实验,实验包括示例实验和拓展实验,供读者巩固所学内容、深度思考,模仿示例实验自主解决问题。希望读者通过学习能够具备一定的解决实际应用问题的能力。本书为融媒体新形态教材,从教与学的需求出发,为使用本书作为教材的教师提供教学课件、例题代码、习题参考答案、示例实验的步骤与代码等配套资源。关于本书配套数字资源:图片可手机扫码在线浏览;扫描zip文件二维码后,请复制邮箱内的文件下载链接,在新浏览器页面打开下载,避免邮箱拦截链接。
本书编写方案的制定、审阅及最终的统稿工作由米红娟完成。全书共7章,第1章、第4章的4.1节~4.7节由米红娟编著,第2章、第4章的4.8节~4.11节由杨鹏斐编著,第3章、第6章、第7.1节由易纪海编著,第5章、第7.2节与7.3节由宋帅编著。
本书可作为本科生数据挖掘等相关课程的配套教材(建议第2章实验课堂使用,其余各章理论课堂使用),也可作为对数据挖掘感兴趣的学习者和业务数据分析从业人员的参考书。作为本科生教材时,授课教师可根据教学需要对章节内容进行筛选和取舍。
本书编著者均为从事数据挖掘、机器学习、大数据分析教学工作多年的一线教师,但数据挖掘领域发展日新月异,且兼具多学科交叉的特性,书中恐有疏漏谬误之处,敬请读者朋友们不吝赐教,我们将不胜感激。
申报人为本科生和研究生开设数据挖掘课程已有20年之久。?人类已经进入大数据时代,人工智能时代也即将到来。利用数据挖掘技术提升竞争力已成为各行各业追逐和挑战的目标,商务智能作为支持企业决策的重要手段,也逐渐被很多企业所重视,社会对数据挖掘与分析应用型人才的需求量很大。顺应这一形势,教育部在2016-2019年累计批准479所高校开设数据科学与大数据分析技术专业以及大数据管理与应用专业,同时,很多大学为计算机科学与技术、信息管理与信息系统、电子商务、统计学、软件工程等专业的本科生和管理科学与工程、新闻与传播、MBA等硕士研究生的教学计划中都设置了数据挖掘或大数据分析课程。?近年来,作为解决问题的方法和工具,数据挖掘已经在数字经济、会计学、管理科学等本科专业以及一些三本院校的计算机科学与技术、信息管理与信息系统、电子商务、网络工程等专业开设。但目前市面上适合这个层次教学的数据挖掘教材较少,高质量的更是少之又少。市面上不乏由著名学者编著的介绍数据挖掘理论基础和算法原理的书籍,以及由企业工程师编写的数据挖掘案例方面的书籍,前者更适合作教材,但缺少案例和实验课的配套内容,而且这类教材都更适合深入学习数据挖掘课程的本科生或研究生使用。?本申报人希望通过努力,能够出版一本数据挖掘基础理论与案例、实验并重,贴近教学的适合非计算机科学与技术、非信息类专业以及三本院校计算机科学与技术、信息类专业本科生使用的教材。?申报人曾主持以数据挖掘为主题的甘肃省自然科学基金资助课题一项,获兰州市科技进步二等奖。在长期教学过程中,参考一些优秀教材已经形成内容既相对稳定又不断更新的讲义,讲义使用30余次,教学效果良好。
目录
前言
第1章绪论1
1.1数据挖掘的概念与流程1
1.1.1数据挖掘的概念1
1.1.2数据挖掘的标准过程模型2
1.2数据挖掘的主要任务4
1.2.1分类与回归4
1.2.2聚类分析5
1.2.3关联分析5
1.2.4异常检测6
1.3数据挖掘的应用6
1.3.1数据挖掘在金融行业的应用7
1.3.2数据挖掘在电信行业的应用8
1.3.3数据挖掘在医疗行业的应用9
1.3.4推荐系统10
习题10
参考文献11
第2章数据挖掘工具12
2.1Python12
2.1.1Python基础12
2.1.2NumPy工具包25
2.1.3Pandas工具包38
2.1.4Matplotlib绘图库44
2.2Scikit-Learn工具包50
2.2.1数据集50
2.2.2k近邻分类器52
2.2.3决策树53
2.2.4朴素贝叶斯分类器54
2.2.5多层感知器55
2.2.6支持向量机55
2.2.7随机森林与AdaBoost56
2.2.8k均值聚类57
2.2.9基于密度的聚类58
2.2.10主成分分析58
习题59
实验60
参考文献60
第3章数据61
3.1数据概述61
3.1.1数据类型62
3.1.2数据质量64
3.1.3数据来源65
3.2探索数据66
3.2.1汇总统计66
3.2.2数据可视化68
3.3数据预处理74
3.3.1数据预处理任务74
3.3.2数据清洗76
3.3.3数据归约78
3.3.4数据离散化85
3.3.5数据规范化86
3.4数据对象相似性与相异性度量87
3.4.1数据矩阵与邻近度矩阵88
3.4.2标称属性的邻近度88
3.4.3二元属性的邻近度89
3.4.4数值属性的邻近度91
3.4.5序数属性的邻近度91
3.4.6混合类型属性的邻近度92
3.4.7余弦相似度和广义Jaccard系数93
习题95
实验97
参考文献98
第4章分类的概念与方法99
4.1分类的基本概念99
4.2分类的一般方法101
4.3决策树归纳102
4.3.1决策树归纳的基本原理102
4.3.2属性划分的度量 104
4.3.3树的剪枝107
4.3.4决策树归纳算法109
4.3.5由决策树提取规则117
4.3.6决策树归纳的一般特点118
4.4模型的评估与选择119
4.4.1模型的过拟合120
4.4.2模型的性能度量123
4.4.3模型评估交叉验证法127
4.4.4模型选择127
4.5k-最近邻分类131
4.5.1k-最近邻分类原理131
4.5.2最近邻分类器的特点132
4.6朴素贝叶斯分类器132
4.6.1贝叶斯定理132
4.6.2朴素贝叶斯分类器的原理133
4.6.3朴素贝叶斯分类器的特征136
4.7Logistic回归136
4.7.1Logistic回归的基本原理136
4.7.2Logistic 回归的特点138
4.8人工神经网络139
4.8.1多层前馈神经网络139
4.8.2误差反向传播算法141
4.8.3人工神经网络的特点144
4.8.4人工神经网络与深度学习145
4.9支持向量机145
4.9.1线性可分支持向量机145
4.9.2软间隔支持向量机149
4.9.3非线性支持向量机152
4.9.4支持向量机的优缺点155
4.10集成学习方法156
4.10.1基本原理156
4.10.2随机森林158
4.11分类的典型应用160
习题161
实验163
参考文献166
第5章关联分析的概念与方法168
5.1关联分析的基本概念168
5.1.1购物篮分析168
5.1.2频繁项集和关联规则169
5.2关联分析的基本任务171
5.3关联分析方法171
5.3.1先验原理171
5.3.2Apriori算法产生频繁项集172
5.3.3Apriori算法生成关联规则179
5.4频繁项集的紧凑表示181
5.4.1极大频繁项集182
5.4.2闭频繁项集182
5.5关联模式评估183
5.5.1模式的客观兴趣度度量183
5.5.2支持度-置信度框架的局限性183
5.5.3提升度、相关度与IS度量184
5.6关联分析的典型应用186
习题187
实验188
参考文献191
第6章聚类分析的概念与方法193
6.1聚类分析的基本概念193
6.1.1聚类分析193
6.1.2聚类分析方法194
6.2k均值聚类195
6.2.1基本k均值算法196
6.2.2基本k均值算法的初始化问题201
6.2.3二分k均值算法202
6.2.4k均值的优点和缺点203
6.3凝聚的层次聚类203
6.3.1簇间邻近度204
6.3.2基本凝聚层次聚类算法及实现205
6.3.3层次聚类的优点和主要问题213
6.4DBSCAN聚类213
6.4.1DBSCAN算法的相关概念213
6.4.2DBSCAN算法及实现214
6.4.3DBSCAN算法参数选择 216
6.4.4DBSCAN算法的优缺点 216
6.5聚类评估216
6.5.1概述217
6.5.2无监督簇评估:凝聚度、分离度
与轮廓系数217
6.5.3确定簇的数目220
6.5.4聚类趋势220
6.6聚类分析的典型应用221
6.6.1环境与数据准备222
6.6.2实验步骤222
6.6.3总结与结论230
习题231
实验231
参考文献231
第7章案例分析232
7.1机票航班延误预测232
7.1.1应用背景与目标232
7.1.2数据探索与理解232
7.1.3数据预处理238
7.1.4分类模型构建与评估241
7.1.5模型的作用246
7.2零售行业购物篮分析247
7.2.1应用背景与目标247
7.2.2数据探索与理解248
7.2.3数据预处理250
7.2.4关联规则挖掘与评估251
7.2.5规则解释255
7.3航空公司客户价值分析255
7.3.1应用背景与目标255
7.3.2数据探索与理解256
7.3.3数据预处理260
7.3.4聚类模型构建与评估262
7.3.5模型解释与应用264