本书以大数据为背景,以商业数据分析为主线,对商业活动中常用的数据处理和定量分析方法及相关软件使用进行了讲解。全书内容由描述性定量分析、预测性定量分析、指导性定量分析三个部分组成,涵盖的知识领域涉及大数据、统计学、商业智能、数据挖掘、运筹优化、决策管理等。真实的数据案例,给你呈现逼真的视觉效果数据和结果。本书使用Excel, Tableau, R或基于python的Orange数据挖掘软件来进行数据分析。通过真实的真实的问题让你学习更多知识。新版更新解决了传统定量概念之外的主题,例如数据争论,数据可视化和数据挖掘,这些在当今的商业环境中越来越重要。
本书是商业数据分析的基础读物,全面覆盖描述性、预测性与规范性三大分析方法。第5版历经重大修订,融入大数据时代最新技术与实战案例,帮助读者掌握从数据清洗到优化决策的全链路技能。
新增数据整理整章:系统讲解数据探索、清洗、丰度化与验证,攻克数据分析中耗时最长的实战难题。
数据挖掘内容重磅扩展:将预测性数据挖掘拆分为回归与分类两章,深入讲解k-最近邻、回归树、神经网络、集成方法等主流算法,并新增主成分分析降维、文本挖掘等描述性挖掘技术。
全流程软件支持:全面整合Excel最新版本操作,并在线提供R(RStudio)和Python基础工具Orange的脚本与工作流实例,满足不同教学与自学需求。
紧跟时代前沿:涵盖大数据、云计算、人工智能、数据隐私与伦理等热点议题,助力培养负责任的商业分析师。
《商业数据分析》是专门为高年级本科生、低年级研究生编写的教材,着重介绍了商业数据分析的基本知识。全书呈现了大量关于商业数据分析这一不断成长领域的第一手素材。第 1 章为导论,对商业数据分析做了概览性介绍,包括商业数据分析方法的分类及其应用,简而言之,商业数据分析能够帮助从事商业活动的专业人士依据数据做出更好的决策。第 2 章到第 4 章介绍了数据资料的探索、清洗、汇总、可视化和理解等内容。第 5 章介绍了概率论的基础知识。第 6 章介绍了描述性数据挖掘,包括主成分分析、聚类分析、文本挖掘等方面的内容。第 7 章至第 11 章介绍了如何从历史数据资料中获得认知,以及对未来情况的预测等。第 12 章着重介绍了如何利用电子表格开展数据资料审查和构建用于决策的电子表格模型。第 13 章展示了如何通过蒙特卡罗模拟在电子表格模型中明确引入不确定性因素。第 14 章、第 15 章和第 16 章介绍了优化模型,以帮助决策者根据可用数据选择最佳决策。第 17 章是决策分析,介绍了决策分析过程中使用概率和不使用概率的决策分析方法。另外,为配合读者学习,本书还编写了与数据分析有关的其他软件如 Tableau、R、Orange 的在线使用说明,有兴趣的读者可以登录本书外方出版社网站(www.cengage.com)获取相关信息。
本教材的内容安排分成两部分:一是商务统计学知识,二是定量分析方法。学习本教材前,原则上对读者是否学习过统计学课程没有什么要求。书中所涉及的统计学概念或范畴,都从商业数据分析的角度运用商业活动中的实际事例进行了解读。第 2 章、第3 章、第 4 章、第 5 章、第 7 章、第 8 章、第 9 章对与统计学有关的概念进行了说明,这些概念是学习复杂商业数据分析方法的基础。第 2 章讲解了描述性统计量,比如位置测度、变异测度、分析数据分布时使用到的方法,以及两个变量间的相关性测度。第5章讲解概率方面的知识,包括离散型概率分布和连续型概率分布。第 7 章讲解统计推断分析的内容,分别介绍了区间估计和假设检验。第 8 章讲解了线性回归模型,主要是简单线性回归模型、多元线性回归模型及其应用。第 9 章讲解了时间序列及其预测方法。第3 章着重讲解了数据的可视化表达。第 4 章对数据的探索、清洗、验证等做了总览性介绍。有关这些方面的知识,传统的商务统计学课程中可能不会涉及,但它是非常重要的,掌握这些方面的知识,有助于理解和掌握数据分析方法。第 6 章、第 10 章和第 11章涉及数据挖掘方面的知识,这些内容在初级商务统计学课程中一般不会讲解,但在当前的商业活动情境下,数据挖掘超级重要,有着广泛的应用。第 6 章讲解的是描述性数据挖掘,包括聚类分析、关联规则和文本挖掘,在这一章中我们还讲解了主成分分析方法在数据降维中的应用问题。第 10 章和第 11 章着重介绍了如何依据数据开展预测分析的数据挖掘方法。其中第 10 章讲解了基于回归的预测性数据挖掘,包括 k- 最近邻法、回归树和神经网络;第 11 章介绍了基于分类的预测性数据挖掘,包括逻辑回归、k- 最近邻法、分类树、集成方法和神经网络。第 10 章和第 11 章还介绍了数据抽样的内容如k- 折交叉验证,以及特征选择方法如封装法、过滤法、嵌入法等。第 12 章介绍了数据分析中电子表格模型的应用,第 13 章到第 17 章侧重讲解了如何利用电子表格模型进行规范性的数据分析,这些内容在许多企业改善决策时都有广泛的应用。
新增内容
第 5 版进行了重大修订,新增了章节、概念和工具。第 4 章属于完全新增加的内容,讲解了数据资料整理的有关问题,包括数据资料的获取和访问、数据资料的结构化处理、数据资料的清洗、数据丰度化,以及数据资料质量的甄别和确认等。关于数据挖掘的相关内容,第 5 版做了较大扩展。第 6 章内容是描述性数据挖掘,在这一章里,新增加了如何运用主成分分析对数据资料施以降维的教学内容,还全面更新了聚类分析、关联规则、文本挖掘的知识。在有关预测性数据挖掘的介绍中,第 5 版把它拆分成两章,分别是第 10 章和第 11 章,其中第 10 章讲解了如何运用 k- 最近邻法、回归树、集成方法、神经网络对定量结果进行预测,第 11 章着重介绍了如何运用 k- 最近邻法、分类树、集成方法、神经网络对二值分类结果进行预测。在有关数据挖掘的介绍中,这一版增加了适用于描述性数据挖掘和预测性数据挖掘分析软件 Orange 的在线学习材料。Orange 是一款开源软件,是建立在 Python 基础上的机器学习和数据可视化软件包。R 软件也能做描述性和预测性数据分析,但相较而言,Orange 和 Python 的功能似乎更强大。第 2 章内容是描述性统计分析,第 3 章内容是数据可视化,第 5 版的相关内容从深度上进行了加强,同时引进了一些新的分析方法。第 8 章讲述了线性回归的内容,第 9 章讲述了时间序列分析和预测,我们在第 5 版中结合经济发展对其中使用到的背景数据做了更新,扩大了相应数据的规模。第 16 章讲述了有关优化方法的内容,第5版新编写了一节内容,就是利用 Excel 规划求解功能中的演化算法求解启发式优化问题。在上述所做的更新和补充工作之外,第 5 版中在每一章都增加了学习目标和要求,凡涉及的重要概念都做了明确的说明,还编写了如何利用 Excel 开展统计数据分析的在线教辅资源。
总结起来,第 5 版所做的更新和补充工作体现在:
新增一章:数据整理。第 4 章是新增加的一章,在这一章中,我们讲解了数据资料的探索、结构化、清洗、丰度化、验证和发布。在许多数据分析专业领域和数据科学活动中,实施数据透视和分析的时候,往往需要花费大量的时间来准备数据,对学生来说,熟悉和掌握这方面的知识和技能无疑是重要的。为此,我们编写了使用R软件处理这些方面问题的在线学习材料以供参考。
补充了描述性数据挖掘章节的学习内容。第 6 章内容是关于描述性数据挖掘的,在这一章中,我们对如何运用主成分分析开展降维问题进行了深入讨论。我们通过实例帮助学生了解主成分分析是如何发挥降维作用的,同时也解释了主成分分析结果的意义。另外,我们重新编写了这一章的许多节内容,对描述性数据挖掘予以详细的解释,进一步阐明了描述性数据挖掘的意义。
充实了预测性数据挖掘的内容。第 5 版中,我们把以前版本中预测性数据挖掘的内容拆分成两章,即第 10 章和第 11 章,第 10 章内容为基于回归的预测性数据挖掘,第 11 章内容是基于分类的预测性数据挖掘。做这样的处理,旨在便于我们引入更多的预测性数据挖掘方法,并能够对预测性数据挖掘方法和分析结果做出更详细的解释。
针对适应数据挖掘分析、基于 Python 基础的 Orange 软件编写了在线学习资源内容。针对描述性数据挖掘和预测性数据挖掘,通过在线资源编写了 Orange 软件包的使用说明。Orange 软件包是建立在 Python 基础上的一款开源软件,适合作为机器学习和数据可视化的使用工具。这款软件不仅容易上手,而且功能强大,能够通过工作流方式构建数据分析模型。作为一款数据分析专业人士使用的软件,Python 的使用已经得到有力的推广,与此相比,Orange 软件在容易学习的环境下对 Python 的使用做了富有成效的导入说明。本书关于这方面的在线资源,通过实例讲解了如何使用 Orange 软件开展数据挖掘分析。
在数据挖掘的有关章节里,对如何使用 R 软件开展数据挖掘分析的知识进行了更新。R 软件是大家熟知的一款开源软件,在第 5 版中,我们仍然通过在线资源介绍了如何利用 R 软件进行描述性数据挖掘分析和预测性数据挖掘分析。在以前版本的在线资源中,我们介绍的是 R 软件中 Rattle 插件的使用,我们在第 5 版着重介绍了 R 软件中 RStudio 插件的脚本命令。根据我们的体会,RStudio 插件的脚本程序似乎比 Rattle 插件更稳健也更稳定。为了便于教学,凡是第 5 版使用到的 R 软件分析,我们在在线资源中给出了它们的脚本程序,并且还编写了细致的说明。
在在线资源中增加了 Orange 软件和 R 软件的应用实例。Orange、R 都是开源软件包,在在线资源中,介绍到 Orange 软件和 R 软件的使用时,我们都增加了相应的应用实例,对怎么解决这些问题我们都给出了清晰的说明。所有的老师都可以使用这些实例,以及使用 Orange 软件和 R 软件的求解说明和代码文件。
增补了描述统计分析和数据可视化方面的学习内容。第 2 章和第 3 章内容分别是描述统计分析、数据可视化,第 5 版对这些方面的教学内容进行了充实。在第 2 章的数据分布部分,我们重新编写了直方图的内容,增加了频数分布折线图的介绍。直方图和折线图,是考察数据分布状态经常使用到的工具。第 3 章对可视化在数据分析实际中的应用做了比较系统的讲解,包括如何突出视觉显示和规划数据墨水比,以创建更有效的表格表达和图形表达。第 5 版对第 2 章和第 3 章的内容做了调整,并增加了表格透镜、瀑布图、股价图、等值面地图、变形地图等可视化工具的介绍。
新增了优化问题的学习内容。第 5 版充实了优化方法和模型,在第 14 章有关线性优化问题的介绍中,新增了运输问题、食谱问题、指派问题。在第 16 章非线性优化问题的介绍中,新增加了一节,即如何利用 Excel 规划求解功能中的演化算法求解启发式优化问题。演化算法是一种重要的非线性规划的求解方法,可以用来求解比较复杂的优化模型。另外,在这一版中,我们新编写了如何利用 R 软件求解优化问题的在线学习资源。
扩充了背景数据集的数据规模。针对第 8 章线性回归分析、第 9 章时间序列分析与预测中涉及的背景数据集,我们都扩大了数据集中的数据规模。这些规模扩大后的数据集,更能契合实战性,对实施推断分析和检查回归分析及时间序列分析的假定条件是否得到满足更有助益。
增加了学习目标和要求。第 5 版的每一章都增加了相应的学习目标和要求,目的是提醒初学者注意理解和掌握各章的重要概念。另外,在各章的复习思考题和案例中,我们也标注了相应的学习目标和要求,有助于老师更好地了解学生对知识的掌握情况。
充实了各章复习思考题和案例讨论的内容。在第 5 版中,我们增加了 170 多道复习思考题和 6 个新案例。我们在第 1 章也编写了复习思考题,这样第 5 版的各章都附有复习思考题。针对第 6 章、第 10 章、第 11 章有关数据挖掘的教学内容,我们将相关的复习思考题按照概念和软件应用进行编排。概念方面的复习思考题不需要借助专门软件解答,因此在数据挖掘有关章节里,我们新编写了许多考核概念性知识的复习思考题。考核软件应用类的复习思考题需要使用专门的软件才能解答,因此允许学生使用软件分析工具。关于软件的应用,在相关的数据挖掘分析章节,我们编写了 Orange、R 的在线学习资源,对怎么使用这些软件求解问题做了具体的介绍。第 5 版秉承以前版本的做法,对需要使用 Excel 求解的复习思考题和使用Excel 讨论的案例,教师可以免费获取 Excel 的求解文件。对于数据挖掘有关的章节,凡是需要使用 Excel 求解的复习思考题,我们同时给出了 Orange、R 的求解参考答案。
保留的做法
在这次修订过程中,我们秉承了以前各个版本的长处和成功的做法。这主要体现在以下方面:
Excel 的应用。和以前的一些版本一样,在第 5 版中,我们也将 Excel 的应用全面
融入教学内容。针对书中涉及的许多方法,我们既讲解了如何进行手工计算,也介
绍了如何利用 Excel 处理。对那些比较复杂的、仅能使用 Excel 处理的模型,我们
只侧重讲解 Excel 求解的使用方法。书中凡是涉及 Excel 方面的内容,我们都按Excel 的最新版本予以更新,因为对学生来说,他们可能更喜欢使用 Excel 的最新
版本。本书的大部分复习思考题和正文中的例子都假设使用桌面版 Excel,但本书
的在线学习资源介绍了 Excel 在线版的基本使用方法。
注释与点评。在本书许多小节的末尾,我们针对所介绍的方法添加了注释与点评,
旨在开阔学生的视野。注释与点评一方面对介绍的方法本身的局限性做出解释,另
一方面对它们应用的注意事项以及进一步学习的方向给出了说明。另外,本书还通
过边注的方式,对讨论的相关知识给出必要的注解和提示。
实践中的数据分析。在大部分章节里,我们都编写了实践中的数据分析。这部
分内容描述了有关商业数据分析方法在实践中应用的有趣事例,它们摘自健康管
理、财务金融、生产制造、市场营销等各个领域的期刊。
数据文件和模型文件。正文中的例子和复习思考题中涉及的所有数据集,都作为在
线学习资源放在了本书外方出版社的网站上,学生可以下载使用。数据文件包含了
书中正文中的例子和复习思考题所用到的背景数据。数据文件中的数据保存格式,
有的是可供 Excel 使用的 .xlsx 格式,有的是可以导入其他软件包使用的 .csv 格
式。模型文件是有关模型性质特征的文件,比如 Excel 公式的拓展应用、Excel 的
规划求解功能说明、R 语言的脚本程序、Orange 软件包的工作流模型等。
复习思考题和案例。为帮助学生掌握学习的内容,第 5 版的每一章都配有丰富的
复习思考题,供学生检查学习效果。这些复习思考题解答的难易程度不等,但都与
商业数据分析实际应用的具体实例有关。偶数编号的复习思考题的答案都放在了本
书外方出版社的网站上。除了第 1 章,其他各章都配有案例,这些案例有一定的
难度,设置案例讨论题目旨在综合运用相应章节介绍的方法。相比各章的复习思考
题,我们尽可能使案例更具开放性,但这并不意味着其回答可以不着边际,我们也
详细地给出了关于案例解答的方向性的提示说明。
感谢审稿人所做的工作,感谢对本书的完善提出中肯意见和建议的读者。这里,特
别要感谢南卡罗来纳大学 Rafael Becerril Arreola、巴克内尔大学 Matthew D.Bailey、丹佛大学 Phillip Beaver、俄亥俄大学 M.Khurrum S.Bhutta、弗吉尼亚联邦大学 Paolo Catasti、维拉诺瓦大学 Q B.Chung、肯塔基大学 Elizabeth A.Denny、波特兰大学Mike Taein Eom、费耶特维尔州立大学 Yvette Njan Essounga、得克萨斯州立大学Lawrence V.Fulton、迦太基学院 Tom Groleau、林肯纪念大学 James F.Hoelscher、路易斯堡学院 Eric Huggins、俄亥俄大学 Faizul Huq、宾夕法尼亚约克学院 Marco Lam、 加 州 大 学 伯 克 利 分 校 Thomas Lee、 西 北 大 学 Roger Myerson、 肯 塔 基 大学 Ram Pakath、詹姆斯麦迪逊大学 Susan Palocsay、加州大学伯克利分校 Andy Shogan、安柏瑞德航空航天大学 Dothan Truong、维克技术社区学院 Kai Wang、美利坚大学 Ed Wasil、辛辛那提大学 Ed Winkofsky。
在本书的编写过程中,我们参考了来自商业界和产业界作者的文章,感谢他们提供
了实践中的数据分析专栏的素材。最后,我们还要向这些人表达我们的谢意,他们
是负责本书统筹工作的高级经理 Aaron Arnsparger、内容高级经理 Breanna Holmes、高 级 学 习 设 计 师 Brandon Foltz、 学 科 专 家 Deborah Cernauskas、 数 字 项 目 经 理Andrew Southwell、项目主管 Shreya Tiwari,感谢他们在本书编写过程中给予的咨询解答和支持。
杰弗里·D. 坎姆(Jeffrey D.Camm)
詹姆斯·J. 科克伦(James J.Cochran)
迈克尔·J. 弗里(Michael J.Fry)
杰弗里·W. 奥尔曼(Jeffrey W.Ohlmann)
[美]杰弗里 D.坎姆(Jeffrey D.Camm)维克森林大学商学院Inmar总裁兼商业分析项目高级副院长。他出生于俄亥俄州的辛辛那提,拥有泽维尔大学的学士学位和克莱姆森大学的博士学位。在加入维克森林大学之前,他曾在辛辛那提大学(University of Cincinnati)工作。他也是斯坦福大学的访问学者和达特茅斯学院塔克商学院的工商管理访问教授。Camm博士发表了超过45篇关于优化应用于运营管理和市场营销问题的论文。他在许多专业期刊上发表了他的研究,包括Science, Management Science, Operations research和the INFORMS Journal on Applied Analytics。
耿修林,南京大学商学院教授、博导,1995年中国人民大学博士毕业,1997年厦门大学博士后毕业,1998至今在南京大学商学院任教。
作者简介
前言
第 1 章 导论 1
1.1 决策的意义 2
1.2 什么是商业数据分析 3
1.3 数据分析方法与模型的分类 4
1.4 大数据、云计算和人工智能 6
1.5 商业数据分析的应用 9
1.6 数据及其分析应用中的法律
和道德问题 13
第 2 章 描述统计分析 16
2.1 数据:定义和目标 17
2.2 数据的类型 18
2.3 Excel 数据的初步探索 22
2.4 数据的分布 27
2.5 位置测度 40
2.6 变异测度 45
2.7 分布分析 48
2.8 两个变量间的相关关系 56
第 3 章 数据可视化 63
3.1 概述 65
3.2 表格 70
3.3 图 80
3.4 高级数据可视化 97
3.5 地理空间数据的可视化 105
3.6 数据仪表盘 108
第 4 章 数据整理:数据管理与
数据清洗 112
4.1 数据探索 114
4.2 数据结构化 119
4.3 数据清洗 126
4.4 数据丰度化 136
4.5 数据验证和发布 143
第 5 章 概率:不确定性现象
建模问题 146
5.1 事件与概率 147
5.2 概率的基本关系 149
5.3 条件概率 152
5.4 随机变量 159
5.5 离散概率分布 160
5.6 连续型概率分布 170
第 6 章 描述性数据挖掘 182
6.1 降维 183
6.2 聚类分析 190
6.3 关联规则 206
6.4 文本挖掘 210
第 7 章 统计推断分析 219
7.1 样本选择 222
7.2 点估计 226
7.3 抽样分布 228
7.4 区间估计 237
7.5 假设检验 248
7.6 大数据、统计推断及其
实际意义 266
第 8 章 线性回归分析 276
8.1 简单线性回归模型 277
8.2 最小二乘法 279
8.3 简单线性回归模型的
拟合效果 284
8.4 多元回归模型 288
8.5 线性回归推断分析 293
8.6 分类自变量 305
8.7 非线性回归模型 309
8.8 建模问题 320
8.9 大数据与回归分析 322
8.10 回归预测分析 326
第 9 章 时间序列分析与预测 329
9.1 时间序列的几种类型 331
9.2 预测准确度问题 338
9.3 移动平均法与指数平滑法 342
9.4 回归预测分析 351
9.5 预测模型优良性评估 360
第 10 章 基于回归的预测性数据挖掘 362
10.1 回归效果评估 363
10.2 数据抽样、预处理与分区 365
10.3 k- 最近邻回归 373
10.4 回归树 376
10.5 神经网络回归 386
10.6 特征选择 393
第 11 章 基于分类的预测性数据挖掘 396
11.1 数据抽样、预处理与分割 397
11.2 二值分类效果测度 401
11.3 基于逻辑回归的分类 407
11.4 k- 最近邻法分类 411
11.5 分类树 414
11.6 神经网络分类 424
11.7 特征选择 431
第 12 章 电子表格模型 435
12.1 电子表格模型构建 436
12.2 what-if 分析 441
12.3 建模常用的 Excel 函数 450
12.4 电子表格模型审核 456
12.5 预测性与规范性电子表格模型 459
第 13 章 蒙特卡罗模拟 461
13.1 Sanotronics 公司的风险分析 463
13.2 Promus 公司存货策略分析 475
13.3 Land Shark 公司模拟模型 481
13.4 相依变量模拟 495
13.5 模拟分析的几点思考 499
第 14 章 线性优化模型 501
14.1 最大化问题 503
14.2 Par 公司规划模型的求解 507
14.3 最小值问题 513
14.4 线性规划的几类特殊情况 516
14.5 敏感性分析 520
14.6 线性规划一般形式及
推广应用 522
14.7 线性规划多个解的
一般性说明 540
第 15 章 整数线性优化 544
15.1 整数线性规划的类型 545
15.2 整数规划的一个实例 546
15.3 运用 Excel 求解整数优化问题 549
15.4 0-1 变量的应用 553
15.5 0-1 变量与建模 563
15.6 生成 0-1 问题的替代最优解 565
第 16 章 非线性优化问题 568
16.1 一个生产管理实例 569
16.2 局部最优和全局最优 574
16.3 选址问题 578
16.4 马科维茨投资组合模型 580
16.5 新产品市场销售预测 585
16.6 运用 Excel 演化求解的
启发式优化问题 589
第 17 章 决策分析 597
17.1 问题的表述 599
17.2 不使用概率的决策分析 601
17.3 使用概率的决策分析 604
17.4 运用样本信息的决策分析 608
17.5 利用贝叶斯定理计算状态
分支概率 614
17.6 效用理论 617