本书聚焦大数据存储技术,以由浅入深、循序渐进的方式展开讲解。书中实例丰富,通过大量案例详细阐释技术原理与应用要点,帮助读者掌握技巧;注重技能提升,通过众多项目案例培养读者独立操作与开发实践的能力;将专业知识与思政教育紧密结合,提升读者的综合素养;采用项目式教学,增强实用性。本书共有7个项目,分别为了解大数据、结构化数据
本书以数据智能技术为核心,深入剖析了其在全球数据爆炸性增长背景下的应用与发展。内容涵盖自然语言文字、图像识别、视频、音频、时间序列、时空、社交网络、生物信息学及多模态等9大关键领域数据的分析与处理。全书系统回顾了每个领域中的基础理论、关键技术进展及其实际应用案例,理论与实践紧密结合,条理清晰,并提供丰富的习题和参考文献
本书是大数据新兴领域“十四五”高等教育教材。本书主要介绍数据全与隐私保护的相关知识、技术和方法,主要内容包括:导论、密码学、数据存储与处理安全、数据传输安全、身份认证与访问控制、数据隐私保护、大数据算法安全与隐私保护、隐私保护案例分析,涉及数据存储、数据处理、数据传输、数据共享和数据使用等生命周期的安全保护,以及隐私保
本书是大数据新兴领域“十四五”高等教育教材。本书系统、全面地阐述了大数据管理的基本概念、技术和方法。全书分为三篇,共9章。第一篇为数据管理系统概述,包含第1章,综述了数据管理系统发展所经历的四个阶段,以及大数据管理系统的数据特征和系统特征,阐述了大数据管理系统的组成,指出大数据管理系统完成了从NoSQL到NewSQL的
《大数据技术与应用实验指导书》以大数据的采集、存储、管理、处理和分析建模的处理流程为顺序,设计了16个实验,全面涵盖了Linux操作系统Docker虚拟化技术、网页爬虫、Flume文件采集、HDFS分布式文件系统、Hive数据仓库、MongoDB文档数据库、HBase列族数据、Neo4j图数据库,以及基于Spark的R
在当今大数据时代,流数据统计建模作为一种核心技术,正在重塑数据分析与决策支持的范式。随着物联网、5G通信技术和云计算的快速发展,数据生成与传输的速度呈现指数级增长,传统离线分析方法已无法满足实时性需求。流数据统计建模技术应运而生,能够对持续产生的数据进行实时分析与建模,为各领域的智能化应用提供了重要的技术支撑。 流数据
本书着重介绍大数据建模与分析中常用的概率极限理论,主要内容包括相依随机变量和过程的极限理论、Stein方法及其应用、自正则化极限理论、高维样本协方差矩阵的谱统计量渐近分布理论、随机梯度方法及其应用、随机复杂网络的整体和局部结构、分布式统计推断方法和渐近理论、Gauss逼近原理及其应用等。
本书共分为8章,每一章都围绕完整的项目展开,涵盖Spark的各个重要组件。包括认识Spark、Scala语法应用、SparkCore数据分析、SparkSQL结构化数据处理、Spark、流式数据处理,Spark结构化流式处理、Spark机器学习应用、社交软件运营数据分析,逐步提升读者的技术水平和应用能力。每个项目由多个
本书精心编排为15章,内容包括Spark简介、Spark集群环境部署、Spark编程体验、RDD深度解读、RDD的Shuffle详解、Spark共享变量、Spark序列化和线程安全、Spark内存管理机制、SparkSQL简介、SparkSQL抽象编程详解、SparkSQL自定义函数、SparkSQL源码解读、Spar
本书聚焦联合训练大数据技术前沿,分为9章深入剖析和系统阐述其全生命周期管理与创新应用,从概念内涵(第1章)、采集传输(第2章)、高效存储(第3章)、规范治理(第4章),到分析与挖掘(第5章)、可视化展示(第6章)、决策与评价(第7章),再到安全防护(第8章)、智能应用(第9章)等关键环节,内容涵盖系统顶层设计、核心技术