本书围绕情绪性病理语音识别与诊断, 以“数据—分析—算法” 为脉络分章展开,第1 章界定研究范畴, 第2、3 章借TORGO 数据集解析病理声学和发音学特性, 第4 章探索病理语音数据增强与不平衡问题, 第5 章构建情绪性病理语音数据集THE-POSSD 及评测体系, 第6、7 章量化情绪与病情的关联并搭建病情预测模型, 第8~10 章从视频、声门、言语流畅性解析病理特性并开发多模态融合识别算法, 第11 章为总结与展望。本书可以作为语音信号处理、病理语音研究人员及语音诊断医护人员的参考用书。
段淑斐 博士,副教授,硕导,CCF计算机学会会员,语音对话与听觉专委会委员,声音与音乐技术专委会委员,生物声学专委会青年委员。2014年7月博士毕业于澳大利亚昆士兰科技大学计算机科学专业;2016年12月赴德国不莱梅应用科技大学参加“工业4.0”培训;2022年8月至2023年8月至英国纽卡斯尔大学计算学院访学。迄今指导培养研究生20名以上。主持国家自然科学基金1项,山西省自然科学基金3项,山西省留学回国人员资助项目1项,横向项目若干项。发表高水平论文20余篇,申请及授权国家发明专利5项,登记软件著作权2项。主要研究方向为智慧医疗中的病理语音检测与修复、情感语音信号处理、生物声学信号处理、音视频信号处理等。
目录
第1 章 绪论
1. 1 研究背景及意义
1. 2 主要研究内容
1. 3 章节安排
参考文献
第2 章 基于 TORGO 数据集的病理声学特性研究
2. 1 构音障碍发音数据集 TORGO
2. 2 基于韵律特征和 MFCC 的 FFPM 提取
2. 3 随机森林分类器
2. 4 实验及结果分析
2. 5 本章小结
参考文献
第3 章 基于 TORGO 数据集的病理发音学特性研究
3. 1 基于发音空间特征的短语级构音障碍病情分级研究
3. 2 TORGO 数据集筛选及预处理
3. 3 构音障碍发音异常运动区间分布研究
3. 4 发音启动时间及分布研究
3. 5 发音运动速度及分布研究
3. 6 结合发音特征的构音障碍识别
3. 7 本章小结
参考文献
第4 章 病理语音数据增强与非平衡分类算法
4. 1 基于代价敏感的旋转森林算法的非平衡病理语音识别
4. 2 PCA-SMOTE-EM 非平衡分类算法
4. 3 WHFEMD 病理语音特征增强算法
4. 4 本章小结
参考文献
第5 章 情绪性病理语音数据集 THE-POSSD 的构建与评测
5. 1 常见的病理语音数据集
5. 2 情感模型
5. 3 多模态多角度的情绪性病理语音数据集 THE-POSSD 构建
5. 4 THE-POSSD 数据集的 VA 量化标注与评测
5. 5 本章小结
参考文献
第6 章 情绪表达与构音障碍病情发展的关联分析
6. 1 声学特征对情绪-病程关联的揭示
6. 2 效价-唤醒情感空间中情绪对病程发展的影响
6. 3 面部表情在情绪与病程关联中的表征作用
6. 4 构音障碍患者言语可懂度分析
6. 5 SCL-90 心理状态因子与病程关联度分析
6. 6 关联特征集有效性验证
6. 7 本章小结
参考文献
第7 章 基于灰色关联度-深度信念网络的构音障碍病情预测
7. 1 灰色关联度算法
7. 2 深度信念网络
7. 3 GRA-DBN 预测模型多模态多角度的情绪性病理语音识别与诊断
7. 4 实验结果及分析
7. 5 优化后的 GRA-DBN 预测模型
7. 6 本章小结
参考文献
第8 章 情绪任务下面部数据标注与特征解析的构音障碍病情分级
8. 1 情绪诱发任务下构音障碍患者面部数据标注
8. 2 情绪诱发任务下构音障碍患者面部特征解析
8. 3 基于面部视觉特征补偿声学特征的构音障碍患者病情分级评估研究
8. 4 本章小结
参考文献
第9 章 声门耦合病理语音识别-多尺度Conv-跨模态注意力深度 GRU 融合
9. 1 数据集准备
9. 2 EGG 信号特征提取
9. 3 EGG 声门特征有效性分析
9. 4 基于多尺度卷积、跨模态注意力与深度GRU 融合的声门耦合病理语音识别模型
9. 5 实验结果
9. 6 本章小结
参考文献
第10 章 言语流畅性特征补偿的双分支残差病理语音识别网络
10. 1 数据集准备
10. 2 言语流畅性特征提取及有效性分析
10. 3 言语流畅性特征补偿的双分支残差网络
10. 4 实验结果与分析
10. 5 本章小结
参考文献
第11 章 总结与展望
11. 1 研究工作总结
11. 2 研究局限性及展望