当前位置:文档之家› 内蒙古工业大学语音信号处理复习题考试专用

内蒙古工业大学语音信号处理复习题考试专用

内蒙古工业大学语音信号处理复习题考试专用
内蒙古工业大学语音信号处理复习题考试专用

内蒙古工业大学语音信号处理复习题(考试专用)

1 由下面的W AV文件读出语音的编码信息:

52 49 46 46 A4 9A 7B 01 57 41 56 45 66 6D 74 20

10 00 00 00 01 00 02 00 44 AC 00 00 10 B1 02 00

04 00 10 00 64 61 74 61 80 9A 7B 01 42 FF 35 FC

2 画出语音信号的产生模型,简述语音的产生过程。

语音的形成过程—空气由肺部排入喉部,经过声带进入声道,最后由嘴辐射出声波,形成语音。

3 为生么语音信号要进行“短时”分析。

答:语音信号特性是随时间变化的,是一个非平稳的随机过程,但在一个短时间范围内其特性基本保持不变,即语音信号具有“短时平稳性”,因而可将语音信号看成准平稳过程,对其进行短时分析.

4 语音信号的时域分析方法有那些?

答:短时能量,短时平均过零率,短时自相关函数

5 语音信号频率范围是多少?

答:语音信号的频率大约在20Hz~20KHz。

6 什么是浊音的基音频率(F0)?男性、女性和儿童的F0大致分布在什么范围。

答:浊音的基音频率(F0):声带张开和闭合一次的时间的倒数。由声带的尺寸、特性和声带所受张力决定。F0的大小决定了声音的高低,称为音高。

男性的F0大致分布在:60-200Hz,女性和儿童的F0大致分布在:200-450Hz

7 可以认为多长的时间范围内,语音信号是平稳信号。

答:10-30ms

8 电话语音的采样率为8kHz;纯语音在进行计算机录入时,一般采样率在15kHz~20kHz

左右;音乐的采样率可以高达44kHz。

9 如何利用语音信号的时域分析方法进行清、浊判断。

答:1、短时能量分析依据:是基于语音信号幅度随时间变化》清音段幅度小,其能量集中高频段;浊音段幅度较大,其能量集中低频段;

2、平均幅度分析的依据:清音段幅度小,浊音段幅度较大。

3、短时平均过零率:浊音平均过零率低,集中在低频段;清音过零率高,集中在高

频段。

4、短时自相关函数:浊音语音的自相关函数具有一定的周期性;

清音语音的自相关函数不具有周期性,类似噪声,有点如语音信号本身

10 通过对语音信号进行分析,可以提取到那些特征参数(列举出三个以上)。

答:短时能量和短时平均幅度,短时平均过零率,短时自相关函数

11 人的发音器官包括那些。

答:人体发音器官—肺、气管、喉(包括声带)和声道。

12、傅立叶分析在信号处理中有什么意义?

答:1、它是分析线性系统和平稳信号和稳态信号特性的强有力手段。

2、以复指数函数为基函数的正交变换,理论完善,计算方便,概念容易理解。

3、傅里叶分析可以使信号的某些特性变得很明显。语音信号的频谱具有非常明显的语

言学意义,可以获得重要的语音特征(如共振峰频率和带宽等),

13 文语转换系统(TTS)属于那种语音合成系统。

答:规则语音合成系统

14 语音的共振峰是如何形成的?

答:气流流过声道时犹如通过了一个具有某种谐振特性的腔体,放大某些频率,在频谱上形成相应位置的峰起,称为共振峰。

15 同态信号处理也称为同态滤波,画出同态滤波中特征系统框图

16 语音合成的分类及特点,举出一个语音信号参数合成的例子。

1、波形合成法

特点:简单/小词汇(报站器)

2、参数合成法

特点:可以合成大词汇(字典)

3、规则合成法

特点:实现难度较大

如TTS系统(文语转换系统)

17 画出实现语音信号时频语音增强功能的框图。

18 什么是语音信号的“短时”处理方法。

答:语音信号的能量是一种随时间变化的信号,可能是浊音激励也可能是清音激励,浊音的基音周期以及信号幅度等语音参数也都对时间变化,但这种变化时缓慢的,在一小段时间内10-30ms,语音信号近似不变。于是,我们把变化的语音信号分成一些相继的段时间段来处理。而每一段时间具有固定的特性,这种方法称为“短时”处理方法。

19 语音信号短时能量分析的用途

答:1、区分清音段与浊音段;2、区分声母和韵母;

3、在高信噪比下,区分无声与有声的分界;

4、区分连字的边界;

5、用于语音识别。

20 短时自相关函数的物理意义,性质,作用。

答:物理意义

确定两个信号在时域内的相似性,用于研究信号本身。

表示方法

性质:

(1) 对称性R(k)= R(-k)

(2)在k = 0处为最大值,即对于所有k来说,|R(k)|≤R(0)

(3)对于确定信号,值R(0)对应于能量,而对于随机信号,R(0)对应于平均功率

作用:

a.区分清/浊音

浊音语音的自相关函数具有一定的周期性。

清音语音的自相关函数不具周期性,类似噪声,与其本身相似。

b.估计浊音语音信号的周期,即估计基音周期。

21利用短时自相关函数进行语音分析时要注意的问题

22 语音信号傅里叶分析的作用(p41)

在语音信号处理中,傅立叶表示在传统上一直起主要作用。其原因一方面在于稳态语音的产生模型由线性系统组成,此系统被一随时间作周期变化或随机变化的源所激励,因而系统输出频谱反映了激励与声道频率响应特性。另一方面,语音信号的频谱具有非常明显的语言声学意义,可以获得某些重要的语音特征。同时,语音的感知过程与人类听觉系统具有频谱分析功能是密切相关的

23 短时傅里叶变换的滤波器的解释。

24 取样率的基本概念

(1)时域取样率的基本概念。

(2)频域取样率的基本概念。

(3)总取样率的基本概念

25 从如下语音信号的短时谱中能得到什么信息?

答:1、快速变化,由激励信号引起的;2、慢速变化,声道滤波器的共振峰引起的;3、采用汉明窗得到的短时频谱较较矩形窗平滑。

26 倒谱分析的作用

答:(1)区分清/浊音

(2)求浊音的基音周期, 可以得到浊音的激励信号。

(3)得到声道的冲激响应h(n)

27 简述语音信号的特点,基频、共振峰是什么含义?

答:特点:语音一般由清音和浊音组成,语音信号具有短时平稳性。

基音频率:浊音的声带振动基本频率。是声带张开和闭合一次时间的倒数。

共振峰:当元音激励进入声道时会引起共振特性,产生一组共振频率,称为共振峰频率或简称共振峰。共振峰为频谱中明显的几个凸起点,它的出现频率与声道

的谐振频率相对应。

28 线性预测的基本思想。

答:一个语音的抽样能够用过去若干个语音抽样的线性组合来逼近。通过时实际语音抽样和线性预测抽样之间差值的平方和(在一个有限间隔上)达到最小值,即进行最小均方误差的逼近,能够决定唯一的一组预测数据,而预测系数就是线性组合中所用的加权系数。

29 线性预测分析如何用于语音编码和语音合成。

答:编码:预测误差e(n)就是激励信号G*u(n),预测系数{ak}就是声道虑波器的系数{dk}.ak=dk,e(n)=G*u(n)线性预测分析可以对生成模型的增益参数G和滤波器系

数{dk}进行直接和高效率的计算。

合成:

30 简述矢量量化的过程。

答:(书上定义):将语音信号波形的K个样点的每一帧,或有K个参数的每一参数帧,构成K维空间中的一个矢量,然后对这个矢量进行量化。

(课件上说):当给矢量量化器输入一个任意矢量Xi进行矢量量化时,矢量量化器首先判断它属于哪个子空间,然后输出该子空间的代表矢量Yj.矢量量化过程就

是用Yj代替Xi的过程。

Yj=Q(Xi) 1

31 通常线性预测分析设定的模型是什么模型。

答:全级点模型。

32 什么是矢量的失真测度?常用的失真测度有哪些

答:失真测度(距离测度)就是将输入矢量Xi用码本重构矢量Yj来表征时所产生的误差或失真的度量方法,它可以描述两个或多个模型矢量之间的相似程度。常用的失真测度为欧氏距离测度。

33 矢量量化器最佳设计的两个条件?

答:最佳划分,最佳码本

34 初始码书的生成方法

随机选取法:从训练序列中随机选取J个矢量作为初始码字,从而构成初始码本。

分裂法:

35 短时能量和短时过零率的的用途。

答:短时能量:1、区分清音段与浊音段;2、区分声母和韵母;3、在高信噪比下,区分无声与有声的分界;4、区分连字的边界;5、用于语音识别。

过零率:1、区分清音和浊音:浊音平均过零率低,集中在低频端;轻音过零率高,集中在高频端。2、从背景噪声中找出是否有语音,以及语音的起点。

36 对语音信号进行处理时为什么要进行分帧。

答:语音信号短时平稳,要将语音信号划分为很多短时的语音段,而每个短时的语音段称为一个分析帧。这样,对语音信号进行分针处理就相当于对特征固定的持续信号进行处理。经过处理,语音信号就已经被分割成一帧一帧的加过窗函数的短时信号,然后再把每一个短时语音帧看成平稳的随机信号,利用数字信号处理来提取语音特征参数。

37 为什么端点检测有重要意义?

答:端点检测:从包含语音的一段信号中确定出语音的起点和终点。有效的端点检测不仅能使处理的时间减到最小,而且能排除无声段的噪声干扰。实验表明:端点检测的正确与否影响到识别率的高低。

语音端点检测的方法:短时能量和短时过零率。

38 什么叫LBG算法,怎样设计初始码本,并用来训练码本。

LBG算法是一种递推算法,从一个事先选定的初始码本开始迭代。把训练序列按照码本中的元素根据最邻近准则分组,对每一分组找质心,得到新的码本,又作为初始码本,再进行分组,重复上述过程,直到系统性能满足要求和不再有明显的改进为止。

39 为什么说语音信号可以看成隐马尔科夫过程,隐马尔科夫过程有哪些模型参数。

HMM包含两个随机过程,三个概率矩阵,一个输出概率

答:隐马尔可夫模型:只能观察到输出符号序列(ab),而不能观测到状态之间如何转移(状态转移概率)和状态的分布(状态的概率)。而语音信号是一个可观察的序列:它是由大脑中的思维(不可观测)及语言需要和语法知识(不可观测)所发出的参数流。

40 列举常用语音编码速率的值。

答:64kbit/s; PCM;32kbit/s; ADPCM;

4.8kbit/s; CELP; 2.4kbit/s; LPC声码器

41波形编码、参数编码与混合编码各有什么优缺点。

答:波形编码:话音质量高,编码速率高。

参数编码:编码速率低,自然度低,对环境噪声敏感。

混合编码:质量高和速率低.

42 在语音编码中,如何使用自适应技术。

答:利用自适应的思想改变量化间隔(量阶)的大小,即用小的量化间隔去编码小的差值,使用大的的量化间隔去编码大的差值

43 语音合成的目的是什么?它主要分为哪几类?比较它们的优缺点。

答:目的:让机器说话,达到一定的音质与可懂度(或产生与人类通信相关的语音)(1)、波形合成法。优点:合成音质好;缺点:存储空间大。(2)、参数合成法。优点:存储空间小;缺点:合成音质较差。(3)、规则合成法。优点:可以合成无限词汇,存储量小;缺点:合成音质效果较差44在TTS系统中,如何进行语音合成中的韵律控制。

答:韵律特征包括声调、语气、停顿方式、发音长短等。这些通过基频、音长、音强等参数来体现,通过控制这些参数达到对韵律控制。包括基音同步帧周期的调整、合成语音幅度的调整、声调曲线的修正等。

预处理:语音信号的放大、防混叠滤波、自动增益控制、模数转换、消除噪声、端点检测。语音特征参数包括:短时平均能量、短时过零率、频谱、三个共振峰频率(F1、F2、F3的频率值、带宽、幅值)、线性预测系数、LPC倒谱和Mel倒谱等。

模式匹配:将未知语音的特征参数与模板参数逐一进行比较与匹配,判决的依据是失真测度最小的准则。

专家知识库:用来存储各种语言学知识,如汉语声调变调规则、音长分布规则、同音字判别规则、构词规则、语法规则、语义规则等。

识别决策:是最后一步,也是系统识别效果的最终表现。根据若干准则及专家知识,判决选出可能结果中最好的结果,由识别系统输出。

46 为什么语音识别时需要做时间规整?

答:语音信号具有很强的随机性,不同的发音习惯,发音时所处的环境不同,心情不同都会导致发音持续时间长短不一的现象。如单词最后的声音带上一些拖音,或者带上一点呼吸音,此时,由于拖音或呼吸音会被误认为一个音素,造成单词的端点检测不准,造成特征参数的变化,从而影响测度估计,降低识别率,因此在语音识别时,首先有必要对语音信号进行时间规整。

47 说话人识别的目的及分类。

答:目的:确认说话人(即证实说话的人是否是所要求的那个人)或者从某个已知的人群集合中辨认出那个说话人。

分类:说话人确认和说话人辨认。主要用于身份的验证。

48 什么叫加性噪声和乘性噪声。为什么加性噪声的处理是语音增强的基础。

答:按噪声和信号相关的性质可将噪声分为加性噪声和乘性噪声。

加性噪声是指噪声和信号相关性是加和关系;(如冲激噪声、周期噪声、宽带噪声等)

乘性噪声是指噪声和信号相关性是乘积关系;(如残响基传输网络的电路噪声)对加性噪声进行处理,从带噪声语音信号中提取尽可能的纯净的原始语音,改善语音质量提高语音可懂度,是语音增强的有效的基本方法。

工作过程:将含噪语音信号和有声、无声判别得到的纯噪声信号进行DFT变化,从含噪语音谱幅度的平方中减去纯噪声的谱幅度的平方,然后开方,得原始语音谱幅度的估值,在借用含噪语音的相位,进行IDFT变化,得到增强的语音。

50 参考:A律压扩编码实例:(课件第五章)LBG算法实例(课件第三章)

隐HMM模型求输出概率实例(课件第四章)

动态时间规正法(DTW)的计算实例(课件第七章)

51 声道冲激响应序列的复倒谱特点。说明如何在语音信号的倒谱中分离出声道冲激响应,

得到声道冲激响应有何用途?

答:(1)h(n)为有限长实序列,则其复倒谱是双边实序列

(2)由于|ak|、|bk|、|ck|和|dk|均小于1,故复倒谱是衰减序列,随着n的增大而衰减。

(3)复倒谱衰减速度快,复倒谱比原来序列更集中于原点附近,具有短时性,用短时窗

函数提取声道响应序列的复倒谱是很有效的

(4)如果h(n)是最小相位序列,即bk=0和dk=0,则复倒谱序列为因果稳定序列。因此,

最小相位序列的复倒谱是因果稳定序列。

52 简述LPC方程的建立过程,LPC系数与语音模型有什么关系?

预测误差e(n)就是激励信号G*u(n),

预测系数{ak}就是声道虑波器的系数{dk}.ak=dk,e(n)=G*u(n)

53 利用模式匹配法进行语音识别的步骤

答:先对系统中的每个字,做一个码本作为该字的参考(标准)模板,共有M个字,故共有M个码本,组成一个模板库。

识别时,对于任意输入的语音特征矢量序列X={X1 , X2 , …, XN},计算该序列中每一个特征矢量对模板库中的每个码本的总平均失真量误差,找出最小的失真误差对应的码本(代表一个字),将对应的字输出作为识别的结果。

55 语音信号的预处理过程包括哪些?

答:语音信号的放大、防混叠滤波、自动增益控制、模数转换、消除噪声、端点检测。

56 通常环境中语音信号的声压级范围是多少?

答:60dB左右

计算机考试复习题(一)

、单选题 3、 DVD 中的视频数据文件采用的格式有 重新启动计算机 B 、正常退出 Windows 系统并关机 C 、重新登录 Windows D 、重新上 Internet 网 QQ 传送了一个文件给他 ,小明即接收并打开该文件 ,此后小明的电脑 ”。下面哪一项不是小明电脑中毒的原因 A A 硬盘没有定期整理 B 杀毒软件没有即时升级 C 病毒防火墙是盗版的 D 对好友传送的文件防范病素养意识不强 8、日常生活中 ,大家可能收到短信 “本通信公司现在将对你的手机进行检查 ,为配合检 查请按 #90 或 90#。若按上述提示进行按键 ,你的 SIM 卡卡号可能被骗取 ,行骗者利用该卡 肆意打电话 ,这是信息中 D 带来的消极影响。 A 信息污染 B 信息泛滥 C 信息毒害 D 信息范罪 9 、以下不是视频文件扩展名的是 C A 、AVI B 、MOV C 、JPEG D 、RM 1、 windows 系统是 个D A 、数据库管理系统 B 、应用软件 C 、文字处理系统 D 、系统软件 2、XX 节日快到 ,李欣上网下载了一个动 画 件扩展名通常为 A ,打算发给在上海读书的表姐 ,他下载的动画文 A .swf B .xls C .txt D .wav A 、 R M 格式 B 、MOV 格式 C 、 M PEG 格式 D 、FLV 格式 4、 M P3 文件是一种压缩格式的 A 、 视频文件 B 、音频文件 C 、文本文件 D 、图像文件 5、 在“关闭 Windows ”对话框中 ,选项 “关闭计算机 ”的作用是 B A 、 6、 天上掉陷饼 ”反映了在获取信息的时候就注意获取信息的 A 、 策略与技巧 B 、过程与方法 C 、特征与影响 D 、鉴别评价 7、 便中了 小明的朋友用 “尾巴病

语音信号处理实验指导书

语音信号处理实验指导书 实验一 语音信号采集与简单处理 一、 实验目的、要求 (1)掌握语音信号采集的方法 (2)掌握一种语音信号基音周期提取方法 (3)掌握短时过零率计算方法 (4)了解Matlab 的编程方法 二、 实验原理 基本概念: (a )短时过零率: 短时内,信号跨越横轴的情况,对于连续信号,观察语音时域波形通过横轴的情况;对于离散信号,相邻的采样值具有不同的代数符号,也就是样点改变符号的次数。 对于语音信号,是宽带非平稳信号,应考察其短时平均过零率。 其中sgn[.]为符号函数 ?? ?? ?<=>=0 x(n)-1sgn(x(n))0 x(n)1sgn(x(n)) 短时平均过零的作用 1.区分清/浊音: 浊音平均过零率低,集中在低频端; 清音平均过零率高,集中在高频端。 2.从背景噪声中找出是否有语音,以及语音的起点。 (b )基音周期 基音是发浊音时声带震动所引起的周期性,而基音周期是指声带震动频率的倒数。基音周期是语音信号的重要的参数之一,它描述语音激励源的一个重要特征,基音周期信息在多个领域有着广泛的应用,如语音识别、说话人识别、语音分析与综合以及低码率语音编码,发音系统疾病诊断、听觉残障者的语音指导等。因为汉语是一种有调语言,基音的变化模式称为声调,它携带着非常重要的具有辨意作用的信息,有区别意义的功能,所以,基音的提取和估计对汉语更是一个十分重要的问题。 ∑--= -=1 )]1(sgn[)](sgn[21N m n n n m x m x Z

由于人的声道的易变性及其声道持征的因人而异,而基音周期的范围又很宽,而同—个人在不同情态下发音的基音周期也不同,加之基音周期还受到单词发音音调的影响,因而基音周期的精确检测实际上是一件比较困难的事情。基音提取的主要困难反映在:①声门激励信号并不是一个完全周期的序列,在语音的头、尾部并不具有声带振动那样的周期性,有些清音和浊音的过渡帧是很难准确地判断是周期性还是非周期性的。②声道共振峰有时会严重影响激励信号的谐波结构,所以,从语音信号中直接取出仅和声带振动有关的激励信号的信息并不容 易。③语音信号本身是准周期性的(即音调是有变化的),而且其波形的峰值点或过零点受共振峰的结构、噪声等的影响。④基音周期变化范围大,从老年男性的50Hz 到儿童和女性的450Hz ,接近三个倍频程,给基音检测带来了一定的困难。由于这些困难,所以迄今为止尚未找到一个完善的方法可以对于各类人群(包括男、女、儿童及不向语种)、各类应用领域和各种环境条件情况下都能获得满意的检测结果。 尽管基音检测有许多困难,但因为它的重要性,基音的检测提取一直是一个研究的课题,为此提出了各种各样的基音检测算法,如自相关函数(ACF)法、峰值提取算法(PPA)、平均幅度差函数(AMDF)法、并行处理技术、倒谱法、SIFT 、谱图法、小波法等等。 三、使用仪器、材料 微机(带声卡)、耳机,话筒。 四、 实验步骤 (1)语音信号的采集 利用Windows 语音采集工具采集语音信号,将数据保存wav 格式。 采集一组浊音信号和一组清音信号,信号的长度大于3s 。 (2)采用短时相关函数计算语音信号浊音基音周期,考虑窗长度对基音周期计算的影响。采用倒谱法求语音信号基音周期。 (3)计算短时过零率,清音和浊音的短时过零率有何区别。 五、实验过程原始记录(数据,图表,计算) 短时过零率 短时相关函数 P j j n s n s j R N j n n n n ,,1) ()()(1 =-=∑-= ∑--=-=10 )]1(sgn[)](sgn[21N m n n n m x m x Z

2019多媒体技术应用期末复习试题

学业水平测试多媒体技术应用复习试题 一、单选题 1、下面关于多媒体技术地描述中,正确的是:( ) A. 多媒体技术只能处理声音和文字 B. 多媒体技术不能处理动画 C. 多媒体技术就是计算机综合处理声音、文本、图像等信息的技术 D. 多媒体技术就是制作视频 2、下列各组应用不属于多媒体技术应用的是( )。 A. 计算机辅助教学 B.电子邮件 C. 远程医疗 D. 视频会议 3、多媒体技术的产生与发展是人类社会需求与科学技术发展相结合的结果,那么多媒体技术诞生于( )。 A. 20世纪60年代 B. 20世纪70年代 C. 20世纪80年代 D. 20世纪90年代 4、下列配置中哪些是MPC(多媒体计算机)必不可少的硬件设备?() ①CD-ROM驱动器②高质量的音频卡③高分辩率的图形图像显示卡④高质量的视频采集卡 A.① B.①、② C.①、②、③ D.全部 5、下列关于多媒体技术主要特征描述正确的是:( ) ①多媒体技术要求各种信息媒体必须要数字化; ②多媒体技术要求对文本,声音,图像,视频等媒体进行集成; ③多媒体技术涉及到信息的多样化和信息载体的多样化; ④交互性是多媒体技术的关键特征; ⑤多媒体的信息结构形式是非线性的网状结构; A. ①②③⑤ B. ①④⑤ C. ①②③ D. ①②③④⑤ 6、媒体技术能够综合处理下列哪些信息( ) ①龙卷风.mp3 ②荷塘月色.doc③发黄的旧照片④泡泡堂.exe⑤一卷胶卷 A. ①②④ B. ①② C. ①②③ D. ①④ 7、( )是将声音变换为数字化信息,又将数字化信息变换为声音的设备。 A. 音箱 B. 音响 C. 声卡 D. PCI卡 8、把时间连续的模拟信号转换为在时间上离散,幅度上连续的模拟信号的过程称为() A.数字化 B.信号采样 C.量化 D.编码 9、()是分析多媒体作品开发的必要性和可行性的步骤。 A.需求分析 B.规划设计 C.素材采集与加工 D.作品发布与评价 10、对多媒体体作品的运行环境给出说明,要求制作者按照这一环境进行开发制作,是在多媒体作品开发的( )阶段。A.需求分析 B.规划设计 C.作品的集成 D.测试 11、多媒体作品界面的设计要遵循一定的原则和方法,它们是:( ) ①注意突出主题信息②界面布局要简明清晰③界面布局应该有整体上的一致性④注意文字显示的效果 A.①②③ B. ①②④ C. ①②③④ D.②③④ 12、制作多媒体作品的直接依据是( )A. 制作脚本 B. 结构设计 C. 文字稿本 D. 需求分析 13、静态图像压缩标准是( )。A. JPAG B. JPBG C. PDG D.JPEG 14、以下列文件格式存储的图象,在图象缩放过程中不易失真的是( )。A. BMP B. WMF C. JPG D. GIF 15、下列哪个文件格式既可以存储静态图像,又可以存储动画( )A. bmp B. jpg C. tif D. gif 16、下面文件格式不是矢量图文件格式的是( )。A.cdr B.jpg C.wmf D.AI 17、一幅彩色静态图像(RGB),设尺寸为256×512,每一种颜色用8bit表示,则该彩色静态图像的数据量为()。 A、512×512×3×8bit B、256×256×3×8bit C、256×512×3×8bit D、512×512×3×8×25bit 18、一张容量为640M的光盘,可以贮存( )张分辨率为1024×768的真彩(24位)相片。 A.568 B.284 C.1137 D.以上都不是 19、当利用扫描仪输入图像数据时,扫描仪可以把所扫描的照片转化为( )。 A.位图图像 B.矢量图 C. 矢量图形 D.三维图 20、在进行素材采集的时候,要获得图形图像,下面哪种方法获得的不是位图图像( )。

语音信号处理实验报告

语音信号处理实验 班级: 学号: 姓名:

实验一 基于MATLAB 的语音信号时域特征分析(2学时) 1) 短时能量 (1)加矩形窗 a=wavread('mike.wav'); a=a(:,1); subplot(6,1,1),plot(a); N=32; for i=2:6 h=linspace(1,1,2.^(i-2)*N);%形成一个矩形窗,长度为2.^(i-2)*N En=conv(h,a.*a);% 求短时能量函数En subplot(6,1,i),plot(En); if (i==2) ,legend('N=32'); elseif (i==3), legend('N=64'); elseif (i==4) ,legend('N=128'); elseif (i==5) ,legend('N=256'); elseif (i==6) ,legend('N=512'); end end 00.51 1.52 2.5 3 x 10 4 -1 100.5 1 1.5 2 2.5 3x 10 4 024 N=3200.5 1 1.5 2 2.5 3x 10 4 05 N=6400.5 1 1.5 2 2.5 3x 10 4 0510 N=12800.5 1 1.5 2 2.5 3x 10 4 01020 N=2560 0.5 1 1.5 2 2.5 3x 10 4 02040 N=512 (2)加汉明窗 a=wavread('mike.wav'); a=a(:,1); subplot(6,1,1),plot(a); N=32;

for i=2:6 h=hanning(2.^(i-2)*N);%形成一个汉明窗,长度为2.^(i-2)*N En=conv(h,a.*a);% 求短时能量函数En subplot(6,1,i),plot(En); if (i==2), legend('N=32'); elseif (i==3), legend('N=64'); elseif (i==4) ,legend('N=128'); elseif (i==5) ,legend('N=256'); elseif (i==6) ,legend('N=512'); end end 00.51 1.52 2.5 3 x 10 4 -1 100.5 1 1.5 2 2.5 3x 10 4 012 N=3200.5 1 1.5 2 2.5 3x 10 4 024 N=6400.5 1 1.5 2 2.5 3x 10 4 024 N=12800.5 1 1.5 2 2.5 3x 10 4 0510 N=2560 0.5 1 1.5 2 2.5 3x 10 4 01020 N=512 2) 短时平均过零率 a=wavread('mike.wav'); a=a(:,1); n=length(a); N=320; subplot(3,1,1),plot(a); h=linspace(1,1,N); En=conv(h,a.*a); %求卷积得其短时能量函数En subplot(3,1,2),plot(En); for i=1:n-1 if a(i)>=0 b(i)= 1;

语音信号处理复习题

1 研究语音信号处理的目的是什么?人类的通信有哪三种方式,从而说明语音信号处理有哪三个学科分支? 它的目的一是要通过处理得到一些反映语音信号重要特征的语音参数以便高效的传输或储存语音信号信息;二是要通过处理的某种运算以达到某种用途的要求。 1.什么叫做语言学?什么叫做语音学?言语过程可分为哪五个阶段? 语音中各个音的排列由一些规则所控制,对这些规则及其含义的研究学问称为语言学;另一个是对语音中各个音的物理特征和分类的研究称为语音学。人的说话过程如图2-1所示,可以分为五个阶段: (1)想说阶段: (2)说出阶段: (3)传送阶段: (4)接收阶段: (5)理解阶段: 3、有哪几种描述声道特性的数学模型?请说明声管模型流图是如何得出的?有几种共振峰模型?各有什么特点和适用情况? 声道的数学模型有两种观点: 1)声管模型 将声道看为由多个不同截面积的管子串联而成的系统。在“短时”期间,声道可表示为形状稳定的管道。 另一种观点是把声道视为一个谐振腔,按此推导出的叫“共振峰模型”。 共振峰模型,把声道视为一个谐振腔。共振峰就是这个腔体的谐振频率。由于人耳听觉的柯替氏器官的纤毛细胞就是按频率感受而排列其位置的,所以这种共振峰的声道模型方法是非常有效的。一般来说,一个元音用前三个共振峰来表示就足够了;而对于较复杂的辅音或鼻音,大概要用到前五个以上的共振峰才行。基于物理声学的共振峰理论,可以建立起三种实用的共振峰模型:级联型、并联型和混合型。 (1)级联型声道模型

这时认为声道是一组串联的二阶谐振器。从共振峰理论来看,整个声道具有多个谐振频率和多个反谐振频率,所以它可被模拟为一个零极点的数学模型;但对于一般元音,则用全极点模型就可以了。它的传输函数可分解表示为多个二阶极点的网络的串联: N=10,M=5时的声道模型如下图所示: (2)并联型声道模型 对于非一般元音以及大部分辅音,必须考虑采用零极点模型。此时,模型的传输函数如下: 通常,N>R ,且设分子与分母无公因子及分母无重根,则上式可分解为如下部分分式之和的形式: 这就是并联型的共振峰模型。如图2-21所示(M=5)。 (3)混合型声道模型 上述两种模型中,级联型比较简单,可以用于描述一般元音。当鼻化元音或鼻腔参与共振,以及阻塞音或摩擦音等情况时,级联模型就不能胜任了。这时腔体具有反谐振特性,必须考虑加入零点,使之成为零极点模型。采用并联结构的目的就在于此,它比级联型复杂些,每个谐振器的幅度都要独立地给以控制。但对于鼻音、塞音、擦音以及塞擦音等都可以适用。正因为如此,将级联模型和并联模型结合起来的混合模型也许是比较完备的一种共振峰模型。 22 12112cos(2)()12cos(2)k k k k B T B T M k B T B T k k e F T e V z e F T z e z ππ------=-+=-+∏∑∑=-=--= N k k k R r r r z a z b z V 1 1)(∑ =----=M i i i i z C z B A z V 12 11)(

数字音频技术期末考试试卷

《数字音视频技术》期末考试试卷 一.选择(每题2分,共20分) 1.可闻声的频率范围() A.20~2000Hz B.200~20000Hz C.20~20000Hz D.200~2000Hz 2.下面哪一种相加混色产生的色彩是错误的() A.红色+绿色=黄色 B.红色+蓝色=橙色 C.蓝色+绿色=青色 D.红色+绿色+蓝色=白色。 3.不是数字图像的格式的是() A.JPG B. GIF C. TIFF D. WAVE 4.在音频数字化的过程中,对模拟语音信号处理的步骤依次为()A.抽样编码量化 B. 量化抽样编码 C. 抽样量化编码 D. 量化编码抽样 5.将声音转变为数字化信息,又将数字化信息变换为声音的设备是() A.声卡B.音响 C. 音箱D.PCI卡 6.不属于国际上常用的视频制式的是() A.PAL制 B.NTSC制C.SECAM制D.MPEG 7.数字音频采样和量化过程所用的主要硬件是() A.数字编码器 B.数字解码器 C.模拟到数字的转换器(A/D转换器) D.数字到模拟的转换器(D/A转换器) 8.信息接受者在没有接收到完整的信息前就能处理那些已经接受到的信息一边接收,一边处理的方式叫() A.多媒体技术B.流媒体技术 C.云技术D.动态处理技术

9.影响声音质量的因素不包括() A.声道数目B.采样频率 C.量化位数D.存储介质 10.我们常用的VCD,DVD采用的视频压缩编码国际标准是()A.MPEG B.PLA C.NTSC D.JPEG 二.填空(每空2分,共30分) 1.音质三要素:、和。 2.色彩三要素:、和。 3.混色的方法有:和。 4.视频冗余是指相邻帧间和每帧的水平方向和垂直方向上的相邻像素间存在很强的相关性,它包含的种类有:冗余、冗余、冗余、冗余和视觉冗余。 5.色彩模型中的三基色原理是指利用、和三种色光混合,可以产生各种色彩。 三.简答题(每题10分,共50分) 1.常见数字音频文件格式有哪些? 2. 常见数字视频文件格式有哪些? 3.什么是5.1声道环绕立体声?

多媒体技术基础复习试题(有答案)

一、多媒体概述 ●什么是媒体?媒体如何分类的? ●什么是多媒体?它有哪些关键特性?有哪些关键技术? ●多媒体计算机系统组成 ●多媒体个人计算机MPC ●媒体素材分成文字、声音、图形、图像、动画、视频等类型。 ●各类素材的文件格式 ●图像的属性 ●图像的大小及压缩标准 ●图像的色彩模式 ●图形与图像的文件存储格式 ●视频的基本概念 ●帧频(动画:12帧/S,视频:24帧/S) ●动画与视频的文件格式 ●声音的三个重要特性:振幅,周期,频率 ●声音效果的三要素:音调、音强、音色 ●声音的文件存储格式 ●文本文件的格式 ●图像采集途径及常用的软件 ●多媒体素材采集的软件及多媒体素材制作软件 二、音频技术 ●声音的数字化——采样、量化及编码 ●数字化后声音文件的大小如何计算 ●声音文件的存储格式 ●Adobe Audition3.0的基本操作 ●声音的高级处理 1、声道变换 2、改变声音文件的固有音量 3、淡入、淡出效果 4、回声原理及其制作 5、延迟效果 6、消除环境噪声 7、声音混响 8、调整时间和音调

9、直接从视频提取声音 三、 视频技术 ● 视频的基本概念 ● 视频的制式——NTSC ,PAL ,SECAM ● 视频素材的获取 ● 常见的视频文件格式 ● 三种MPEG 视频压缩格式的比较 ● 常用的视频播放器 ● 网络视频格式 ● 视频编辑处理软件—会声会影的基本使用 四、 Photoshop 五、 FLASH 单项选择题部分 1.多媒体当中的媒体指的是以下哪种媒体( )。 A .表现媒体 B .表示媒体 C .感觉媒体 D .存储媒体 2.以下的采样频率中哪个是目前音频卡所支持的( )。 A .20KHz B .11.025KHz C .10KHz D .50KHz 3.下面文件格式属于声音文件的是( )。 (1).MIDI 文件 (2).WA V 文件 (3).A VI 文件 (4).PCX 文件 A .(1)(3) B .(2)(3)(4) 保存接近于一部一部交互式、多媒体、DIVX(.AVI) WMV ASF PAL PAL DVD 画质的 小体积视频文件 120分钟长的电影压缩为4~8GB 的大小 120分钟长的电 影压缩为1.2GB 左右的大小 压缩情况 1998年 1994年1992年时间低码率视频 数字电视CD-ROM 上的交互式 视频 目标RMVB MOV MPG MPG 常见后缀网络视频 DVD VCD 应用可调4~8Mbps 1~1.5Mbps 带宽可调:720×576NTSC :720×480 :352×288NTSC :320×240画面尺寸MPEG-4MPEG-2(DVD )MPEG-1类型

语音信号处理实验报告

通信与信息工程学院 信息处理综合实验报告 班级:电子信息工程1502班 指导教师: 设计时间:2018/10/22-2018/11/23 评语: 通信与信息工程学院 二〇一八年 实验题目:语音信号分析与处理 一、实验内容 1. 设计内容 利用MATLAB对采集的原始语音信号及加入人为干扰后的信号进行频谱分析,使用窗函数法设计滤波器滤除噪声、并恢复信号。 2.设计任务与要求 1. 基本部分

(1)录制语音信号并对其进行采样;画出采样后语音信号的时域波形和频谱图。 (2)对所录制的语音信号加入干扰噪声,并对加入噪声的信号进行频谱分析;画出加噪后信号的时域波形和频谱图。 (3)分别利用矩形窗、三角形窗、Hanning窗、Hamming窗及Blackman 窗几种函数设计数字滤波器滤除噪声,并画出各种函数所设计的滤波器的频率响应。 (4)画出使用几种滤波器滤波后信号时域波形和频谱,对滤波前后的信号、几种滤波器滤波后的信号进行对比,分析信号处理前后及使用不同滤波器的变化;回放语音信号。 2. 提高部分 (5)录制一段音乐信号并对其进行采样;画出采样后语音信号的时域波形和频谱图。 (6)利用MATLAB产生一个不同于以上频段的信号;画出信号频谱图。 (7)将上述两段信号叠加,并加入干扰噪声,尝试多次逐渐加大噪声功率,对加入噪声的信号进行频谱分析;画出加噪后信号的时域波形和频谱图。 (8)选用一种合适的窗函数设计数字滤波器,画出滤波后音乐信号时域波形和频谱,对滤波前后的信号进行对比,回放音乐信号。 二、实验原理 1.设计原理分析 本设计主要是对语音信号的时频进行分析,并对语音信号加噪后设计滤波器对其进行滤波处理,对语音信号加噪声前后的频谱进行比较分析,对合成语音信号滤波前后进行频谱的分析比较。 首先用PC机WINDOWS下的录音机录制一段语音信号,并保存入MATLAB软件的根目录下,再运行MATLAB仿真软件把录制好的语音信号用audioread函数加载入MATLAB仿真软件的工作环境中,输入命令对语音信号进行时域,频谱变换。 对该段合成的语音信号,分别用矩形窗、三角形窗、Hanning窗、Hamming窗及Blackman窗几种函数在MATLAB中设计滤波器对其进行滤波处理,滤波后用命令可以绘制出其频谱图,回放语音信号。对原始语音信号、合成的语音信号和经过滤波器处理的语音信号进行频谱的比较分析。 2.语音信号的时域频域分析 在Matlab软件平台下可以利用函数audioread对语音信号进行采样,得到了声音数据变量y,同时把y的采样频率Fs=44100Hz放进了MATALB的工作空间。

语音信号处理考试题(综合)

语音信号处理重点、考点、考试题 一、填空题:(共7小题,每空2分,共20分) A卷 1、矢量量化系统主要由编码器和组成,其中编码器主要是由搜索算法和构成。 2、基于物理声学的共振峰理论,可以建立起三种实用的共振峰模型:级联型、并联型和。 3、语音编码按传统的分类方法可以分为、和混合编码。 4、对语音信号进行压缩编码的基本依据是语音信号的和人的听觉感知机理。 5、汉语音节一般由声母、韵母和三部分组成。 6、人的听觉系统有两个重要特性,一个是耳蜗对于声信号的时频分析特性;另一个是人耳听觉的效应。 7、句法的最小单位是,词法的最小单位是音节,音节可以由构成。 二、判断题:(共3小题,每小题2分,共6分) 1、预测编码就是利用对误差信号进行编码来降低量化所需的比特数,从而使编码速率大幅降低。() 2、以线性预测分析-合成技术为基础的参数编码,一般都是根据语音信号的基音周期和清/浊音标志信息来决定要采用的激励信号源。() 3、自适应量化PCM就是一种量化器的特性,能自适应地随着输入信号的短时能量的变化而调整的编码方法。() 三、单项选择题:(共3小题,每小题3分,共9分) 1、下列不属于衡量语音编码性能的主要指标是()。(A)编码质量(B)矢量编码(C)编码速率(D)坚韧性 2、下列不属于编码器的质量评价的是()(A)MOS (B)DAM(C)DRT(D)ATC 3、限词汇的语音合成技术已经比较成熟了,一般我们是采用()作为合成基元。 (A)词语(B)句子(C)音节(D)因素 四、简答题:(共2小题,每小题12分,共24分) 1、画出矢量量化器的基本结构,并说明其各部分的作用。 2、试画出语音信号产生的离散时域模型的原理框图,并说明各部分的作用。 五、简答题:(共5小题,前三小题,每题5分,后两小题,每题10分,共35分) 1、线性预测分析的基本思想是什么? 2、隐马尔可夫模型的特点是什么? 3、矢量量化器的所谓最佳码本设计是指什么? 4、针对短时傅里叶变换Ⅹn(ejw)的定义式,请从两个角度对其进行物理意义的分析。 5、针对短时傅里叶变换的时间分辨率和频率分辨率的矛盾性,请给予分析说明。 六、计算题:(共1小题,每小题6分,共6分) 1、已知一个简单的三状态HMM模型的图形,如图一所示。求该HMM模型输出aab的概率为多少?(要有求解过程,无计算过程不得分)

大学本科语音信号处理实验讲义8学时

语音信号处理实验讲义 时间:2011-12

目录 实验一语音信号生成模型分析 (3) 实验二语音信号时域特征分析 (7) 实验三语音信号频域特征分析 (12) 实验四语音信号的同态处理和倒谱分析 (16)

实验一 语音信号生成模型分析 一、实验目的 1、了解语音信号的生成机理,了解由声门产生的激励函数、由声道产生的调制函数和由嘴唇产生的辐射函数。 2、编程实现声门激励波函数波形及频谱,与理论值进行比较。 3、编程实现已知语音信号的语谱图,区分浊音信号和清音信号在语谱图上的差别。 二、实验原理 语音生成系统包含三部分:由声门产生的激励函数()G z 、由声道产生的调制函数()V z 和由嘴唇产生的辐射函数()R z 。语音生成系统的传递函数由这三个函数级联而成,即 ()()()()H z G z V z R z = 1、激励模型 发浊音时,由于声门不断开启和关闭,产生间隙的脉冲。经仪器测试它类似于斜三角波的脉冲。也就是说,这时的激励波是一个以基音周期为周期的斜三角脉冲串。单个斜三角波的频谱表现出一个低通滤波器的特性。可以把它表示成z 变换的全极点形式 12 1()(1) cT G z e z --= -? 这里c 是一个常数,T 是脉冲持续时间。周期的三角波脉冲还得跟单位脉冲串的z 变换相乘: 112 1 ()()()1(1)v cT A U z E z G z z e z ---=?= ?--? 这就是整个激励模型,v A 是一个幅值因子。 2、声道模型 当声波通过声道时,受到声腔共振的影响,在某些频率附近形成谐振。反映在信号频谱图上,在谐振频率处其谱线包络产生峰值,把它称为共振峰。 一个二阶谐振器的传输函数可以写成 12 ()1i i i i A V z B z C z --= -- 实践表明,用前3个共振峰代表一个元音足够了。对于较复杂的辅音或鼻音共振峰要到5个以上。多个()i V z 叠加可以得到声道的共振峰模型 12 1 11 ()()11R r r M M i r i N k i i i i k k b z A V z V z B z C z a z -=---======---∑∑∑ ∑ 3、辐射模型 从声道模型输出的是速度波,而语音信号是声压波。二者倒比称为辐射阻抗,它表征了

语音信号处理复习纲要

Ch1 绪论 §1.1 语音信号处理概述 一、语音、语音信号处理的名词解释 1、语音:是语言的声学表现,是声音和意义的结合体,是相互传递信息的重要手段,是人类最重要、最有效、最常用和最方便的交换信息的形式。 2、语音信号处理:是研究用数字信号处理技术对语音信号进行处理的一门学科,它是一门新兴的学科,同时又是综合性的多学科领域和涉及很广的交叉学科。 二、语音处理技术的应用领域 语音处理技术的应用领域包括:工业、军事、交通、医学、民用等。 三、语音信号采用数字处理的原因(数字语音的优点) 语音信号均采用数字处理,是因为数字处理与模拟处理相比具有许多优点: 1、数字技术能够完成许多很复杂的信号处理工作; 2、通过语音进行交换的信息本质上具有离散的性质,语音可以看做是音素的组合,适合数字处理; 3、数字系统具有高可靠性、廉价、快速等优点,容易完成实时处理任务; 4、数字语音适合在强干扰信道中传输,也易于加密传输。 四、语音学的名词解释 语音学:是研究言语过程的一门科学,它包括三个研究内容:发音器官在发音过程中的运动和语音的音位特性;语音的物理特性;以及听觉和语言感知。 §1.2 语音信号处理的发展概况 一、语音信号处理的发展史 1、1874年:电话的发明时现代语音通信的开端; 2、1939年:通道声码器技术; 3、40年代后期:语谱仪; 4、50年代初:第一台口授打字机和英语单词语音识别器; 5、60年代:Fant发表《语音产生的声学理论》; 6、70年代初:Flanagan著作《语音分析、合成和感知》; 7、90年代以来:语音识别的研究由实验室走向实用化。 二、语音编码、语音合成、语音识别名词解释 1、语音编码:语音编码技术是伴随着语音信号的数字化而产生的,目前主要应用在数字语音通信领域。 2、语音合成:语音合成的目的是使计算机能像人一样说话,它是一种人机语音通信技术,应用领域广泛。 3、语音识别:语音识别是使计算机判断出所说的话得内容,和语音合成一样也是一种人机语音通信技术。 为了实现人机语音通信,必须具备语音识别和语音理解两种功能 Ch2 基础知识 §2.2 语音产生的过程 一、现代语音学发展的三个分支:发音语音学、声学语音学、听觉语音学。 二、语音、清音、浊音的名词解释及语音的产生过程(名词解释、简答,集中备课) 1、语音:声音是一种波,能被人耳听到,振动频率在20Hz-20kHz之间。语音室声音的一种,它是由人的发音器官发出的、具有一定语法和意义的声音。语音的振动频率最高可达15kHz左右。 2、人类生成语音过程的第一阶段包括神经核肌肉的生理学阶段和产生语音波、传递语音波的物理阶段。 3、语音由声带振动或不经声带振动来产生,其中由声带振动产生的音统称为浊音,而不由声带振动产生的音统称为清音。浊音中包括所有的元音和一些辅音,清音包括另一部分辅音。

《语音信号处理》实验报告材料

实用 中南大学 信息科学与工程学院 语音信号处理 实验报告 指导老师:覃爱娜 学生班级:信息0704 学生名称:阮光武 学生学好:0903070430 提交日期:2010年6月18日

实验一 语音波形文件的分析和读取 一、实验的任务、性质与目的 本实验是选修《语音信号处理》课的电子信息类专业学生的基础实验。通过实验: (1)掌握语音信号的基本特性理论:随机性,时变特性,短时平稳性,相关性等; (2)掌握语音信号的录入方式和*.WAV音波文件的存储结构; (3)使学生初步掌握语音信号处理的一般实验方法。 二、实验原理和步骤: WAV文件格式简介 WAV文件是多媒体中使用了声波文件的格式之一,它是以RIFF格式为标准。每个WAV文件的头四个字节就是“RIFF”。WAV文件由文件头和数据体两大部分组成,其中文件头又分为RIFF/WAV文件标识段和声音数据格式说明段两部分。常见的WAV声音文件有两种,分别对应于单声道(11.025KHz采样率、8Bit的采样值)和双声道(44.1KHz采样率、16Bit的采样值)。采样率是指声音信号在“模拟→数字”转换过程中,单位时间内采样的次数;采样值是指每一次采样周期内声音模拟信号的积分值。对于单声道声音文件,采样数据为8位的短整数(short int 00H-FFH);而对于双声道立体声声音文件,每次采样数据为一个16位的整数(int),高八位和低八位分别代表左右两个声道。WAV文件数据块包含以脉冲编码调制(PCM)格式表示的样本。在单声道WAV文件中,道0代表左声道,声道1代表右声道;在多声道WAV文件中,样本是交替出现的。WAV文件的格式见表1。

语音信号处理复习资料

8预加重和去加重的理解7线性预测编码特点和定义 5隐马尔可夫差数特点计算 以上三题没有 老师画的其他的重点为红色标记的(注意:仅供参考) 一、语音、语音信号处理的名词解释 1、语音:是语言的声学表现,是声音和意义的结合体,是相互传递信息的重要手段,是人类最重要、最有效、最常用和最方便的交换信息的形式。 2、语音信号处理:是研究用数字信号处理技术对语音信号进行处理的一门学科,它是一门新兴的学科,同时又是综合性的多学科领域和涉及很广的交叉学科。它与语音学、语言学、声学、认知科学、生理学、心理学有密切关系。 二、语音学的名词解释 语音学:是研究言语过程的一门科学,它包括三个研究内容:发音器官在发音过程 中的运动和语音的音位特性;语音的物理特性;以及听觉和语言感知。 §.2语音信号处理的发展概况 1、语音编码:语音编码技术是伴随着语音信号的数字化而产生的,目前主要应用在数字语音通信领域。 2、语音合成:语音合成的目的是使计算机能像人一样说话。 3、语音识别:语音识别是使计算机判断出所说的话得内容。 §.2语音产生的过程 一、语音、清音、浊音 1、语音:声音是一种波,能被人耳听到,振动频率在20Hz-20kHz之间。语音是声音的一种,它是由人的发音器官发出的、具有一定语法和意义的声音。语音的振动频率最高可达15kHz左右。

2、浊音、清音:语音由声带振动或不经声带振动来产生,其中由声带振动产生的音统称为浊音,而不由声带振动产生的音统称为清音。浊音中包括所有的元音和一些辅音,清音包括另一部分辅音。 二、语音的产生过程:空气从肺部排出形成气流。空气通过声带时,如果声带是紧绷的,则声带将产生张弛振动,即声带周期性地开启和闭合。声带开启时,空气流从声门喷射出来,形成一个脉冲;声带闭合时相应于脉冲序列的间歇期。 语言交际:通过连接说话人大脑的一连串心理、生理、和物理的转换过程实现的。这个过程包括:发音-传递-感知。因此现代语音的三个分支:发音语言学、声学语言学、听觉语言学。 三、基音周期、基音频率 基音周期:声带开启和闭合一次的时间即振动周期称为音调周期或基音周期。基音频率:基音周期的倒数称为基音频率,简称为基频。 四、浊音、清音、爆破音的激励源 对于浊音、清音和爆破音来说,激励源是不同的,浊音语音是位于声门处的准周期脉冲序列,清音的激励源是位于声道的某个收缩区的空气湍流,而爆破音的激励源是位于声道某个闭合点处建立起来的气压及其突然释放。 五、共振峰的概念(参见大纲) 1、共振峰名词解释:声道是一个分布参数系统,它是一个谐振腔,有许多谐振频率, 称为共振峰,它是声道的重要声学特征。 2、共振峰的公式:Fn=(2 n-1)c/4L (会运用公式进行计算,填空、选择) 3、谐振点间的间隔不同,但平均仍然大约为每1KHz有一个谐振点。 4、声道的共振峰特性决定所发声音的频谱特性(音色)。 5、头三个共振峰最重要。 §.3语音信号的特性 一、语音的物理属性(集中备课) 语音的物理性质包括音质、音调、音强、音长等特性。语音是人的发音器官发出的一种声波,具有声音的物理属性。音质是一种声音区别于其他声音的基本特征;音调指声音的高低,取决

语音信号处理实验报告实验二

通信工程学院12级1班 罗恒 2012101032 实验二 基于MATLAB 的语音信号频域特征分析 一、 实验要求 要求根据已有语音信号,自己设计程序,给出其倒谱、语谱图的分析结果,并根据频域分析方法检测所分析语音信号的基音周期或共振峰。 二、 实验目的 信号的傅立叶表示在信号的分析与处理中起着重要的作用。因为对于线性系统来说,可以很方便地确定其对正弦或复指数和的响应,所以傅立叶分析方法能完善地解决许多信号分析和处理问题。另外,傅立叶表示使信号的某些特性变得更明显,因此,它能更深入地说明信号的各项红物理现象。 由于语音信号是随着时间变化的,通常认为,语音是一个受准周期脉冲或随机噪声源激励的线性系统的输出。输出频谱是声道系统频率响应与激励源频谱的乘积。声道系统的频率响应及激励源都是随时间变化的,因此一般标准的傅立叶表示虽然适用于周期及平稳随机信号的表示,但不能直接用于语音信号。由于语音信号可以认为在短时间内,近似不变,因而可以采用短时分析法。 三、 实验设备 1.PC 机; 2.MATLAB 软件环境; 四、 实验内容 1.上机前用Matlab 语言完成程序编写工作。 2.程序应具有加窗(分帧)、绘制曲线等功能。 3.上机实验时先调试程序,通过后进行信号处理。 4.对录入的语音数据进行处理,并显示运行结果。 5.依次给出其倒谱、语谱图的分析结果。 6. 根据频域分析方法检测所分析语音信号的基音周期或共振峰。 五、 实验原理及方法 1、短时傅立叶变换 由于语音信号是短时平稳的随机信号,某一语音信号帧的短时傅立叶变换的定义为: 其中w(n -m)是实窗口函数序列,n 表示某一语音信号帧。令n -m=k',则得到 ()()()jw jwm n m X e x m w n m e ∞-=-∞= -∑

(完整)《语音信号处理》期末试题总结,推荐文档

2011-2013学年 《语音信号处理》期末考试试题 适用班级:时量:120分钟闭卷记分: 考生班级:姓名:学号: 注:答案全部写在答题纸上,写在试卷上无效! 一、填空题:(每空2分) 1、矢量量化系统主要由编码器和译码器组成,其中编码器主要是由搜索算法和码书构成。P101 2、基于物理声学的共振峰理论,可以建立起三种实用的共振峰模型:级联型、并联型和混合型。P18 3、语音编码按传统的分类方法可以分为波形编码、参数编码和混合编码。P137 4、对语音信号进行压缩编码的基本依据是语音信号的冗余度和人的听觉感知机理。 P137-138 5、汉语音节一般由声母、韵母和声调三部分组成。P10 6、人的听觉系统有两个重要特性,一个是耳蜗对于声信号的时频分析特性;另一个是人耳听觉的掩蔽效应。P22 7、句法的最小单位是词,词法的最小单位是音节,音节可以由音素构成。P9 8、复倒谱分析中避免相位卷绕的算法,常用的有微分法和最小相位信号法。P62 9、语音信号处理也可以简称为语音处理,它是利用数字信号处理技术对语音信号进行处理的一门学科,包括语音编码、语音合成、语音识别、说话人识别和语音增强等五大分支。P3 10、语音信号处理也可以简称为语音处理,它是以数字信号处理和语音学为基础而形成的一个综合新的学科,包括发音语音学、声学语音学、听觉语音学和心理学等四大分支。P2,6 11、语音的四大要素:音质、音调、音强和音长。P9 12、人类发音过程有三类不同的激励方式,因而能产生三类不同的声音,即浊音、清音、和爆破音。P8 13、元音的一个重要声学特性是共振峰,它是区别不同元音的重要参数,它一般包括共振峰频率的位置和频带宽度。 14、语音信号的倒谱分析就是求取语音倒谱特征参数的过程,它可以通过同态信号处理来实现。P56 二、判断题:(每小题2分)√× 1、预测编码就是利用对误差信号进行编码来降低量化所需的比特数,从而使编码速率大幅降低。(×)P143 2、以线性预测分析-合成技术为基础的参数编码,一般都是根据语音信号的基音周期和清/浊音标志信息来决定要采用的激励信号源。(×)P181 3、自适应量化PCM就是一种量化器的特性,能自适应地随着输入信号的短时能量的变化而调整的编码方法。(×)P142 4、线性预测法正是基于全极点模型假定,采用时域均方误差最小准则来估计模型参数的。(×)P72 5、波形编码是依赖模型假定的语音编码方法。(×)P137 6、掩蔽效应是使一个声音A能感知的阀值因另一个声音B的出现而提高的现象,这时A叫

高中计算机考试的题库

单选题() windows系统是一个(D) A、数据库管理系统 B、应用软件 C、文字处理系统 D、系统软件 XX节日快到,欣上网下载了一个动画,打算发给在读书的表姐,他下载的动画文件扩展名通常为(A) A .swf B .xls C .txt D .wav DVD中的视频数据文件采用的格式有(C) A、RM格式 B、MOV格式 C、MPEG格式 D、FLV格式 MP3文件是一种压缩格式的(B) A、视频文件 B、音频文件 C、文本文件 D、图像文件 在“关闭Wind ows”对话框中,选项“关闭计算机”的作用是(B) A、重新启动计算机 B、正常退出Windows系统并关机 C、重新登录Windows D、重新上Internet网 “天上掉陷饼”反映了在获取信息的时候就注意获取信息的(D) A、策略与技巧 B、过程与方法 C、特征与影响 D、鉴别评价 小明的朋友用QQ传送了一个文件给他,小明即接收并打开该文件,此后小明的电脑便中了“QQ尾巴病”。下面哪一项不是小明电脑中毒的原因(A) A硬盘没有定期整理B杀毒软件没有即时升级 C病毒防火墙是盗版的D对好友传送的文件防病素养意识不强 日常生活中,大家可能收到短信“本通信公司现在将对你的手机进行检查,为配合检查请按#90或90#。若按上述提示进行按键,你的SIM卡卡号可能被骗取,行骗者利用该卡肆意打,这是信息中(D)带来的消极影响。 A信息污染B信息泛滥C信息毒害D信息罪 以下不是视频文件扩展名的是(C) A AVI B MOV C JPEG D RM 以下不是视频文件扩展名的是(B) A FLV B WAV C MPEG D AVI 以下均为音频文件扩展名的是(B) A BMP MID XLS B MID WAV MP3 C WAV DOC JPG D AVI GIF MP3 下面(A)格式是计算机位图的存储格式。 A、BMP B、CDR C、AI D、WMF 下面(D)格式是计算机位图的存储格式。 A、AI B、EPS C、CDR D、GIF 下面(D )格式是计算机位图的存储格式 A、CDR B、AI C、EPS D、JPEG 下面(A)格式是计算机矢量图的存储格式。 A、CDR B、PSD C、GIF D、BMP 下面说法符合计算机位图基本特征的是(D) A、在计算机上调整图像大小或颜色时不会降低分辨率与品质 B、图像由一组指令集合加以描述。 C、图像无论放大或缩小,都有一样平滑的边缘,一样的视觉细节和浅析度 D、图像由像素构成,在缩放过程中会损失细节或产生锯齿。 下面关于空演示文稿的叙述,正确的是(B)

语音信号处理试验教程

语音信号处理试验 实验一:语音信号时域分析 实验目的: (1)录制两段语音信号,内容是“语音信号处理”,分男女声。 (2)对语音信号进行采样,观察采样后语音信号的时域波形。 实验步骤: 1、使用window自带录音工具录制声音片段 使用windows自带录音机录制语音文件,进行数字信号的采集。启动录音机。录制一段录音,录音停止后,文件存储器的后缀默认为.Wav。将录制好文件保存,记录保存路径。男生女生各录一段保存为test1.wav和test2.wav。 图1基于PC机语音信号采集过程。 2、读取语音信号 在MATLAB软件平台下,利用wavread函数对语音信号进行采样,记住采样频率和采样点数。通过使用wavread函数,理解采样、采样频率、采样位数等概念! Wavread函数调用格式: y=wavread(file),读取file所规定的wav文件,返回采样值放在向量y中。

[y,fs,nbits]=wavread(file),采样值放在向量y中,fs表示采样频率(hz),nbits表示采样位数。 y=wavread(file,N),读取前N点的采样值放在向量y中。 y=wavread(file,[N1,N2]),读取从N1到N2点的采样值放在向量y中。 3、编程获取语音信号的抽样频率和采样位数。 语音信号为test1.wav和test2.wav,内容为“语音信号处理”,两端语音保存到工作空间work文件夹下。在M文件中分别输入以下程序,可以分两次输入便于观察。 [y1,fs1,nbits1]=wavread('test1.wav') [y2,fs2,nbits2]=wavread('test2.wav') 结果如下图所示 根据结果可知:两端语音信号的采样频率为44100HZ,采样位数为16。 4、语音信号的时域分析 语音信号的时域分析就是分析和提取语音信号的时域参数。进行语音分析时,最先接触到并且夜市最直观的是它的时域波形。语音信

相关主题
文本预览
相关文档 最新文档