💞哈喽!大家好,我是HappyGirl快乐女孩💞
😜是一位爱好技术的【技术Fans】!😜


💞💞💞 如果有对技术感兴趣的宅友,欢迎关注💞💞💞
❤️❤️❤️感谢各位❤️❤️❤️

L6等级教案ppt及素材下载链接:

百度语音识别实战:SDK调用、语音文件转文字与多方言支持(教师教案/开发实验手册)资源-CSDN下载


语音识别

——第 16 次课 常规课

一、教学目标

1.知识与技能

(1)认识语音识别技术的识别方法和分类应用;

(2)掌握语音识别模块的创建及模型的搭建过程;

(3)学习语音识别SDK的调用方法。

2.过程与方法:

(1)通过一个个贴近生活的案例进行情景引入,激发学生对本节学习内容的兴趣,引发关联性的内容思考;

(2)每节课程开始前,对上节学习内容的知识点进行复习,加深印象;

(3)老师与学生间进行代码互动式的教学编写,带着孩子一步步完成任务。

3、情感态度与价值观:

(1)通过贴近生活的案例培养激发孩子的兴趣与爱好,在一个个生活案例中树立孩子正确的价值导向;

(2)代码的编写过程是精彩的,也是乏味的;是充满创造性的,也是一点点的基础前行;训练孩子逻辑思维、想象能力的同时,还磨练了孩子们的耐心,做到身心的锻炼。

二、教学重点、难点

【重点】 语音识别模块SDK API的访问方法

【难点】 API接口调用代码的编写

三、课时安排

课时安排:120 分钟

四、上课准备

1.   课前检查所有学员电脑Python的安装情况,打开代码试运行。

2.   课前检查电脑、投影仪、网络是否有故障,及时修复。

3.   备课过程中预设上课的突发情况,想办法解决。

4.   备课过程中,以学生的视角去审视自己的课堂,及时做出改进。

5.   课前排查教学环境中所存在的安全隐患。

五、教学活动

1 语音识别功能(时间:15-25min)

      1.1 随着数据处理技术的进步以及移动互联网的快速普及,计算机技术被广泛地运用到了社会的各个领域,随之而来的则是海量数据的产生。其中,语音数据受到了人们越来越多的重视。语音识别是一门交叉学科。近二十年来。语音识别技术取得显著进步,开始从实验室走向市场。人们预计,未来10年内,语音识别技术将进入工业、家电、通信、汽车电子、医疗、家庭服务、消费电子产品等各个领域。很多专家都认为语音识别技术是2000年至2010年间信息技术领域十大重要的科拄发展技术之一。语音识别技术所涉及的领域包括:信号处理、模式识别、概率论和信息论、发声机理和听觉机理、人工智能等等。

      1.2 语音识别是涉及心理学、生理学、声学、语言学、信息理论、信号处理、计算机科学、模式识别等多个学科的交叉学科,具有广阔的应用前景,如语音检索、命令控制、自动客户服务、机器自动翻译等。当今信息社会的高速发展迫切需要性能优越的,能满足各种不同需求的自动语音识别技术。但是,这样的目标面临着诸多困难:1、对自然语言的识别和理解。首先必须将连续的讲话分解为词、音素等单位,其次要建立一个理解语义的规则。2、语音信息量大。语音模式不仅对不同的说话人不同,对同一说话人也是不同的,例如,一个说话人在随意说话和认真说话时的语音信息是不同的。一个人的说话方式随着时间变化。3、语音的模糊性。说话者在讲话时,不同的词可能听起来是相似的。这在英语和汉语中常见。4、单个字母或词、字的语音特性受上下文的影响,以致改变了重音、音调、音量和发音速度等。5、环境噪声和干扰对语音识别有严重影响,致使识别率低。

      1.3 现在我们所使用的语音识别方法主要是采用模式匹配来实现的,在训练阶段,用户将词汇表中的每一词依次说一遍,并且将其特征矢量作为模板存入模板库。在识别阶段,将输入语音的特征矢量依次与模板库中的每个模板进行相似度比较,将相似度最高者作为识别结果输出。

2 创建语音识别应用(时间:10-15min)

      2.1 要使用语音识别服务首先我们需要访问网站 http://ai.baidu.com/,选择导航栏中的开放能力,在弹出的下拉弹窗中选择语音技术→语音识别,跳转到语音的主页面之后我们选择主页的立即使用或者右上方的控制台点击进入即可,接着再进入了登录页面之后我们输入注册好的账号密码进行登录。登陆完毕之后我们会进入到应用管理后台,在这里我们可以管理应用和创建应用。

2.2 在控制台页面的左侧我们可以看到服务的应用列表,这里可以创建对应功能的应用服务,下方的技术文档中我们可以查询调用API的文档资料使用说明,当然也可以通过下载对应的SDK进行使用。下面接跟着老师一起我们来创建一个通用文字识别的应用。填好应用名称,选择好对应的接口我们即可使用啦。在创建好应用之后,平台将会分配给应用相关凭证,主要为AppID、API Key、Secret Key。依据不同地域的方言文化差异,平台在普通话的基础上还提供了四川话、粤语等不同语言的语音识别功能。

3 课间休息 (10min)

老师组织一些活动,操类、逻辑题或小游戏,也可和孩子多交流,了解课程理解能力。

4 语音识别(SDK)(时间:30-40min)

4.1 本节课我们将要学习使用SDK客户端发起访问上传完整的语音文件进行识别,转化成文字信息。首先第一步,我们是要打开JupyterNotebook,建立新的Aip Speech,AipSpeech是语音识别的Python SDK客户端,为使用语音识别的开发人员提供了一系列的交互方法。

from aip import AipSpeech
"""
你的 APPID AK SK """

APP_ID = '23624527'

API_KEY = 'iHASVtWQ9wqBI8NKEoCicCWN'

SECRET_KEY = 'IuyxsuGUl2wFkVesGFjGTIOl92RwdeSW'


client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

4.2 下一步,我们需要向远程服务上传整段的语音文件进行识别,同学们可以先参照老师的代码进行编写,稍后老师会在一一详细的说明其中所涉及到的函数及其参数的具体说明。

# 读取文件
def get_file_content(filePath):

    with open(filePath, 'rb') as fp:

        return fp.read()


# 识别本地文件

client.asr(get_file_content('sounds/demo.wav'), 'wav', 16000, {

    'dev_pid': 1537,

})

4.3 其中,我们用到了asr( )这个函数,它调用的就是语音识别的函数方法。

参数

类型

描述

是否必须

speech

Buffer

建立包含语音内容的Buffer对象, 语音文件的格式,pcm 或者 wav 或者 amr。不区分大小写

format

String

语音文件的格式,pcm 或者 wav 或者 amr。不区分大小写。推荐pcm文件

rate

int

采样率,16000、8000,固定值

cuid

String

用户唯一标识,用来区分用户,填写机器 MAC 地址或 IMEI 码,长度为60以内

dev_pid

Int

不填写lan参数生效,都不填写,默认1537(普通话 输入法模型),dev_pid参数见本节开头的表格

dev_pid参数是以字典的形式传入其中,它的作用是声明识别的语言类型

dev_pid

语言

模型

是否有标点

备注

1537

普通话(纯中文识别)

输入法模型

有标点

支持自定义词库

1737

英语

无标点

不支持自定义词库

1637

粤语

有标点

不支持自定义词库

1837

四川话

有标点

不支持自定义词库

1936

普通话远场

远场模型

有标点

不支持

4.4 在返回的参数类型上,如果发生错误会返回相应的错误信息,其中包括参数,类型,,描述等等。

参数

类型

是否一定输出

描述

err_no

int

错误码

err_msg

int

错误码描述

sn

int

语音数据唯一标识,系统内部产生,用于 debug

result

int

识别结果数组,提供1-5 个候选结果,string 类型为识别的字符串, utf-8 编码

5 结束语(3min)

      同学们你们都做好了吗?本节课我们学习了语音识别应用模块的使用,掌握了就基本的语音文件转文字的方法,课后同学们可以继续尝试探索新的方法,比如极速版的语音识别等服务应用,快自己动手去参照开发文档https://ai.baidu.com/ai-doc/SPEECH/jkhq0ohzz 学习使用吧!遇到问题及时和老师沟通呢!本节课的学习任务到此就结束啦!让我们下节课再见吧!

  • 教师课后反思及总结

教师通过完整的一堂课,总结哪些环节讲需要重新规划、学生上课过程中的反馈、教师自己在上课过程中的自我表现、以及课程中优秀的点,及时写进教学反馈里。同时在下次备课和磨课过程中,做好改善工作。

课程环节反思

学生反馈反思

教师自我反思

教学闪光点

其他


走过路过,就点个赞吧呗!送你小心心哦💞💞💞

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐