利索能及
我要发布
收藏
专利号: 2018111072251
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种中文在线音视频的字幕生成方法,其特征在于,包括如下步骤:S1、音频数据提取步骤,服务器接收用户上传的音视频文件、并从所接收的音视频文件中提取出音频数据,将音频数据转化为标准格式;

S2、降噪步骤,对已转化为标准格式的音频数据进行降噪处理,得到降噪完成的音频文件;

S3、数据切分步骤,对音频文件进行端点切分,得到音频样本;

S4、片段识别步骤,对所得到的音频样本进行进一步切分,得到一系列语音片段,再对语音片段进行识别,整理得到全部音频数据的识别结果;

S5、字幕生成步骤,整合分析出文本及对应的时间轴,得到字幕文件,按照生成的字幕文件将字幕与音频数据进行匹配;

S1所述音频数据提取步骤,具体包括,用户通过中文在线课程视频网站上传一段音视频文件,服务器接收到音视频文件、提取出其中的音频数据,服务器从音频数据中读取参数信息,并将音频数据转化为标准格式;所述参数信息至少包括声道数、编码方式及采样率;

S2所述降噪步骤,具体包括,选取音频数据中前0.5秒的声音作为噪声样本,通过汉宁窗对噪声样本进行分帧并求出每一帧对应的强度值,以此作为噪声门阈值,再通过汉宁窗对音频数据进行分帧并求出每一帧对应的强度值,获得音频信号强度值,随后对音频信号强度值与噪声门阈值进行逐帧比较,保留音频信号强度值大于噪声门阈值的音频数据,最终得到降噪完成的音频文件;

S3所述数据切分步骤,具体包括,采用双门限语音端点检测技术,对已完成降噪的音频文件进行端点切分,切分出可用的音频样本,将未满足门限的部分音频文件当做静音或噪音、不做处理;

S3所述数据切分步骤中,所述双门限语音端点检测技术中的两个门限为包括过零率及短时能量;

S4所述片段识别步骤,具体包括,按照默认的最小静音长度和最短有效声音两项参数对S3中选择出的音频样本进行进一步切分,得到一系列的语音片段,然后将得到语音片段通过调用百度api进行语音识别,整理得到全部音频数据的识别结果,对识别结果采用Hanlp、Boson句法依存分布来检测符合依存语法关系的情况、判断识别效果;

S4所述片段识别步骤中,依存语法关系包括以下条件:一个句子中只有一个成分是独立的;句子的其他成分都从属于某一成分;句子中的任何一个成分都不能依存于两个或两个以上的成分;若句子中的成分A直接从属成分B,而成分C在句子中位于A和B之间,那么,成分C或者从属于A,或者从属于B,或者从属于A和B之间的某一成分;句子中心成分左右两边的其他成分相互不发生关系;

S4所述片段识别步骤中,若识别结果不满足预期,则将最小静音长度及最短有效声音提供给用户进行参数调整,调整完毕后重新执行S4所述片段识别步骤;若识别结果满足预期,则进入S5所述字幕生成步骤;

S5所述字幕生成步骤,具体包括,将各个语音片段对应的中文字幕,按照字幕的格式写入srt文件,每个语音片段的时间戳对应一段中文字幕,然后利用脚本自动调用字幕添加软件,将生成好的字幕文件按照时间添加进用户上传的音视频文件当中,最终得到一个带有字幕的中文课程视频,返回给用户以供下载。

2.根据权利要求1所述的中文在线音视频的字幕生成方法,其特征在于:所述的标准格式为单声道和16000帧率的WAV格式。