简介
语音合成(Text To Speech,TTS),是一种可以将任意输入文本转换成语音,同时也是计算机语音领域的重要研究方向,
DeepVoice(深度语音)
将传统参数合成的TTS系统分拆成多个子模块,每个子模块用一个神经网络模型代替。
DeepVoice将语音合成分成5部分进行,分别为:文本转音素(又称语素转音素, G2P)、音频切分、音素时长预测、基频预测、声学模型。
文本转音素:
DeepVoice直接输入文本即可,但是由于不同语言存在“同字不同音”的现象,因此需要将文本转化为注音字符。对于中文而言,就是将汉字转化为拼音。
音频切分:
获得每个音素在对应音频中的起点和终点。使用Deep Speech 2: End-to-End Speech Recognition in English and Mandarin的对齐方法,这些对齐信息用于训练后面的“音素时长预测”模型。
音素时长预测和基频预测
该模型为多任务模型,输入带有重音标注的音素序列,输出为音素时长、是否发音的概率和基频
声学模型:
即后文的"声码器" (Vocoder)。用于将前面得到的高层特征转换为声音波形。DeepVoice的声学模型即是在前文的WaveNet基础上改进的。改进的主要方向是:改变网络层数、残差通道数、矩阵乘代替上采样卷积、CPU优化、GPU优化等。
优势:提供了完整的TTS解决方案,不像WaveNet需要依赖其它模块提供特征,使用的人工特征也减少了;合成速度快,实时性好
缺陷:误差累积,5个子模块的误差会累积,一个模块出错,整个合成失败,开发和调试难度大;虽然减少使用了人工特征,但在这个完整的解决方案中,仍然需要使用音素标记、重音标记等特征;直接使用文本输入,不能很好解决多音字问题。
-来源网络
了解
这个语音合成是基于深度神经网络训练而成的模型,目前效果还是可以就是有的时候说话语调有点奇怪,毕竟没有十全十美的东西,里面我比较喜欢的角色是七七她跟像正常人说话一样,目前能和合成的人物声音有以下这些,另外还加了几个人物说的是日语,这个模型是B站上的一位UP主训练的,用了5天时间要是我电脑配置训练起来,那还真整不出来只能用了。

项目是基于Github上开源的VITS
Github地址:https://github.com/w4123/vits
[ '派蒙', '凯亚', '安柏', '丽莎', '琴', '香菱', '枫原万叶',
'迪卢克', '温迪', '可莉', '早柚', '托马', '芭芭拉', '优菈',
'云堇', '钟离', '魈', '凝光', '雷电将军', '北斗',
'甘雨', '七七', '刻晴', '神里绫华', '戴因斯雷布', '雷泽',
'神里绫人', '罗莎莉亚', '阿贝多', '八重神子', '宵宫',
'荒泷一斗', '九条裟罗', '夜兰', '珊瑚宫心海', '五郎',
'散兵', '女士', '达达利亚', '莫娜', '班尼特', '申鹤',
'行秋', '烟绯', '久岐忍', '辛焱', '砂糖', '胡桃', '重云',
'菲谢尔', '诺艾尔', '迪奥娜', '鹿野院平藏' ]
// 日语
{"宁宁": 0, "爱瑠": 1, "芳乃": 2, "茉子": 3, "丛雨": 4, "小春": 5, "七海": 6, }

效果视频
1.以上是我修改过的语音合成,以下是通过QQ机器人的方式发送指令合成语音。
安装教程:https://www.bilibili.com/video/BV1m84y1B7NW
评论 (0)