TTS文本转语音、音频、SSML、微软AZURE、w3c等
文章目录
做有声小说,或者给视频录音,自己的音色如果好,是一个方向。
如果音色不好,可以考虑的方案:
1、音频合成工具 # 例如选
解说小帅角色,但是感觉怪怪的,对抑扬顿挫处理的不太好。
2、文本转语音 # 听说技术比较成熟,弄好的话可以满足要求,也开辟了有声小说的渠道。
有哪些比较好的产品
1、微软azure # 支持ssml 生态也最全
2、tts-vue
w3c是什么,www.w3.org也没有c啊?
好问题。我一开也有这个疑问。
w3c是什么?
w3c(world wide web consortium)(万维网联盟) # 看看是不是正好3个w,一个c
www.w3.org是万维网联盟的官网,这就清楚了吧。
tts-vue(还是废弃掉吧,国内访问外网不稳)
比较好的客户端。
tts-vue是免费的吗?
是开源免费的(个人使用)。
底层是调用微软 Edge 免费语音接口,但是个人版不收费。
从github上下载1.9.5并安装成功,界面也出现了,但是转换后下载时日志里显示403,还是网的问题,废弃掉吧。
tts-vue git地址
https://github.com/LokerL/tts-vue/releases # 实测可用
ssml语法
示例及说明
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="string">
<mstts:backgroundaudio src="string" volume="string" fadein="string" fadeout="string"/>
<mstts:voiceconversion url="string"/>
<voice name="string" effect="string">
<audio src="string"></audio>
<bookmark mark="string"/>
<break strength="string" time="string" />
<emphasis level="value"></emphasis>
<lang xml:lang="string"></lang>
<lexicon uri="string"/>
<math xmlns="http://www.w3.org/1998/Math/MathML"></math>
<mstts:audioduration value="string"/>
<mstts:ttsembedding speakerProfileId="string"></mstts:ttsembedding>
<mstts:express-as style="string" styledegree="value" role="string"></mstts:express-as>
<mstts:silence type="string" value="string"/>
<mstts:viseme type="string"/>
<p></p>
<phoneme alphabet="string" ph="string"></phoneme>
<prosody pitch="value" contour="value" range="value" rate="value" volume="value"></prosody>
<s></s>
<say-as interpret-as="string" format="string" detail="string"></say-as>
<sub alias="string"></sub>
</voice>
</speak>
说明:
以下列表描述了每个元素中允许的一些内容示例:
audio:如果音频文件不可用或不可播放,可在 audio 元素的正文中包含可讲述的纯文本或 SSML 标记。 audio 元素还包含文本和以下元素:audio、break、p、s、phoneme、prosody、say-as 和 sub。
bookmark:此元素不能包含文本或任何其他元素。
break:此元素不能包含文本或任何其他元素。
emphasis:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
lang:此元素可包含除 mstts:backgroundaudio、voice 和 speak 以外的所有其他元素。
lexicon:此元素不能包含文本或任何其他元素。
math:此元素只能包含文本和 MathML 元素。
mstts:audioduration:此元素不能包含文本或任何其他元素。
mstts:backgroundaudio:此元素不能包含文本或任何其他元素。
mstts:voiceconversion:此元素不能包含文本或任何其他元素。 它指定语音转换的源音频 URL。
mstts:embedding:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
mstts:express-as:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
mstts:silence:此元素不能包含文本或任何其他元素。
mstts:viseme:此元素不能包含文本或任何其他元素。
p:此元素可包含文本和以下元素:audio、break、phoneme、prosody、say-as、sub、mstts:express-as 和 s。
phoneme:此元素只能包含文本,不能包含任何其他元素。
prosody:此元素可包含文本和以下元素:audio、break、p、phoneme、prosody、say-as、sub 和 s。
s:此元素可包含文本和以下元素:audio、break、phoneme、prosody、say-as、mstts:express-as 和 sub。
say-as:此元素只能包含文本,不能包含任何其他元素。
sub:此元素只能包含文本,不能包含任何其他元素。
speak:SSML 文档的根元素。 此元素可包含以下元素:mstts:backgroundaudio 和 voice。
voice:此元素可包含除 mstts:backgroundaudio 和 speak 以外的所有其他元素。
语音服务可自动适当处理停顿(例如,在句号后面暂停片刻),或者在以问号结尾的句子中使用正确的音调。
其他
文档
微软azure中文官网-文本转语音文档:
https://docs.azure.cn/zh-cn/ai-services/speech-service/index-text-to-speech
w3c官网对SSML1.0的规范:
https://www.w3.org/TR/2004/REC-speech-synthesis-20040907/
更多推荐

所有评论(0)