做有声小说,或者给视频录音,自己的音色如果好,是一个方向。
如果音色不好,可以考虑的方案:
1、音频合成工具 # 例如选 解说小帅角色,但是感觉怪怪的,对抑扬顿挫处理的不太好。
2、文本转语音 # 听说技术比较成熟,弄好的话可以满足要求,也开辟了有声小说的渠道。

有哪些比较好的产品

1、微软azure # 支持ssml 生态也最全
2、tts-vue

w3c是什么,www.w3.org也没有c啊?

好问题。我一开也有这个疑问。
w3c是什么?
w3c(world wide web consortium)(万维网联盟) # 看看是不是正好3个w,一个c
www.w3.org是万维网联盟的官网,这就清楚了吧。

tts-vue(还是废弃掉吧,国内访问外网不稳)

比较好的客户端。

tts-vue是免费的吗?

是开源免费的(个人使用)。

底层是调用微软 Edge 免费语音接口,但是个人版不收费。

从github上下载1.9.5并安装成功,界面也出现了,但是转换后下载时日志里显示403,还是网的问题,废弃掉吧。

tts-vue git地址

https://github.com/LokerL/tts-vue/releases # 实测可用

ssml语法

示例及说明
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="string">
    <mstts:backgroundaudio src="string" volume="string" fadein="string" fadeout="string"/>
    <mstts:voiceconversion url="string"/>
    <voice name="string" effect="string">
        <audio src="string"></audio>
        <bookmark mark="string"/>
        <break strength="string" time="string" />
        <emphasis level="value"></emphasis>
        <lang xml:lang="string"></lang>
        <lexicon uri="string"/>
        <math xmlns="http://www.w3.org/1998/Math/MathML"></math>
        <mstts:audioduration value="string"/>
        <mstts:ttsembedding speakerProfileId="string"></mstts:ttsembedding>
        <mstts:express-as style="string" styledegree="value" role="string"></mstts:express-as>
        <mstts:silence type="string" value="string"/>
        <mstts:viseme type="string"/>
        <p></p>
        <phoneme alphabet="string" ph="string"></phoneme>
        <prosody pitch="value" contour="value" range="value" rate="value" volume="value"></prosody>
        <s></s>
        <say-as interpret-as="string" format="string" detail="string"></say-as>
        <sub alias="string"></sub>
    </voice>
</speak>

说明:
以下列表描述了每个元素中允许的一些内容示例:
audio:如果音频文件不可用或不可播放,可在 audio 元素的正文中包含可讲述的纯文本或 SSML 标记。 audio 元素还包含文本和以下元素:audio、break、p、s、phoneme、prosody、say-as 和 sub。
bookmark:此元素不能包含文本或任何其他元素。
break:此元素不能包含文本或任何其他元素。
emphasis:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
lang:此元素可包含除 mstts:backgroundaudio、voice 和 speak 以外的所有其他元素。
lexicon:此元素不能包含文本或任何其他元素。
math:此元素只能包含文本和 MathML 元素。
mstts:audioduration:此元素不能包含文本或任何其他元素。
mstts:backgroundaudio:此元素不能包含文本或任何其他元素。
mstts:voiceconversion:此元素不能包含文本或任何其他元素。 它指定语音转换的源音频 URL。
mstts:embedding:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
mstts:express-as:此元素可包含文本和以下元素:audio、break、emphasis、lang、phoneme、prosody、say-as 和 sub。
mstts:silence:此元素不能包含文本或任何其他元素。
mstts:viseme:此元素不能包含文本或任何其他元素。
p:此元素可包含文本和以下元素:audio、break、phoneme、prosody、say-as、sub、mstts:express-as 和 s。
phoneme:此元素只能包含文本,不能包含任何其他元素。
prosody:此元素可包含文本和以下元素:audio、break、p、phoneme、prosody、say-as、sub 和 s。
s:此元素可包含文本和以下元素:audio、break、phoneme、prosody、say-as、mstts:express-as 和 sub。
say-as:此元素只能包含文本,不能包含任何其他元素。
sub:此元素只能包含文本,不能包含任何其他元素。
speak:SSML 文档的根元素。 此元素可包含以下元素:mstts:backgroundaudio 和 voice。
voice:此元素可包含除 mstts:backgroundaudio 和 speak 以外的所有其他元素。
语音服务可自动适当处理停顿(例如,在句号后面暂停片刻),或者在以问号结尾的句子中使用正确的音调。

其他

文档

微软azure中文官网-文本转语音文档:
https://docs.azure.cn/zh-cn/ai-services/speech-service/index-text-to-speech

w3c官网对SSML1.0的规范:
https://www.w3.org/TR/2004/REC-speech-synthesis-20040907/

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐