ChatTTS 概述
·
项目简介
ChatTTS 是一个专注于“对话场景”的语音合成(Text-to-Speech,TTS)模型。其核心目标是生成贴近互动、对话式的语音输出,而非通用朗读或播报。
开源地址:https://github.com/2noise/ChatTTS
主要亮点
- 对话优化:专为助手型对话、角色间交互设计,支持多说话人(multi-speaker)模拟。
- 韵律控制:可精细预测并调节韵律特征,如笑声、停顿、插入语等。
- 性能优势:在韵律表达上优于多数开源 TTS 模型。
语言与数据支持
- 语言:支持中文和英文。
- 数据规模:主模型训练数据超 100,000 小时中英文语音;开源版本为 40,000 小时预训练模型,未进行特殊微调(SFT)。
安装与使用
- 安装方式:
或从 GitHub 克隆最新版本:pip install ChatTTSpip install git+https://github.com/2noise/ChatTTS - 基础示例:
import ChatTTS import torch import torchaudio chat = ChatTTS.Chat() chat.load(compile=False) texts = ["First sentence.", "Second sentence."] wavs = chat.infer(texts) for i in range(len(wavs)): torchaudio.save(f"output{i}.wav", torch.from_numpy(wavs[i]).unsqueeze(0), 24000) - 高级功能:支持调节说话者参数、温度(temperature)、插入控制 Token(如
[laugh]、[break])。
注意事项与许可
- 许可:
- 代码部分采用 AGPLv3+。
- 模型权重为 CC BY-NC 4.0,仅限教育及研究用途,禁止商业或非法使用。
- 伦理安全:
- 为防止滥用,模型注入高频噪声并压缩音频质量(MP3格式)。
- 未来计划开源检测模型以识别生成语音。
性能与资源
- 硬件要求:生成 30 秒音频需至少 4GB GPU 内存;高端 GPU(如 RTX 4090)的实时生成速度约为 7 token/秒。
- 稳定性提示:多说话人场景或音质可能波动,建议多次采样优化结果。
未来计划
- 开源 40k 小时基础模型及说话人统计文件。
- 支持流式音频生成、多情绪控制、C++高性能部署(ChatTTS.cpp)。
应用场景
- 对话系统:虚拟助手、聊天机器人、互动剧本等需自然对话韵律的场景。
- 研究价值:开源大规模训练模型案例,适合探索对话式 TTS 的挑战。
局限与建议
- 语言限制:仅支持中英文,其他语言待扩展。
- 资源需求:高 GPU 内存占用,普通硬件可能体验不佳。
- 合规风险:需严格遵守非商业许可,避免声线冒充等滥用行为。
总结
ChatTTS 为对话场景提供高表现力的开源 TTS 解决方案,适合开发者和研究者探索互动语音合成。需注意其许可限制、硬件要求及伦理风险。
更多推荐



所有评论(0)