Soprano 是一个超轻量级的开源文本转语音(TTS)模型,专为实时、高保真语音合成而设计,在保持模型紧凑且易于部署的同时,实现了前所未有的速度。

Soprano 仅包含 8000 万参数,实时因子(RTF)高达 ~2000×,可在 20 秒内生成 10 小时的音频。Soprano 采用 无缝流式传输 技术,实现 <15 毫秒 的真正实时合成,比现有 TTS 流水线快多个数量级。

主要功能

      • 高保真 32 kHz 音频:

        Soprano 以 32 kHz 采样率合成语音,其清晰度在听感上与 44.1 kHz 音频无异,显著优于许多现有 TTS 模型所使用的 24 kHz 输出。

      • 基于 Vocos 的神经解码器:

        Soprano 未采用缓慢的扩散解码器,而是使用 基于 Vocos 的解码器,在保持相近感知质量的同时,实现 数量级更快 的波形生成速度。

      • 无缝实时流式传输:

        Soprano 利用解码器有限的感受野,以 超低延迟 无损地流式传输音频。流式输出在声学上与离线合成结果完全一致,可支持亚帧级延迟的交互式应用。

      • 先进的神经音频编解码器:

        语音通过一种 神经编解码器 表示,仅以 0.2 kbps 的码率将音频压缩至 约 15 个 token/秒,在不牺牲音质的前提下实现极快的生成速度和高效的内存使用。

      应用场景

        • 场景描述一

        集成至手机/AR眼镜/智能终端,将网页、PDF、电子书、短信、通知等文字内容毫秒级转为自然语音,支持逐句/逐词流式朗读,无卡顿、无预加载。

        • 场景描述二

        在直播、远程会议、教育陪练、心理陪伴机器人等场景中,驱动虚拟人口型与语音同步生成,实现“思考即发声”的拟人化交互(如用户刚说完问题,AI 已在 30–50 ms 内开始作答)。

        【ekwek/Soprano-80M】模型已经在趋动云『社区项目』上线,无需自己创建环境、下载模型,一键即可快速部署,快来体验【ekwek/Soprano-80M】带来的精彩体验吧!

        项目入口

        https://open.virtaicloud.com/web/project/detail/660765566332035072

        视频教程

        https://www.bilibili.com/video/BV1n3ikBkEFz/?vd_source=85d5574e8763d2ef3afdafc50f2b9d43

        启动开发环境

        进入【ekwek/Soprano-80M】项目主页中,点击运行一下,将项目一键克隆至工作空间,『社区项目』推荐适用的算力规格,可以直接立即运行,省去个人下载数据、模型和计算算力的大量准备时间。

        配置完成,点击进入开发环境,根据主页项目介绍进行部署。

        使用方法

        在/gemini/code中找到使用说明,选中使用说明单元格,点击运行。

        等待生成local URL,右侧添加端口7860。

        项目使用方法

        示例展示

        ➫温馨提示: 完成项目后,记得及时关闭开发环境,以免继续产生费用!

        Logo

        Agent 垂直技术社区,欢迎活跃、内容共建。

        更多推荐