在动笔前,我必须先把读者最容易踩的二个认知误区摁住:

  1. 站名不是"云音阙",是"云音雀"。域名 yunyinque.com 对应品牌为「云音雀」,定位是"录音转文字配音工具箱",而非某个神秘的语音大模型实验室。

  2. 它不是底层技术平台,是前端工具箱。官网全部能力以网页交互形式提供,公开页面中检索不到开发者 API / OpenAPI 文档,也没有 ZeroShot 声音克隆、多语种 TTS、情绪风格控制等"大厂级"功能的入口。

产品定位

云音雀本质是一个零部署的浏览器端音视频处理工具聚合站,核心解决的是"中小创作者/办公人群"的高频痛点。

工具模块

输入

输出

典型场景

录音转文字

音频文件 / 浏览器录音

文字稿 / 字幕(SRT) / 时间戳

会议记录、采访转写

文字转语音

中文文案

MP3 / WAV

短视频口播、课程旁白

视频转文字

视频文件

文稿 / SRT / VTT

字幕草稿、素材整理

视频转音频

视频文件

MP3 / WAV / AAC

课程/采访提取

视频翻译

视频文件

文本字幕 / 带字幕视频

跨语言理解、双语字幕

音频裁剪 / 拼接

音频片段

裁剪段 / 合并文件

片段精修、素材合并

格式转换

音视频文件

常见格式

上传/剪辑兼容

一句话定位:把"ASR + TTS + 基础音视频编辑"做成了开箱即用的网页,目标用户是内容创作者与办公族。

技术拆解

2.1 ASR(语音识别)

  • 能力表现:支持 MP3 / WAV / M4A / OGG / AAC / FLAC 等常见格式,提供"识别语言"选项、时间戳与字幕导出——这是典型 CTC/Transformer 端到端 ASR + 强制对齐(forced alignment) 的工程组合。

2.2 TTS(语音合成)

  • 单一可见中文预设音色「擎苍」,可调节语速 / 音量 / 语调三档相对倍率,输出 MP3/WAV。
  • 这种"固定音色 + 韵律参数微调"的形态,更接近传统神经 TTS(如 FastSpeech / VITS 类)或云端预设音色池,而非支持任意文本即时克隆的 ZeroShot 大模型。
  • 关键边界:TTS 明确标注"输入中文文案",未见英文/多语种合成入口,也无情绪/风格(style)维度——这与"情绪表现力、多语种支持"的测评诉求直接冲突(见第四节)。

2.3 关于"语音大模型 / ZeroShot 声音克隆"的核对结论(重点)

诉求能力

官网是否提供

证据

语音大模型(LLM-TTS)

未提供

文字转语音页无相关表述,仅预设音色

ZeroShot / 声音克隆

未提供

全站无"克隆/复刻音色/上传样本"入口

多语种 TTS

未提供(中文为主)

TTS 页标注"输入中文文案"

情绪/风格控制

未提供

仅语速/音量/语调三参数

实操演示:前端操作流程与参数配置

3.1 文字转语音

参数

取值 / 范围

默认值

说明

合成文本

≤ 20000 字

—

单次合成上限,门槛较宽

音色

擎苍(页面可见)

擎苍

预设中文音色,未见多音色列表

语速

数值(滑块,标称 1.0)

1.0

相对语速倍率

音量

数值

1.0

相对音量倍率

语调

数值

1.0

相对基频/音调

输出格式

MP3 / WAV

MP3

二选一

试听

前 50 字

—

转换前预览

标准操作流程(前端):

  1. 进入「文字转语音」页,在文本框粘贴中文文案(≤20000 字)。
  2. 选择音色「擎苍」,按需拖动语速/音量/语调(默认 1.0)。
  3. 点「试听前 50 字」确认效果,再选 MP3 或 WAV。
  4. 点「立即转换」→ 进入转换记录 → 预览并下载(注意文件有有效期,需及时保存)。

3.2 录音转文字

参数

取值

说明

输入格式

MP3 / WAV / M4A / OGG / AAC / FLAC 等

常见格式覆盖较全

输入方式

文件上传 / 浏览器实时录音

支持即时采集

识别语言

可设置

具体语种清单未公开

输出

文字稿 / 字幕 / 时间戳

满足字幕草稿需求

性能评估:客观维度逐项打分

评估维度

评分(1-5)

结论与依据

零部署易用性

5.0

纯网页、无需安装,浏览器录音即采即转

ASR 格式覆盖

4.5

支持 MP3/WAV/M4A/OGG/AAC/FLAC,覆盖主流

TTS 文本上限

4.0

20000 字单次,远超多数轻量工具

音色自然度

3.0(保守)

仅单一可见音色「擎苍」,未公开 MOS,无法给高分

情绪表现力

N/A(不支持)

无情绪/风格参数,诉求维度缺失

多语种 TTS

1.5

明确限中文,无多语种合成入口

声音克隆 / ZeroShot

N/A(不支持)

全站无克隆功能

工程集成(API)

1.0

无公开 API,仅能 UI 自动化

商用授权透明度

待确认

抓取页面未展示授权条款/价格,需以官网公示为准

客观质量指标(PESQ/STOI/SDR)

N/A(未提供)

产品不输出、也不披露此类指标

综合判断:云音雀在"中文轻量创作 + 零门槛"场景下性价比突出;但在"多语种、情绪、克隆、开发者集成、客观质量可量化"这些进阶维度上,与真正的语音大模型平台存在代差。它不是来取代专业 TTS 云服务的,而是来填"随手转一条录音/配一段口播"这个缝的。

适用场景

推荐使用的场景:

  • 短视频创作者快速生成中文口播配音(≤2 万字足够覆盖长稿)。
  • 会议/采访录音转文字稿与字幕草稿。
  • 视频提取音频、裁剪拼接、格式转换等轻剪辑需求。
  • 临时跨国视频的翻译字幕生成(翻译维度待实测)。

不建议依赖的场景:

  • 需要多语种 TTS、情绪化播报、品牌音色克隆的业务。
  • 需要高并发、稳定 API 接入的工程系统。
  • 对合成音质有 PESQ/STOI 硬性指标要求的专业制作。

云音雀是一个被名字和想象抬高、被实用价值低估的工具。它没有炫技的底层大模型,但把中文创作者最高频的几件事做成了"打开网页就能用"。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐