上个月我接了个活儿:把一期将近两小时的访谈视频整理成文字稿,还要顺手出一版字幕。要是搁以前,我肯定一边看一边手动敲,敲到眼冒金星。后来想想,我平时折腾音频降噪、人声分离那套经验,不就是跟「声音里的信息」打交道的吗?转文字这事儿,本质也是从信号里把内容捞出来。于是我把市面上这类工具挨个试了一遍,最后落在云音雀的「视频转文字」上。这篇文章不是广告,是我这半年折腾下来的一些真实感受和踩过的坑。

这事儿远没有「点一下等结果」那么简单

很多人以为「视频转文字」就是把声音变成字,一键完事。真上手才知道,它和我做音频降噪、人声分离是同一类问题——都是在跟信号较劲,只是目标不同。

语音识别(ASR,Automatic Speech Recognition)这条链路,粗略说是这样走的:

音频进来 → 端点检测(VAD,先把有声音和没声音的段切开)→ 声学模型把声音帧映射成音素/字 → 语言模型按上下文把音素拼成通顺句子 → 标点恢复 → 时间戳对齐(forced alignment)

每一步都在丢东西。VAD 切错了,一句话开头半个字就被削掉;语言模型为了通顺,会把你说错的同音字「纠正」成另一个词;时间戳对齐要是粗暴地按整句给,你后期想精修字幕就抓瞎。

所以别指望它一次出完美稿。我现在的预期是:它能把 80% 的机械劳动替我干了,剩下 20% 我得自己听、自己改。这个预期摆正了,用着就舒服。

什么样的源素材,识别出来才像样

我搞音频的对源素材一向挑剔,转文字也一样。下面几个是我自己验证过的点:

  • 采样率:ASR 模型大多吃 16kHz 单声道就够,但你的源如果是 48kHz 采访录音,下采样本身不丢信息,关键是别用乱七八糟的压缩。
  • 编码格式:能给 WAV 就别给 MP3。MP3 的量化噪声对「听感」影响不像对 ASR 那么大,但累积起来会让边界音素变模糊。我做过对比,同一段录音 WAV 比 128kbps MP3 的错字少一截。
  • 信噪比(SNR):这是我最想强调的。我做降噪时关心的 SNR,转文字时一样要命。空调底噪、马路声、回声,都会让声学模型把「噪声的特征」学进预测里。所以脏素材先降噪再转,比直接转准得多——和我做播客后期的逻辑一模一样。
  • 专业术语 / 人名:通用模型不认识你的行业黑话。这时候「热词」功能就关键了,提前把嘉宾名字、专有名词喂进去,识别率肉眼可见地涨。

不同导出格式差别不小,别只导一个 TXT 就完事:

格式

是什么

我拿它干嘛

注意点

SRT

最通用的字幕文件,带起止时间和文本

丢进剪映 / PR 做硬字幕

时间码精度够用,手改时间容易崩

VTT

网页字幕标准,结构类似 SRT

视频网站 / B 站投稿挂字幕

时间戳格式是 .000 而非 ,000

ASS

高级字幕,支持样式 / 位置 / 特效

需要花字、走位字幕时

文本量大会臃肿,普通稿用不上

TXT

纯文本稿

自己读、做笔记、二次处理

丢了时间信息,想回查得另存

JSON

带时间戳和置信度的结构化数据

写脚本批量处理、做检索

字段多,得自己解析

我用的流程,以及云音雀卡在哪几个点上

我现在的标准动作是:拿到视频先不动它,看是不是已经带干净音轨;如果是现场录的脏素材,先用降噪把底噪压一压;再丢给视频转文字工具。

云音雀的「视频转文字」走三步:选视频 → 设参数 → 进转换记录等结果。它把「设参数」单独拎出来这点是合理的,因为真正影响成品的不是工具多花哨,而是这几个旋钮:

  1. 识别语言:中文 / 英文 / 方言,选错整篇都歪。
  2. 时间戳粒度:按句还是按词。我要做字幕就选细粒度,后期对轴省事。
  3. 文本导出格式:纯文本、SRT、VTT、带时间轴的 JSON 等。SRT 给剪辑软件吃,TXT 给我自己读,JSON 留着二次处理。

它对常见视频格式都吃,上传后后台跑,不用盯着。会议录像、课程视频、访谈这三类我实测最稳——因为说话人离麦克风近、信噪比高。

源素材的几个参数对识别效果的影响,我整理成一张表,方便对照着调:

影响因素

我的做法

对识别的实际影响

采样率

源高就保留,转 16k 单声道喂模型

过高无意义,过低丢高频辅音,错字变多

编码格式

能给 WAV 就不给 MP3

MP3 量化噪声累积,模糊边界音素

信噪比 (SNR)

脏素材先降噪再转

噪声被声学模型学进预测,错字飙升

专业术语

提前加热词

通用模型不认识黑话,热词能救一命

语速 / 插话

接受偶尔漂移,手动修

强制对齐在静音段估算偏,时间戳会飘

而工具本身那几个设置项,决定的是你后期费不费手:

参数

怎么选

我踩过的坑

识别语言

按素材真实语种选,含方言就选对应项

选错语种整篇歪,不是改几个字的事

时间戳粒度

做字幕选细(句 / 词级),纯稿选粗

只给整句时间,对轴时能累死

导出格式

字幕用 SRT/VTT,稿子用 TXT,二次处理用 JSON

只导 TXT 丢了时间,回查得重跑

输入格式

常见视频格式都支持,优先清晰音轨

源本身带噪,转出来照样糊

几个体验过才懂的细节

  • 标点恢复不是玄学,但别全信。模型给的逗号句号常常按语气而非语法,我一般导出后自己顺一遍。
  • 多人对话时,它目前大多不给「说话人分离」(speaker diarization)。要区分谁说的,得靠你听。这点别指望工具替你做,它只管「说了什么」,不管「谁说的」。
  • 外语 / 方言别硬上通用模型。云音雀支持选语言,选对语种比事后改稿省十倍力气。

说句实在话

视频转文字这类工具,早几年还经常翻车,现在端到端模型(像 Whisper 那一套思路)普及之后,日常素材的可用度已经很高了。但它终究是个「帮你干机械活」的帮手,不是神仙。你给它干净、近讲、术语对齐好的素材,它还你一篇能用的初稿;你丢一段远处录的嘈杂录音进去,它也只能尽力。

我把云音雀定位成我音频工作流里「收尾整理」的一环:前面降噪、分离把好声音关,最后转文字把好内容关。工具链顺了,两小时的访谈,真正花在我手上的时间也就二三十分钟。这就够了。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐