日常工作中,如需要对会议、演讲进行录音并写成文字归档,最简单的方法自然是通过剪映、讯飞等的相关软硬件去完成,不过都是需要投入相应的花费。

如果希望通过免费的软件,且处理涉及商业秘密乃至个人隐私的音频,那么就得考虑其他方式了。

先查到一款叫做WhisperDesktop的开源软件,

WhisperDesktop 是一个运行在 Windows 64 位上的本地语音转文字工具,
基于 OpenAI Whisper 模型的 C/C++ 实现,可将音频、视频或麦克风输入转录为文本。

本项目适合:

  • 会议/访谈录音整理

  • 课程、播客、视频的文字转写

  • 本地、离线的批量语音转录需求

其发布地址为:https://github.com/gtppoplp/WhisperDesktop  ,但这款软件依赖显卡(gpu),我办公用电脑使用的是Intel的集成显卡,转换起来进度条十分钟几乎不动,只能考虑其他途径。

图片

WhisperDesktop是基于GPU的,对显卡要求较高,如显卡不匹配的话,转换起速度较慢。Buzz是基本CPU的,正好解决此问题。

Buzz-0.8.1 视频语音转成TXT、SRT、VTT工具

Buzz

项目文档

在个人电脑上离线转录和翻译音频。技术模型来源 OpenAI Whisper.

MIT License

CI

codecov

GitHub release (latest by date)

Github all releases

发布地址为:https://github.com/chidiwilliams/buzz/

它的两个功能一个是录音转文字,一个是实时语音识别。其中实时语音转文字、实时翻译需要麦克风权限。它转录文本导出为 TXT、SRT 和 VTT 的格式。而且支持Windows、macos和Linux。

第一次安装的时候,需要把文件夹中的三个文件都下载下来。

图片

安装时如果电脑发出警告,那就选择More info-> Run anyway。 第一次使用时它会自动下载 Whisper 模型,可以自己选择模型大小,模型越大准确率越高,模型越小,准确率偏低。它也支持GPU加速。

图片

它的优点是免费开源,而且所有的文字,视频都在本地,没有任何泄露的风险。

不过本身默认下载的tiny模型,识别率不高,如下图所示

图片

使用了Large-v3-turbo模型,虽然化的时间长多了,但是识别率大大提高。

图片

图片

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐