本文覆盖百炼 CLI 从环境安装到 TTS 语音合成、ASR 语音识别、语音翻译的完整流程,10 个实战场景全部收录,每个场景给出输入示例、完整命令、实际输出表现和调参要点,收藏后可按步骤复现。

目录:一、百炼 CLI 是什么|二、环境准备与安装|三、TTS 语音合成教程(场景 1-6)|四、ASR 语音识别转写教程(场景 7-8)|五、语音翻译教程(场景 9-10)|六、三个命令串联成流水线|七、成本参考|八、常见问题|九、总结

一、百炼 CLI 是什么

百炼 CLI 是阿里云百炼平台的命令行工具,通过 bl 命令调用平台 AI 能力。音频方向封装了三个核心命令:

命令功能底层模型
bl speech tts文本转语音(TTS 语音合成)CosyVoice
bl speech asr语音转文字(ASR 语音识别)Paraformer
bl speech translate语音翻译实时翻译引擎

注意一个基本机制:每次 bl 调用都是独立进程,不共享上下文,音色、语速等参数每次都要显式指定。好处是参数固定在脚本里后,批量跑一百次的输出风格完全一致。

二、环境准备与安装

步骤 1:确认环境。只需要 Node.js 18 及以上,不需要 GPU、Python 环境或音频处理库。

步骤 2:安装 CLI;步骤 3:登录配置 API Key

npm install -g bailian-cli
bl auth login

还没有百炼账号的话,可以先免费获取 API Key,或访问百炼控制台首页了解平台能力。安装详细文档参考百炼 CLI 官方页面

三、TTS 语音合成教程(场景 1-6)

bl speech tts 接收文本输出语音文件,底层模型 CosyVoice 支持多音色、多情感、多角色、多语言。

场景 1:相声风格朗读

适用:搞笑向短音频账号。输入一段职场吐槽:“各位观众,今天咱们说说开会。有一种会叫’对齐会’,对了一个小时,齐是没齐,人先散了。”

bl speech tts --text "各位观众,今天咱们说说开会……" --voice 幽默 --format mp3

调参要点:默认音色生成的效果像新闻联播在念段子,包袱全塌;换成幽默音色后,"齐是没齐,人先散了"的顿挫才有现挂的味道。输出可直接当短音频素材;方言包袱这类依赖临场感的表演合成音色还接不住,仍是真人演员的领地。

场景 2:有声书朗读

适用:想做有声版的小说作者。输入抒情文本:“那是一个秋天的傍晚,夕阳把天空染成了橘红色。微风拂过树叶,发出沙沙的声响。”

bl speech tts --text "那是一个秋天的傍晚……" --voice 温柔 --speed 0.9 --format mp3

调参要点:温柔音色默认语速偏快,抒情段落像在赶进度,加 --speed 0.9 才有从容感。"沙沙"这类拟声词处理自然,没有逐字硬念。电台级情感演播目前合成音色还到不了,商业出版级有声书仍需配音演员。

场景 3:广告配音

适用:电商运营,一天十几条促销配音。输入:“双十二狂欢节!全场商品五折起,限时抢购不容错过!”

bl speech tts --text "双十二狂欢节!全场商品五折起,限时抢购不容错过!" --voice 激昂 --format mp3

调参要点:温柔音色念促销词像睡前故事,激昂音色下感叹号处有真实的语气上扬,"五折起"是自然连读。信息流广告和商品页旁白够用;品牌 TVC 建议专业配音员。批量做法见第六节。

场景 4:角色配音(童声)

适用:睡前故事、有声书儿童角色。输入童话文本:“从前,在一片大森林里,住着一只可爱的小兔子。每天早晨,它都会对着太阳说早安。”

bl speech tts --text "从前,在一片大森林里……" --voice 童声 --speed 0.9 --format mp3

调参要点:童声稚气感到位,"小兔子"叠词有绘本感;默认语速下童声念得偏急,降到 0.9 才有讲故事的耐心。多角色有声书给每个角色固定一组音色参数批量生成再拼接;角色对手戏的情绪衔接仍需人工听一遍把关。

场景 5:播客开场

适用:每期开场、转场、片尾等模板化语音。输入:“大家好,欢迎收听科技新发现,我是你的主播。今天要聊的话题是,人工智能将如何改变我们的日常生活。”

bl speech tts --text "大家好,欢迎收听科技新发现……" --voice 磁性 --format mp3

调参要点:两句合在一次调用里生成,句间停顿偏短像连读;拆成两次生成再拼接,呼吸感就对了。模板化语音生成一次能用一季;多人即兴对谈的正片不适合合成。

场景 6:金句配音

适用:把大会、长会议中的金句做成短视频素材。输入:“2025年IDEA大会高峰对话,五位嘉宾围绕AI时代创新格局展开深度讨论。从科研范式转型到教育改革,每一句金句都引发全场共鸣。”

bl speech tts --text "2025年IDEA大会高峰对话……" --voice 磁性 --speed 0.95 --format mp3

调参要点:长句会被一口气念完,重音落不到关键词上;手动断句、关键词前补逗号后重音才对——合成引擎按标点安排气口,文本预处理比调参数更管用。“2025年"读成"二零二五年”,数字处理干净。

四、ASR 语音识别转写教程(场景 7-8)

bl speech asr 底层用 Paraformer 模型,支持说话人识别、时间戳对齐、标点恢复和章节分割,转写结果直接落成结构化文本文件。

场景 7:会议录音生成纪要 + 待办

输入:一段 45 分钟的普通话项目例会录音。

bl speech asr --input meeting.mp3 --speaker-diarization --output transcript.md

输出示例:

[说话人1] 这周的重点还是把导出功能收尾,测试环境今天下午就能更新。
[说话人2] 那文档这块我来跟,周四之前给初稿。

要点:不加 --speaker-diarization 时输出是一整块连续文本,多人发言糊在一起,务必加上。标点恢复表现好,口语里的"嗯""然后"被合理断句,输出直接是能读的 markdown,可再让模型提炼待办和负责人。多人交叉说话的段落准确率会明显下降,重要会议对照原始录音复核关键结论。

场景 8:音视频章节整理

输入:一期一小时的中文播客录音。

bl speech asr --input podcast.mp3 --output chapters.md

输出示例:

## 00:00:00 开场与本期话题
## 00:06:32 AI 播客工具的现状
## 00:21:45 从工具聊到工作流

要点:时间戳定位到句子级别,找话题不用拖进度条盲听。个别切分点会落在语义中间,需手动挪切点;章节标题偏"概括体",发布前自行润色。手工两三个小时的活变成几分钟初稿加十几分钟微调。

五、语音翻译教程(场景 9-10)

bl speech translate 底层是实时翻译引擎,支持中文与多语言互译,输出翻译后的文本和语音。

场景 9:语音翻译

输入一段中文语音(内容:“今天天气真好,我们一起去公园散步吧”):

bl speech translate --input voice.mp3 --source zh --target en --output translated.mp3

要点:日常口语难度的句子译文自然、语音流畅。不指定 --source 时中英混杂的语音识别混乱,务必显式指定源语言。同传级现场翻译仍属人类译员,异步内容翻译才是它的主场。

场景 10:音视频多语言转写

输入:一期中文播客音频,需出英文版。

bl speech translate --input podcast.mp3 --source zh --target en --output podcast-en.mp3

要点:转写加翻译一步完成,再接一步 TTS 即可生成目标语言配音。专有名词是主要的坑:中文产品名会被直译得生硬,先把文稿术语统一成英文原词再翻译,译文立刻顺了。字幕时间轴对齐和压制需配合剪辑工具完成。

六、三个命令串联成流水线

三个命令的输入输出都是标准文件,可以用脚本接起来。示例链路"会议录音 → 转写纪要 → 金句配音 → 英文版":

# 第一步:转写会议录音,按说话人分段
bl speech asr --input meeting.mp3 --speaker-diarization --output transcript.md
# 第二步:把人工挑出的金句合成为音频
bl speech tts --text "这里粘贴从 transcript.md 里挑出的金句" --voice 磁性 --speed 0.95 --format mp3
# 第三步:生成英文版语音
bl speech translate --input meeting.mp3 --source zh --target en --output meeting-en.mp3

批量配音:十几条文案放进 copy.txt,一行一条:

# PowerShell 示例:逐行读取文案并批量配音
Get-Content copy.txt | ForEach-Object { bl speech tts --text $_ --voice 激昂 --format mp3 }

七、成本参考

基于百炼官方定价(2026 年 7 月,来源:阿里云模型 studio 产品计费文档):

操作CLI 单次成本传统方案参考
TTS 语音合成(1 分钟,约 200 字)~0.034 元(标准语音合成 1.70 元/万字)50-200 元/分钟(专业配音员)
ASR 语音识别(1 小时音频)~3.5 元(实时转写约 0.06 元/分钟)100-300 元/小时(人工转写服务)
语音翻译(1 分钟)~0.5 元(ASR + 翻译 + TTS 组合)200-500 元/分钟(同声传译)

10 个场景全部跑一遍,API 成本约 5 元。传统方案定价包含人工创意和质量把控,两边不是同一种商品;这张表的实际意义是试错成本——每次调参重试只花几分钱。

八、常见问题

Q1:每次调用不共享上下文是什么意思? 每次 bl 命令都是独立进程,不能说"用刚才那个音色再读一段",参数每次显式指定。想保持一致性,把参数固定在脚本里即可。

Q2:需要 GPU 吗? 不需要。CLI 调用云端 API,本地只需 Node.js 18+。

Q3:声音克隆有什么注意事项? 注意合规,不要克隆未经授权的人声,百炼平台对此有明确的使用规范。

九、总结

如果你每周都要处理十几条配音、几个小时的录音转写,或者在做多语言内容,本文的三条命令能把散落在多个工具里的手动搬运串成一条可定时跑的流水线,参数固定后输出质量稳定。偶尔用一次的话,剪映、ElevenLabs 这类带界面、能实时试听的产品更省事。建议收藏本文,从 10 个场景里挑一个你本周就会遇到的,按步骤跑一遍看输出。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐