OpenClaw语音扩展:Qwen3.5-9B实现会议录音转写
OpenClaw语音扩展:Qwen3.5-9B实现会议录音转写
1. 为什么需要语音自动化助手
上周三的部门例会让我意识到一个严重问题——当会议持续90分钟以上时,人工记录的关键信息准确率会直线下降。我尝试用手机录音后转文字,但发现三个痛点:
- 市面转写工具无法区分发言人(所有内容混在一起)
- 转写后的文字需要手动提取行动项
- 待办事项需要复制到不同系统(如飞书待办、邮件提醒)
这正是OpenClaw结合Qwen3.5-9B能解决的场景。通过搭建本地语音处理流水线,可以实现:
- 实时转写录音文件(保留说话人标记)
- 自动提取会议决议和待办事项
- 直接同步到办公系统
整个过程完全在本地完成,不用担心敏感会议内容泄露。
2. 系统架构与核心组件
2.1 技术选型思路
我测试过多种组合方案,最终稳定运行的架构包含三个关键层:
语音处理层
使用Vosk作为本地语音识别引擎,选择它是因为:
- 支持中英文混合识别
- 提供说话人分离功能
- 模型文件仅300MB(对比Whisper的1.5GB)
大模型层
部署Qwen3.5-9B镜像处理文本,主要利用其:
- 超长上下文理解(32K tokens)
- 结构化信息提取能力
- 本地推理的低延迟特性
自动化层
OpenClaw负责:
- 监控录音文件目录
- 调用各组件处理流水线
- 将结果推送到办公系统
2.2 具体组件版本
# 核心组件版本
vosk-0.3.45
qwen3.5-9b-mirror
openclaw-1.8.3
3. 实战部署过程
3.1 语音识别模块配置
首先下载Vosk中文模型:
mkdir -p ~/models/vosk
cd ~/models/vosk
wget https://alphacephei.com/vosk/models/vosk-model-zh-cn-0.22.zip
unzip vosk-model-zh-cn-0.22.zip
在OpenClaw中注册语音处理技能:
// ~/.openclaw/skills/audio.json
{
"skills": {
"audio_transcribe": {
"type": "python",
"entry": "transcribe.py",
"env": {
"MODEL_PATH": "~/models/vosk/vosk-model-zh-cn-0.22"
}
}
}
}
3.2 Qwen模型接入配置
修改OpenClaw模型配置文件:
// ~/.openclaw/openclaw.json
{
"models": {
"providers": {
"local-qwen": {
"baseUrl": "http://localhost:8000/v1",
"api": "openai-completions",
"models": [
{
"id": "qwen3.5-9b",
"name": "Local Qwen",
"contextWindow": 32768
}
]
}
}
}
}
启动模型服务(假设已部署Qwen镜像):
docker run -d -p 8000:8000 qwen3.5-9b-mirror
3.3 任务链组装
创建自动化工作流脚本:
# ~/scripts/meeting_pipeline.py
from openclaw.sdk import workflow
@workflow(
triggers=["file_added:/recordings"],
outputs=["feishu:todos"]
)
def process_meeting(audio_file):
# 语音转文字
transcript = skills.audio_transcribe(audio_file)
# 提取关键信息
prompt = f"""会议记录:
{transcript}
请提取:
1. 重要决议(带通过时间)
2. 待办事项(分配人+截止时间)
用JSON格式返回"""
analysis = models.local_qwen.chat(prompt)
# 同步到飞书
for task in analysis["todos"]:
channels.feishu.create_task(
title=task["desc"],
assignee=task["owner"],
due_time=task["due"]
)
4. 效果验证与调优
4.1 基础功能测试
用测试会议录音验证流程:
- 将录音文件放入监控目录:
cp test.mp3 ~/recordings/ - 查看处理日志:
tail -f ~/.openclaw/logs/pipeline.log - 检查飞书待办事项是否生成
4.2 性能优化记录
初期遇到两个典型问题:
问题1:长会议内存溢出
当录音超过60分钟时,Qwen会因上下文过长OOM。解决方案:
- 在transcribe.py中按发言人分段
- 每20分钟内容单独发送给模型
问题2:时间识别错误
模型常把"下周"识别为具体日期。改进方法:
- 在prompt中明确要求"必须解析出具体日期"
- 添加后处理校验脚本
优化前后的关键指标对比:
| 指标 | 优化前 | 优化后 |
|---|---|---|
| 处理速度 | 3x实时 | 1.5x实时 |
| 待办准确率 | 68% | 92% |
| 内存占用峰值 | 18GB | 9GB |
5. 实际应用建议
经过两周的实际使用,总结出三条经验:
第一,一定要设置"人工确认"环节。我在飞书机器人配置了二次确认指令,只有当用户回复"确认提交"时,待办才会真正创建。这避免了模型误解析带来的混乱。
第二,为不同会议类型准备定制prompt。技术评审会和运营例会的关注点完全不同,我建立了prompt模板库,根据会议名称自动选择。
第三,维护常见术语表。我们发现模型对公司内部项目代号识别率低,后来在知识库中添加了术语对照表,准确率提升明显。
这套系统现在每天处理3-4个会议录音,节省了至少2小时/天的手动处理时间。最让我惊喜的是,当多人同时说话时,Vosk的说话人分离效果比人工记录更准确。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
更多推荐


所有评论(0)