语音识别API接口(支持:时间戳、字幕、说话人)

一、产品简介
本接口提供高精度的语音转文本(STT)服务,支持长音频、多语种识别及说话人分离,可快速将音频/视频文件转化为结构化文本数据。适用于视频字幕生成、会议纪要整理、媒体内容分析等场景,集成字粒度时间戳与SRT字幕导出功能,助力开发者高效构建语音交互应用。

二、核心功能
多格式兼容:支持mp3、wav、aac、m4a、flac等主流音频格式及mp4、mov、mkv等视频格式,最大支持2GB文件或12小时时长。
智能识别:
   自动语言检测(默认),支持中、英、日、粤、韩、德、法、俄等多语种。
   说话人分离(Speaker Diarization),标记不同说话人身份。
   字粒度时间戳,精准定位语音片段。
字幕生成:直接输出SRT格式字幕文本,可保存为.srt文件导入视频编辑软件。
实时反馈:异步任务模式,支持查询任务状态(PENDING/RUNNING/SUCCEEDED/FAILED)。

三、计费与配额
免费额度:新用户享10分钟免费转写。
按量计费:0.008元/分钟(不足1分钟按1分钟计)。
请求限制:无每日调用次数限制。

四、请求参数说明
参数名   必填   类型   示例值   说明
key   是   string   35kj5jnlj53453kl5j43nj5   接口密钥(控制台获取)

url   是   string   https://#/audio.mp3   音视频文件公网可访问URL

taskId   是   string   640c4f3f-...   唯一任务ID(建议使用UUID)

language   否   string   zh   语种代码(留空为自动识别)

五、返回参数说明
参数名   类型   说明
code   int   状态码(200成功,403密钥错误等)

msg   string   状态描述信息

data   object   结果数据集

taskId   string   任务ID

text   string   全量识别文本

subtitle   string   SRT格式字幕内容

sentences   array   包含说话人、句级/词级时间戳的详细片段

六、调用示例
请求示例
POST https://#/api/stt/speechrecognition
Content-Type: application/x-www-form-urlencoded;charset=utf-8

成功返回示例
{
"code": 200,
"msg": "success",
"data": {
"taskId": "640c4f3f-6545-4102-88f6-703a826bdd14",
"url": "https://#/audio.mp3",
"format": "mp3",
"seconds": 61.07,
"sampling_rate": 44100,
"submission_time": "2026-07-03 18:54:42.330",
"completion_time": "2026-07-03 18:54:42.330",
"text": "我是一个草根。",
"subtitle": "1n00:00:01,000 --> 00:00:03,000n我是一个草根。n",
"sentences": [
{
"speaker": "SPEAKER_00",
"text": "我是一个草根。",
"start": 1000,
"end": 3000,
"words": [
{
"word": "我",
"start": 1000,
"end": 1200
}
]
}
]
},
"exec_time": 0.346334,
"ip": "220.172.49.45"
}

七、错误码说明
错误码   说明
403   请求密钥KEY不正确

400   参数缺失或格式错误

500   服务器内部错误

504   音视频文件下载超时

八、使用建议
文件准备:确保音频采样率≥16kHz,人声清晰,无严重背景噪音。
任务查询:对于长音频(>5分钟),建议通过taskId轮询结果。
字幕优化:利用sentences中的词级时间戳,可实现逐字高亮字幕效果。

九、技术支持
API文档:点击查看完整文档
调试工具:控制台提供在线调试功能
实名认证:需完成实名认证后方可调用接口


来源:酷虎云api开放平台

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐