MAI-Transcribe-1刚刚在Azure上开放公开预览,这是一篇完整的接入教程,从开通服务到生产可用,覆盖所有关键步骤。

MAI-Transcribe-1核心规格

在深入代码之前,先看清楚这个模型能做什么:

  • 支持语言:英语、中文、日语、韩语、法语、德语、西班牙语、葡萄牙语、阿拉伯语、印地语、俄语(11种)
  • 音频格式:WAV、MP3、M4A、FLAC、OGG(最大文件:25MB)
  • 延迟:标准模式约1-2秒/分钟音频,流式模式实时输出
  • 计费:按音频分钟数计费,预览期间有免费额度

Step 1:在Azure门户开通MAI服务

  1. 登录Azure Portal,创建或选择已有的Azure OpenAI资源
  2. 进入"模型部署",点击"部署新模型"
  3. 在模型列表中找到mai-transcribe-1,选择"公开预览"版本
  4. 设置部署名称(建议:mai-transcribe-prod),配置请求速率上限

注意:MAI-Transcribe-1当前仅在East US 2和Sweden Central区域可用。如果你的Azure资源在其他区域,需要创建新资源或通过跨区域调用。

Step 2:Python接入代码

python

复制

Step 3:生产环境的错误处理和重试

python

复制

Step 4:长音频分割处理

对于超过25MB的长音频(如1小时以上的会议录音),需要先分割再分批提交:

python

复制

成本对比:MAI-Transcribe-1 vs Whisper

服务 价格($/分钟) 中文准确率 延迟
MAI-Transcribe-1 约$0.006 优秀 ~1.5s/min
OpenAI Whisper-1 $0.006 良好 ~2s/min
Azure Speech Service $0.014 良好 ~1s/min

对于以中文为主的场景,MAI-Transcribe-1在准确率上有明显优势,价格与Whisper持平,是目前最具性价比的选择。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐