以前做实时语音翻译,通常要经过三个步骤:

语音识别 → 文本翻译 → 语音合成

看起来很简单,实际体验却经常不太理想。

首先,语音识别需要等待一句话说完;然后翻译模型还要理解上下文;最后再把翻译结果转换成语音。三个环节叠加以后,延迟很容易达到几秒。

这也是为什么很多所谓的“实时翻译”,听起来更像延迟播放的字幕配音。

而 Gemini 3.5 Live Translate 最大的变化,就是把这几个步骤整合到了一起。

一、直接从语音翻译成语音

Gemini 3.5 Live Translate 主打的是原生语音到语音翻译。

简单来说就是:

输入中文语音
      ↓
Gemini 实时处理
      ↓
输出英文语音

开发者不再需要自己分别接入语音识别、翻译模型和语音合成服务。

这样做的好处非常明显:

  • 翻译等待时间更短
  • 对话过程更加连续
  • 语音听起来更自然
  • 整体开发流程更简单

它比较适合用于跨国会议、游戏语音、外语学习以及直播同传等场景。


开发环境推荐|推广

实时语音翻译使用的是 WebSocket 长连接,对服务器网络和稳定性要求比较高。

如果本地网络连接海外 API 经常断开,可以使用 【产品名称】 搭建海外接口中转或后端服务,支持 WebSocket、流量监控和多地区节点。

查看免费测试方案 →


二、接入难度并没有想象中高

它并不是普通的 HTTP 请求,而是通过 WebSocket 持续传输音频。

大概流程如下:

打开麦克风
   ↓
将音频分成小块
   ↓
持续发送给 Gemini
   ↓
接收翻译后的音频
   ↓
在客户端播放

音频一般需要使用 16 kHz、单声道的 PCM 格式,并持续发送较短的音频片段。

初始化时,只需要指定目标语言。例如:

{
  "translationConfig": {
    "targetLanguageCode": "en"
  }
}

这里的 en 代表英语,也可以改成:

zh-Hans  简体中文
ja       日语
ko       韩语
fr       法语
de       德语

输入语言通常不需要手动指定,模型会自动识别用户正在说什么语言。

三、真正麻烦的是音频处理

模型接入并不是最难的部分。

对于网页应用来说,更容易踩坑的是浏览器录音格式。浏览器默认录制的音频通常是 WebM 或 Opus,而接口需要的是 PCM 音频。

因此还需要进行:

麦克风录音
   ↓
转换为 PCM
   ↓
调整采样率
   ↓
切分音频
   ↓
发送到接口

除此之外,还要处理网络中断、音频播放队列以及 API Key 安全问题。

如果直接把长期 API Key 写进网页代码,其他人很容易通过开发者工具获取。因此正式项目最好通过后端生成临时凭证,而不是把完整密钥暴露在前端。


不只让 AI 翻译更快,也让自己打字更快|推广

如果你还在使用全拼,可以试试「双拼双键」。网站支持小鹤双拼、自然码、智能
ABC、微软双拼等常见方案,提供双拼键位图、配置教程和在线练习,无需安装软件,打开网页就能开始训练。

网站地址:https://shuangpin.xyz/


四、它并不是万能语音助手

需要注意,Gemini 3.5 Live Translate 是一个专门用于翻译的模型。

它主要负责:

听到一种语言
      ↓
翻译成目标语言
      ↓
输出语音

它并不适合用来查询天气、调用工具、搜索资料或者完成复杂任务。

例如你对它说:

帮我计算一下 25 乘以 40。

它更可能只是把这句话翻译出来,而不是帮你计算答案。

因此,如果项目既需要实时翻译,又需要语音助手功能,通常要同时接入普通 Gemini 模型。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐