开源实时语音翻译器:基于Elixir、Rust与Deepgram的构建方案
商业实时语音翻译服务在通话中的无缝使用方面存在不足。Google Meet仅支持6种语言,延迟达2-3秒,且需要付费的AI Pro订阅。JotMe、Talo和Transync提供字幕而非语音翻译,仅适用于Chrome或Zoom等特定平台。企业级解决方案如Palabra、KUDO和Interprefy每月费用从300美元起,主要面向会议场景。
物理设备会错过短语开头、混淆词汇,不适合实时对话。目前尚无解决方案能在任何应用中实现无生态限制的语音翻译。
| 解决方案 | 价格 | 语音/字幕 | 延迟 | 语言 | 平台 |
|----------|-------|-----------------|-------|-----------|-----------|
| Google Meet | AI Pro订阅 | 语音 | 2-3秒 | 6 | 仅限Meet |
| JotMe | 10-15美元/月 | 字幕 | ~1-2秒 | 77 | Chrome |
| Talo | 订阅 | 字幕 + 机器人 | ~2秒 | 60 | Zoom、Meet |
| Palabra | SaaS | 语音 | ~0.8秒 | 25+ | Zoom、Meet |
| KUDO | 300+美元/月 | 语音 + 人工 | ~2-4秒 | 60+ | 专有平台 |
自定义流程:从语音识别到语音合成
从麦克风捕获音频,识别语音,翻译,合成,并路由至虚拟麦克风。反向流程处理对方语音。采用Elixir + Rust + Flask(单文件)的完整v3架构,开源实现。
流程:
- 语音识别:通过WebSocket使用Deepgram Nova-3,延迟258-681毫秒,支持带暂停的流式处理。
- 翻译:使用Groq的llama-3.3-70b模型,延迟250-560毫秒,提示词确保直译并保留语气。
- 语音合成:本地运行Piper,延迟300-500毫秒,支持29种语言离线使用。
- 音频处理:虚拟麦克风/扬声器适配任何应用(Meet、Zoom、Discord)。
总延迟0.8-1.7秒——比现场口译员(2-5秒)更快。
基于基准测试的组件选择
语音识别:Deepgram对比其他方案
- voxtral.c:本地运行需15+秒,在Apple Silicon上存在故障。
- Groq Whisper:约500毫秒,分块处理效果不佳。
- Deepgram:流式处理,暂停时输出最终文本。
大语言模型翻译:Groq领先
| 提供商 | 延迟 | 价格 | 缺点 |
|----------|-------|-------|-----------|
| Google翻译 | 100-300毫秒 | 20美元/百万字符 | 对会话语音的翻译效果不如大语言模型 |
| DeepL | 200-500毫秒 | 25美元/月 | 订阅制,效果不如大语言模型 |
| OpenAI | 500-1200毫秒 | 付费 | 速度慢 |
| Groq | 250-560毫秒 | 免费 | 最优选择 |
Groq的LPU芯片运行llama-3.3-70b模型——免费层级满足基本需求。
语音合成:Piper实现离线使用
- ElevenLabs:效果出色,但每小时5.57美元。
- Cartesia:每小时1.26美元。
- Piper:质量可接受,免费,支持29种语言。
成本与实施
- Deepgram:200美元信用额度(可使用数百小时)。
- Groq:免费。
- Piper:离线运行。
总计约0美元。在Meet/Zoom团队测试显示:翻译准确传达含义,但丢失习语/讽刺。Piper的语音听起来机械(俄语'Denis'——像1980年代的教授)。延迟加网络延迟明显但功能正常。
安装:Elixir用于编排,Rust处理音频,Flask作为桥梁。支持macOS Apple Silicon。
关键要点
- 完全兼容任何VoIP:在音频驱动层面捕获。
- 0.8-1.7秒延迟得益于Deepgram流式处理与快速Groq。
- 免费:200美元Deepgram信用额度可用数年,其余组件开源/免费。
- 权衡:Piper语音机械,大语言模型忽略会话语音的细微差别。
- 开源:提供仓库供自定义(Elixir/Rust技术栈)。
— Editorial Team
暂无评论。