Traductor de Voz en Tiempo Real de Código Abierto: Una Implementación con Elixir, Rust y Deepgram
Los servicios comerciales de traducción de voz en tiempo real no cumplen para un uso fluido en llamadas. Google Meet solo traduce 6 idiomas con un retraso de 2-3 segundos y requiere una suscripción paga AI Pro. JotMe, Talo y Transync ofrecen subtítulos en lugar de voz, funcionan solo en Chrome o plataformas específicas como Zoom. Las soluciones empresariales como Palabra, KUDO e Interprefy cuestan desde $300/mes y están orientadas a conferencias.
Los dispositivos físicos pierden el inicio de las frases, confunden palabras y no son adecuados para conversaciones en vivo. Ninguna solución ofrece traducción de voz en cualquier aplicación sin limitaciones del ecosistema.
| Solución | Precio | Voz/Subtítulos | Retraso | Idiomas | Plataformas |
|----------|-------|-----------------|-------|-----------|-----------|
| Google Meet | Suscripción AI Pro | Voz | 2-3s | 6 | Solo Meet |
| JotMe | $10-15/mes | Subtítulos | ~1-2s | 77 | Chrome |
| Talo | Suscripción | Subtítulos + bot | ~2s | 60 | Zoom, Meet |
| Palabra | SaaS | Voz | ~0.8s | 25+ | Zoom, Meet |
| KUDO | $300+/mes | Voz + humanos | ~2-4s | 60+ | Propietaria |
Pipeline Personalizado: De STT a TTS
Capturar audio del micrófono, reconocer voz, traducir, sintetizar y redirigir a un micrófono virtual. Flujo inverso para el habla del interlocutor. Arquitectura completa v3 con Elixir + Rust + Flask (archivo único), de código abierto.
Proceso:
- STT: Deepgram Nova-3 vía WebSocket, 258-681ms, transmisión con pausas.
- Traducción: Groq con llama-3.3-70b, 250-560ms, instrucción para traducción literal con tono.
- TTS: Piper localmente, 300-500ms, 29 idiomas sin conexión.
- Audio: Micrófono/altavoz virtual para cualquier aplicación (Meet, Zoom, Discord).
Retraso total 0.8-1.7s — más rápido que un intérprete en vivo (2-5s).
Selección de Componentes Basada en Benchmarks
STT: Deepgram vs Alternativas
- voxtral.c: 15+s localmente, fallos en Apple Silicon.
- Groq Whisper: ~500ms, basura en fragmentos.
- Deepgram: Transmisión, texto finalizado en pausas.
Traducción con LLM: Groq Lidera
| Proveedor | Retraso | Precio | Desventajas |
|----------|-------|-------|-----------|
| Google Translate | 100-300ms | $20/1M | Peor que LLM en habla conversacional |
| DeepL | 200-500ms | $25/mes | Suscripción, peor que LLM |
| OpenAI | 500-1200ms | Pago | Lento |
| Groq | 250-560ms | Gratis | Óptimo |
llama-3.3-70b en chips LPU de Groq — nivel gratuito para tareas básicas.
TTS: Piper para Uso Sin Conexión
- ElevenLabs: Excelente, pero $5.57/hora.
- Cartesia: $1.26/hora.
- Piper: Calidad aceptable, gratis, 29 idiomas.
Costo e Implementación
- Deepgram: $200 en créditos (cientos de horas).
- Groq: Gratis.
- Piper: Sin conexión.
Total ~$0. Pruebas en Meet/Zoom con un equipo mostraron: la traducción es precisa en significado pero pierde modismos/sarcasmo. La voz de Piper suena robótica (ruso 'Denis' — como un profesor de los 80). Retraso + ping de red = notable pero funcional.
Instalación: Elixir para orquestación, Rust para audio, Flask como puente. Funciona en macOS Apple Silicon.
Conclusiones Clave
- Compatibilidad total con cualquier VoIP: captura a nivel de controlador de audio.
- Retraso de 0.8-1.7s gracias a transmisión de Deepgram + Groq rápido.
- Gratis: $200 en créditos de Deepgram para años, el resto código abierto/gratis.
- Compromisos: Piper suena robótico, LLM pierde matices del habla conversacional.
- Código abierto: repositorio para personalización (stack Elixir/Rust).
— Editorial Team
Aún no hay comentarios.