Open-Source Echtzeit-Sprachübersetzer: Ein Build mit Elixir, Rust und Deepgram
Kommerzielle Echtzeit-Sprachübersetzungsdienste sind für den nahtlosen Einsatz in Anrufen unzureichend. Google Meet übersetzt nur 6 Sprachen mit einer Verzögerung von 2-3 Sekunden und erfordert ein kostenpflichtiges AI Pro-Abonnement. JotMe, Talo und Transync bieten Untertitel statt Sprache, funktionieren nur in Chrome oder auf bestimmten Plattformen wie Zoom. Unternehmenslösungen wie Palabra, KUDO und Interprefy kosten ab 300 €/Monat und sind auf Konferenzen ausgelegt.
Physische Geräte verpassen den Anfang von Sätzen, verwechseln Wörter und eignen sich nicht für Live-Gespräche. Keine Lösung bietet Sprachübersetzung in jeder Anwendung ohne Ökosystembeschränkungen.
| Lösung | Preis | Sprache/Untertitel | Verzögerung | Sprachen | Plattformen |
|----------|-------|-----------------|-------|-----------|-----------|
| Google Meet | AI Pro-Abonnement | Sprache | 2-3s | 6 | Nur Meet |
| JotMe | 10-15 €/Monat | Untertitel | ~1-2s | 77 | Chrome |
| Talo | Abonnement | Untertitel + Bot | ~2s | 60 | Zoom, Meet |
| Palabra | SaaS | Sprache | ~0,8s | 25+ | Zoom, Meet |
| KUDO | 300+ €/Monat | Sprache + Menschen | ~2-4s | 60+ | Proprietär |
Benutzerdefinierte Pipeline: Von STT zu TTS
Audio vom Mikrofon aufnehmen, Sprache erkennen, übersetzen, synthetisieren und an ein virtuelles Mikrofon weiterleiten. Umgekehrter Fluss für die Sprache des Gesprächspartners. Vollständige v3-Architektur mit Elixir + Rust + Flask (einzelne Datei), Open-Source.
Prozess:
- STT: Deepgram Nova-3 über WebSocket, 258-681ms, Streaming mit Pausen.
- Übersetzung: Groq mit llama-3.3-70b, 250-560ms, Prompt für wörtliche Übersetzung mit Ton.
- TTS: Piper lokal, 300-500ms, 29 Sprachen offline.
- Audio: Virtuelles Mikrofon/Lautsprecher für jede Anwendung (Meet, Zoom, Discord).
Gesamtverzögerung 0,8-1,7s — schneller als ein Live-Dolmetscher (2-5s).
Komponentenauswahl basierend auf Benchmarks
STT: Deepgram vs. Alternativen
- voxtral.c: 15+s lokal, Störungen auf Apple Silicon.
- Groq Whisper: ~500ms, Müll in Chunks.
- Deepgram: Streaming, finalisierter Text bei Pausen.
LLM-Übersetzung: Groq führt
| Anbieter | Verzögerung | Preis | Nachteile |
|----------|-------|-------|-----------|
| Google Translate | 100-300ms | 20 €/1M | Schlechter als LLM bei Konversationssprache |
| DeepL | 200-500ms | 25 €/Monat | Abonnement, schlechter als LLM |
| OpenAI | 500-1200ms | Bezahlt | Langsam |
| Groq | 250-560ms | Kostenlos | Optimal |
llama-3.3-70b auf Groqs LPU-Chips — kostenlose Stufe für grundlegende Aufgaben.
TTS: Piper für Offline-Nutzung
- ElevenLabs: Ausgezeichnet, aber 5,57 €/Stunde.
- Cartesia: 1,26 €/Stunde.
- Piper: Akzeptable Qualität, kostenlos, 29 Sprachen.
Kosten und Implementierung
- Deepgram: 200 € Guthaben (Hunderte Stunden).
- Groq: Kostenlos.
- Piper: Offline.
Gesamt ~0 €. Tests auf Meet/Zoom mit einem Team zeigten: Übersetzung ist inhaltlich genau, verliert aber Redewendungen/Sarkasmus. Pipers Stimme klingt roboterhaft (Russisch 'Denis' — wie ein Professor der 1980er). Verzögerung + Netzwerk-Ping = spürbar, aber funktional.
Installation: Elixir für Orchestrierung, Rust für Audio, Flask als Brücke. Funktioniert auf macOS Apple Silicon.
Wichtige Erkenntnisse
- Volle Kompatibilität mit jedem VoIP: Aufnahme auf Treiberebene.
- Verzögerung von 0,8-1,7s dank Deepgram-Streaming + schnellem Groq.
- Kostenlos: 200 € Deepgram-Guthaben für Jahre, Rest Open-Source/kostenlos.
- Kompromisse: Piper klingt roboterhaft, LLM verpasst Nuancen der Konversationssprache.
- Open-Source: Repository für Anpassungen (Elixir/Rust-Stack).
— Editorial Team
Noch keine Kommentare.