Open-source překladač řeči v reálném čase: sestavení s Elixir, Rust a Deepgram
Komerční služby pro překlad řeči v reálném čase nezvládají bezproblémovou práci v hovorech. Google Meet překládá pouze 6 jazyků se zpožděním 2-3 sekundy a vyžaduje placené předplatné AI Pro. JotMe, Talo a Transync poskytují titulky místo hlasu, fungují pouze v Chrome nebo na konkrétních platformách jako Zoom. Korporátní Palabra, KUDO, Interprefy stojí od 300 $/měsíc a jsou zaměřené na konference.
Fyzická zařízení ztrácejí začátek vět, pletou si slova a nehodí se pro živé rozhovory. Žádné řešení nezajišťuje hlasový překlad v jakékoli aplikaci bez omezení ekosystému.
| Řešení | Cena | Hlas/Titulky | Zpoždění | Jazyky | Platformy |
|---------|------|----------------|----------|-------|-----------|
| Google Meet | Předplatné AI Pro | Hlas | 2-3s | 6 | Pouze Meet |
| JotMe | 10-15 $/měsíc | Titulky | ~1-2s | 77 | Chrome |
| Talo | Předplatné | Titulky + bot | ~2s | 60 | Zoom, Meet |
| Palabra | SaaS | Hlas | ~0.8s | 25+ | Zoom, Meet |
| KUDO | 300+ $/měsíc | Hlas + lidé | ~2-4s | 60+ | Vlastní |
Vlastní pipeline: od STT k TTS
Zachytávání zvuku z mikrofonu, rozpoznávání, překlad, syntéza a směrování do virtuálního mikrofonu. Zpětný tok pro řeč protějšku. Kompletní architektura v3 na Elixir + Rust + Flask (jeden soubor), open-source.
Proces:
- STT: Deepgram Nova-3 přes WebSocket, 258-681 ms, streamování s pauzami.
- Překlad: Groq s llama-3.3-70b, 250-560 ms, prompt na doslovný překlad s tónem.
- TTS: Piper lokálně, 300-500 ms, 29 jazyků offline.
- Zvuk: Virtuální mikrofon/reproduktor pro jakékoli aplikace (Meet, Zoom, Discord).
Celkové zpoždění 0.8-1.7 s — rychlejší než živý překladatel (2-5 s).
Výběr komponent podle benchmarků
STT: Deepgram vs alternativy
- voxtral.c: 15+ s lokálně, závady na Apple Silicon.
- Groq Whisper: ~500 ms, šum v úsecích.
- Deepgram: Streamování, finalizovaný text podle pauz.
LLM-překlad: Groq vede
| Poskytovatel | Zpoždění | Cena | Nevýhody |
|-----------|----------|------|--------|
| Google Translate | 100-300 ms | 20 $/1M | Horší LLM na hovorové řeči |
| DeepL | 200-500 ms | 25 $/měsíc | Předplatné, horší LLM |
| OpenAI | 500-1200 ms | Placené | Pomalu |
| Groq | 250-560 ms | Zdarma | Optimálně |
llama-3.3-70b na LPU-čipech Groq — bezplatná úroveň pro základní úkoly.
TTS: Piper pro offline
- ElevenLabs: Výborně, ale 5.57 $/hod.
- Cartesia: 1.26 $/hod.
- Piper: Přijatelná kvalita, zdarma, 29 jazyků.
Náklady a implementace
- Deepgram: 200 $ kreditů (stovky hodin).
- Groq: Zdarma.
- Piper: Offline.
Celkem ~0 $. Testování na Meet/Zoom s týmem ukázalo: překlad je přesný na smyslu, ale ztrácí idiomy/sarkasmus. Hlas Piper zní roboticky (ruský 'Denis' — jako učitel z 80. let). Zpoždění + síťový ping = znatelné, ale funkční.
Instalace: Elixir pro orchestraci, Rust pro zvuk, Flask jako most. Funguje na macOS Apple Silicon.
Co je důležité
- Plná kompatibilita s jakýmikoli VoIP: zachytávání na úrovni audio-ovladačů.
- Zpoždění 0.8-1.7 s díky streamování Deepgram + rychlému Groq.
- Zdarma: 200 $ kredit Deepgram na roky, zbytek open-source/zdarma.
- Kompromisy: Piper zní jako robot, LLM přehlíží nuance hovorové řeči.
- Open-source: repozitář pro vylepšení (Elixir/Rust stack).
— Editorial Team
Zatím žádné komentáře.