Realtime Voice Bridge
Traducción de voz bilateral y en tiempo real para Meet, Zoom y Teams.
Estado
Beta funcional en macOS · ~1s de latencia
Agosto 2026 – hoy
Construido con
Enlaces
El problema era mío
Mi inglés es B2 y va mejorando, pero en una entrevista en vivo eso no es lo mismo que soltura. Sabía la respuesta y la perdía en algún punto entre pensarla en español y decirla en inglés. Esa duda se lee como inseguridad, aunque no lo sea.
Así que construí lo que necesitaba: un puente que se sienta entre la videollamada y yo, y traduce en las dos direcciones, en vivo.
Cómo funciona
Dos canales de audio corriendo a la vez. El de entrada captura lo que dicen los demás y me lo devuelve traducido a los auriculares. El de salida toma mi micrófono, lo traduce y empuja la voz traducida hacia la llamada.
El pipeline es voz a texto con Deepgram, traducción con Groq y texto a voz con Cartesia. Python lo sostiene todo y hace el enrutamiento de audio en macOS.
La primera versión no servía
El primer intento usaba Gemini como traductor. Era inestable justo de la forma que mata una herramienta en tiempo real: errores de conexión, fallos al enviar el texto. En un traductor, un segundo caído no es un glitch: es una frase que nunca escuchas.
No lo parcheé. Lo tiré entero y lo reconstruí sobre el stack actual. Esa reconstrucción es lo que lo llevó de demo que a veces funcionaba a beta que de verdad uso.
Dónde está hoy
Beta funcional en macOS, con alrededor de un segundo de latencia de punta a punta. Estoy trabajando en bajar de un segundo, que es el punto en el que una conversación traducida deja de sentirse como una entrevista de radio.