Todos los proyectos

Realtime Voice Bridge

Traducción de voz bilateral y en tiempo real para Meet, Zoom y Teams.

Estado

Beta funcional en macOS · ~1s de latencia

Agosto 2026 – hoy

Construido con

  • Python
  • Deepgram
  • Groq
  • Cartesia
  • Audio en tiempo real
  • macOS

Enlaces

El problema era mío

Mi inglés es B2 y va mejorando, pero en una entrevista en vivo eso no es lo mismo que soltura. Sabía la respuesta y la perdía en algún punto entre pensarla en español y decirla en inglés. Esa duda se lee como inseguridad, aunque no lo sea.

Así que construí lo que necesitaba: un puente que se sienta entre la videollamada y yo, y traduce en las dos direcciones, en vivo.

Cómo funciona

Dos canales de audio corriendo a la vez. El de entrada captura lo que dicen los demás y me lo devuelve traducido a los auriculares. El de salida toma mi micrófono, lo traduce y empuja la voz traducida hacia la llamada.

El pipeline es voz a texto con Deepgram, traducción con Groq y texto a voz con Cartesia. Python lo sostiene todo y hace el enrutamiento de audio en macOS.

La primera versión no servía

El primer intento usaba Gemini como traductor. Era inestable justo de la forma que mata una herramienta en tiempo real: errores de conexión, fallos al enviar el texto. En un traductor, un segundo caído no es un glitch: es una frase que nunca escuchas.

No lo parcheé. Lo tiré entero y lo reconstruí sobre el stack actual. Esa reconstrucción es lo que lo llevó de demo que a veces funcionaba a beta que de verdad uso.

Dónde está hoy

Beta funcional en macOS, con alrededor de un segundo de latencia de punta a punta. Estoy trabajando en bajar de un segundo, que es el punto en el que una conversación traducida deja de sentirse como una entrevista de radio.