Cómo transcribir el audio de la computadora en tiempo real
La duda más común de quien empieza a transcribir es esta: "quiero transcribir lo que suena en mi computadora - la voz de la persona en la llamada, el audio del video -, no mi voz en el micrófono". Parece un detalle, pero es la diferencia entre una transcripción que sirve y una que no.
Micrófono vs. audio del sistema
Hay dos fuentes de sonido muy distintas en tu PC:
- Micrófono: capta tu voz y el ambiente a tu alrededor. Es lo que usan la mayoría de las apps de dictado.
- Audio del sistema (o "loopback"): es el sonido que sale de la computadora - la otra persona en la reunión, el narrador del video, la música del reproductor. Ese es el que quieres transcribir cuando se trata de una reunión, una clase o un video.
Transcribir el audio del sistema es lo que permite capturar el habla de quien está del otro lado, sin depender de acercar el micrófono al altavoz (lo que generaría un texto lleno de errores).
Para qué sirve en el día a día
- Reuniones: registrar lo que se dijo en una llamada, incluso en otro idioma.
- Clases y cursos: tener el texto de una videoclase para revisar después.
- Videos y podcasts: convertir contenido hablado en texto buscable.
- Accesibilidad: leer lo que se está diciendo cuando el audio no es una opción.
Cómo transcribir el audio del sistema
En Windows, la captura del audio del sistema es posible de forma nativa (el propio sistema ofrece ese flujo de sonido a las apps que saben pedirlo). Un programa de transcripción capta ese flujo, lo envía a una IA de reconocimiento de voz y devuelve el texto en tiempo real. Los pasos típicos son:
- Abre lo que quieres transcribir (la reunión, el video, la clase).
- En el programa de transcripción, elige capturar el audio de la computadora (no el micrófono).
- Pulsa iniciar - el texto va apareciendo mientras la persona habla.
- Al final, exporta la transcripción para revisar o archivar.
Si el contenido está en otro idioma, puedes ir más allá de la transcripción y traducirlo en vivo: el texto original y la traducción aparecen lado a lado, al instante.
Un punto que suele pasar desapercibido: la privacidad
Como la captura es de tu audio, en tu computadora, ningún bot entra en la reunión como participante. Nadie del otro lado ve un "grabador" en la llamada. En entornos corporativos esto suele ser decisivo, porque los bots de grabación chocan con políticas internas.
Hacerlo en la práctica con Lumespeak
Lumespeak captura el audio del sistema de tu computadora y muestra la transcripción en tiempo real - y, si quieres, la traducción al lado. Funciona con cualquier fuente de sonido (Teams, Meet, Zoom, YouTube, un reproductor de video) y no entra en la llamada. Al final, exportas el texto.
Transcribir el audio de la computadora ya no exige trucos raros. Con la captura del audio del sistema, conviertes cualquier sonido que suena en el PC en texto - y, si lo necesitas, en texto ya traducido.
Lee también: Cómo entender videos y clases en inglés en vivo →