Saltar al contenido
Aprende IA

Lección 2 de 5 · 40 minutos

Audio y video: transcribir clases, voces y subtítulos

Nacho

Al terminar esta lección
podrás transcribir una clase grabada, resumirla con IA, generar voz en español, crear subtítulos sincronizados y armar un video corto, todo con herramientas gratuitas.

Imagínate que estás en tercer semestre y el profesor de Cálculo habla rapidísimo. Grabas la clase con el celular (con permiso, siempre), pero terminas con un archivo de 90 minutos que nunca vuelves a abrir porque escucharlo otra vez es perder otra hora y media. Al mismo tiempo, tu grupo de trabajo tiene que entregar un video de dos minutos explicando el proyecto, nadie quiere poner la cara ni la voz, y el plazo se vence el viernes.

Esas dos escenas se resuelven hoy con las mismas herramientas y son gratis. La IA ya convierte audio en texto con muy buena calidad en español, ese texto se puede resumir y convertir en guía de estudio, ese guion se puede leer con una voz sintética y ese video se puede subtitular en minutos. En esta lección vas a hacer el recorrido completo: audio → texto → resumen → voz → subtítulos → video. No necesitas tarjeta de crédito ni computador potente: con un celular y una cuenta de Google alcanza. Y también vas a aprender dónde falla la IA, porque una transcripción con errores en los nombres o una voz clonada sin permiso te pueden costar caro.

Cómo hace la IA para "oír": del sonido al texto

Cuando grabas, el micrófono guarda una onda: miles de mediciones por segundo de cómo vibra el aire. Un modelo de transcripción automática (en inglés se le dice speech-to-text o ASR, reconocimiento automático del habla) convierte esa onda en texto. No lo hace letra por letra: parte el audio en pedacitos de milisegundos, los transforma en una especie de imagen del sonido y predice qué secuencia de palabras es la más probable que haya producido ese sonido.

La palabra clave es probable. El modelo no "sabe" lo que dijiste: apuesta. Por eso entiende bien lo común y falla en lo raro. Con audio limpio y español estándar puede acertar casi todo; con ruido de la 30, dos personas hablando encima o un micrófono lejano, empieza a inventar.

El modelo abierto más usado para esto se llama Whisper, es gratuito, funciona en español y viene en varios tamaños (tiny, base, small, medium, large). Entre más grande, transcribe mejor pero se demora más y pide más memoria.

Qué esperar en la práctica, para que no te sorprenda:

  • Nombres propios y siglas: "Nacional" puede quedar bien, pero "Sáenz", "Uniandes", "MinTIC" o "ICFES" salen mal con frecuencia.
  • Fórmulas y símbolos: "equis al cuadrado" queda escrito así, en letras, no como x².
  • Muletillas: quedan todas ("o sea", "entonces", "¿sí me hago entender?").
  • Puntuación: la pone el modelo y a veces parte las frases en lugares raros.
  • Varios hablantes: separar quién dijo qué se llama diarización y las herramientas gratis lo hacen regular o no lo hacen.

Regla de oro: la transcripción es un borrador excelente, no un documento final. Siempre pasas los ojos por encima antes de usarla.

Transcribir una clase: dos caminos gratis

Camino 1 (celular, cero configuración). Muchas apps de notas y grabadoras del propio celular ya transcriben. También puedes abrir Google Docs en el computador, entrar a Herramientas → Escritura por voz, y poner el audio a sonar cerca del micrófono. Funciona, es instantáneo y no requiere instalar nada, pero la calidad baja porque el sonido pasa por el aire dos veces.

Camino 2 (Google Colab, mejor calidad y sigue siendo gratis). Colab te presta un computador de Google por un rato, dentro del navegador. Sirve igual desde un portátil viejo. Los pasos:

1. Entras a Colab con tu cuenta de Google y creas un cuaderno nuevo. 2. En el menú Entorno de ejecución → Cambiar tipo de entorno, eliges GPU (el procesador rápido). Sin GPU también corre, solo que más lento. 3. Subes tu archivo de audio arrastrándolo al panel de archivos del lado izquierdo. 4. Corres dos celdas: una que instala Whisper y otra que transcribe.

Un audio de una hora con el modelo small y GPU suele tardar unos pocos minutos. Si el resultado te queda flojo, subes a medium.

Dos advertencias importantes antes de subir nada. Primera: grabar una clase requiere permiso del profesor, y grabar a personas sin avisar es problemático legal y éticamente; en Colombia el manejo de datos personales está regulado por la Ley 1581 de 2012. Segunda: lo que subes a una herramienta en la nube sale de tu computador. Nunca subas una consulta médica, una entrevista laboral confidencial o audios de menores de edad a un servicio del que no leíste las condiciones. Si el contenido es sensible, corre el modelo localmente en tu propio equipo.

Ejemplo
Celda 1:
```
!pip install -q openai-whisper
```
Celda 2 (cambia el nombre del archivo por el tuyo):
```
!whisper clase.m4a --language Spanish --model small --output_format all
```
Eso genera, en la misma carpeta, el texto plano (`.txt`), los subtítulos (`.srt` y `.vtt`) y una versión con marcas de tiempo. Los descargas con clic derecho → Descargar.

Del transcrito de 9.000 palabras a un resumen que sí sirve

Ya tienes un texto largo, feo y sin formato. Ahora entra el modelo de lenguaje (ChatGPT, Gemini, Claude o el que uses en su plan gratis). Aquí hay tres cosas que cambian el resultado por completo.

Uno: dale el texto, no el link. Si le pasas la URL de un video de YouTube y le pides el resumen, muchas veces no puede verlo y alucina, es decir, se inventa un resumen convincente de un contenido que nunca leyó. Pega el transcrito o sube el archivo.

Dos: si es muy largo, pártelo. Los modelos gratuitos tienen un límite de cuánto texto procesan de una. Si te rebota o responde raro, divide el transcrito en bloques de unas 2.000 palabras, resume cada bloque, y al final le pides que una los resúmenes.

Tres: pide estructura y trazabilidad. Un resumen suelto no sirve para estudiar. Pide conceptos, definiciones, fórmulas mencionadas, lo que el profesor dijo que entra en el parcial, y sobre todo pídele que marque el minuto de cada punto, porque el .srt trae las marcas de tiempo. Así puedes volver al audio a verificar.

Y verifica de verdad. El modelo puede leer mal una palabra mal transcrita y construir encima una explicación coherente pero falsa: si Whisper escribió "varianza" donde el profesor dijo "covarianza", el resumen te va a explicar con total seguridad algo que no es. Revisa siempre las definiciones, los números y las fechas contra el audio original. La IA te ahorra el trabajo mecánico; el criterio sigue siendo tuyo.

Ejemplo
Prompt listo para copiar:

"Te voy a pasar la transcripción automática de una clase universitaria en español. Puede tener errores de reconocimiento en nombres propios y términos técnicos; si algo no te cuadra, márcalo con [¿?] en vez de corregirlo por tu cuenta. Devuélveme: 1) un resumen de máximo 200 palabras; 2) los conceptos clave con su definición tal como la dio el profesor; 3) las fórmulas o datos que mencionó; 4) todo lo que suene a instrucción de evaluación (parcial, entrega, fecha); 5) tres preguntas de repaso con su respuesta. Al lado de cada punto pon el minuto aproximado. Transcripción: ..."

Voz sintética en español: cuándo usarla y cuándo no

TTS (text-to-speech, texto a voz) es el camino contrario: le das texto y te devuelve audio. Las voces de hoy ya no suenan a robot de los noventa; leen con entonación y pausas bastante naturales.

Opciones gratis desde Colombia:

  • Microsoft Edge, función "Leer en voz alta": abres tu texto en el navegador, le das leer, escoges voz en español (según la versión encuentras varias variantes de español latinoamericano) y grabas la salida del sistema con Audacity, que es gratuito y de código abierto. Es la vía más rápida sin instalar casi nada.
  • Editores de video como CapCut o Canva en su plan gratis: pegas el texto en un cuadro y generan la locución dentro del propio proyecto, ya sincronizada con el video.
  • Modelos abiertos que corres en Colab, para quien quiera control total y no depender de la nube de nadie.

Tres trucos para que no suene raro: escribe los números como se pronuncian ("tres mil quinientos pesos", no "$3.500"), rompe las frases largas en frases cortas porque la voz respira donde hay punto, y escribe las siglas separadas ("I C F E S") si el sistema las lee pegadas.

Ahora lo serio. La misma tecnología permite clonar una voz con pocos segundos de muestra. Clonar la voz de otra persona sin su permiso —tu profesor, un familiar, alguien famoso— es una suplantación, y es exactamente el método de las estafas telefónicas del "llamé y era la voz de mi hijo". Las reglas mínimas: usa tu propia voz o voces sintéticas genéricas; si vas a usar la de alguien, pide permiso por escrito; y avisa en el video que la voz es generada con IA. Un letrero de "voz generada con IA" no le quita nada a tu trabajo y te protege.

Subtítulos y video corto: el formato SRT por dentro

Un archivo de subtítulos es un archivo de texto plano, no magia. El formato más común es SRT y lo puedes abrir y editar en el Bloc de notas. Su estructura es un número, una línea de tiempos y el texto:

1
00:00:00,000 --> 00:00:02,400
Hola, en este video les cuento

2
00:00:02,400 --> 00:00:05,100
cómo transcribimos una clase con IA.

Entender esto te da poder: si Whisper escribió mal un nombre, lo corriges ahí mismo con buscar y reemplazar. Si los subtítulos van adelantados, le sumas segundos a los tiempos (Subtitle Edit, gratuito, lo hace de un solo). El otro formato que verás es VTT, prácticamente igual, usado en páginas web.

Buenas prácticas de subtitulado, que casi nadie aplica y se nota:

  • Máximo dos líneas por pantalla y unos 40 caracteres por línea.
  • Que cada subtítulo dure al menos un segundo y medio: si pasa volando, nadie alcanza a leer.
  • Corta las frases donde hay sentido ("la matriz de covarianza / se calcula así"), no a mitad de palabra.
  • Escribe los subtítulos en el mismo idioma del audio; traducir es otra tarea distinta.

Para el video corto, CapCut y Canva en plan gratis hacen lo mismo por caminos parecidos: importas tus clips o imágenes, agregas la locución, y con la función de subtítulos automáticos generas el texto en pantalla. Reviso siempre dos cosas antes de exportar: que los subtítulos no queden tapados por la interfaz de la red social (déjalos en el tercio central) y en qué formato exportas (vertical 9:16 para celular, horizontal 16:9 para YouTube o para proyectar en clase).

Y no lo hagas solo por moda: los subtítulos son accesibilidad real para personas sordas y para todo el que ve videos sin sonido en TransMilenio.

Práctica: De una clase grabada a un video de 60 segundos, hoy mismo

  1. Graba 10 minutos de audio: una clase (con permiso del profesor), una explicación tuya sobre un tema que domines, o un pódcast que ya tengas. Guárdalo en tu computador.

  2. Abre Google Colab con tu cuenta de Google, crea un cuaderno, cambia el entorno de ejecución a GPU y sube el audio arrastrándolo al panel de archivos.

  3. Corre !pip install -q openai-whisper y luego !whisper tu_audio.m4a --language Spanish --model small --output_format all. Descarga el .txt y el .srt que se generaron.

  4. Abre el .srt en el Bloc de notas y corrige a mano cinco errores: nombres propios, siglas o términos técnicos que la IA escribió mal. Fíjate en cómo están escritos los tiempos.

  5. Pega el .txt en un modelo de lenguaje gratuito con el prompt de resumen de la sección 3 y pídele además un guion de 60 segundos (unas 150 palabras) explicando lo más importante.

  6. Convierte ese guion en audio: usa "Leer en voz alta" de Edge grabando con Audacity, o pega el texto directamente en la función de voz de CapCut o Canva.

  7. Arma el video: fondo simple (imágenes, tu pantalla o un color), agrega la locución, genera subtítulos automáticos, revísalos y muévelos al tercio central. Pon un letrero que diga "voz generada con IA".

  8. Exporta en vertical, míralo completo con el sonido apagado para comprobar que se entiende solo con los subtítulos, y compártelo con un compañero para que te diga si algo quedó mal transcrito.

Al terminar tienes: Tienes la transcripción corregida de tu clase, un resumen de estudio con marcas de tiempo, un archivo .srt que sabes editar y un video subtitulado de 60 segundos hecho de principio a fin sin pagar nada.

Dónde se equivoca la gente

  • Dar por buena la transcripción sin leerla, y estudiar de un resumen construido sobre palabras mal reconocidas.Antes de resumir, busca en el texto los nombres propios, siglas, números y términos técnicos, y corrígelos. Pídele al modelo que marque con [¿?] lo que le parezca inconsistente en vez de arreglarlo por su cuenta.
  • Pasarle a la IA el link de un video o de un audio y pedirle el resumen.Muchas veces no puede abrirlo y te entrega un resumen inventado que suena perfecto. Transcribe primero y pega el texto o sube el archivo; si el texto es muy largo, pártelo en bloques y resume por partes.
  • Clonar la voz de alguien, o subir audios con información privada de terceros a una herramienta en la nube.Usa tu propia voz o voces sintéticas genéricas y avisa que el audio es generado con IA. Para contenido sensible (salud, menores, entrevistas confidenciales), corre el modelo localmente y pide permiso por escrito.
  • Dejar los subtítulos tal como salieron: bloques larguísimos, sin puntuación y tapados por los botones de la app.Máximo dos líneas y unos 40 caracteres por línea, mínimo segundo y medio en pantalla, cortes donde hay sentido, y ubícalos en el tercio central. Revisa el video con el sonido apagado antes de publicarlo.

Lo que te llevas

  • La transcripción automática predice el texto más probable a partir del sonido: es un borrador buenísimo, no un documento final, y falla en nombres propios, siglas y audio ruidoso.
  • Whisper es gratuito, funciona bien en español y lo puedes correr desde Google Colab en el navegador, sin instalar nada y sin computador potente.
  • Para resumir, pásale el texto y no el link, pártelo si es muy largo, y pide estructura con marcas de tiempo para poder verificar contra el audio.
  • Las voces sintéticas gratis alcanzan para locuciones profesionales; clonar la voz de otra persona sin permiso es suplantación, y conviene declarar siempre que el audio es generado con IA.
  • Un archivo .srt es texto plano que puedes abrir y corregir en el Bloc de notas: entenderlo te permite arreglar errores y sincronizar sin depender de ninguna herramienta.
  • Todo lo que subes a la nube sale de tu computador: para audio sensible, corre el modelo localmente y respeta la protección de datos personales.

Palabras nuevas

Transcripción automática (ASR / speech-to-text)
Tecnología que convierte audio hablado en texto escrito, prediciendo qué palabras explican mejor el sonido grabado.
Whisper
Modelo abierto y gratuito de transcripción que funciona en español y viene en varios tamaños; entre más grande, más preciso y más lento.
TTS (texto a voz)
Lo contrario de la transcripción: le entregas un texto escrito y te devuelve un audio con una voz sintética leyéndolo.
SRT
Formato de archivo de subtítulos en texto plano: cada bloque tiene un número, la hora de inicio y fin, y el texto que aparece en pantalla.
Diarización
Separar en la transcripción quién dijo cada cosa cuando hay varias personas hablando; las herramientas gratuitas todavía lo hacen de forma limitada.

Quiz de la lección

Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.

Pregunta 1 de 6Transcribes una clase y el texto dice "la matriz de varianza" donde el profesor dijo "covarianza". Le pides el resumen a un modelo de lenguaje. ¿Qué es lo más probable que pase?
Pregunta 2 de 6¿Por qué se recomienda usar el modelo `small` o `medium` de Whisper en vez de `tiny` para una clase universitaria?
Pregunta 3 de 6Vas a subtitular un video de dos minutos para el trabajo final. ¿Cuál de estas decisiones es la correcta?
Pregunta 4 de 6Un compañero quiere clonar la voz de su profesor para una parodia del curso y subirla al grupo de WhatsApp. ¿Cuál es la respuesta correcta?
Pregunta 5 de 6Tienes que transcribir la entrevista de un trabajo de campo donde una persona habla de su historia clínica. ¿Cuál es el camino más responsable?
Pregunta 6 de 6¿Qué ventaja práctica te da entender cómo está hecho por dentro un archivo .srt?

Ya sabes contar algo en video; en la próxima lección vas a aprender a mostrarlo bien, armando presentaciones y piezas de diseño con IA sin que parezcan plantilla genérica.