Sprechverlauf

Todos los artículos

Transcribir grabaciones largas: dividirlas bien en lugar de confiar en la suerte

19 de agosto de 2026 · 8 min de lectura

Las clases de dos horas y las jornadas de congreso se transcriben mucho mejor si antes se cortan en los puntos adecuados. Dónde cortar, cómo corregir las marcas de tiempo y qué comandos lo hacen.

Una clase de 90 minutos, una jornada de congreso, una entrevista narrativa larga: estas grabaciones son lo habitual en cuanto se transcribe de forma sistemática. Enviarlas de una sola pieza parece cómodo, hasta que un fallo en el minuto 80 cuesta el archivo entero, la transcripción se vuelve ilegible o se agota el cupo del día. Dividir antes es más rápido y un error cuesta unos minutos en lugar de dos horas.

¿Cuándo merece la pena dividir?

No todo archivo largo hay que trocearlo. Deciden tres preguntas: ¿cabe en los límites del servicio?, ¿necesita atribución de hablantes coherente a lo largo de toda la grabación? y ¿cuánto dolería repetir el proceso? En Sprechverlauf el plan gratuito cubre archivos de hasta 30 minutos, 90 minutos de audio al día y 10 horas al mes, así que las grabaciones más largas hay que dividirlas de todos modos.

DuraciónRecomendaciónMotivo
Hasta 30 minutosDejarla enteraCabe en un archivo y los hablantes se mantienen coherentes
De 30 a 60 minutosDos partes, cortando en una pausaUna parte se puede repetir sin reprocesar todo
De 1 a 3 horasSecciones de 20 a 30 minutosCoincide con puntos del orden del día, pausas o cambios de tema
Jornadas completasUn archivo por ponencia o sesiónCada sección recibe un texto propio y bien nombrado
Grabaciones con pausas largasQuitar el silencio antesAhorra tiempo de proceso y evita tramos vacíos

La regla principal: nunca cortar a mitad de frase

El reconocimiento de voz trabaja con contexto. Si se parte una frase por la mitad, ambas partes lo pierden: la primera se corta y la segunda empieza sin referencia. Se nota sobre todo en tecnicismos y nombres propios, justo donde el modelo depende de las palabras vecinas. Corte en una pausa, preferiblemente donde ya cambia el tema.

  • Cortar entre puntos del orden del día, diapositivas o rondas de preguntas
  • Dejar dos o tres segundos de solape para que no desaparezca ninguna palabra
  • Omitir el saludo, la prueba de sonido y la despedida
  • Eliminar antes la música, los aplausos y los cambios de sala
  • Nombrar las partes en orden: «clase-01», «clase-02», no «nuevo» y «nuevo-final»

Dividir con ffmpeg: bastan dos comandos

ffmpeg es gratuito, funciona en cualquier sistema y no recodifica el audio si no se le pide. Este comando parte un archivo en secciones de 25 minutos (1500 segundos) sin tocar el audio:

  • ffmpeg -i clase.m4a -f segment -segment_time 1500 -c copy parte_%02d.m4a
  • ffmpeg -i clase.wav -ac 1 -b:a 64k clase.mp3 (reduce mucho las grabaciones de voz antes de dividirlas)
  • ffmpeg -i clase.m4a -ss 00:12:30 -to 00:41:00 -c copy fragmento.m4a (extrae una sección concreta)

Mono a 64 kbit/s suena drástico, pero para voz no lo es: el modelo no necesita estéreo ni resolución de música. Una hora de habla cabe holgadamente en unos 30 MB. Conserve el original y trabaje con la copia menor: siempre se divide la copia, nunca el máster.

Dividir sin línea de comandos

Si prefiere no abrir un terminal, Audacity llega igual de lejos: abrir el archivo, seleccionar un tramo y «Archivo → Exportar → Exportar audio seleccionado». La vista de onda tiene una ventaja real: las pausas se ven como zonas estrechas, así que el punto de corte se ve en lugar de adivinarse. En el móvil, las aplicaciones de notas de voz hacen lo mismo de forma más tosca.

Después de dividir: las marcas de tiempo vuelven a cero

Cada transcripción cuenta desde el inicio de su propio archivo. La segunda parte de una clase empieza otra vez en 00:00 aunque en realidad comience en el minuto 25. Al unir las partes hay que sumar el desplazamiento inicial a cada marca de tiempo o todas las referencias apuntarán al lugar equivocado. En archivos SRT y VTT, la mayoría de los editores de subtítulos lo resuelven con una función llamada «shift» o «desplazar tiempos».

  • Anotar el desplazamiento inicial de cada parte antes de perder de vista el archivo original
  • Poner un subtítulo por parte al unir exportaciones de texto
  • Citar siempre con número de parte y tiempo, por ejemplo «parte 2, 07:41»
  • Unir los subtítulos solo después de desplazar los tiempos

Las etiquetas de hablante no se mantienen entre partes

La detección de hablantes analiza cada archivo por separado. «Hablante 1» en la primera parte y «Hablante 1» en la segunda no tienen por qué ser la misma persona: ninguna ejecución sabe de la otra. Es una propiedad del método, no un fallo. En la práctica: escuche los primeros segundos de cada parte y sustituya las etiquetas genéricas por nombres reales antes de unir las secciones.

Cuando la atribución coherente importa más que todo lo demás —una vista judicial o un grupo de discusión con seis personas—, hay buenas razones para no dividir, fijar el número de hablantes y aceptar el tiempo de proceso adicional.

Un orden de trabajo practicable

  • Guardar el original y crear una copia de trabajo en MP3 mono
  • Repasar la grabación una vez y marcar los cortes en las pausas
  • Dividir en secciones de 20 a 30 minutos, numeradas en orden
  • Transcribir sección por sección, indicando antes idioma y términos clave
  • Cambiar las etiquetas de hablante por nombres reales en cada sección
  • Desplazar las marcas de tiempo y unir los textos
  • Comprobar por muestreo cifras, nombres y citas con el audio

Fuentes y enlaces