Sprechverlauf

Tous les articles

Transcrire de longs enregistrements : découper au bon endroit

19 août 2026 · 8 min de lecture

Les cours de deux heures et les journées de conférence se transcrivent bien mieux si on les découpe d'abord aux bons endroits. Où couper, comment recaler les horodatages et quelles commandes le font.

Un cours de 90 minutes, une journée de conférence, un long entretien narratif : ces enregistrements deviennent la norme dès qu'on transcrit régulièrement. Les envoyer d'un seul bloc paraît commode, jusqu'à ce qu'un échec à la 80e minute coûte le fichier entier, que la transcription devienne illisible ou que le quota du jour soit épuisé. Découper avant, c'est plus rapide, et une erreur coûte quelques minutes au lieu de deux heures.

Quand le découpage est-il utile ?

Tous les longs fichiers ne doivent pas être découpés. Trois questions tranchent : le fichier entre-t-il dans les limites du service, avez-vous besoin d'une attribution des locuteurs cohérente sur toute la durée, et à quel point serait-il pénible de relancer le traitement ? Chez Sprechverlauf, l'offre gratuite couvre les fichiers jusqu'à 30 minutes, 90 minutes d'audio par jour et 10 heures par mois : les enregistrements plus longs doivent de toute façon être découpés.

DuréeRecommandationRaison
Jusqu'à 30 minutesLaisser d'un seul tenantTient dans un fichier et les locuteurs restent cohérents
De 30 à 60 minutesDeux parties, coupées sur une pauseUne partie reste rejouable sans tout retraiter
De 1 à 3 heuresSections de 20 à 30 minutesCorrespond aux points de l'ordre du jour ou aux changements de thème
Journées entièresUn fichier par interventionChaque section obtient son propre texte bien nommé
Enregistrements avec longues pausesSupprimer le silence d'abordÉconomise du temps de calcul et évite les passages vides

La règle essentielle : ne jamais couper au milieu d'une phrase

La reconnaissance vocale travaille avec le contexte. Une phrase coupée en deux prive les deux parties de ce contexte : la première s'interrompt, la seconde commence sans référence. Cela se voit surtout sur les termes techniques et les noms propres, précisément là où le modèle s'appuie sur les mots voisins. Coupez donc pendant une pause, idéalement là où le sujet change déjà.

  • Couper entre les points de l'ordre du jour, les diapositives ou les séries de questions
  • Laisser deux à trois secondes de recouvrement pour ne perdre aucun mot
  • Omettre l'accueil, le test technique et les salutations finales
  • Retirer au préalable la musique, les applaudissements et les phases d'installation
  • Nommer les parties dans l'ordre : « cours-01 », « cours-02 », pas « nouveau » et « nouveau-final »

Découper avec ffmpeg : deux commandes suffisent

ffmpeg est gratuit, fonctionne partout et ne réencode pas l'audio si on ne le lui demande pas. Cette commande découpe un fichier en sections de 25 minutes (1500 secondes) sans toucher à l'audio :

  • ffmpeg -i cours.m4a -f segment -segment_time 1500 -c copy partie_%02d.m4a
  • ffmpeg -i cours.wav -ac 1 -b:a 64k cours.mp3 (réduit fortement les enregistrements de parole avant découpage)
  • ffmpeg -i cours.m4a -ss 00:12:30 -to 00:41:00 -c copy extrait.m4a (extrait une section précise)

Le mono à 64 kbit/s paraît radical mais ne pose aucun problème pour la parole : le modèle n'a besoin ni de stéréo ni d'une résolution musicale. Une heure de parole tient largement dans 30 Mo environ. Conservez l'original et travaillez sur la copie : on découpe toujours la copie, jamais le master.

Découper sans ligne de commande

Si vous préférez éviter le terminal, Audacity fait aussi bien : ouvrir le fichier, sélectionner une plage, puis « Fichier → Exporter → Exporter la sélection ». L'affichage de la forme d'onde a un avantage réel : les pauses sont visibles comme des zones étroites, donc on voit le point de coupe au lieu de le deviner. Sur téléphone, les applications de dictaphone font la même chose, en plus grossier.

Après le découpage : les horodatages repartent de zéro

Chaque transcription compte à partir du début de son propre fichier. La deuxième partie d'un cours commence donc de nouveau à 00:00, alors qu'elle démarre en réalité à la 25e minute. En fusionnant les parties, il faut ajouter le décalage initial à chaque horodatage, sinon toutes les références pointent au mauvais endroit. Pour les fichiers SRT et VTT, la plupart des éditeurs de sous-titres proposent une fonction « shift » ou « décaler les temps ».

  • Noter le décalage initial de chaque partie avant de perdre de vue le fichier d'origine
  • Ajouter un intertitre par partie lors de la fusion des exports texte
  • Citer avec le numéro de partie et le temps, par exemple « partie 2, 07:41 »
  • Ne fusionner les sous-titres qu'après avoir décalé les temps

Les étiquettes de locuteurs ne se conservent pas d'une partie à l'autre

La détection des locuteurs analyse chaque fichier isolément. « Locuteur 1 » dans la première partie et « Locuteur 1 » dans la seconde ne sont pas nécessairement la même personne : aucun des deux traitements ne connaît l'autre. C'est une propriété de la méthode, pas un défaut. En pratique : écoutez les premières secondes de chaque partie et remplacez les étiquettes génériques par les vrais noms avant de fusionner.

Quand l'attribution cohérente prime sur tout le reste — une audience, ou une discussion de groupe à six personnes —, il y a de bonnes raisons de ne pas découper, de fixer le nombre de locuteurs et d'accepter le temps de traitement supplémentaire.

Un ordre de travail réaliste

  • Archiver l'original et créer une copie de travail en MP3 mono
  • Parcourir l'enregistrement une fois et marquer les coupes aux pauses
  • Découper en sections de 20 à 30 minutes, numérotées dans l'ordre
  • Transcrire section par section, en indiquant d'abord la langue et les termes clés
  • Remplacer les étiquettes de locuteurs par les vrais noms dans chaque section
  • Décaler les horodatages et fusionner les textes
  • Vérifier par sondage les chiffres, les noms et les citations avec l'audio

Sources et liens complémentaires