Lange opnames transcriberen: goed splitsen in plaats van hopen
19 augustus 2026 · 8 min. leestijd
Colleges van twee uur en hele congresdagen transcriberen veel betrouwbaarder als je ze eerst op de juiste plekken knipt. Waar je knipt, hoe je tijdstempels herstelt en welke commando's het werk doen.
Een college van 90 minuten, een congresdag, een lang narratief interview: zulke opnames zijn de norm zodra je systematisch transcribeert. Ze in één keer door een model sturen lijkt handig, tot een storing op minuut 80 het hele bestand kost, de transcriptie onleesbaar wordt of het dagtegoed op is. Vooraf splitsen gaat sneller, en een fout kost een paar minuten in plaats van twee uur.
Wanneer loont splitsen?
Niet elk lang bestand hoeft opgedeeld. Drie vragen beslissen: past het bestand binnen de limieten van de dienst, heb je consistente sprekertoewijzing over de hele lengte nodig, en hoe vervelend zou het zijn de verwerking over te doen? Bij Sprechverlauf dekt het gratis plan bestanden tot 30 minuten, 90 minuten audio per dag en 10 uur per maand, dus langere opnames moeten sowieso worden gesplitst.
| Opnameduur | Aanbeveling | Reden |
|---|---|---|
| Tot 30 minuten | In één stuk laten | Past in één bestand en sprekers blijven consistent |
| 30 tot 60 minuten | Twee delen, geknipt op een pauze | Eén deel blijft herhaalbaar zonder alles opnieuw te verwerken |
| 1 tot 3 uur | Secties van 20 tot 30 minuten | Sluit aan bij agendapunten, pauzes of themawisselingen |
| Hele congresdagen | Eén bestand per lezing of sessie | Elke sectie krijgt een eigen, goed benoemde tekst |
| Opnames met lange pauzes | Stilte vooraf verwijderen | Bespaart verwerkingstijd en voorkomt lege stukken |
De belangrijkste regel: nooit midden in een zin knippen
Spraakherkenning werkt met context. Wordt een zin doormidden geknipt, dan missen beide delen die context: het eerste deel breekt af, het tweede begint zonder referentie. Dat merk je vooral bij vaktermen en eigennamen, precies waar het model op omringende woorden leunt. Knip daarom in een pauze, het liefst waar het onderwerp toch al wisselt.
- Knippen tussen agendapunten, dia's of vragenrondes
- Twee à drie seconden overlap laten zodat er geen woord verdwijnt
- Begroeting, geluidscheck en afsluiting gerust weglaten
- Muziek, applaus en ombouwpassages vooraf verwijderen
- Delen op volgorde benoemen: „college-01”, „college-02”, niet „nieuw” en „nieuw-definitief”
Splitsen met ffmpeg: twee commando's volstaan
ffmpeg is gratis, draait overal en hercodeert je audio niet als je daar niet om vraagt. Dit commando knipt een bestand in secties van 25 minuten (1500 seconden) en laat de audio ongemoeid:
- ffmpeg -i college.m4a -f segment -segment_time 1500 -c copy deel_%02d.m4a
- ffmpeg -i college.wav -ac 1 -b:a 64k college.mp3 (verkleint spraakopnames flink voor het splitsen)
- ffmpeg -i college.m4a -ss 00:12:30 -to 00:41:00 -c copy fragment.m4a (haalt gericht één sectie eruit)
Mono op 64 kbit/s klinkt drastisch, maar is voor spraak onproblematisch: het model heeft geen stereobreedte of muziekresolutie nodig. Een uur spraak past ruim in ongeveer 30 MB. Bewaar het origineel en werk met de kleinere kopie — je splitst altijd de kopie, nooit de master.
Splitsen zonder opdrachtregel
Wie liever geen terminal opent, komt met Audacity even ver: bestand openen, bereik selecteren, dan „Bestand → Exporteren → Selectie exporteren”. De golfvormweergave heeft daarbij een echt voordeel: pauzes zijn zichtbaar als smalle stukken, dus je ziet het knippunt in plaats van het te raden. Op de telefoon doen de meegeleverde spraakmemo-apps hetzelfde, zij het grover.
Na het splitsen: tijdstempels beginnen weer op nul
Elke transcriptie telt vanaf het begin van het eigen bestand. Deel twee van een college begint dus weer op 00:00, terwijl het in werkelijkheid op minuut 25 start. Wie de delen samenvoegt, moet bij elk tijdstempel de startverschuiving optellen, anders wijzen alle verwijzingen naar de verkeerde plek. Bij SRT- en VTT-bestanden regelen de meeste ondertitelprogramma's dat met een functie „shift” of „tijden verschuiven”.
- Noteer de startverschuiving van elk deel voordat je het originele bestand uit het oog verliest
- Zet bij het samenvoegen van tekstexports een tussenkop per deel
- Citeer met deelnummer en tijd, bijvoorbeeld „deel 2, 07:41”
- Voeg ondertitels pas samen nadat de tijden zijn verschoven
Sprekerlabels blijven niet gelijk tussen delen
Sprekerherkenning analyseert elk bestand op zichzelf. „Spreker 1” in deel één en „Spreker 1” in deel twee hoeven niet dezelfde persoon te zijn — beide runs weten niets van elkaar. Dat is een eigenschap van de methode, geen fout. In de praktijk: luister de eerste seconden van elk deel en vervang de algemene labels door echte namen voordat je de secties samenvoegt.
Als consistente sprekertoewijzing zwaarder weegt dan al het andere — een zitting, of een groepsgesprek met zes deelnemers — zijn er goede redenen om niet te splitsen, het aantal sprekers vast in te stellen en de extra verwerkingstijd te accepteren.
Een werkbare volgorde
- Origineel bewaren en een werkkopie als mono-MP3 maken
- De opname één keer doorlopen en knippunten op pauzes markeren
- Splitsen in secties van 20 tot 30 minuten, op volgorde genummerd
- Secties één voor één transcriberen, vooraf taal en vaktermen opgeven
- Sprekerlabels per sectie vervangen door echte namen
- Tijdstempels verschuiven en de teksten samenvoegen
- Cijfers, namen en citaten steekproefsgewijs tegen de audio controleren