Sprechverlauf

Alle artikelen

Limieten van AI-transcriptie: bestandsgrootte, duur en nauwkeurigheid

7 augustus 2026 · 9 min. leestijd

Bestandsgrootte is maar één grens. Opnameduur, bitrate, geluidskwaliteit, sprekers, taal, verwerkingstijd en privacy bepalen mede het resultaat.

AI-transcriptie kan uren spraak omzetten in doorzoekbare tekst, maar elke dienst heeft grenzen. Sommige zijn harde technische beperkingen, zoals een maximale uploadgrootte. Andere zijn praktisch: een bestand kan succesvol worden geüpload en toch zorgvuldige controle vereisen omdat sprekers door elkaar praten, de opname rumoerig is of de woordenschat zeer specialistisch. Het verschil kennen voorkomt mislukte uploads en onrealistische verwachtingen over nauwkeurigheid.

Wat zijn de grenzen van AI-transcriptie?

AI-transcriptie wordt begrensd door bestandsgrootte, opnameduur, verwerkingstijd, geluidskwaliteit, taalondersteuning, sprekeronderscheiding en de hoeveelheid menselijke controle die nodig is. Bij Sprechverlauf gelden momenteel vijf harde grenzen: 100 MiB per geüpload bestand, 30 minuten per bestand, 90 minuten audio per dag, 10 uur audio per kalendermaand en maximaal vijf gestarte transcripties per uur.

LimietWat deze bepaaltPraktische oplossing
BestandsgrootteOf de upload wordt geaccepteerdBestanden boven 100 MiB comprimeren of splitsen
OpnameduurHoeveel audio binnen de limiet pastEen bitrate gebruiken die geschikt is voor spraak
VerwerkingstijdOf het model op tijd klaar isUitzonderlijk lange opnamen splitsen
GeluidskwaliteitNauwkeurigheid van herkenningRuis verminderen en microfoons dichtbij houden
Overlappende stemmenSprekerlabels en tekstAparte sporen opnemen of gesprekken controleren
Taal en jargonNamen en vaktermenDe taal instellen en belangrijke woorden meegeven

Bestandslimiet: 100 MiB per upload

Sprechverlauf accepteert momenteel uploads tot 100 MiB. Dit is een vaste grens: een groter bestand moet vóór de upload worden gecomprimeerd of verdeeld. Ondersteunde formaten zijn onder meer MP3, WAV, M4A, OGG, FLAC en WebM, maar het formaat alleen bepaalt de grootte niet. Bitrate, aantal kanalen, samplefrequentie en compressie maken het verschil.

Hoeveel opname past in 100 MiB?

Er bestaat geen vaste omzetting van megabytes naar minuten. Een compacte spraak-MP3 kan uren bevatten, terwijl een ongecomprimeerde WAV veel sneller dezelfde grootte bereikt. De onderstaande schattingen gaan uit van een constante bitrate en laten een kleine hoeveelheid containermetadata buiten beschouwing; echte bestanden kunnen daarom iets korter zijn.

CoderingGeschatte audio binnen 100 MiBTypisch gebruik
MP3 met 64 kbpsOngeveer 3 u 38 minSpraak waarbij een klein bestand belangrijk is
MP3 met 128 kbpsOngeveer 1 u 49 minGoede algemene instelling voor spraak
MP3 met 192 kbpsOngeveer 1 u 13 minHogere kwaliteit of delen met muziek
Mono-WAV, 16-bit/44,1 kHzOngeveer 20 minOngecomprimeerde montagemaster

Voor gesproken materiaal verkleint een werkkopie als mono-MP3 of M4A de upload vaak sterk zonder informatie te verwijderen die het spraakmodel nodig heeft. Bewaar de originele opname apart en transcribeer de kleinere werkkopie.

Is er een maximale opnameduur?

Sprechverlauf hanteert geen apart betaald minutensaldo of dagelijks duurquotum. In de praktijk vormen bestandsgrootte en verwerkingstijd de bruikbare grens. Een lange opname met een lage bitrate kan onder 100 MiB blijven, maar sessies van meerdere uren opdelen in logische delen vereenvoudigt uploads, beperkt het werk bij een mislukte poging en levert beter hanteerbare transcripties op.

  • Interviews of vergaderingen als één bestand houden wanneer ze gemakkelijk passen en sprekercontinuïteit belangrijk is
  • Conferenties van meerdere uren splitsen per sessie, spreker of agendapunt
  • Lange stiltes en stukken met alleen muziek vóór export verwijderen
  • Bij elke knip enkele seconden context bewaren en niet midden in een zin splitsen
  • Duidelijke bestandsnamen gebruiken zodat de transcriptiedelen in de juiste volgorde blijven

Gebruikslimiet: vijf transcriptiestarts per uur

De gratis dienst staat momenteel maximaal vijf gestarte transcripties per uur toe als technische bescherming tegen misbruik. Dit is geen voorraad betaalde minuten en de limiet wordt niet kleiner voor lange audio. Bereid bij een grote reeks eerst alle bestanden voor, controleer ze en verwerk daarna de belangrijkste opnamen op volgorde, in plaats van starts te verbruiken aan dubbele of onvolledige uploads.

Er bestaat geen eerlijk universeel nauwkeurigheidspercentage

Eén nauwkeurigheidscijfer kan niet elke opname beschrijven. Duidelijke spraak dicht bij de microfoon in een ondersteunde taal is veel eenvoudiger dan een groepsgesprek op afstand met echo, onderbrekingen en vakspecifieke namen. Zelfs een vloeiend leesbare transcriptie kan een verkeerd getal, een eigennaam of een fout sprekerlabel bevatten. Schijnbare leesbaarheid bewijst daarom geen feitelijke juistheid.

  • Achtergrondgeluid kan medeklinkers en woordeinden verbergen
  • Echo en oversturing verwijderen details die software niet betrouwbaar kan reconstrueren
  • Gelijktijdige spraak maakt zowel de tekst als de sprekerstoewijzing moeilijker
  • Accenten, taalwisselingen en zeldzame talen kunnen meer fouten veroorzaken
  • Namen, afkortingen, producttermen en cijfers verdienen handmatige controle
  • Muziek, applaus en lange overlappingen kunnen onbruikbare passages opleveren

Sprekerherkenning is nuttig, maar niet onfeilbaar

Diarisatie bepaalt wie wanneer sprak en staat los van de herkenning van woorden. Duidelijk verschillende stemmen met nette beurtwisselingen worden meestal goed gescheiden. Vergelijkbare stemmen, onderbrekingen van één woord, gedeelde microfoons en gelijktijdige spraak kunnen labels samenvoegen of verwisselen. Luister naar het begin, koppel generieke labels aan echte namen en controleer elke toewijzing die wordt geciteerd of gepubliceerd.

Grenzen van taal en specialistische woordenschat

Meertalige modellen ondersteunen veel talen, maar presteren niet in elke taal hetzelfde. De bekende opnametaal instellen voorkomt onnodige detectiefouten. Voeg voor colleges, onderzoeksinterviews en technische vergaderingen belangrijke namen, afkortingen en vaktermen toe aan het contextveld. Dat helpt het model, maar vervangt geen correctieronde.

Grenzen van verwerking en privacy

Sprechverlauf stuurt de opname voor AI-verwerking naar Replicate. Replicate documenteert een uitvoeringstijdlimiet van 30 minuten voor predictions en verwijdert invoer, uitvoer, bestanden en logs van API-predictions standaard na ongeveer één uur. Sprechverlauf bewaart audio- of transcriptie-inhoud niet permanent op de eigen server; exporteer het resultaat als Word of PDF wanneer u het wilt behouden.

Wanneer menselijke controle nodig blijft

Wanneer fouten gevolgen hebben, kunt u AI-uitvoer het best behandelen als een snelle eerste versie. Controleer citaten aan de hand van de opname, verifieer cijfers en namen en gebruik een gekwalificeerd menselijk proces voor juridische, medische of andere risicovolle inhoud. De juiste vraag is niet alleen of het model het bestand kan transcriberen, maar of het resultaat betrouwbaar genoeg is voor het beoogde doel.

Checklist vóór een lange transcriptie

  • Controleren of het bestand 100 MiB of kleiner is
  • Te grote WAV-bestanden omzetten naar een spraakgeschikte MP3- of M4A-kopie
  • Opnamen van meerdere uren op natuurlijke grenzen splitsen
  • De bekende opnametaal kiezen in plaats van alleen op detectie te vertrouwen
  • Namen en vaktermen als context toevoegen
  • Het juiste aantal sprekers voor diarisatie instellen
  • Controle van citaten, cijfers, namen en gevoelige beweringen inplannen
  • De voltooide transcriptie exporteren voordat u de resultaatpagina verlaat

Bronnen en verdere links