Limieten van AI-transcriptie: bestandsgrootte, duur en nauwkeurigheid
7 augustus 2026 · 9 min. leestijd
Bestandsgrootte is maar één grens. Opnameduur, bitrate, geluidskwaliteit, sprekers, taal, verwerkingstijd en privacy bepalen mede het resultaat.
AI-transcriptie kan uren spraak omzetten in doorzoekbare tekst, maar elke dienst heeft grenzen. Sommige zijn harde technische beperkingen, zoals een maximale uploadgrootte. Andere zijn praktisch: een bestand kan succesvol worden geüpload en toch zorgvuldige controle vereisen omdat sprekers door elkaar praten, de opname rumoerig is of de woordenschat zeer specialistisch. Het verschil kennen voorkomt mislukte uploads en onrealistische verwachtingen over nauwkeurigheid.
Wat zijn de grenzen van AI-transcriptie?
AI-transcriptie wordt begrensd door bestandsgrootte, opnameduur, verwerkingstijd, geluidskwaliteit, taalondersteuning, sprekeronderscheiding en de hoeveelheid menselijke controle die nodig is. Bij Sprechverlauf gelden momenteel vijf harde grenzen: 100 MiB per geüpload bestand, 30 minuten per bestand, 90 minuten audio per dag, 10 uur audio per kalendermaand en maximaal vijf gestarte transcripties per uur.
| Limiet | Wat deze bepaalt | Praktische oplossing |
|---|---|---|
| Bestandsgrootte | Of de upload wordt geaccepteerd | Bestanden boven 100 MiB comprimeren of splitsen |
| Opnameduur | Hoeveel audio binnen de limiet past | Een bitrate gebruiken die geschikt is voor spraak |
| Verwerkingstijd | Of het model op tijd klaar is | Uitzonderlijk lange opnamen splitsen |
| Geluidskwaliteit | Nauwkeurigheid van herkenning | Ruis verminderen en microfoons dichtbij houden |
| Overlappende stemmen | Sprekerlabels en tekst | Aparte sporen opnemen of gesprekken controleren |
| Taal en jargon | Namen en vaktermen | De taal instellen en belangrijke woorden meegeven |
Bestandslimiet: 100 MiB per upload
Sprechverlauf accepteert momenteel uploads tot 100 MiB. Dit is een vaste grens: een groter bestand moet vóór de upload worden gecomprimeerd of verdeeld. Ondersteunde formaten zijn onder meer MP3, WAV, M4A, OGG, FLAC en WebM, maar het formaat alleen bepaalt de grootte niet. Bitrate, aantal kanalen, samplefrequentie en compressie maken het verschil.
Hoeveel opname past in 100 MiB?
Er bestaat geen vaste omzetting van megabytes naar minuten. Een compacte spraak-MP3 kan uren bevatten, terwijl een ongecomprimeerde WAV veel sneller dezelfde grootte bereikt. De onderstaande schattingen gaan uit van een constante bitrate en laten een kleine hoeveelheid containermetadata buiten beschouwing; echte bestanden kunnen daarom iets korter zijn.
| Codering | Geschatte audio binnen 100 MiB | Typisch gebruik |
|---|---|---|
| MP3 met 64 kbps | Ongeveer 3 u 38 min | Spraak waarbij een klein bestand belangrijk is |
| MP3 met 128 kbps | Ongeveer 1 u 49 min | Goede algemene instelling voor spraak |
| MP3 met 192 kbps | Ongeveer 1 u 13 min | Hogere kwaliteit of delen met muziek |
| Mono-WAV, 16-bit/44,1 kHz | Ongeveer 20 min | Ongecomprimeerde montagemaster |
Voor gesproken materiaal verkleint een werkkopie als mono-MP3 of M4A de upload vaak sterk zonder informatie te verwijderen die het spraakmodel nodig heeft. Bewaar de originele opname apart en transcribeer de kleinere werkkopie.
Is er een maximale opnameduur?
Sprechverlauf hanteert geen apart betaald minutensaldo of dagelijks duurquotum. In de praktijk vormen bestandsgrootte en verwerkingstijd de bruikbare grens. Een lange opname met een lage bitrate kan onder 100 MiB blijven, maar sessies van meerdere uren opdelen in logische delen vereenvoudigt uploads, beperkt het werk bij een mislukte poging en levert beter hanteerbare transcripties op.
- Interviews of vergaderingen als één bestand houden wanneer ze gemakkelijk passen en sprekercontinuïteit belangrijk is
- Conferenties van meerdere uren splitsen per sessie, spreker of agendapunt
- Lange stiltes en stukken met alleen muziek vóór export verwijderen
- Bij elke knip enkele seconden context bewaren en niet midden in een zin splitsen
- Duidelijke bestandsnamen gebruiken zodat de transcriptiedelen in de juiste volgorde blijven
Gebruikslimiet: vijf transcriptiestarts per uur
De gratis dienst staat momenteel maximaal vijf gestarte transcripties per uur toe als technische bescherming tegen misbruik. Dit is geen voorraad betaalde minuten en de limiet wordt niet kleiner voor lange audio. Bereid bij een grote reeks eerst alle bestanden voor, controleer ze en verwerk daarna de belangrijkste opnamen op volgorde, in plaats van starts te verbruiken aan dubbele of onvolledige uploads.
Er bestaat geen eerlijk universeel nauwkeurigheidspercentage
Eén nauwkeurigheidscijfer kan niet elke opname beschrijven. Duidelijke spraak dicht bij de microfoon in een ondersteunde taal is veel eenvoudiger dan een groepsgesprek op afstand met echo, onderbrekingen en vakspecifieke namen. Zelfs een vloeiend leesbare transcriptie kan een verkeerd getal, een eigennaam of een fout sprekerlabel bevatten. Schijnbare leesbaarheid bewijst daarom geen feitelijke juistheid.
- Achtergrondgeluid kan medeklinkers en woordeinden verbergen
- Echo en oversturing verwijderen details die software niet betrouwbaar kan reconstrueren
- Gelijktijdige spraak maakt zowel de tekst als de sprekerstoewijzing moeilijker
- Accenten, taalwisselingen en zeldzame talen kunnen meer fouten veroorzaken
- Namen, afkortingen, producttermen en cijfers verdienen handmatige controle
- Muziek, applaus en lange overlappingen kunnen onbruikbare passages opleveren
Sprekerherkenning is nuttig, maar niet onfeilbaar
Diarisatie bepaalt wie wanneer sprak en staat los van de herkenning van woorden. Duidelijk verschillende stemmen met nette beurtwisselingen worden meestal goed gescheiden. Vergelijkbare stemmen, onderbrekingen van één woord, gedeelde microfoons en gelijktijdige spraak kunnen labels samenvoegen of verwisselen. Luister naar het begin, koppel generieke labels aan echte namen en controleer elke toewijzing die wordt geciteerd of gepubliceerd.
Grenzen van taal en specialistische woordenschat
Meertalige modellen ondersteunen veel talen, maar presteren niet in elke taal hetzelfde. De bekende opnametaal instellen voorkomt onnodige detectiefouten. Voeg voor colleges, onderzoeksinterviews en technische vergaderingen belangrijke namen, afkortingen en vaktermen toe aan het contextveld. Dat helpt het model, maar vervangt geen correctieronde.
Grenzen van verwerking en privacy
Sprechverlauf stuurt de opname voor AI-verwerking naar Replicate. Replicate documenteert een uitvoeringstijdlimiet van 30 minuten voor predictions en verwijdert invoer, uitvoer, bestanden en logs van API-predictions standaard na ongeveer één uur. Sprechverlauf bewaart audio- of transcriptie-inhoud niet permanent op de eigen server; exporteer het resultaat als Word of PDF wanneer u het wilt behouden.
Wanneer menselijke controle nodig blijft
Wanneer fouten gevolgen hebben, kunt u AI-uitvoer het best behandelen als een snelle eerste versie. Controleer citaten aan de hand van de opname, verifieer cijfers en namen en gebruik een gekwalificeerd menselijk proces voor juridische, medische of andere risicovolle inhoud. De juiste vraag is niet alleen of het model het bestand kan transcriberen, maar of het resultaat betrouwbaar genoeg is voor het beoogde doel.
Checklist vóór een lange transcriptie
- Controleren of het bestand 100 MiB of kleiner is
- Te grote WAV-bestanden omzetten naar een spraakgeschikte MP3- of M4A-kopie
- Opnamen van meerdere uren op natuurlijke grenzen splitsen
- De bekende opnametaal kiezen in plaats van alleen op detectie te vertrouwen
- Namen en vaktermen als context toevoegen
- Het juiste aantal sprekers voor diarisatie instellen
- Controle van citaten, cijfers, namen en gevoelige beweringen inplannen
- De voltooide transcriptie exporteren voordat u de resultaatpagina verlaat