Maak van een Rommelig Transcript Leesbare Tekst
Plak een ruw transcript, het soort dat je krijgt van YouTube-ondertitels, een Zoom .vtt, of een automatisch gegenereerde podcast-export, en het verwijdert de rommel: de tijdstempels, de ondertitel-cue-nummers, de “um” en “uh”, de “SPREKER 1:” labels, en de regels die herhalen. Vervolgens voegt het de gebroken ondertitel-fragmenten weer samen tot paragrafen die je daadwerkelijk kunt lezen.
Het draait volledig in je browser. Het transcript wordt nooit geüpload, wat belangrijk is wanneer hetgeen je opschoont een privé-gesprek of een ongepubliceerd interview is.
Regels, Geen AI, en Waarom Dat Het Punt Is
De meeste tools met “AI” in de naam halen je transcript door een taalmodel om het op te schonen. Dat corrigeert grammatica, maar het betekent ook dat het model stilletjes kan herformuleren wat iemand heeft gezegd. Voor een transcript is dat het enige wat je niet wilt. Een citaat dat “verbeterd” is, is geen citaat meer.
Dit schoont op met eenvoudige patroonregels in plaats daarvan. Het verwijdert precies wat je inschakelt en niets anders. Het zal geen zin herschrijven, interpunctie uitvinden, of een onhandige formulering gladstrijken, dus wat overblijft zijn nog steeds de daadwerkelijke woorden van de spreker, minus de ruis.
De eerlijke afweging: omdat het op regels gebaseerd is, corrigeert het geen grammatica of voegt het geen interpunctie toe zoals een AI-pass dat zou doen. Als je dat wilt, haal het dan daarna door de transcript formatter, die AI gebruikt om sprekersstructuur en leesbaarheid toe te voegen. Eerst opschonen om de rommel te verwijderen, daarna formatteren als je polijstwerk wilt. Ik gebruik de opschoner alleen ongeveer tachtig procent van de tijd, omdat een leesbare paragraaf meestal alles is wat ik nodig heb.
Wat Het Verwijdert
Elk hiervan is een schakelaar, dus je behoudt wat je wilt en laat de rest vallen.
- Tijdstempels en cues. SRT-reeksnummers, de
00:00:04,500 --> 00:00:08,200timinglijnen, deWEBVTT-header, en inline stempels zoals[00:05]of een kale00:01:32. Dit is de “verwijder tijdstempels uit transcript”-taak waar mensen het meest naar zoeken. - Vulwoorden. De duidelijke verbale tics: um, uh, er, hmm, “weet je”, “ik bedoel”. Het telt hoeveel het heeft verwijderd, zodat je de schade kunt zien die de opname heeft veroorzaakt.
- Sprekerlabels. Tags aan het begin van een regel zoals
SPREKER 1:,John:,[Interviewer], en de>>markeringen die Zoom en ondertitelingstools toevoegen. - Herhaalde regels. Automatische ondertitels printen vaak dezelfde regel twee keer wanneer ze opnieuw worden getekend. Opeenvolgende duplicaten worden samengevoegd tot één.
- Gebroken regelafstand. Ondertitels breken elke paar woorden af, dus een zin komt verdeeld over vier regels aan. Samenvoegen voegt ze weer samen en breekt het resultaat op in paragrafen.
Eén weloverwogen keuze die het vermelden waard is: het verwijdert geen “like”, “actually”, “basically”, of “so”. Die lijken op vulwoorden in een lijst, maar ze dragen vaak genoeg een echte betekenis met zich mee dat het verwijderen ervan zinnen verandert. Een opschoner die bewerkt wat je bedoelde is erger dan een die een extra “like” laat staan, dus het laat ze staan.
Schoon een YouTube-, Zoom- of Podcast-transcript op
De drie bronnen die de meeste rommel genereren, zijn de drie die dit het beste aanpakt.
YouTube-ondertitel-dumps komen met een tijdstempel op bijna elke regel en helemaal geen paragrafen. Plak het gekopieerde transcript, schakel tijdstempels in en voeg samen, en je krijgt een blogklaar blok in plaats van een stapel fragmenten van vijf woorden.
Zoom en Teams geven je een .vtt bestand met cue-nummers, timings en een sprekerlabel bij elke beurt. Zet het bestand erin en het komt terug als schone dialoog of vloeiende tekst, het is aan jou of je de sprekernamen wilt behouden.
Podcast- en interviewtranscripten zijn meestal al schoner, maar zitten vol met verbale vulwoorden, omdat mensen nu eenmaal zo praten. Verwijder de “um”s en voeg samen, en de leestijd daalt zonder de inhoud aan te tasten.
Hoe Tijdstempels uit een Transcript in Word te Verwijderen
Mensen zoeken hiernaar omdat ze het proberen te doen met Zoeken en Vervangen in Microsoft Word, met behulp van jokerpatronen om 00:00:00 te matchen. Het werkt, nauwelijks, maar het patroon is onhandig en breekt zodra het tijdstempelformaat verandert tussen het ene bestand en het volgende.
Het plakken van de tekst hier is de snelkoppeling. Het herkent automatisch de veelvoorkomende tijdstempelformaten, SRT, VTT, en kale HH:MM:SS, zodat je geen jokertekenuitdrukking hoeft te schrijven of het vier keer hoeft uit te voeren voor vier formaten. Schoon het hier op, plak het resultaat terug in Word.
Na de opschoning
Zodra het transcript schoon is, hebben de volgende stappen hun eigen tools. Om een goede sprekersstructuur en leesbaarheid met AI toe te voegen, gebruik je de transcript formatter. Om in de eerste plaats een schoon transcript rechtstreeks uit een video- of audiobestand te halen, doet de transcript generator de transcriptie. En om een opgeschoond transcript om te zetten in ondertitels, plaatst de text to SRT converter deze keer de tijdstempels expres terug.
Veelgestelde vragen
Is deze transcriptreiniger gratis?
Ja, en het blijft in je browser. Er is geen aanmelding, geen upload en geen limiet aan het aantal transcripten dat je opschoont, omdat het werk op je apparaat plaatsvindt in plaats van op een server.
Uploadt of bewaart het mijn transcript?
Nee. De opschoning is puur JavaScript dat op de pagina draait, dus de tekst verlaat je browser nooit. Niets wordt ergens naartoe gestuurd, opgeslagen of gelogd, wat de reden is om een lokale reiniger te gebruiken voor een privégesprek of een ongepubliceerd interview.
Hoe verwijder ik alleen de tijdstempels en behoud ik al het andere?
Schakel de schakelaar voor tijdstempels in en de andere uit. Het verwijdert de SRT- en VTT-tijdlijnen, de volgnummers en inline stempels zoals [00:05], en laat de sprekerslabels, opvulwoorden en regeleinden precies zoals ze waren.
Verwijdert het “like” en “actually” als opvulwoorden?
Nee, met opzet. Het verwijdert alleen duidelijke verbale opvulwoorden zoals “uhm” en “eh”. Woorden als “like”, “actually” en “basically” dragen te vaak echte betekenis, dus het verwijderen ervan zou zinnen veranderen. Een reiniger mag niet bewerken wat iemand heeft gezegd.
Welke bestandstypen kan ik opschonen?
Plak elke tekst, of sleep een .srt, .vtt of .txt bestand. De tool leest het bestand lokaal en schoont het op dezelfde manier op als geplakte tekst. Bestanden tot ongeveer 5 MB werken soepel; daarboven kun je beter de tekst plakken.
Is een regelgebaseerde reiniger beter dan een AI-transcriptreiniger?
Ze doen verschillende taken. Een regelgebaseerde reiniger zoals deze verwijdert ruis zonder je woorden te veranderen, wat veiliger is voor citaten en opnames. Een AI-reiniger corrigeert ook grammatica en interpunctie, maar kan herformuleren wat er is gezegd. Maak hier eerst schoon en voer pas daarna een AI-pass uit als je de puntjes op de i wilt zetten.