Maak van een Rommelig Transcript Leesbare Tekst
Plak een ruw transcript, het soort dat je krijgt van YouTube-ondertitels, een Zoom .vtt, of een automatisch gegenereerde podcast-export, en het verwijdert de rommel: de tijdstempels, de ondertitel-cue-nummers, de “um” en “uh”, de “SPREKER 1:” labels, en de regels die herhalen. Vervolgens voegt het de gebroken ondertitel-fragmenten weer samen tot paragrafen die je daadwerkelijk kunt lezen.
Het draait volledig in je browser. Het transcript wordt nooit geüpload, wat belangrijk is wanneer hetgeen je opschoont een privé-gesprek of een ongepubliceerd interview is.
Regels, Geen AI, en Waarom Dat Het Punt Is
De meeste tools met “AI” in de naam halen je transcript door een taalmodel om het op te schonen. Dat corrigeert grammatica, maar het betekent ook dat het model stilletjes kan herformuleren wat iemand heeft gezegd. Voor een transcript is dat het enige wat je niet wilt. Een citaat dat “verbeterd” is, is geen citaat meer.
Dit schoont op met eenvoudige patroonregels in plaats daarvan. Het verwijdert precies wat je inschakelt en niets anders. Het zal geen zin herschrijven, interpunctie uitvinden, of een onhandige formulering gladstrijken, dus wat overblijft zijn nog steeds de daadwerkelijke woorden van de spreker, minus de ruis.
De eerlijke afweging: omdat het op regels gebaseerd is, corrigeert het geen grammatica of voegt het geen interpunctie toe zoals een AI-pass dat zou doen. Als je dat wilt, haal het dan daarna door de transcript formatter, die AI gebruikt om sprekersstructuur en leesbaarheid toe te voegen. Eerst opschonen om de rommel te verwijderen, daarna formatteren als je polijstwerk wilt. Ik gebruik de opschoner alleen ongeveer tachtig procent van de tijd, omdat een leesbare paragraaf meestal alles is wat ik nodig heb.
Wat Het Verwijdert
Elk hiervan is een schakelaar, dus je behoudt wat je wilt en laat de rest vallen.
- Tijdstempels en cues. SRT-reeksnummers, de
00:00:04,500 --> 00:00:08,200timinglijnen, deWEBVTT-header, en inline stempels zoals[00:05]of een kale00:01:32. Dit is de “verwijder tijdstempels uit transcript”-taak waar mensen het meest naar zoeken. - Vulwoorden. De duidelijke verbale tics: um, uh, er, hmm, “weet je”, “ik bedoel”. Het telt hoeveel het heeft verwijderd, zodat je de schade kunt zien die de opname heeft veroorzaakt.
- Sprekerlabels. Tags aan het begin van een regel zoals
SPREKER 1:,John:,[Interviewer], en de>>markeringen die Zoom en ondertitelingstools toevoegen. - Herhaalde regels. Automatische ondertitels printen vaak dezelfde regel twee keer wanneer ze opnieuw worden getekend. Opeenvolgende duplicaten worden samengevoegd tot één.
- Gebroken regelafstand. Ondertitels breken elke paar woorden af, dus een zin komt verdeeld over vier regels aan. Samenvoegen voegt ze weer samen en breekt het resultaat op in paragrafen.
Eén weloverwogen keuze die het vermelden waard is: het verwijdert geen “like”, “actually”, “basically”, of “so”. Die lijken op vulwoorden in een lijst, maar ze dragen vaak genoeg een echte betekenis met zich mee dat het verwijderen ervan zinnen verandert. Een opschoner die bewerkt wat je bedoelde is erger dan een die een extra “like” laat staan, dus het laat ze staan.
Schoon een YouTube-, Zoom- of Podcast-transcript op
De drie bronnen die de meeste rommel genereren, zijn de drie die dit het beste aanpakt.
YouTube-ondertitel-dumps komen met een tijdstempel op bijna elke regel en helemaal geen paragrafen. Plak het gekopieerde transcript, schakel tijdstempels in en voeg samen, en je krijgt een blogklaar blok in plaats van een stapel fragmenten van vijf woorden.
Zoom en Teams geven je een .vtt bestand met cue-nummers, timings en een sprekerlabel bij elke beurt. Zet het bestand erin en het komt terug als schone dialoog of vloeiende tekst, het is aan jou of je de sprekernamen wilt behouden.
Podcast- en interviewtranscripten zijn meestal al schoner, maar zitten vol met verbale vulwoorden, omdat mensen nu eenmaal zo praten. Verwijder de “um”s en voeg samen, en de leestijd daalt zonder de inhoud aan te tasten.
Hoe Tijdstempels uit een Transcript in Word te Verwijderen
Mensen zoeken hiernaar omdat ze het proberen te doen met Zoeken en Vervangen in Microsoft Word, met behulp van jokerpatronen om 00:00:00 te matchen. Het werkt, nauwelijks, maar het patroon is onhandig en breekt zodra het tijdstempelformaat verandert tussen het ene bestand en het volgende.
Het plakken van de tekst hier is de snelkoppeling. Het herkent automatisch de veelvoorkomende tijdstempelformaten, SRT, VTT, en kale HH:MM:SS, zodat je geen jokertekenuitdrukking hoeft te schrijven of het vier keer hoeft uit te voeren voor vier formaten. Schoon het hier op, plak het resultaat terug in Word.
Na de opschoning
Zodra het transcript schoon is, hebben de volgende stappen hun eigen tools. Om een goede sprekersstructuur en leesbaarheid met AI toe te voegen, gebruik je de transcript formatter. Om in de eerste plaats een schoon transcript rechtstreeks uit een video- of audiobestand te halen, doet de transcript generator de transcriptie. En om een opgeschoond transcript om te zetten in ondertitels, plaatst de text to SRT converter deze keer de tijdstempels expres terug.