Meet Transcriptienauwkeurigheid Met WER
Plak het correcte transcript in het ene vak en het transcript dat je wilt beoordelen in het andere, lees dan de Woordfoutfrequentie. Je krijgt ook de karakterfoutfrequentie, de woordnauwkeurigheid en een woord-voor-woord diff die elke substitutie, verwijdering en invoeging markeert. Het draait allemaal in de browser, dus geen van beide transcripten wordt ergens geüpload.
WER is de standaardmethode om numeriek uit te drukken hoe dicht een transcript bij de waarheid ligt. Het is wat spraakherkenningspapers rapporteren, wat teams gebruiken om het ene transcriptietool met het andere te vergelijken, en wat je zou gebruiken om te beslissen of een transcript schoon genoeg is om te leveren of een nieuwe revisie nodig heeft.
Wat de Woordfoutfrequentie Werkelijk Meet
WER telt de bewerkingen die nodig zijn om het transcript dat je controleert om te zetten in de referentie, en deelt dit vervolgens door de lengte van de referentie:
WER = (S + D + I) / N
S staat voor substituties, een woord dat verkeerd is. D staat voor verwijderingen, een referentiewoord dat het transcript heeft weggelaten. I staat voor invoegingen, een extra woord dat het transcript heeft toegevoegd. N is het totale aantal woorden in de referentie. De tool vindt de kleinste set van deze bewerkingen door de twee woordreeksen uit te lijnen, hetzelfde ‘edit-distance’-idee als achter spellingcontroleurs, zodat de telling de meest eerlijke mogelijke meting is in plaats van een naïeve links-naar-rechts vergelijking.
Een WER van 0 betekent dat de twee woord voor woord overeenkomen. Een WER van 0,10 betekent één bewerking voor elke tien referentiewoorden. Het kan boven de 1,0 uitkomen, wat mensen de eerste keer verrast: als het transcript is aangevuld met veel meer woorden dan de referentie, kunnen de invoegingen alleen al de referentielengte overtreffen, dus een WER van 120 procent is een echt resultaat, geen bug.
Hoe WER te Berekenen
- Plak de referentie, het transcript waarvan je weet dat het correct is, in het linkervak. Dit is waar alles tegen wordt afgemeten, dus dit moet de betrouwbare zijn.
- Plak het transcript dat je wilt beoordelen in het rechtervak.
- Kies of je hoofdletters en interpunctie wilt negeren en lees vervolgens de WER, CER, nauwkeurigheid en de gemarkeerde diff hieronder.
De diff is het deel dat het lezen waard is. Eén enkel getal vertelt je hoe slecht, de diff vertelt je waar en waarom. Je kunt in één oogopslag zien of de fouten verspreide misverstanden zijn of een hele weggelaten zin, en dat verandert wat je vervolgens doet.
Waarom Jouw WER Er Erger Uit Kan Zien Dan Het Transcript Werkelijk Is
Onbewerkte WER is onverbiddelijk over dingen die niet echt fouten zijn. “Hello.” en “hello” tellen als een substitutie als je interpunctie en hoofdletters meeneemt. Zo ook “OK” versus “okay”, of “twenty” versus “20”. Geen van deze verandert de betekenis, maar elk voegt toe aan het totaal.
Daarom zijn de twee schakelaars belangrijk. Het negeren van hoofdletters en interpunctie is de normale instelling voor het vergelijken van gesproken inhoud, omdat je erom geeft of de woorden correct zijn, niet of er een komma is geplaatst. Schakel ze uit wanneer opmaak deel uitmaakt van wat je beoordeelt, bijvoorbeeld een ondertitelbestand waarin hoofdletters en interpunctie het geleverde product zijn. Er is geen enkele correcte instelling. De eerlijke zet is om er één te kiezen, deze hetzelfde te houden voor elk transcript dat je vergelijkt, en te vermelden welke je hebt gebruikt.
Cijfers, uitgeschreven woorden en samentrekkingen zijn de andere veelvoorkomende “opblazers”. Als je referentie “cannot” schrijft en het transcript “can’t”, is dat een substitutie, zelfs al zou een luisteraar het nooit merken. Voor een strikte benchmark normaliseer je eerst beide zijden; voor een snelle controle zijn de schakelaars meestal voldoende.
WER, CER en Woordnauwkeurigheid
Woordnauwkeurigheid is gewoon 1 - WER, omgedraaid zodat hoger beter is. Het is het vriendelijkere getal voor een rapport, hoewel het dezelfde voorbehouden kent, en het is begrensd op nul omdat een transcript slechter kan zijn dan “alle woorden fout” zodra invoegingen zich opstapelen.
Karakterfoutfrequentie (CER) doet dezelfde “edit-distance”-telling op karakters in plaats van woorden. CER is de betere metriek wanneer woordgrenzen onbetrouwbaar zijn, voor talen die woorden niet spatieren zoals het Engels, of wanneer je gedeeltelijke credits wilt voor een woord dat bijna goed is. “recognize” versus “recognise” is een volledige substitutie onder WER, maar een enkel-karakter bewerking onder CER, dus CER leest lager en vaak eerlijker voor bijna-missers.
Gebruik WER als de hoofdmetriek voor Engelse spraak, bekijk CER wanneer een lage WER nog steeds te streng aanvoelt voor bijna-missers, en vermeld woordnauwkeurigheid wanneer je een resultaat overhandigt aan iemand die niet dagelijks met foutpercentages werkt.
Wie controleert Woordfoutpercentage
Teams die transcriptieleveranciers vergelijken, voeren hetzelfde geluid door elk van hen, transcriberen een fragment handmatig als referentie en beoordelen de uitvoer van elke tool daartegen. WER maakt van “deze voelde beter” een cijfer dat ze kunnen verdedigen.
Onderzoekers en studenten die werken aan spraakherkenning rapporteren WER omdat het de gemeenschappelijke maatstaf is. Een modelwijziging is alleen een verbetering als het WER daalt op een niet-gebruikte referentieset.
Ondertitelings- en lokalisatieteams controleren WER voordat een transcript naar vertaling of naar een ondertitelingsbestand gaat, aangezien een fout in dit stadium stroomafwaarts wordt vermenigvuldigd. En iedereen die heeft betaald voor transcriptie en wil weten of ze kregen waarvoor ze betaalden, kan het hier meten in plaats van te gokken.
Nadat u het nummer heeft
Als het transcript dat u beoordeelt ruw bleek te zijn en u een schonere wilt om mee te beginnen, dan produceert de transcript generator het transcript met sprekerlabels, en de AI transcript checker proefleest een enkel transcript wanneer u geen referentie heeft om tegen te meten. Om een beoordeeld transcript om te zetten in een ondertitelingsbestand zodra u er tevreden mee bent, verzorgt de text to SRT converter de timing.
Opnames worden getranscribeerd door Whisper Large-v3, en u kunt de modellen en de opzet achter de nauwkeurigheid zien op de nauwkeurigheidspagina.
Veelgestelde vragen
Wat is een goed Woordfoutpercentage?
Het hangt volledig af van het geluid. Schone, door één spreker voorgelezen audio kan in de lage cijfers belanden, terwijl rumoerige, meerdere sprekers of zwaar geaccentueerde opnames veel hoger uitvallen voor elke tool. Er is geen universele acceptatienorm. Vergelijk tools op dezelfde audio met dezelfde referentie, en beoordeel het WER daartegen, niet tegen een cijfer van een andere dataset.
Hoe wordt WER berekend?
Door het transcript uit te lijnen met de referentie om de minste bewerkingen daartussen te vinden, door substituties, verwijderingen en invoegingen te tellen, en dat totaal te delen door het aantal woorden in de referentie. Deze tool voert de uitlijning voor u uit en toont elke bewerking in de diff.
Kan het Woordfoutpercentage meer dan 100% zijn?
Ja. Als het transcript veel meer woorden toevoegt dan de referentie heeft, kunnen de invoegingen alleen al het totale aantal bewerkingen voorbij de referentielengte duwen, waardoor het WER boven 1,0 uitkomt. Een zeer korte referentie tegen een lang, fout transcript is de gebruikelijke manier om dit te zien.
Tellen hoofdletters en interpunctie mee?
Alleen als u die schakelaars aan laat staan. Standaard negeert de tool beide, omdat de meeste mensen bij gesproken inhoud erom geven of de woorden kloppen, niet de hoofdletters. Zet ze aan wanneer de opmaak zelf is wat u beoordeelt.
Wat is het verschil tussen WER en CER?
WER telt fouten in hele woorden, CER telt ze in tekens. CER geeft gedeeltelijke credit voor een woord dat bijna goed is en werkt beter voor talen die woorden niet scheiden met spaties. Voor Engelse spraak is WER de gebruikelijke hoofdmaatstaf en CER is een nuttige tweede blik.
Is mijn transcript privé?
Ja. De hele berekening vindt plaats in uw browser met JavaScript. Noch de referentie, noch het transcript dat u beoordeelt, wordt naar een server gestuurd, dus er wordt niets geüpload, opgeslagen of gelogd.
Hoe meet ik de nauwkeurigheid van mijn transcriptietool?
Transcribeer een fragment handmatig, of corrigeer één transcript zorgvuldig, en gebruik dat als referentie. Laat dezelfde audio door de tool lopen die u test en plak de uitvoer ervan als het te beoordelen transcript. De WER is het foutenpercentage van die tool op dat fragment. Gebruik meerdere fragmenten voor een betrouwbare meting.