Woordfoutpercentage Calculator

Plak het correcte transcript en het transcript dat u wilt beoordelen, en ontvang het Woordfoutpercentage met de substituties, deleties en inserties gemarkeerd. Het draait in de browser, dus geen van beide transcripten wordt geüpload.

Twee transcripten vergelijken
Referentie (de juiste)
0 words
Transcript om te scoren
0 words
Normalize

Opnames zijn versleuteld tijdens verzending en opslag, en worden niet gebruikt om AI-modellen te trainen. Privacy · Beveiliging

Meet Transcriptienauwkeurigheid Met WER

Plak het correcte transcript in het ene vak en het transcript dat u wilt beoordelen in het andere, lees dan het Woordfoutpercentage. U krijgt ook de karakterfoutfrequentie, de woordnauwkeurigheid en een woord-voor-woord diff die elke substitutie, deletie en insertie markeert. Het draait allemaal in de browser, dus geen van beide transcripten wordt ergens geüpload.

WER is de standaardmethode om numeriek uit te drukken hoe dicht een transcript bij de waarheid ligt. Het is wat spraakherkenningspapers rapporteren, wat teams gebruiken om het ene transcriptietool met het andere te vergelijken, en wat u zou gebruiken om te beslissen of een transcript schoon genoeg is om te leveren of een nieuwe revisie nodig heeft.

Wat het Woordfoutpercentage Werkelijk Meet

WER telt de bewerkingen die nodig zijn om het transcript dat u controleert om te zetten in de referentie, en deelt dit vervolgens door de lengte van de referentie:

WER = (S + D + I) / N

S staat voor substituties, een woord dat verkeerd is. D staat voor deleties, een referentiewoord dat het transcript heeft weggelaten. I staat voor inserties, een extra woord dat het transcript heeft toegevoegd. N is het totale aantal woorden in de referentie. De tool vindt de kleinste set van deze bewerkingen door de twee woordreeksen uit te lijnen, hetzelfde ‘edit-distance’-idee als achter spellingcontroleurs, zodat de telling de meest eerlijke mogelijke meting is in plaats van een naïeve links-naar-rechts vergelijking.

Een WER van 0 betekent dat de twee woord voor woord overeenkomen. Een WER van 0,10 betekent één bewerking voor elke tien referentiewoorden. Het kan boven de 1,0 uitkomen, wat mensen de eerste keer verrast: als het transcript is aangevuld met veel meer woorden dan de referentie, kunnen de inserties alleen al de referentielengte overtreffen, dus een WER van 120 procent is een echt resultaat, geen bug.

Hoe WER te Berekenen

  1. Plak de referentie, het transcript waarvan u weet dat het correct is, in het linkervak. Dit is waar alles tegen wordt afgemeten, dus dit moet de betrouwbare zijn.
  2. Plak het transcript dat u wilt beoordelen in het rechtervak.
  3. Kies of u hoofdletters en interpunctie wilt negeren, en lees vervolgens de WER, CER, nauwkeurigheid en de gemarkeerde diff hieronder.

De diff is het deel dat het lezen waard is. Eén enkel getal vertelt u hoe slecht, de diff vertelt u waar en waarom. U kunt in één oogopslag zien of de fouten verspreide misverstanden zijn of een hele weggelaten zin, en dat verandert wat u vervolgens doet.

Waarom Uw WER Er Erger Uit Kan Zien Dan Het Transcript Werkelijk Is

Onbewerkte WER is onverbiddelijk over dingen die niet echt fouten zijn. “Hello.” en “hello” tellen als een substitutie als u interpunctie en hoofdletters meeneemt. Zo ook “OK” versus “okay”, of “twenty” versus “20”. Geen van deze verandert de betekenis, maar elk voegt toe aan het totaal.

Daarom zijn de twee schakelaars belangrijk. Het negeren van hoofdletters en interpunctie is de normale instelling voor het vergelijken van gesproken inhoud, omdat u erom geeft of de woorden correct zijn, niet of er een komma is geplaatst. Schakel ze uit wanneer opmaak deel uitmaakt van wat u beoordeelt, bijvoorbeeld een ondertitelbestand waarin hoofdletters en interpunctie het geleverde product zijn. Er is geen enkele correcte instelling. De eerlijke zet is om er één te kiezen, deze hetzelfde te houden voor elk transcript dat u vergelijkt, en te vermelden welke u hebt gebruikt.

Cijfers, uitgeschreven woorden en samentrekkingen zijn de andere veelvoorkomende ‘opblazers’. Als uw referentie “cannot” schrijft en het transcript “can’t”, is dat een substitutie, zelfs al zou een luisteraar het nooit merken. Voor een strikte benchmark normaliseert u eerst beide zijden; voor een snelle controle zijn de schakelaars meestal voldoende.

WER, CER en Woordnauwkeurigheid

Woordnauwkeurigheid is gewoon 1 - WER, omgedraaid zodat hoger beter is. Het is het vriendelijkere getal voor een rapport, hoewel het dezelfde voorbehouden kent, en het is begrensd op nul omdat een transcript slechter kan zijn dan “alle woorden fout” zodra inserties zich opstapelen.

Karakterfoutfrequentie (CER) doet dezelfde ‘edit-distance’-telling op karakters in plaats van woorden. CER is de betere metriek wanneer woordgrenzen onbetrouwbaar zijn, voor talen die woorden niet spatieren zoals het Engels, of wanneer u gedeeltelijke credits wilt voor een woord dat bijna goed is. “recognize” versus “recognise” is een volledige substitutie onder WER, maar een enkel-karakter bewerking onder CER, dus CER leest lager en vaak eerlijker voor bijna-missers.

Gebruik WER als de hoofdmetriek voor Engelse spraak, bekijk CER wanneer een lage WER nog steeds te streng aanvoelt voor bijna-missers, en vermeld woordnauwkeurigheid wanneer u een resultaat overhandigt aan iemand die niet dagelijks met foutpercentages werkt.

Wie Controleert Woordfoutpercentage

Teams die transcriptieleveranciers vergelijken, voeren hetzelfde geluid door elk van hen, transcriberen een fragment handmatig als referentie en beoordelen de uitvoer van elke tool daartegen. WER maakt van “deze voelde beter” een cijfer dat ze kunnen verdedigen.

Onderzoekers en studenten die werken aan spraakherkenning rapporteren WER omdat het de gemeenschappelijke maatstaf is. Een modelwijziging is alleen een verbetering als het WER daalt op een niet-gebruikte referentieset.

Ondertitelings- en lokalisatieteams controleren WER voordat een transcript naar vertaling of naar een ondertitelingsbestand gaat, aangezien een fout in dit stadium stroomafwaarts wordt vermenigvuldigd. En iedereen die heeft betaald voor transcriptie en wil weten of ze kregen waarvoor ze betaalden, kan het hier meten in plaats van te gokken.

Nadat U Het Nummer Hebt

Als het transcript dat u beoordeelt ruw bleek te zijn en u een schonere wilt om mee te beginnen, dan produceert de transcript generator het transcript met sprekerlabels, en de AI transcript checker proefleest een enkel transcript wanneer u geen referentie hebt om tegen te meten. Om een beoordeeld transcript om te zetten in een ondertitelingsbestand zodra u er tevreden mee bent, verzorgt de text to SRT converter de timing.

Zie de huidige transcriptiemodellen en meetmethode.

FAQ

Wat is een goed Woordfoutpercentage?

Het hangt volledig af van de audio. Schone, door één spreker voorgelezen audio kan in de lage cijfers belanden, terwijl rumoerige, meerdere sprekers, of zwaar geaccentueerde opnames veel hoger uitvallen voor elke tool. Er is geen universele acceptatienorm. Vergelijk tools op dezelfde audio met dezelfde referentie, en beoordeel het WER daartegen, niet tegen een cijfer van een andere dataset.

Hoe wordt WER berekend?

Door het transcript uit te lijnen met de referentie om de minste bewerkingen daartussen te vinden, door substituties, deleties en inserties te tellen, en dat totaal te delen door het aantal woorden in de referentie. Deze tool voert de uitlijning voor u uit en toont elke bewerking in de diff.

Kan het Woordfoutpercentage meer dan 100% zijn?

Ja. Als het transcript veel meer woorden toevoegt dan de referentie heeft, kunnen de inserties alleen al het totale aantal bewerkingen voorbij de referentielengte duwen, waardoor het WER boven 1,0 uitkomt. Een zeer korte referentie tegen een lang, fout transcript is de gebruikelijke manier om dit te zien.

Tellen hoofdletters en interpunctie mee?

Alleen als u die schakelaars aan laat staan. Standaard negeert de tool beide, omdat voor gesproken inhoud de meeste mensen erom geven of de woorden kloppen, niet de hoofdletters. Zet ze aan wanneer de opmaak zelf is wat u beoordeelt.

Wat is het verschil tussen WER en CER?

WER telt fouten in hele woorden, CER telt ze in karakters. CER geeft gedeeltelijke credit voor een woord dat bijna goed is en werkt beter voor talen die woorden niet scheiden met spaties. Voor Engelse spraak is WER de gebruikelijke hoofdmaatstaf en CER is een nuttige tweede blik.

Is mijn transcript privé?

Ja. De hele berekening vindt plaats in uw browser met JavaScript. Noch de referentie, noch het transcript dat u beoordeelt, wordt naar een server gestuurd, dus er wordt niets geüpload, opgeslagen of gelogd.

Hoe meet ik de nauwkeurigheid van mijn transcriptietool?

Transcribeer een fragment handmatig, of corrigeer één transcript zorgvuldig, en gebruik dat als referentie. Laat dezelfde audio door de tool lopen die u test en plak de uitvoer ervan als het te beoordelen transcript. De WER is het foutenpercentage van die tool op dat fragment. Gebruik meerdere fragmenten voor een betrouwbare meting.

Echte resultaten van echte gebruikers

works like a charm, notes have been super helpful alongside chat function. loveeeee
KS
Katharine Suy
Chrome Web Store, October 17, 2024
nice app for important summary
S
SAHIL
Google Play, January 30, 2026

Klaar om uw productiviteit te verhogen?

Start Woordfoutpercentage Calculator met een gratis account. Gebruikslimieten gelden; app-downloads vereisen een betaald abonnement.

Gratis beginnen →

Begin in 60 seconden met gebruiken