Transkriptionsgenauigkeit mit WER messen
Fügen Sie das korrekte Transkript in ein Feld ein und das Transkript, das Sie bewerten möchten, in das andere, dann lesen Sie die Worterfehlerrate. Sie erhalten außerdem die Zeichenfehlerrate, die Wortgenauigkeit und einen Wort-für-Wort-Diff, der jede Substitution, Löschung und Einfügung markiert. Alles läuft im Browser, sodass keines der Transkripte irgendwo hochgeladen wird.
WER ist die Standardmethode, um die Nähe eines Transkripts zur Wahrheit zu beziffern. Es ist das, was Spracherkennungsartikel berichten, was Teams verwenden, um ein Transkriptionswerkzeug mit einem anderen zu vergleichen, und was Sie verwenden würden, um zu entscheiden, ob ein Transkript sauber genug ist, um ausgeliefert zu werden, oder eine weitere Überarbeitung benötigt.
Was die Worterfehlerrate tatsächlich misst
WER zählt die Bearbeitungsschritte, die nötig sind, um das zu prüfende Transkript in die Referenz umzuwandeln, und teilt diese dann durch die Länge der Referenz:
WER = (S + D + I) / N
S steht für Substitutionen, ein Wort, das falsch war. D steht für Löschungen, ein Referenzwort, das das Transkript weggelassen hat. I steht für Einfügungen, ein zusätzliches Wort, das das Transkript hinzugefügt hat. N ist die Gesamtzahl der Wörter in der Referenz. Das Tool findet die kleinste Menge dieser Bearbeitungen durch die Ausrichtung der beiden Wortsequenzen, die gleiche Idee der Bearbeitungsdistanz, die hinter Rechtschreibprüfungen steckt, sodass die Zählung die fairste mögliche Lesart ist und nicht ein naiver Vergleich von links nach rechts.
Eine WER von 0 bedeutet, dass die beiden Wort für Wort übereinstimmen. Eine WER von 0,10 bedeutet eine Bearbeitung pro zehn Referenzwörtern. Sie kann über 1,0 liegen, was die Leute beim ersten Mal überrascht: Wenn das Transkript mit weitaus mehr Wörtern als die Referenz gefüllt ist, können die Einfügungen allein die Länge der Referenz übersteigen, sodass eine WER von 120 Prozent ein echtes Ergebnis ist und kein Fehler.
Wie man WER berechnet
- Fügen Sie die Referenz, das Transkript, das Sie als korrekt kennen, in das linke Feld ein. Dies ist die Grundlage, an der alles gemessen wird, daher muss es das vertrauenswürdige sein.
- Fügen Sie das Transkript, das Sie bewerten möchten, in das rechte Feld ein.
- Wählen Sie, ob Groß-/Kleinschreibung und Satzzeichen ignoriert werden sollen, und lesen Sie dann die WER, CER, Genauigkeit und den markierten Diff unten.
Der Diff ist der lesenswerte Teil. Eine einzelne Zahl sagt Ihnen, wie schlecht es ist, der Diff sagt Ihnen, wo und warum. Sie können auf einen Blick erkennen, ob die Fehler verstreute Hörfehler oder ein ganzer ausgelassener Satz sind, und das ändert, was Sie als Nächstes tun.
Warum Ihre WER schlechter aussehen könnte, als das Transkript tatsächlich ist
Die rohe WER ist unerbittlich bei Dingen, die eigentlich keine Fehler sind. „Hello.“ und „hello“ zählen als Substitution, wenn Sie Satzzeichen und Groß-/Kleinschreibung beibehalten. Ebenso „OK“ versus „okay“ oder „twenty“ versus „20“. Keines davon ändert die Bedeutung, aber jedes erhöht die Zählung.
Deshalb sind die beiden Umschalter wichtig. Das Ignorieren von Groß-/Kleinschreibung und Satzzeichen ist die normale Einstellung zum Vergleich von gesprochenem Inhalt, da es Ihnen darum geht, ob die Wörter richtig sind, nicht ob ein Komma gesetzt wurde. Schalten Sie sie aus, wenn die Formatierung Teil Ihrer Bewertung ist, zum Beispiel bei einer Untertiteldatei, bei der Groß-/Kleinschreibung und Satzzeichen das Ergebnis sind. Es gibt keine einzelne korrekte Einstellung. Der ehrliche Ansatz ist, eine auszuwählen, sie bei jedem verglichenen Transkript beizubehalten und anzugeben, welche Sie verwendet haben.
Zahlen, ausgeschriebene Wörter und Kontraktionen sind die anderen häufigen Inflationsfaktoren. Wenn Ihre Referenz „cannot“ schreibt und das Transkript „can’t“ schreibt, ist das eine Substitution, auch wenn ein Zuhörer es niemals bemerken würde. Für einen strengen Benchmark normalisieren Sie beide Seiten zuerst; für einen schnellen Plausibilitätstest reichen die Umschalter meistens aus.
WER, CER und Wortgenauigkeit
Die Wortgenauigkeit ist einfach 1 - WER, umgekehrt, sodass ein höherer Wert besser ist. Es ist die freundlichere Zahl für einen Bericht, obwohl sie die gleichen Vorbehalte mit sich bringt, und sie ist auf Null begrenzt, da ein Transkript schlechter als „alle Wörter falsch“ sein kann, sobald sich Einfügungen häufen.
Die Zeichenfehlerrate führt die gleiche Bearbeitungsdistanz-Zählung auf Zeichen statt auf Wörtern durch. CER ist die bessere Metrik, wenn Wortgrenzen unzuverlässig sind, für Sprachen, die Wörter nicht so trennen wie das Englische, oder wenn Sie Teilanerkennung für ein Wort wünschen, das fast richtig ist. „recognize“ versus „recognise“ ist eine vollständige Substitution unter WER, aber eine Ein-Zeichen-Bearbeitung unter CER, daher liest sich CER niedriger und oft fairer bei knappen Fehlern.
Verwenden Sie WER als Überschrift für englische Sprache, werfen Sie einen Blick auf CER, wenn eine niedrige WER bei knappen Fehlern immer noch zu hart erscheint, und zitieren Sie die Wortgenauigkeit, wenn Sie ein Ergebnis jemandem übergeben, der nicht in Fehlerraten lebt.
Wer überprüft die Wortfehlerrate
Teams, die Transkriptionsanbieter vergleichen, lassen dasselbe Audio durch jeden Anbieter laufen, transkribieren einen Clip von Hand als Referenz und bewerten die Ausgabe jedes Tools dagegen. Die WER wandelt „dieses hier fühlte sich besser an“ in eine Zahl um, die sie verteidigen können.
Forscher und Studenten, die an Spracherkennung arbeiten, berichten über die WER, da sie der gemeinsame Maßstab ist. Eine Modelländerung ist nur dann eine Verbesserung, wenn die WER auf einem zurückgehaltenen Referenzdatensatz sinkt.
Untertitelungs- und Lokalisierungsteams überprüfen die WER, bevor ein Transkript zur Übersetzung oder in eine Untertiteldatei geht, da ein Fehler in diesem Stadium sich in den nachfolgenden Schritten vervielfacht. Und jeder, der für eine Transkription bezahlt hat und wissen möchte, ob er das bekommen hat, wofür er bezahlt hat, kann dies hier messen, anstatt zu raten.
Nachdem Sie die Zahl haben
Wenn das Transkript, das Sie bewerten, unsauber war und Sie ein saubereres als Ausgangsbasis wünschen, erstellt der Transkript-Generator das Transkript mit Sprecherbezeichnungen, und der KI-Transkriptionsprüfer korrigiert ein einzelnes Transkript, wenn Sie keine Referenz zum Vergleich haben. Um ein bewertetes Transkript in eine Untertiteldatei umzuwandeln, sobald Sie damit zufrieden sind, übernimmt der Text-zu-SRT-Konverter das Timing.
Aufnahmen werden von Whisper Large-v3 transkribiert, und Sie können die Modelle und die Einrichtung hinter der Genauigkeit auf der Genauigkeitsseite sehen.


