Mesurer la précision de la transcription avec le WER
Collez la transcription correcte dans une boîte et la transcription que vous voulez évaluer dans l’autre, puis lisez le Taux d’Erreur de Mots. Vous obtenez également le taux d’erreur de caractères, la précision des mots, et une comparaison mot par mot qui marque chaque substitution, suppression et insertion. Tout cela s’exécute dans le navigateur, donc aucune des transcriptions n’est téléchargée.
Le WER est la méthode standard pour quantifier la proximité d’une transcription par rapport à la vérité. C’est ce que rapportent les articles sur la reconnaissance vocale, ce que les équipes utilisent pour comparer un outil de transcription à un autre, et ce que vous utiliseriez pour décider si une transcription est suffisamment propre pour être publiée ou si elle nécessite une autre révision.
Ce que le Taux d’Erreur de Mots mesure réellement
Le WER compte les modifications nécessaires pour transformer la transcription que vous vérifiez en référence, puis divise par la longueur de la référence :
WER = (S + D + I) / N
S représente les substitutions, un mot qui est apparu incorrectement. D représente les suppressions, un mot de référence que la transcription a omis. I représente les insertions, un mot supplémentaire que la transcription a ajouté. N est le nombre total de mots dans la référence. L’outil trouve le plus petit ensemble de ces modifications en alignant les deux séquences de mots, la même idée de distance d’édition derrière les correcteurs orthographiques, de sorte que le compte est la lecture la plus juste possible plutôt qu’une comparaison naïve de gauche à droite.
Un WER de 0 signifie que les deux correspondent mot pour mot. Un WER de 0,10 signifie une modification pour dix mots de référence. Il peut dépasser 1,0, ce qui surprend les gens la première fois : si la transcription contient beaucoup plus de mots que la référence, les insertions seules peuvent être plus nombreuses que la longueur de la référence, donc un WER de 120 % est un résultat réel, pas un bug.
Comment calculer le WER
- Collez la référence, la transcription que vous savez correcte, dans la boîte de gauche. C’est ce à quoi tout est mesuré, elle doit donc être la plus fiable.
- Collez la transcription que vous voulez évaluer dans la boîte de droite.
- Choisissez d’ignorer ou non les majuscules et la ponctuation, puis lisez le WER, le CER, la précision et la différence annotée ci-dessous.
La différence est la partie qui vaut la peine d’être lue. Un seul chiffre vous dit à quel point c’est mauvais, la différence vous dit où et pourquoi. Vous pouvez voir en un coup d’œil si les erreurs sont des méprises éparses ou une phrase entière omise, et cela change ce que vous faites ensuite.
Pourquoi votre WER pourrait paraître pire que la transcription ne l’est
Le WER brut est impitoyable pour des choses qui ne sont pas vraiment des erreurs. « Hello. » et « hello » comptent comme une substitution si vous conservez la ponctuation et la casse. Il en va de même pour « OK » versus « okay », ou « twenty » versus « 20 » (vingt). Aucun de ceux-ci ne change le sens, mais chacun ajoute au compte.
C’est pourquoi les deux options sont importantes. Ignorer les majuscules et la ponctuation est le réglage normal pour comparer le contenu parlé, car ce qui compte, c’est si les mots sont corrects, pas si une virgule est présente. Désactivez-les lorsque le formatage fait partie de ce que vous évaluez, par exemple un fichier de sous-titres où la casse et la ponctuation sont le livrable. Il n’y a pas de réglage unique correct. L’honnêteté est de choisir un réglage, de le conserver identique pour chaque transcription que vous comparez, et de préciser celui que vous avez utilisé.
Les chiffres, les mots épellés et les contractions sont les autres facteurs courants d’augmentation. Si votre référence écrit « cannot » et que la transcription écrit « can’t », c’est une substitution même si un auditeur ne le remarquerait jamais. Pour une référence stricte, vous normalisez d’abord les deux côtés ; pour une vérification rapide, les options sont généralement suffisantes.
WER, CER et Précision des mots
La précision des mots est simplement 1 - WER, inversée pour que plus c’est élevé, mieux c’est. C’est le chiffre le plus convivial pour un rapport, bien qu’il comporte les mêmes mises en garde, et il est plafonné à zéro car une transcription peut être pire que « tous les mots faux » une fois que les insertions s’accumulent.
Le Taux d’Erreur de Caractères effectue le même décompte de distance d’édition sur les caractères au lieu des mots. Le CER est la meilleure métrique lorsque les frontières des mots sont incertaines, pour les langues qui ne séparent pas les mots comme l’anglais, ou lorsque vous voulez un crédit partiel pour un mot qui est presque correct. « recognize » versus « recognise » est une substitution complète sous le WER mais une modification d’un seul caractère sous le CER, donc le CER donne un résultat plus bas et souvent plus juste pour les erreurs proches.
Utilisez le WER comme titre principal pour la parole en anglais, jetez un coup d’œil au CER lorsque un WER bas semble encore trop sévère pour les erreurs proches, et citez la précision des mots lorsque vous présentez un résultat à quelqu’un qui n’est pas habitué aux taux d’erreur.
Qui vérifie le Taux d’Erreur de Mots
Les équipes comparant les fournisseurs de transcription font passer le même audio à travers chacun d’eux, transcrivent un extrait à la main comme référence, et évaluent la sortie de chaque outil par rapport à celle-ci. Le TEM transforme “celui-ci semblait meilleur” en un nombre qu’elles peuvent défendre.
Les chercheurs et les étudiants travaillant sur la reconnaissance vocale rapportent le TEM car c’est l’étalon commun. Une modification de modèle n’est une amélioration que si le TEM diminue sur un ensemble de référence conservé.
Les équipes de sous-titrage et de localisation vérifient le TEM avant qu’une transcription ne soit traduite ou ne devienne un fichier de sous-titres, car une erreur à ce stade se multiplie en aval. Et quiconque a payé pour une transcription et veut savoir s’il en a eu pour son argent peut le mesurer ici au lieu de deviner.
Après avoir obtenu le nombre
Si la transcription que vous évaluez est sortie brute et que vous souhaitez une version plus propre pour commencer, le générateur de transcription produit la transcription avec les étiquettes des locuteurs, et le vérificateur de transcription IA relit une seule transcription lorsque vous n’avez pas de référence à mesurer. Pour transformer une transcription évaluée en un fichier de sous-titres une fois que vous en êtes satisfait, le convertisseur texte en SRT gère le minutage.
Les enregistrements sont transcrits par Whisper Large-v3, et vous pouvez voir les modèles et la configuration derrière la précision sur la page de précision.
Foire aux questions
Qu’est-ce qu’un bon Taux d’Erreur de Mots ?
Cela dépend entièrement de l’audio. L’audio propre, lu par un seul locuteur, peut se situer dans les faibles chiffres, tandis que les enregistrements bruyants, multi-locuteurs ou fortement accentués donnent des résultats beaucoup plus élevés pour chaque outil. Il n’y a pas de note de passage universelle. Comparez les outils sur le même audio avec la même référence, et jugez le TEM par rapport à cela, et non par rapport à un nombre provenant d’un ensemble de données différent.
Comment le TEM est-il calculé ?
En alignant la transcription à la référence pour trouver le moins d’éditions entre elles, en comptant les substitutions, les suppressions et les insertions, et en divisant ce total par le nombre de mots dans la référence. Cet outil effectue l’alignement pour vous et affiche chaque édition dans le diff.
Le Taux d’Erreur de Mots peut-il être supérieur à 100 % ?
Oui. Si la transcription ajoute beaucoup plus de mots que la référence n’en contient, les insertions seules peuvent pousser le total des éditions au-delà de la longueur de la référence, de sorte que le TEM dépasse 1,0. Une référence très courte comparée à une transcription longue et erronée est la façon habituelle de le constater.
La majuscule et la ponctuation comptent-elles ?
Seulement si vous laissez ces bascules activées. Par défaut, l’outil ignore les deux, car pour le contenu parlé, la plupart des gens se soucient de l’exactitude des mots, pas de la casse. Activez-les lorsque le formatage lui-même est ce que vous évaluez.
Quelle est la différence entre WER et CER ?
Le WER compte les erreurs en mots entiers, le CER les compte en caractères. Le CER accorde un crédit partiel pour un mot qui est presque correct et fonctionne mieux pour les langues qui ne séparent pas les mots par des espaces. Pour la parole en anglais, le WER est le titre habituel et le CER est un deuxième examen utile.
Ma transcription est-elle privée ?
Oui. L’intégralité du calcul s’effectue dans votre navigateur avec JavaScript. Ni la référence ni la transcription que vous évaluez ne sont envoyées à un serveur, donc rien n’est téléchargé, stocké ou enregistré.
Comment mesurer la précision de mon outil de transcription ?
Transcribe un extrait à la main, ou corrigez une transcription avec soin, et utilisez-la comme référence. Exécutez le même audio via l’outil que vous testez et collez sa sortie comme transcription à évaluer. Le WER est le taux d’erreur de cet outil sur cet extrait. Utilisez plusieurs extraits pour une lecture fiable.