Mide la precisión de la transcripción con WER
Pega la transcripción correcta en una casilla y la transcripción que quieres puntuar en la otra, luego lee la Tasa de Error de Palabras. También obtienes la tasa de error de caracteres, la precisión de palabras y una diferencia palabra por palabra que marca cada sustitución, eliminación e inserción. Todo se ejecuta en el navegador, por lo que ninguna transcripción se carga en ningún lugar.
WER es la forma estándar de cuantificar cuán cerca está una transcripción de la verdad. Es lo que informan los artículos de reconocimiento de voz, lo que los equipos usan para comparar una herramienta de transcripción con otra, y lo que usarías para decidir si una transcripción es lo suficientemente limpia para entregar o necesita otra revisión.
Qué mide realmente la Tasa de Error de Palabras
WER cuenta las ediciones necesarias para convertir la transcripción que estás verificando en la referencia, luego divide por la longitud de la referencia:
WER = (S + D + I) / N
S son sustituciones, una palabra que salió mal. D son eliminaciones, una palabra de referencia que la transcripción omitió. I son inserciones, una palabra extra que la transcripción añadió. N es el número total de palabras en la referencia. La herramienta encuentra el conjunto más pequeño de esas ediciones alineando las dos secuencias de palabras, la misma idea de distancia de edición detrás de los correctores ortográficos, por lo que el recuento es la lectura más justa posible en lugar de una comparación ingenua de izquierda a derecha.
Un WER de 0 significa que los dos coinciden palabra por palabra. Un WER de 0.10 significa una edición por cada diez palabras de referencia. Puede superar 1.0, lo que sorprende a la gente la primera vez: si la transcripción está rellena con muchas más palabras que la referencia, las inserciones por sí solas pueden superar la longitud de la referencia, por lo que un WER del 120 por ciento es un resultado real, no un error.
Cómo calcular el WER
- Pega la referencia, la transcripción que sabes que es correcta, en la casilla izquierda. Esto es contra lo que se mide todo, por lo que debe ser la fiable.
- Pega la transcripción que quieres puntuar en la casilla derecha.
- Elige si ignorar mayúsculas y puntuación, luego lee el WER, CER, la precisión y la diferencia marcada a continuación.
La diferencia es la parte que vale la pena leer. Un solo número te dice cuán mal, la diferencia te dice dónde y por qué. Puedes ver de un vistazo si los errores son malinterpretaciones dispersas o una frase entera omitida, y eso cambia lo que haces a continuación.
Por qué tu WER podría parecer peor de lo que es la transcripción
El WER sin procesar es implacable con cosas que no son realmente errores. «Hello.» y «hello» cuentan como una sustitución si dejas la puntuación y el caso. Lo mismo ocurre con «OK» versus «okay», o «twenty» versus «20». Ninguno de esos cambia el significado, pero cada uno suma al recuento.
Por eso los dos interruptores importan. Ignorar las mayúsculas y la puntuación es la configuración normal para comparar contenido hablado, porque te importa si las palabras son correctas, no si una coma se colocó. Desactívalos cuando el formato sea parte de lo que estás evaluando, por ejemplo, un archivo de subtítulos donde el uso de mayúsculas y la puntuación son el entregable. No hay una única configuración correcta. Lo honesto es elegir uno, mantenerlo igual en cada transcripción que compares y decir cuál usaste.
Números, palabras deletreadas y contracciones son los otros infladores comunes. Si tu referencia escribe «cannot» y la transcripción escribe «can’t», eso es una sustitución aunque un oyente nunca lo notaría. Para un benchmark estricto, primero normalizas ambos lados; para una verificación rápida, los interruptores suelen ser suficientes.
WER, CER y Precisión de Palabras
La precisión de palabras es simplemente 1 - WER, invertida para que un valor más alto sea mejor. Es el número más amigable para un informe, aunque conlleva las mismas advertencias, y se limita a cero porque una transcripción puede ser peor que «todas las palabras incorrectas» una vez que se acumulan las inserciones.
La Tasa de Error de Caracteres realiza el mismo recuento de distancia de edición en caracteres en lugar de palabras. CER es la mejor métrica cuando los límites de las palabras no son fiables, para idiomas que no separan las palabras como lo hace el inglés, o cuando quieres un crédito parcial por una palabra que está casi correcta. «recognize» versus «recognise» es una sustitución completa bajo WER pero una edición de un solo carácter bajo CER, por lo que CER arroja un valor más bajo y a menudo más justo para errores por poco.
Usa WER como titular para el habla en inglés, mira CER cuando un WER bajo aún parezca demasiado severo para errores cercanos, y cita la precisión de palabras cuando entregues un resultado a alguien que no está familiarizado con las tasas de error.
¿Quién Comprueba la Tasa de Error de Palabras?
Los equipos que comparan proveedores de transcripción procesan el mismo audio a través de cada uno, transcriben un fragmento a mano como referencia y puntúan la salida de cada herramienta contra ella. La WER convierte “este se sintió mejor” en un número que pueden defender.
Investigadores y estudiantes que trabajan en reconocimiento de voz informan la WER porque es el estándar compartido. Un cambio de modelo es una mejora solo si la WER disminuye en un conjunto de referencia retenido.
Los equipos de subtitulado y localización verifican la WER antes de que una transcripción pase a traducción o a un archivo de subtítulos, ya que un error en esta etapa se multiplica en las etapas posteriores. Y cualquiera que haya pagado por una transcripción y quiera saber si obtuvo lo que pagó puede medirlo aquí en lugar de adivinar.
Después de Tener el Número
Si la transcripción que estás puntuando resultó tosca y quieres una más limpia para empezar, el generador de transcripciones produce la transcripción con etiquetas de orador, y el verificador de transcripciones de IA corrige una sola transcripción cuando no tienes una referencia contra la cual medir. Para convertir una transcripción puntuada en un archivo de subtítulos una vez que estés satisfecho con ella, el conversor de texto a SRT gestiona la sincronización.
Las grabaciones son transcritas por Whisper Large-v3, y puedes ver los modelos y la configuración detrás de la precisión en la página de precisión.
Preguntas frecuentes
¿Qué es una buena Tasa de Error de Palabras?
Depende completamente del audio. El audio limpio, leído por un solo orador, puede situarse en cifras bajas de un solo dígito, mientras que las grabaciones ruidosas, con varios oradores o fuertemente acentuadas, arrojan cifras mucho más altas para cualquier herramienta. No existe una calificación mínima universal. Compara las herramientas en el mismo audio con la misma referencia y juzga la WER en función de eso, no de un número de un conjunto de datos diferente.
¿Cómo se calcula la WER?
Alineando la transcripción con la referencia para encontrar la menor cantidad de ediciones entre ellas, contando sustituciones, eliminaciones e inserciones, y dividiendo ese total por el número de palabras en la referencia. Esta herramienta realiza la alineación por ti y muestra cada edición en la diferencia.
¿Puede la Tasa de Error de Palabras ser superior al 100%?
Sí. Si la transcripción añade muchas más palabras de las que tiene la referencia, las inserciones por sí solas pueden empujar el total de ediciones más allá de la longitud de la referencia, por lo que la WER supera el 1.0. Una referencia muy corta frente a una transcripción larga y errónea es la forma habitual de verlo.
¿Cuentan las mayúsculas y la puntuación?
Solo si dejas esos interruptores activados. Por defecto, la herramienta ignora ambos, porque para el contenido hablado, la mayoría de la gente se preocupa de que las palabras sean correctas, no de las mayúsculas. Actívalos cuando el formato en sí sea lo que estés evaluando.
¿Cuál es la diferencia entre WER y CER?
WER cuenta los errores en palabras completas, CER los cuenta en caracteres. CER otorga crédito parcial por una palabra que está casi correcta y funciona mejor para idiomas que no separan las palabras con espacios. Para el habla en inglés, WER es el titular habitual y CER es una segunda mirada útil.
¿Es privada mi transcripción?
Sí. Todo el cálculo ocurre en tu navegador con JavaScript. Ni la referencia ni la transcripción que estás puntuando se envían a un servidor, por lo que nada se carga, almacena o registra.
¿Cómo mido la precisión de mi herramienta de transcripción?
Transcribe un clip a mano, o corrige una transcripción cuidadosamente, y úsala como referencia. Pasa el mismo audio por la herramienta que estás probando y pega su salida como la transcripción a puntuar. El WER es la tasa de error de esa herramienta en ese clip. Usa varios clips para una lectura en la que puedas confiar.