Calculadora de Tasa de Error de Palabras

Pegue la transcripción correcta y la que desea puntuar, y obtenga la Tasa de Error de Palabras con las sustituciones, eliminaciones e inserciones marcadas. Se ejecuta en el navegador, por lo que ninguna transcripción se sube.

Amado por más de 8.1 millones de personas

Mide la precisión de la transcripción con WER

Pega la transcripción correcta en una casilla y la transcripción que quieres puntuar en la otra, luego lee la Tasa de Error de Palabras. También obtienes la tasa de error de caracteres, la precisión de palabras y una diferencia palabra por palabra que marca cada sustitución, eliminación e inserción. Todo se ejecuta en el navegador, por lo que ninguna transcripción se carga en ningún lugar.

WER es la forma estándar de cuantificar cuán cerca está una transcripción de la verdad. Es lo que informan los artículos de reconocimiento de voz, lo que los equipos usan para comparar una herramienta de transcripción con otra, y lo que usarías para decidir si una transcripción es lo suficientemente limpia para entregar o necesita otra revisión.

Qué mide realmente la Tasa de Error de Palabras

WER cuenta las ediciones necesarias para convertir la transcripción que estás verificando en la referencia, luego divide por la longitud de la referencia:

WER = (S + D + I) / N

S son sustituciones, una palabra que salió mal. D son eliminaciones, una palabra de referencia que la transcripción omitió. I son inserciones, una palabra extra que la transcripción añadió. N es el número total de palabras en la referencia. La herramienta encuentra el conjunto más pequeño de esas ediciones alineando las dos secuencias de palabras, la misma idea de distancia de edición detrás de los correctores ortográficos, por lo que el recuento es la lectura más justa posible en lugar de una comparación ingenua de izquierda a derecha.

Un WER de 0 significa que los dos coinciden palabra por palabra. Un WER de 0.10 significa una edición por cada diez palabras de referencia. Puede superar 1.0, lo que sorprende a la gente la primera vez: si la transcripción está rellena con muchas más palabras que la referencia, las inserciones por sí solas pueden superar la longitud de la referencia, por lo que un WER del 120 por ciento es un resultado real, no un error.

Cómo calcular el WER

  1. Pega la referencia, la transcripción que sabes que es correcta, en la casilla izquierda. Esto es contra lo que se mide todo, por lo que debe ser la fiable.
  2. Pega la transcripción que quieres puntuar en la casilla derecha.
  3. Elige si ignorar mayúsculas y puntuación, luego lee el WER, CER, la precisión y la diferencia marcada a continuación.

La diferencia es la parte que vale la pena leer. Un solo número te dice cuán mal, la diferencia te dice dónde y por qué. Puedes ver de un vistazo si los errores son malinterpretaciones dispersas o una frase entera omitida, y eso cambia lo que haces a continuación.

Por qué tu WER podría parecer peor de lo que es la transcripción

El WER sin procesar es implacable con cosas que no son realmente errores. «Hello.» y «hello» cuentan como una sustitución si dejas la puntuación y el caso. Lo mismo ocurre con «OK» versus «okay», o «twenty» versus «20». Ninguno de esos cambia el significado, pero cada uno suma al recuento.

Por eso los dos interruptores importan. Ignorar las mayúsculas y la puntuación es la configuración normal para comparar contenido hablado, porque te importa si las palabras son correctas, no si una coma se colocó. Desactívalos cuando el formato sea parte de lo que estás evaluando, por ejemplo, un archivo de subtítulos donde el uso de mayúsculas y la puntuación son el entregable. No hay una única configuración correcta. Lo honesto es elegir uno, mantenerlo igual en cada transcripción que compares y decir cuál usaste.

Números, palabras deletreadas y contracciones son los otros infladores comunes. Si tu referencia escribe «cannot» y la transcripción escribe «can’t», eso es una sustitución aunque un oyente nunca lo notaría. Para un benchmark estricto, primero normalizas ambos lados; para una verificación rápida, los interruptores suelen ser suficientes.

WER, CER y Precisión de Palabras

La precisión de palabras es simplemente 1 - WER, invertida para que un valor más alto sea mejor. Es el número más amigable para un informe, aunque conlleva las mismas advertencias, y se limita a cero porque una transcripción puede ser peor que «todas las palabras incorrectas» una vez que se acumulan las inserciones.

La Tasa de Error de Caracteres realiza el mismo recuento de distancia de edición en caracteres en lugar de palabras. CER es la mejor métrica cuando los límites de las palabras no son fiables, para idiomas que no separan las palabras como lo hace el inglés, o cuando quieres un crédito parcial por una palabra que está casi correcta. «recognize» versus «recognise» es una sustitución completa bajo WER pero una edición de un solo carácter bajo CER, por lo que CER arroja un valor más bajo y a menudo más justo para errores por poco.

Usa WER como titular para el habla en inglés, mira CER cuando un WER bajo aún parezca demasiado severo para errores cercanos, y cita la precisión de palabras cuando entregues un resultado a alguien que no está familiarizado con las tasas de error.

¿Quién Comprueba la Tasa de Error de Palabras?

Los equipos que comparan proveedores de transcripción procesan el mismo audio a través de cada uno, transcriben un fragmento a mano como referencia y puntúan la salida de cada herramienta contra ella. La WER convierte “este se sintió mejor” en un número que pueden defender.

Investigadores y estudiantes que trabajan en reconocimiento de voz informan la WER porque es el estándar compartido. Un cambio de modelo es una mejora solo si la WER disminuye en un conjunto de referencia retenido.

Los equipos de subtitulado y localización verifican la WER antes de que una transcripción pase a traducción o a un archivo de subtítulos, ya que un error en esta etapa se multiplica en las etapas posteriores. Y cualquiera que haya pagado por una transcripción y quiera saber si obtuvo lo que pagó puede medirlo aquí en lugar de adivinar.

Después de Tener el Número

Si la transcripción que estás puntuando resultó tosca y quieres una más limpia para empezar, el generador de transcripciones produce la transcripción con etiquetas de orador, y el verificador de transcripciones de IA corrige una sola transcripción cuando no tienes una referencia contra la cual medir. Para convertir una transcripción puntuada en un archivo de subtítulos una vez que estés satisfecho con ella, el conversor de texto a SRT gestiona la sincronización.

Las grabaciones son transcritas por Whisper Large-v3, y puedes ver los modelos y la configuración detrás de la precisión en la página de precisión.

Preguntas frecuentes

¿Qué es una buena Tasa de Error de Palabras?

Depende completamente del audio. El audio limpio, leído por un solo orador, puede situarse en cifras bajas de un solo dígito, mientras que las grabaciones ruidosas, con varios oradores o fuertemente acentuadas, arrojan cifras mucho más altas para cualquier herramienta. No existe una calificación mínima universal. Compara las herramientas en el mismo audio con la misma referencia y juzga la WER en función de eso, no de un número de un conjunto de datos diferente.

¿Cómo se calcula la WER?

Alineando la transcripción con la referencia para encontrar la menor cantidad de ediciones entre ellas, contando sustituciones, eliminaciones e inserciones, y dividiendo ese total por el número de palabras en la referencia. Esta herramienta realiza la alineación por ti y muestra cada edición en la diferencia.

¿Puede la Tasa de Error de Palabras ser superior al 100%?

Sí. Si la transcripción añade muchas más palabras de las que tiene la referencia, las inserciones por sí solas pueden empujar el total de ediciones más allá de la longitud de la referencia, por lo que la WER supera el 1.0. Una referencia muy corta frente a una transcripción larga y errónea es la forma habitual de verlo.

¿Cuentan las mayúsculas y la puntuación?

Solo si dejas esos interruptores activados. Por defecto, la herramienta ignora ambos, porque para el contenido hablado, la mayoría de la gente se preocupa de que las palabras sean correctas, no de las mayúsculas. Actívalos cuando el formato en sí sea lo que estés evaluando.

¿Cuál es la diferencia entre WER y CER?

WER cuenta los errores en palabras completas, CER los cuenta en caracteres. CER otorga crédito parcial por una palabra que está casi correcta y funciona mejor para idiomas que no separan las palabras con espacios. Para el habla en inglés, WER es el titular habitual y CER es una segunda mirada útil.

¿Es privada mi transcripción?

Sí. Todo el cálculo ocurre en tu navegador con JavaScript. Ni la referencia ni la transcripción que estás puntuando se envían a un servidor, por lo que nada se carga, almacena o registra.

¿Cómo mido la precisión de mi herramienta de transcripción?

Transcribe un clip a mano, o corrige una transcripción cuidadosamente, y úsala como referencia. Pasa el mismo audio por la herramienta que estás probando y pega su salida como la transcripción a puntuar. El WER es la tasa de error de esa herramienta en ese clip. Usa varios clips para una lectura en la que puedas confiar.

FAQ

¿Qué es una buena Tasa de Error de Palabras?

Depende completamente del audio. El audio limpio, leído por un solo orador, puede situarse en cifras bajas de un solo dígito, mientras que las grabaciones ruidosas, con varios oradores o fuertemente acentuadas, arrojan cifras mucho más altas para cualquier herramienta. No existe una calificación mínima universal. Compara las herramientas en el mismo audio con la misma referencia y juzga la WER en función de eso, no de un número de un conjunto de datos diferente. #

¿Cómo se calcula la WER?

Alineando la transcripción con la referencia para encontrar la menor cantidad de ediciones entre ellas, contando sustituciones, eliminaciones e inserciones, y dividiendo ese total por el número de palabras en la referencia. Esta herramienta realiza la alineación por ti y muestra cada edición en la diferencia. #

¿Puede la Tasa de Error de Palabras ser superior al 100%?

Sí. Si la transcripción añade muchas más palabras de las que tiene la referencia, las inserciones por sí solas pueden empujar el total de ediciones más allá de la longitud de la referencia, por lo que la WER supera el 1.0. Una referencia muy corta frente a una transcripción larga y errónea es la forma habitual de verlo. #

¿Cuentan las mayúsculas y la puntuación?

Solo si dejas esos interruptores activados. Por defecto, la herramienta ignora ambos, porque para el contenido hablado, la mayoría de la gente se preocupa de que las palabras sean correctas, no de las mayúsculas. Actívalos cuando el formato en sí sea lo que estés evaluando. #

¿Cuál es la diferencia entre WER y CER?

WER cuenta los errores en palabras completas, CER los cuenta en caracteres. CER otorga crédito parcial por una palabra que está casi correcta y funciona mejor para idiomas que no separan las palabras con espacios. Para el habla en inglés, WER es el titular habitual y CER es una segunda mirada útil. #

¿Es privada mi transcripción?

Sí. Todo el cálculo ocurre en tu navegador con JavaScript. Ni la referencia ni la transcripción que estás puntuando se envían a un servidor, por lo que nada se carga, almacena o registra. #

¿Cómo mido la precisión de mi herramienta de transcripción?

Transcribe un clip a mano, o corrige una transcripción cuidadosamente, y úsala como referencia. Pasa el mismo audio por la herramienta que estás probando y pega su salida como la transcripción a puntuar. El WER es la tasa de error de esa herramienta en ese clip. Usa varios clips para una lectura en la que puedas confiar.

Resultados Reales de Usuarios Reales

Aaron photo

Aaron

Gerente de Proyecto

★★★★★

¡Nuestra experiencia general con ScreenApp ha sido simplemente excelente! Su soporte es fantástico, y ScreenApp es un gran sistema de grabación.

JP photo

JP

Gerente de Operaciones

★★★★★

Finalmente, un grabador de pantalla que no pone marcas de agua en todo. El plan gratuito me da 45 minutos de procesamiento de IA mensual - eso es suficiente para la mayoría de mis videos de entrenamiento.

Trina photo

Trina

Fundadora

★★★★★

Era escéptica sobre otro asistente de notas con IA, pero el generoso nivel gratuito de ScreenApp me conquistó completamente. La calidad es de nivel profesional, y las funciones de IA realmente funcionan como se anuncia. Ahora lo uso para todas mis presentaciones con clientes y demos del equipo.

Kelvin photo

Kelvin

Ingeniero de Software

★★★★★

Las aplicaciones de escritorio y móvil son fantásticas. Grabar reuniones mientras estoy en movimiento nunca ha sido más fácil, y la función de dictado es un gran ahorrador de tiempo.

Millie photo

Millie

Directora

★★★★★

Nuestro equipo se estaba ahogando en comentarios de clientes hasta que encontramos ScreenApp. Ahora grabamos cada presentación y llamada de cliente, y los resúmenes de IA son perfectos.

Tanmay photo

Tanmay

Gurú de Marketing

★★★★★

Hace que grabar y compartir guías sea fácil. Me encanta cómo puedo capturar mi pantalla y convertirla al instante en guías paso a paso en cualquier formato. Inteligente, simple y un uso brillante de la IA.

Sav photo

Sav

Gerente de Proyecto

★★★★★

Los usuarios elogian constantemente nuestra plataforma basada en web que no requiere instalación. Comienza a grabar en segundos, no minutos.

Nate photo

Nate

Creador de Video

★★★★★

La capacidad de transcribir y resumir automáticamente grabaciones es un gran ahorrador de tiempo, convirtiendo contenido de video en datos útiles y buscables.

User
User
User
Únete a 8,179,408+ usuarios

¿Listo para aumentar tu productividad?

Prueba Calculadora de Tasa de Error de Palabras y más de 300 otras características impulsadas por IA gratis.

Empezar Gratis →

Empezar a usar en 60 segundos • No se requiere tarjeta de crédito