Qué hace el traductor de voz
Este traductor de voz convierte el habla entre 99 idiomas; la calidad de la traducción sigue la tasa de error de palabras del idioma de origen. Sube grabaciones o habla en vivo en el navegador. Sin descarga, sin cuenta, sin límites de minutos.
Arrastra un archivo de audio, obtén texto traducido. Sube MP3, WAV, M4A, MP4, OGG o FLAC. El modelo transcribe el idioma de origen, realiza la traducción al destino que elijas y exporta el resultado como texto plano, SRT o VTT para subtítulos. Los archivos de hasta 3 horas funcionan en una sola pasada.
La traducción en vivo se ejecuta en la misma pestaña del navegador. Haz clic en el micrófono, habla, y el texto traducido aparece en menos de 1.5 segundos. Útil para llamadas de soporte internacionales, reuniones con proveedores y entrevistas bilingües donde esperar a que termine una grabación no es una opción (referencia de latencia de abril de 2026).
Capacidades clave:
- Traducir voz a inglés desde cualquier idioma de origen con detección automática
- Traducción de voz en vivo con menos de 1.5 segundos de retraso
- Subir archivos de audio de hasta 3 horas de duración (MP3, WAV, M4A, MP4, OGG, FLAC)
- Traductor de voz en vivo gratuito para reuniones, llamadas y presentaciones
- Maneja acentos, dialectos y ruido de fondo; WER por idioma en la página de precisión
- Salida de voz para que las traducciones se reproduzcan como audio hablado
- Basado en navegador, sin instalación
- Transcripciones con marca de tiempo para documentación y búsqueda
La herramienta está diseñada para reuniones grabadas, podcasts, entrevistas, llamadas de atención al cliente y contenido de vídeo. Usa el modo en vivo para conversaciones en tiempo real o sube archivos para trabajo por lotes con transcripciones buscables.
Matriz de calidad de pares de idiomas
La calidad de la traducción sigue la calidad de la transcripción. Los pares con baja tasa de error de palabras (WER) en el idioma de origen producen traducciones más limpias porque hay menos entrada distorsionada para que la fase de traducción la interprete. Los números a continuación son del reexamen de WER de abril de 2026.
| Par de idiomas | WER promedio (transcripción) | Calidad de la traducción | Notas |
|---|---|---|---|
| en, es | 4-5% | Excelente | Par de mayor volumen, más entrenado |
| en, pt | 5-6% | Excelente | Variantes brasileña y europea soportadas |
| en, fr | 5-6% | Excelente | Francés de Quebec cubierto |
| en, de | 6-7% | Bueno | Palabras compuestas manejadas correctamente |
| en, ja | 7-8% | Bueno | Puntuación reconstruida |
| en, zh | 7-8% | Bueno | Simplificado y Tradicional |
| en, ko | 7-8% | Bueno | Niveles honoríficos preservados |
| es, pt | 5-6% | Excelente | Alta inteligibilidad mutua |
| en, ar | 9-10% | Aceptable | Solo MSA, cobertura dialectal limitada |
| en, hi | 9-10% | Aceptable | Cambio de código con inglés manejado |
Para los pares no listados, consulta el WER del idioma de origen en la tabla de precisión por idioma y añade aproximadamente un nivel de calidad entre el rango de WER y la traducción final. Los pares en el rango de WER del 10%+ aún producen traducciones útiles para la comprensión general, solo espera más pulido de nombres propios e modismos.
Cómo usar el traductor de voz
La herramienta funciona en tres pasos, ya sea que subas una grabación o hables en vivo.
- Sube archivos de audio (MP3, WAV, M4A, MP4, OGG, FLAC) o haz clic en el micrófono para hablar en vivo
- La IA detecta automáticamente el idioma de origen entre más de 100 opciones
- El habla se convierte a tu idioma objetivo con una precisión del 96%+ y con marcas de tiempo
- Copia el texto o descarga la transcripción traducida
Los idiomas soportados incluyen español, francés, alemán, chino, japonés, coreano, árabe, hindi, portugués, ruso, italiano y holandés, además de más de 90.
El modo de traductor de voz en vivo procesa conversaciones instantáneamente con una latencia inferior a 1.5 segundos. Está diseñado para reuniones de negocios, llamadas de clientes, entrevistas y presentaciones internacionales. Haz clic para hablar y traducir durante una llamada sin cambiar de pestaña.
La entrada de micrófono captura tu voz directamente en el navegador. Haz clic en el botón del micrófono, concede permiso y habla. La IA detecta el idioma, traduce el contenido y muestra el resultado. Funciona en navegadores de escritorio y móviles.
Comparación del Traductor de Voz con Otras Herramientas
| Característica | ScreenApp | Maestra | Sonix | Notta | Speechmatics | Veed.io |
|---|---|---|---|---|---|---|
| Idiomas soportados | 100+ | 125+ | 53 | 58 | 50+ | 125+ |
| Detección automática de idioma de origen | Sí | Sí | Sí | Sí | Sí | Sí |
| Clonación de voz para salida doblada | No (voces TTS) | Sí | No | No | No | Sí |
| Límite de tamaño / duración de archivo | 3 horas por subida | 5 GB por archivo | 4 GB / 5 horas | 2 GB / 5 horas | 2 GB por archivo | 2 GB por archivo |
| Nivel gratuito | 1 grabación, 2 transcripciones, 3 subidas | Prueba de 30 min | Prueba de 30 min | 120 min/mes | 8 horas/mes | |
| Formatos de exportación | TXT, SRT, VTT, DOCX | SRT, VTT, TXT, DOCX | SRT, VTT, TXT, DOCX | TXT, SRT, DOCX, PDF | TXT, SRT, JSON | SRT, VTT, TXT |
| Precio (de pago) | Gratis | $29/mes | $22/hora | $14.99/mes | $0.30/hora API | $24/mes |
Sources, checked 2026-09-12: screenapp.io/pricing
- vs Maestra: Maestra clona la voz de un orador para la reproducción doblada en el idioma de destino, lo cual es útil para la localización de videos. Limita la prueba gratuita a 30 minutos. ScreenApp utiliza voces TTS genéricas en lugar de clonar, pero el uso gratuito no tiene límite de minutos y exporta SRT/VTT directamente.
- vs Sonix: Sonix cubre 53 idiomas y cobra $22 por hora de audio después de la prueba de 30 minutos. ScreenApp cubre 99 idiomas con traducción gratuita, aunque Sonix tiene etiquetas de diarización de altavoces más robustas en grabaciones de reuniones largas.
- vs Notta: Notta ofrece 120 minutos gratuitos al mes en 58 idiomas y exporta SRT para trabajo de vídeo. ScreenApp acepta más formatos de archivo (OGG, FLAC incluidos) y elimina el límite mensual de minutos, mientras que Notta tiene una integración más estrecha con bots de Zoom y Google Meet.
- vs Speechmatics: Speechmatics es un motor de transcripción API-first con un costo de $0.30 por hora de audio y 8 horas gratuitas al mes. Necesita integración por parte de un desarrollador para traducir. ScreenApp funciona en el navegador sin necesidad de código.
- vs Veed.io: Veed.io añade clonación de voz por IA y estilo de subtítulos en pantalla para editores de video, con un nivel gratuito mensual de 30 minutos. ScreenApp se centra en la ruta de traducción de audio a texto y omite la edición de video, pero maneja archivos más largos (3 horas vs 2 GB) sin costo.
Traducción con Salida de Voz
El traductor de voz devuelve transcripciones de texto y audio hablado en el idioma de destino. Después de convertir el habla a texto, reproduce audio de sonido natural utilizando texto a voz.
Características de la salida de voz:
- Pronunciación natural en más de 100 voces de idiomas, incluyendo acentos regionales
- Velocidad de habla ajustable para ralentizar o acelerar el audio traducido
- Selección de género para opciones de voz masculina o femenina en la mayoría de los idiomas
- Reproducción instantánea durante conversaciones en vivo
- Archivos de audio descargables del habla traducida
Usa la salida de voz para el aprendizaje de idiomas, la accesibilidad o cualquier entorno donde leer texto no sea práctico, llamadas telefónicas, conducir o reuniones manos libres. La traducción hablada también ayuda con la pronunciación y la entonación.
Para Quién Es el Traductor de Voz
Los equipos de localización que distribuyen contenido multilingüe pasan locuciones en el idioma original, anuncios y tutoriales de productos a través del traductor para producir archivos SRT para cada mercado de lanzamiento. La cobertura de más de 100 idiomas reduce el número de proveedores necesarios para un único lanzamiento.
Los periodistas que cubren entrevistas en idiomas extranjeros suben grabaciones de campo el mismo día que se capturan. La transcripción y la traducción regresan con marcas de tiempo, de modo que un reportero puede citar una frase a las 00:14:32 sin pagar por un asistente aparte.
Los profesores de idiomas que preparan materiales bilingües insertan un podcast o un clip de noticias en la herramienta y obtienen tanto la transcripción original como la traducción al inglés. Los estudiantes comparan ambos lado a lado, y la exportación SRT se conecta a los reproductores de video del aula.
Los equipos de soporte que gestionan tickets de audio en idiomas no ingleses traducen correos de voz y grabaciones de Zoom de clientes que no hablan el idioma del equipo. El agente lee la transcripción traducida en su mesa de ayuda y responde por escrito sin derivar el ticket a una cola bilingüe.
Qué Se Pierde en la Traducción de Voz
La traducción automática de voz es buena para el significado y más débil en las cosas que rodean el significado. Los modismos, el sarcasmo y los juegos de palabras se aplanan; un chiste que depende de un juego de palabras en el idioma original vuelve como una frase literal y sin gracia. Eso es un límite de la traducción en sí misma, no de esta herramienta específicamente, y vale la pena saberlo antes de confiar en el resultado para cualquier cosa matizada.
Los nombres y los términos técnicos son el otro punto débil. Un apellido que el modelo lee como una palabra común se traduce en lugar de conservarse, y un término especializado puede regresar como su equivalente cotidiano más cercano. Para una conversación informal, nada de esto importa. Para una grabación legal o médica, trate la traducción automática como una primera pasada rápida y haga que un humano revise las partes que tienen un peso real.


