Etiqueta a los Hablantes en una Transcripción, Obtén Marcas de Tiempo
Sube audio o video con más de un hablante, o pega un enlace, y ScreenApp devuelve una transcripción que etiqueta las intervenciones de cada hablante con una marca de tiempo. La grabación no tiene que subirse desde tu dispositivo: un enlace de Dropbox, Google Drive o un podcast también funciona.
Una transcripción etiquetada significa que puedes encontrar lo que dijo una persona en concreto sin volver a escuchar toda la grabación.
Lo que obtienes:
- Una transcripción con etiquetas de hablante y marcas de tiempo, en 100+ idiomas
- haga clic en la etiqueta de un orador para cambiarle el nombre, asociarlo con un miembro del equipo o reasignar un solo segmento
- Exporta como PDF, DOCX, TXT, SRT y VTT
- Haz preguntas a la IA sobre la grabación y recibe respuestas que señalan el momento exacto en que ocurrió
- Plan gratuito: 2 transcripciones de grabaciones de hasta 45 minutos cada una, con etiquetas de hablante incluidas
El sistema asigna a los hablantes por voz, no comparando caras ni nombres, así que toda grabación empieza con etiquetas genéricas (Hablante 1, Hablante 2) que renombras después.
Cómo Identificar Hablantes en un Audio
- Sube o pega un enlace: Arrastra un archivo (MP3, M4A, MP4A, M4B, AAC, WAV, OGG, OPUS, FLAC, AIFF, WMA, WEBMA, MKA, AC3, EAC3, WV, AMR, DSF, DFF; hasta 2 GB en la herramienta online gratuita) o pega un enlace de Dropbox, Google Drive o un podcast.
- La transcripción separa por hablante: Cada voz recibe su propia etiqueta, con una marca de tiempo en cada intervención.
- Renombra y exporta: haga clic en la etiqueta de un orador para cambiarle el nombre, asociarlo con un miembro del equipo o reasignar un solo segmento. Exporta la transcripción terminada como PDF, DOCX, TXT, SRT y VTT.
El audio claro con voces distintas se separa mejor, y el habla superpuesta puede confundir el sistema de diarización, así que evita que los hablantes se interrumpan entre sí cuando puedas. Consulta cómo medimos la precisión.
Diarización de Hablantes vs Otras Apps
| Función | ScreenApp | AssemblyAI | Otter.ai | Notta |
|---|---|---|---|---|
| Plan gratuito | 2 transcripciones, hasta 45 min cada una | $50 en créditos | 300 min/mes, 30 min/conversación | 120 min/mes, 3 min/conversación |
| Etiquetas de hablante | Incluidas | +$0.02/hr adicional | Incluidas desde el plan Básico | Incluido |
| Idiomas | 100+ | No indicado | 6 | 58 |
| Formatos de exportación | PDF, DOCX, TXT, SRT y VTT | No indicado | mp3 y txt en el plan gratuito, además de pdf, docx y srt desde Pro, con exportación masiva desde Business | TXT, DOCX, PDF o XLSX |
| Plan de pago | $19/mes anual | $0.15/hora | $8.33/mes anual | $8.17/mes anual |
Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer
- vs AssemblyAI: AssemblyAI es una API para desarrolladores, con un precio de $0.15 por hora de audio y la diarización de hablantes como complemento adicional de +$0.02/hr, más $50 en créditos gratis para una cuenta nueva. ScreenApp es una app terminada: subes un archivo y recibes la transcripción etiquetada, sin necesidad de integración.
- vs Otter.ai: El plan gratuito de Otter es de 300 minutos al mes, con un tope de 30 minutos por conversación, y la identificación de hablantes disponible desde el plan Básico en adelante. El plan gratuito de ScreenApp es 2 transcripciones de grabaciones de hasta 45 minutos cada una, con etiquetas de hablante incluidas desde el principio.
- vs Notta: El plan gratuito de Notta da 120 minutos al mes en clips de hasta 3 minutos, con identificación de hablantes incluida. Notta transcribe 58 idiomas; ScreenApp transcribe 100+.
Quién Usa la Diarización de Hablantes
Podcasters suben el episodio en bruto y obtienen una transcripción dividida por presentador e invitado, lista para pegar en las notas del episodio o en una página de transcripción.
Notas de reuniones y entrevistas se benefician cuando solo el audio ya muestra quién dijo qué. Los entrevistadores usan la separación por hablante para distinguir sus propias preguntas de las respuestas sin volver a escuchar todo.
Investigadores que dirigen grupos focales o entrevistas cualitativas usan etiquetas de hablante consistentes para rastrear quién aportó cada idea, en lugar de etiquetar las intervenciones a mano.
Profesionales del derecho y la salud necesitan transcripciones con hablantes etiquetados de declaraciones, llamadas con clientes y consultas, con una marca de tiempo en cada intervención.


