Diarización de Hablantes Online

Sube una grabación con más de un hablante y obtén una transcripción que etiqueta quién habla, con marcas de tiempo que puedes buscar y exportar.

Los archivos se procesan en la nube. Se necesita una cuenta gratuita para usar y guardar resultados en la aplicación. La descarga de archivos requiere un plan de pago.

MP3, WAV, M4A, AAC, OGG, FLAC, AMR, WMA

O pegar un enlace de audio

YouTube, TikTok, Instagram, Vimeo, Google Drive, Dropbox, enlaces directos

Las grabaciones están cifradas en tránsito y en reposo y no se usan para entrenar modelos de IA. Privacidad · Seguridad

Etiqueta a los Hablantes en una Transcripción, Obtén Marcas de Tiempo

Sube audio o video con más de un hablante, o pega un enlace, y ScreenApp devuelve una transcripción que etiqueta las intervenciones de cada hablante con una marca de tiempo. La grabación no tiene que subirse desde tu dispositivo: un enlace de Dropbox, Google Drive o un podcast también funciona.

Una transcripción etiquetada significa que puedes encontrar lo que dijo una persona en concreto sin volver a escuchar toda la grabación.

Lo que obtienes:

El sistema asigna a los hablantes por voz, no comparando caras ni nombres, así que toda grabación empieza con etiquetas genéricas (Hablante 1, Hablante 2) que renombras después.

Cómo Identificar Hablantes en un Audio

  1. Sube o pega un enlace: Arrastra un archivo (MP3, M4A, MP4A, M4B, AAC, WAV, OGG, OPUS, FLAC, AIFF, WMA, WEBMA, MKA, AC3, EAC3, WV, AMR, DSF, DFF; hasta 2 GB en la herramienta online gratuita) o pega un enlace de Dropbox, Google Drive o un podcast.
  2. La transcripción separa por hablante: Cada voz recibe su propia etiqueta, con una marca de tiempo en cada intervención.
  3. Renombra y exporta: haga clic en la etiqueta de un orador para cambiarle el nombre, asociarlo con un miembro del equipo o reasignar un solo segmento. Exporta la transcripción terminada como PDF, DOCX, TXT, SRT y VTT.

El audio claro con voces distintas se separa mejor, y el habla superpuesta puede confundir el sistema de diarización, así que evita que los hablantes se interrumpan entre sí cuando puedas. Consulta cómo medimos la precisión.

Diarización de Hablantes vs Otras Apps

FunciónScreenAppAssemblyAIOtter.aiNotta
Plan gratuito2 transcripciones, hasta 45 min cada una$50 en créditos300 min/mes, 30 min/conversación120 min/mes, 3 min/conversación
Etiquetas de hablanteIncluidas+$0.02/hr adicionalIncluidas desde el plan BásicoIncluido
Idiomas100+No indicado658
Formatos de exportaciónPDF, DOCX, TXT, SRT y VTTNo indicadomp3 y txt en el plan gratuito, además de pdf, docx y srt desde Pro, con exportación masiva desde BusinessTXT, DOCX, PDF o XLSX
Plan de pago$19/mes anual$0.15/hora$8.33/mes anual$8.17/mes anual

Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer

  • vs AssemblyAI: AssemblyAI es una API para desarrolladores, con un precio de $0.15 por hora de audio y la diarización de hablantes como complemento adicional de +$0.02/hr, más $50 en créditos gratis para una cuenta nueva. ScreenApp es una app terminada: subes un archivo y recibes la transcripción etiquetada, sin necesidad de integración.
  • vs Otter.ai: El plan gratuito de Otter es de 300 minutos al mes, con un tope de 30 minutos por conversación, y la identificación de hablantes disponible desde el plan Básico en adelante. El plan gratuito de ScreenApp es 2 transcripciones de grabaciones de hasta 45 minutos cada una, con etiquetas de hablante incluidas desde el principio.
  • vs Notta: El plan gratuito de Notta da 120 minutos al mes en clips de hasta 3 minutos, con identificación de hablantes incluida. Notta transcribe 58 idiomas; ScreenApp transcribe 100+.

Quién Usa la Diarización de Hablantes

Podcasters suben el episodio en bruto y obtienen una transcripción dividida por presentador e invitado, lista para pegar en las notas del episodio o en una página de transcripción.

Notas de reuniones y entrevistas se benefician cuando solo el audio ya muestra quién dijo qué. Los entrevistadores usan la separación por hablante para distinguir sus propias preguntas de las respuestas sin volver a escuchar todo.

Investigadores que dirigen grupos focales o entrevistas cualitativas usan etiquetas de hablante consistentes para rastrear quién aportó cada idea, en lugar de etiquetar las intervenciones a mano.

Profesionales del derecho y la salud necesitan transcripciones con hablantes etiquetados de declaraciones, llamadas con clientes y consultas, con una marca de tiempo en cada intervención.

FAQ

¿Qué es la diarización de hablantes?

La diarización de hablantes es el proceso de determinar quién habló y cuándo en una grabación. El sistema agrupa el audio por voz y asigna a cada segmento una etiqueta de hablante, de modo que la transcripción se lee como Hablante 1, Hablante 2 y así sucesivamente, con cada intervención marcada con su hora.

¿Qué tan precisa es la diarización de hablantes?

La precisión depende de la grabación: el audio claro con voces distintas se separa mejor, y el habla superpuesta puede confundir el sistema de diarización. Consulta cómo se mide la precisión.

¿Cuántos hablantes puede identificar?

La diarización asigna una etiqueta a cada voz distinta que detecta en la grabación, desde dos hablantes hasta una conversación de grupo completa. Cuantos más hablantes haya, sobre todo con voces parecidas o habla superpuesta, más difícil es la separación.

¿Funciona con podcasts?

Sí. Sube el archivo del episodio o pega un enlace de tu plataforma de podcast, y cada presentador e invitado recibe una etiqueta de hablante distinta que puedes renombrar en la transcripción.

¿Hace diarización en tiempo real?

No, esta es una herramienta de subida: procesa un archivo o enlace después de terminada la grabación, no mientras ocurre. Para reuniones en vivo, usa el grabador de reuniones, que graba y transcribe mientras sucede la llamada.

¿Qué formatos de audio y video funcionan?

¿Puede identificar a personas específicas por su nombre?

No de forma automática. El sistema asigna etiquetas genéricas (Hablante 1, Hablante 2) solo a partir de la voz; no compara una voz con una identidad conocida. Después, haga clic en la etiqueta de un orador para cambiarle el nombre, asociarlo con un miembro del equipo o reasignar un solo segmento.

¿Hay un plan gratuito?

Sí. 2 transcripciones de grabaciones de hasta 45 minutos cada una, con etiquetas de hablante, marcas de tiempo y exportación incluidas. El plan Pro a $19 al mes facturado anualmente elimina el límite de grabaciones.

Resultados Reales de Usuarios Reales

works like a charm, notes have been super helpful alongside chat function. loveeeee
KS
Katharine Suy
Chrome Web Store, October 17, 2024
nice app for important summary
S
SAHIL
Google Play, January 30, 2026

¿Listo para aumentar tu productividad?

Inicia Diarización de Hablantes con una cuenta gratuita. Se aplican límites de uso; las descargas de apps requieren un plan de pago.

Empezar Gratis →

Empezar a usar en 60 segundos