Étiquetez les locuteurs dans une transcription, obtenez des horodatages
Chargez un fichier audio ou vidéo avec plus d’un locuteur, ou collez un lien vers celui-ci, et ScreenApp renvoie une transcription qui étiquette les interventions de chaque locuteur avec un horodatage. L’enregistrement n’a pas besoin d’être téléchargé depuis votre appareil : un lien depuis Dropbox, Google Drive ou un hébergeur de podcast fonctionne également.
Une transcription étiquetée signifie que vous pouvez trouver ce qu’une personne spécifique a dit sans réécouter tout l’enregistrement.
Ce que vous obtenez :
- Une transcription avec des étiquettes de locuteurs et des horodatages, en 100+ langues
- Cliquez sur une étiquette d'intervenant pour la renommer, l'associer à un membre de l'équipe ou réaffecter un seul segment
- Exportation au format PDF, DOCX, TXT, SRT et VTT
- Posez des questions à l’IA sur l’enregistrement et obtenez des réponses qui renvoient au moment où cela s’est produit
- Plan gratuit : 2 transcriptions pour des enregistrements de 45 minutes maximum chacun, avec les étiquettes de locuteurs incluses
Le système attribue les locuteurs par la voix, et non en faisant correspondre les visages ou les noms, de sorte que chaque enregistrement commence par des étiquettes génériques (Locuteur 1, Locuteur 2) que vous renommez ensuite.
Comment identifier les locuteurs dans l’audio
- Téléchargez ou collez un lien : Faites glisser un fichier (MP3, M4A, MP4A, M4B, AAC, WAV, OGG, OPUS, FLAC, AIFF, WMA, WEBMA, MKA, AC3, EAC3, WV, AMR, DSF, DFF, jusqu’à 2 GB dans l’outil en ligne gratuit) ou collez un lien depuis Dropbox, Google Drive ou un hébergeur de podcast.
- La transcription sépare par locuteur : Chaque voix reçoit sa propre étiquette, avec un horodatage à chaque intervention.
- Renommez et exportez : Cliquez sur une étiquette d'intervenant pour la renommer, l'associer à un membre de l'équipe ou réaffecter un seul segment. Exportez la transcription finale au format PDF, DOCX, TXT, SRT et VTT.
Un audio clair avec des voix distinctes se sépare mieux, et Le chevauchement de la parole peut perturber le système de diarisation, alors évitez que les locuteurs ne se parlent en même temps lorsque vous le pouvez. Voir comment nous mesurons la précision.
Diarisation des locuteurs vs autres applications
| Fonctionnalité | ScreenApp | AssemblyAI | Otter.ai | Notta |
|---|---|---|---|---|
| Plan gratuit | 2 transcriptions, 45 min | $50 en crédits | 300 min/mois, 30 min/conversation | 120 min/mois, 3 min/conversation |
| Étiquettes de locuteurs | Inclus | +0,02 $/heure en supplément | Inclus à partir du plan Basique | Inclus |
| Langues | 100+ | Non spécifié | 6 | 58 |
| Formats d’exportation | PDF, DOCX, TXT, SRT et VTT | Non spécifié | mp3 et txt avec l'offre gratuite, plus pdf, docx et srt à partir de Pro, avec export groupé à partir de Business | TXT, DOCX, PDF ou XLSX |
| Plan payant | $19/mois annuel | $0.15/heure | $8.33/mois annuel | $8.17/mois annuel |
Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer
- vs AssemblyAI : AssemblyAI est une API pour développeurs, facturée $0.15 l’heure d’audio avec la diarisation des locuteurs comme supplément de +0,02 $/heure, et $50 en crédits gratuits pour un nouveau compte. ScreenApp est une application complète : téléchargez un fichier et obtenez la transcription étiquetée, aucune intégration requise.
- vs Otter.ai : Le plan gratuit d’Otter est de 300 minutes par mois, plafonné à 30 minutes par conversation, avec identification des locuteurs à partir du plan Basique. Le plan gratuit de ScreenApp est de 2 transcriptions pour des enregistrements de 45 minutes maximum chacun, avec les étiquettes de locuteurs incluses dès le début.
- vs Notta : Le plan gratuit de Notta offre 120 minutes par mois en clips de jusqu’à 3 minutes, avec identification des locuteurs incluse. Notta transcrit 58 langues ; ScreenApp transcrit 100+.
Qui utilise la diarisation des locuteurs
Les podcasteurs téléchargent l’épisode brut et obtiennent une transcription divisée par animateur et invité, prête à être collée dans les notes d’émission ou une page de transcription pour l’épisode.
Les notes de réunion et d’entretien sont améliorées lorsque l’audio seul indique toujours qui a dit quoi. Les intervieweurs utilisent la séparation des locuteurs pour distinguer leurs propres questions des réponses sans réécouter.
Les chercheurs menant des groupes de discussion ou des entretiens qualitatifs utilisent des étiquettes de locuteurs cohérentes pour suivre qui a contribué quoi, au lieu d’étiqueter les interventions à la main.
Les professionnels du droit et de la santé ont besoin de transcriptions avec étiquettes de locuteurs pour les dépositions, les appels clients et les consultations, avec un horodatage attaché à chaque intervention.


