Transformer une transcription désordonnée en texte lisible
Collez une transcription brute, celle que vous obtenez des sous-titres YouTube, d’un fichier Zoom .vtt ou d’une exportation de podcast auto-générée, et il supprime l’encombrement : les horodatages, les numéros de séquence des sous-titres, les “euh” et “hum”, les étiquettes “SPEAKER 1:”, et les lignes qui se répètent. Ensuite, il fusionne les fragments de sous-titres brisés en paragraphes que vous pouvez réellement lire.
Il s’exécute entièrement dans votre navigateur. La transcription n’est jamais téléchargée, ce qui est important lorsque ce que vous nettoyez est un appel privé ou une interview non publiée.
Des règles, pas de l’IA, et pourquoi c’est le but
La plupart des outils portant le nom “IA” passent votre transcription à travers un modèle linguistique pour la nettoyer. Cela corrige la grammaire, mais cela signifie aussi que le modèle peut reformuler discrètement ce que quelqu’un a dit. Pour une transcription, c’est la seule chose que vous ne voulez pas. Une citation qui a été “améliorée” n’est plus une citation.
Ceci nettoie avec de simples règles de motifs à la place. Il supprime exactement ce que vous activez et rien d’autre. Il ne réécrira pas une phrase, n’inventera pas de ponctuation, ni ne lissera une formulation maladroite, de sorte que ce qui reste sont toujours les mots réels de l’orateur, moins le bruit.
Le compromis honnête : parce qu’il est basé sur des règles, il ne corrige pas la grammaire et n’ajoute pas de ponctuation comme le ferait un passage par l’IA. Si vous voulez cela, passez-le ensuite par le formateur de transcription, qui utilise l’IA pour ajouter de la structure et de la lisibilité. Nettoyez d’abord pour supprimer le superflu, formatez ensuite si vous voulez peaufiner. J’utilise le nettoyeur seul environ quatre-vingts pour cent du temps, car un paragraphe lisible est généralement tout ce dont j’ai besoin.
Ce qu’il supprime
Chacun de ces éléments est une option, vous gardez donc ce que vous voulez et supprimez le reste.
- Horodatages et repères. Numéros de séquence SRT, les lignes de synchronisation
00:00:04,500 --> 00:00:08,200, l’en-têteWEBVTT, et les horodatages en ligne comme[00:05]ou un simple00:01:32. C’est le travail de “suppression des horodatages de la transcription” que les gens recherchent le plus. - Mots de remplissage. Les tics verbaux clairs : um, uh, er, hmm, “you know”, “i mean”. Il compte combien il en a retiré pour que vous puissiez voir les dégâts causés par l’enregistrement.
- Étiquettes de locuteur. Balises de début de ligne comme
SPEAKER 1:,John:,[Interviewer], et les marqueurs>>que Zoom et les outils de sous-titrage insèrent. - Lignes répétées. Les sous-titres automatiques impriment souvent la même ligne deux fois lors du réaffichage. Les doublons consécutifs sont fusionnés en un seul.
- Espacement de ligne brisé. Les sous-titres s’interrompent tous les quelques mots, de sorte qu’une phrase arrive divisée en quatre lignes. La fusion les regroupe et divise le résultat en paragraphes.
Un choix délibéré à souligner : il ne supprime pas “like”, “actually”, “basically”, ou “so”. Ceux-ci ressemblent à des mots de remplissage dans une liste, mais ils portent souvent une signification réelle et leur suppression modifierait les phrases. Un nettoyeur qui modifie ce que vous vouliez dire est pire qu’un nettoyeur qui laisse un “like” supplémentaire, il les laisse donc.
Nettoyer une transcription YouTube, Zoom ou de Podcast
Les trois sources qui génèrent le plus de désordre sont celles que cet outil gère le mieux.
Les exports de sous-titres YouTube sont accompagnés d’un horodatage sur presque chaque ligne et sans aucun paragraphe. Collez la transcription copiée, activez les horodatages et la fusion, et vous obtenez un bloc prêt pour un blog au lieu d’une pile de fragments de cinq mots.
Zoom et Teams vous donnent un fichier .vtt avec des numéros de repère, des horodatages et une étiquette de locuteur à chaque prise de parole. Déposez le fichier et il revient sous forme de dialogue propre ou de texte fluide, à vous de décider si vous voulez conserver les noms des locuteurs.
Les transcriptions de podcasts et d’interviews sont généralement déjà plus propres mais pleines de mots de remplissage, car les gens parlent réellement de cette façon. Supprimez les “euh” et fusionnez, et le temps de lecture diminue sans toucher au contenu.
Comment supprimer les horodatages d’une transcription dans Word
Les gens recherchent cela parce qu’ils essaient de le faire avec Rechercher et Remplacer dans Microsoft Word, en utilisant des motifs de caractères génériques pour faire correspondre 00:00:00. Cela fonctionne, à peine, mais le motif est délicat et il se casse dès que le format d’horodatage change entre un fichier et le suivant.
Coller le texte ici est le raccourci. Il reconnaît automatiquement les formes d’horodatage courantes, SRT, VTT et le simple HH:MM:SS, vous n’avez donc pas à écrire une expression de caractères génériques ou à l’exécuter quatre fois pour quatre formats. Nettoyez-le ici, collez le résultat dans Word.
Après le Nettoyage
Une fois la transcription nettoyée, les étapes suivantes ont leurs propres outils. Pour ajouter une structure de locuteur appropriée et améliorer la lisibilité avec l’IA, utilisez le formateur de transcription. Pour obtenir une transcription propre directement à partir d’un fichier vidéo ou audio, le générateur de transcription effectue la transcription. Et pour transformer une transcription nettoyée en sous-titres, le convertisseur texte en SRT réinsère les horodatages, volontairement cette fois.