Превратите неопрятную стенограмму в читаемый текст
Вставьте необработанную стенограмму, ту, что вы получаете из субтитров YouTube, файла Zoom .vtt или автоматически сгенерированного экспорта подкаста, и она удалит все лишнее: временные метки, номера подсказок субтитров, “эм” и “а”, метки “SPEAKER 1:” и повторяющиеся строки. Затем она объединяет разорванные фрагменты субтитров обратно в абзацы, которые вы действительно можете прочитать.
Она работает полностью в вашем браузере. Стенограмма никогда не загружается, что важно, когда то, что вы очищаете, является частным звонком или неопубликованным интервью.
Правила, а не ИИ, и почему это важно
Большинство инструментов с “ИИ” в названии пропускают вашу стенограмму через языковую модель для ее очистки. Это исправляет грамматику, но также означает, что модель может незаметно перефразировать то, что сказал кто-то. Для стенограммы это именно то, чего вы не хотите. Цитата, которая была “улучшена”, больше не является цитатой.
Вместо этого она очищает с помощью простых правил на основе шаблонов. Она удаляет ровно то, что вы включаете, и ничего больше. Она не будет переписывать предложения, придумывать знаки препинания или сглаживать неловкие фразы, так что то, что останется, будет по-прежнему фактическими словами говорящего, за вычетом шума.
Честный компромисс: поскольку она основана на правилах, она не исправляет грамматику и не добавляет знаки препинания так, как это сделал бы ИИ. Если вам это нужно, пропустите ее через форматтер стенограмм после, который использует ИИ для добавления структуры спикеров и читаемости. Сначала очистите, чтобы удалить мусор, затем отформатируйте, если хотите отполировать. Я использую только очиститель примерно в восьмидесяти процентах случаев, потому что читаемый абзац - это обычно все, что мне нужно.
Что она удаляет
Каждый из них является переключателем, так что вы оставляете то, что хотите, и отбрасываете остальное.
- Временные метки и подсказки. Номера последовательностей SRT, строки времени
00:00:04,500 --> 00:00:08,200, заголовокWEBVTTи встроенные метки, такие как[00:05]или просто00:01:32. Это та самая задача “удалить временные метки из стенограммы”, которую люди ищут чаще всего. - Слова-паразиты. Явные словесные тики: эм, а, э, хмм, “знаете”, “я имею в виду”. Она подсчитывает, сколько слов было удалено, чтобы вы могли видеть, какой ущерб нанесла запись.
- Метки спикеров. Теги в начале строки, такие как
SPEAKER 1:,John:,[Interviewer], и маркеры>>, которые добавляют Zoom и инструменты для субтитров. - Повторяющиеся строки. Автоматические субтитры часто печатают одну и ту же строку дважды при перерисовке. Последовательные дубликаты сворачиваются в один.
- Нарушенное межстрочное расстояние. Субтитры переносятся каждые несколько слов, поэтому предложение разбивается на четыре строки. Объединение восстанавливает их и разбивает результат на абзацы.
Один важный момент, который стоит отметить: она не удаляет “like”, “actually”, “basically” или “so”. Они выглядят как слова-паразиты в списке, но достаточно часто несут реальное значение, так что их удаление меняет предложения. Очиститель, который редактирует то, что вы имели в виду, хуже, чем тот, который оставляет лишнее “like”, поэтому он их оставляет.
Очистка стенограммы YouTube, Zoom или подкаста
Три источника, которые создают наибольший беспорядок, лучше всего обрабатываются этим инструментом.
Дампы субтитров YouTube содержат временные метки почти на каждой строке и вообще не имеют абзацев. Вставьте скопированную стенограмму, включите временные метки и объединение, и вы получите готовый для блога блок вместо стопки из пятисловных фрагментов.
Zoom и Teams предоставляют файл .vtt с номерами подсказок, таймингами и меткой спикера на каждом повороте. Загрузите файл, и он вернется в виде чистого диалога или связного текста, вы сами решаете, оставлять ли имена спикеров.
Стенограммы подкастов и интервью обычно уже чище, но полны словесных паразитов, потому что люди действительно так говорят. Удалите “эм” и объедините, и время чтения сократится, не затрагивая содержание.
Как удалить временные метки из стенограммы в Word
Люди ищут это, потому что пытаются сделать это с помощью “Найти и заменить” в Microsoft Word, используя шаблоны подстановочных знаков для сопоставления 00:00:00. Это работает, едва, но шаблон придирчив и ломается в тот момент, когда формат временной метки меняется между одним файлом и следующим.
Вставка текста сюда - это быстрый способ. Она автоматически распознает общие форматы временных меток: SRT, VTT и простой HH:MM:SS, поэтому вам не нужно писать выражение подстановочных знаков или запускать его четыре раза для четырех форматов. Очистите здесь, вставьте результат обратно в Word.
После очистки
После того как стенограмма очищена, для следующих шагов есть свои инструменты. Чтобы добавить правильную структуру докладчиков и удобочитаемость с помощью ИИ, используйте форматтер стенограмм. Чтобы изначально получить чистую стенограмму прямо из видео- или аудиофайла, генератор стенограмм выполняет транскрипцию. А чтобы превратить очищенную стенограмму в субтитры, конвертер текста в SRT возвращает временные метки, на этот раз намеренно.
Часто задаваемые вопросы
Этот очиститель стенограмм бесплатен?
Да, и он работает прямо в вашем браузере. Нет регистрации, нет загрузки и нет ограничений на количество очищаемых стенограмм, потому что работа происходит на вашем устройстве, а не на сервере.
Он загружает или хранит мою стенограмму?
Нет. Очистка - это простой JavaScript, работающий на странице, поэтому текст никогда не покидает ваш браузер. Ничего не отправляется, не хранится и не логируется, что является причиной использования локального очистителя для частного звонка или неопубликованного интервью.
Как удалить только временные метки и оставить все остальное?
Включите переключатель временных меток и выключите остальные. Он удаляет строки синхронизации SRT и VTT, порядковые номера и встроенные метки времени, такие как [00:05], и оставляет метки говорящих, слова-паразиты и разрывы строк точно такими, как они были.
Удаляет ли он “like” и “actually” как слова-паразиты?
Нет, намеренно. Он удаляет только явные вербальные слова-паразиты, такие как “ум” и “э”. Такие слова, как “like”, “actually” и “basically”, слишком часто несут реальное значение, поэтому их удаление изменило бы предложения. Очиститель не должен редактировать то, что кто-то сказал.
Какие типы файлов я могу очищать?
Вставьте любой текст или перетащите файл .srt, .vtt или .txt. Инструмент читает файл локально и очищает его так же, как и вставленный текст. Файлы размером до 5 МБ работают без сбоев; если больше, вставьте текст.
Лучше ли очиститель на основе правил, чем очиститель стенограмм на основе ИИ?
Они выполняют разные задачи. Очиститель на основе правил, подобный этому, удаляет шум, не изменяя ваших слов, что безопаснее для цитат и записей. Очиститель на основе ИИ также исправляет грамматику и пунктуацию, но может перефразировать сказанное. Сначала очистите здесь, а затем запустите ИИ только в том случае, если вам нужна доработка.