Ubah Transkrip Berantakan Menjadi Teks yang Dapat Dibaca
Tempelkan transkrip mentah, seperti yang Anda dapatkan dari teks YouTube, Zoom .vtt, atau ekspor podcast yang dibuat secara otomatis, dan itu akan menghilangkan kekacauan: stempel waktu, nomor isyarat teks, “um” dan “uh”, label “SPEAKER 1:”, dan baris yang berulang. Kemudian, ia menggabungkan fragmen teks yang terputus kembali menjadi paragraf yang benar-benar dapat Anda baca.
Ini berjalan sepenuhnya di browser Anda. Transkrip tidak pernah diunggah, hal ini penting ketika hal yang Anda bersihkan adalah panggilan pribadi atau wawancara yang belum dipublikasikan.
Aturan, Bukan AI, dan Mengapa Itu Intinya
Sebagian besar alat dengan nama “AI” menjalankan transkrip Anda melalui model bahasa untuk membersihkannya. Itu memperbaiki tata bahasa, tetapi juga berarti model dapat dengan diam-diam mengubah kata-kata yang diucapkan seseorang. Untuk transkrip, itulah satu hal yang tidak Anda inginkan. Kutipan yang “ditingkatkan” bukan lagi kutipan.
Ini membersihkan dengan aturan pola biasa sebagai gantinya. Ini menghapus persis apa yang Anda aktifkan dan tidak ada yang lain. Ini tidak akan menulis ulang kalimat, membuat tanda baca, atau menghaluskan frasa yang canggung, jadi yang tersisa masih merupakan kata-kata asli pembicara, dikurangi kebisingan.
Kompromi jujur: karena ini berbasis aturan, ini tidak memperbaiki tata bahasa atau menambahkan tanda baca seperti yang akan dilakukan oleh AI. Jika Anda menginginkan itu, jalankan melalui pemformat transkrip setelahnya, yang menggunakan AI untuk menambahkan struktur pembicara dan keterbacaan. Bersihkan terlebih dahulu untuk menghilangkan sampah, format kedua jika Anda ingin polesan. Saya menggunakan pembersih saja sekitar delapan puluh persen dari waktu, karena paragraf yang mudah dibaca biasanya adalah semua yang saya butuhkan.
Apa yang Dihilangkannya
Masing-masing ini adalah tombol, jadi Anda menyimpan apa yang Anda inginkan dan membuang sisanya.
- Stempel waktu dan isyarat. Nomor urut SRT, baris waktu
00:00:04,500 --> 00:00:08,200, headerWEBVTT, dan stempel sebaris seperti[00:05]atau00:01:32saja. Ini adalah pekerjaan “menghapus stempel waktu dari transkrip” yang paling banyak dicari orang. - Kata-kata pengisi. Kebiasaan verbal yang jelas: um, uh, er, hmm, “you know”, “i mean”. Ini menghitung berapa banyak yang ditariknya sehingga Anda dapat melihat kerusakan yang ditimbulkan rekaman tersebut.
- Label pembicara. Tag awal baris seperti
SPEAKER 1:,John:,[Interviewer], dan penanda>>yang dimasukkan oleh Zoom dan alat takarir. - Baris berulang. Teks otomatis sering mencetak baris yang sama dua kali saat digambar ulang. Duplikat berturut-turut digabungkan menjadi satu.
- Spasi baris yang rusak. Takarir membungkus setiap beberapa kata, sehingga sebuah kalimat tiba terbagi menjadi empat baris. Penggabungan menyatukannya kembali dan memecah hasilnya menjadi paragraf.
Satu pilihan yang disengaja yang patut disebut: itu tidak menghilangkan “like”, “actually”, “basically”, atau “so”. Kata-kata itu terlihat seperti pengisi dalam daftar, tetapi mereka sering membawa makna nyata sehingga menghilangkannya mengubah kalimat. Pembersih yang mengedit apa yang Anda maksud lebih buruk daripada yang meninggalkan “like” tambahan, jadi itu membiarkannya.
Bersihkan Transkrip YouTube, Zoom, atau Podcast
Tiga sumber yang paling banyak menghasilkan kekacauan adalah tiga sumber yang paling baik ditangani ini.
Dump teks YouTube dilengkapi dengan stempel waktu di hampir setiap baris dan tanpa paragraf sama sekali. Tempelkan transkrip yang disalin, aktifkan stempel waktu dan gabungkan, dan Anda mendapatkan blok siap blog alih-alih tumpukan fragmen lima kata.
Zoom dan Teams memberi Anda file .vtt dengan nomor isyarat, waktu, dan label pembicara di setiap giliran. Jatuhkan file itu dan itu kembali sebagai dialog bersih atau teks mengalir, pilihan Anda apakah akan mempertahankan nama pembicara.
Transkrip podcast dan wawancara biasanya sudah lebih bersih tetapi penuh dengan pengisi verbal, karena orang benar-benar berbicara seperti itu. Hapus “um” dan gabungkan, dan waktu baca berkurang tanpa menyentuh konten.
Cara Menghapus Stempel Waktu dari Transkrip di Word
Orang mencari ini karena mereka mencoba melakukannya dengan Cari dan Ganti di Microsoft Word, menggunakan pola wildcard untuk mencocokkan 00:00:00. Itu berhasil, nyaris, tetapi polanya rumit dan rusak saat format stempel waktu berubah antara satu file dan berikutnya.
Menempelkan teks di sini adalah jalan pintas. Itu mengenali bentuk stempel waktu umum secara otomatis, SRT, VTT, dan HH:MM:SS saja, jadi Anda tidak perlu menulis ekspresi wildcard atau menjalankannya empat kali untuk empat format. Bersihkan di sini, tempelkan hasilnya kembali ke Word.
Setelah Pembersihan
Setelah transkrip bersih, langkah selanjutnya memiliki alatnya sendiri. Untuk menambahkan struktur pembicara yang tepat dan keterbacaan dengan AI, gunakan pemformat transkrip. Untuk mendapatkan satu transkrip bersih langsung dari file video atau audio sejak awal, pembuat transkrip melakukan transkripsi. Dan untuk mengubah transkrip yang sudah dibersihkan menjadi subtitle, konverter teks ke SRT mengembalikan stempel waktu, kali ini memang disengaja.