将一堵文字墙变成可读的文字记录
粘贴原始文字记录,并将其格式化返回:包括说话人标签、适当的段落分隔,以及整理好的填充词。大多数自动转录工具会给你一个没有结构的完整文本块,这是使其可读的步骤。
它适用于你已有的文本。放入从 Otter、Zoom、Google Meet、YouTube 字幕、Whisper 或任何录音机导出的内容,它会为你整理出原始输出中缺失的结构。
原始自动转录文本的真实面貌
如果你曾从会议工具中导出过文字记录,你就会知道这个问题。以下是一段典型的原始输出:
所以,是的,我认为主要的事情是我们需要在星期五之前发布入职流程,因为市场推广与它相关联,如果我们推迟了,那么其他一切都会随之推迟。约翰说他可以负责 API 工作,但他星期二不在,所以我们需要一个备用人选,老实说我可以做。
这是格式化后的同一段落:
说话人 1: 主要的事情是,我们需要在星期五之前发布入职流程,因为市场推广与它相关联。如果我们推迟了,其他一切都会随之推迟。
说话人 2: 约翰说他可以负责 API 工作,但他星期二不在,所以我们需要一个备用人选。我可以做。
相同的词语,相同的含义。不同之处在于第二段是可读的。这就是全部工作。
它解决了什么
语音转文本的原始输出存在可预测的问题,而这可以解决每一个问题:
- 没有段落。一个 40 分钟的通话会以一个无休止的文本块返回。格式化工具会在话题或说话人改变的地方将其拆分,这样你的眼睛就能找到着陆点。
- 没有说话人标签,或者标签混乱。它将声音分开并加上标签,因此采访读起来像是对话而非独白。如果源文件已经有“说话人 1”这样的标记,它会保留并清理它们。
- 填充词和虚假开始。例如“嗯”、重复的“的 的”以及半途重起的句子,这些使逐字记录难以阅读的内容会被整理,而不会改变实际说出的内容。
- 破碎的句子边界。自动转录通常会将三个句子连在一起,或将一个句子分成两行。格式化工具会将句号放回正确的位置。
它不做的一件事是:转录音频。它格式化你已有的文本。如果你仍然需要文字记录本身,请先使用 音频转文本转换器 或 在线文字记录生成器,然后将结果通过此处进行清理。
你的文字记录来源
混乱程度因生成工具而异,格式化工具处理常见的几种情况:
- Zoom 和 Google Meet 导出的文件通常包含时间戳和粗略的说话人标签,但没有段落,因此一小时的会议记录会是一堵坚实的文字墙。这会添加断句。
- Otter 和 Fireflies 提供了更清晰的说话人分离,但仍然倾向于逐字记录,每个“嗯”和重新开始的词都在里面。这会进行精简。
- YouTube 字幕通常是两三个词的短行,完全没有标点符号,因为它们是为屏幕显示而计时,而不是为了阅读。这会将它们重新组合成句子。
- Whisper 和原始 ASR 输出通常是一长串没有标点符号的字符串。这是最难的起点,也是格式化帮助最大的地方。
为什么一份整洁的文字记录值得这一步
原始文字记录从技术上讲包含了信息,但没有人愿意阅读它,而文字记录的意义就在于此。一份经过格式化的文字记录你可以真正地略读、引用和交给他人。它对可访问性更好,因为屏幕阅读器在结构化的段落中移动比在一个 unbroken block 中艰难前行要好得多。而为了 SEO 发布在页面上的文字记录,当它是可读的散文时,其作用远大于当它是一个搜索引擎难以解析的单一无差别的段落时。
如何格式化转录稿
- 将原始转录稿粘贴到框中。
- 它会添加说话人标签、段落分隔和轻微清理。
- 复制格式化后的版本,即可阅读、分享或放入文档。
无需安装任何东西,也无需上传音频。它是文本输入,更清晰的文本输出。


