ChatGPT能观看和分析视频吗?哪些是真正可行的?
On this page
人们问的这是一个问题,但实际上是六个问题,有六个不同的答案。
ChatGPT能否观看视频、分析视频、总结视频、转录视频、翻译视频、理解视频。这些任务并非相同,ChatGPT在其中一些方面表现出色,但在一个特定方面表现非常糟糕。将它们视为一个简单的“是”或“否”,是许多人最终感到沮丧的原因,他们盯着一个显然遗漏了视频一半内容的摘要。
简单来说:它擅长任何以文本为起点的任务,不擅长任何以媒体文件为起点的任务,而这两种情况之间的差距就是所有抱怨的来源。
快速回答
一旦视频内容转化为文本,ChatGPT就能很好地推断其内容。它会从上传的片段中采样帧和音频,这适用于短视频,但它不是一个转录引擎,也无法可靠地完整观看长时间的录音。可靠的路径是先转录,后使用ChatGPT。
- 最擅长:总结、翻译和重构你提供的文本
- 部分擅长:通过采样帧观看和描述短片
- 最不擅长:生成准确、带时间戳的转录文本
- 免费版限制:每天可上传3个文件,因此无法进行批量处理
六个问题,六个答案
这是整篇文章的一个表格概览。其余的是细节。
| 你想要 | 答案 | 注意事项 |
|---|---|---|
| 总结它 | 是,很好 | 只取决于你输入的文本质量 |
| 翻译它 | 是,很好 | 翻译的是文字记录,而不是音频本身 |
| 理解它 | 部分 | 推断内容,不感知内容 |
| 分析它 | 部分 | 擅长主题,不擅长视觉细节 |
| 观看它 | 短片段 | 采样帧,不播放视频 |
| 转录它 | 不可靠 | 它不是语音识别系统 |
注意它的这种形态。它做得最好的两件事都始于文本。它做得最差的那件事是把媒体转换成文本。这不是巧合,也是理解这里最有用的一点。
ChatGPT能观看视频吗?
不能像你一样观看。它只是采样。
当你给它一个片段时,它会按间隔提取帧并读取它能获取的任何音频信号,然后根据这些样本进行推断。对于一个30秒的产品演示来说,这通常足以描述发生的事情。对于一个40分钟的网络研讨会来说,这更像是翻阅几张静止图片,然后猜测其余内容。
这对于任何短暂的内容都影响最大。一闪而过半秒的字幕、一个快速剪辑、屏幕上出现一拍的数字:这些都存在于采样之间,对模型来说根本不存在。如果某个特定帧很重要,请截图并粘贴图片。你将得到比询问整个视频好得多的答案。
关于上传机制、格式和设备差异,我们已经有一篇关于如何上传视频和音频到ChatGPT的完整指南。本文主要讨论文件上传后的情况。
ChatGPT能理解视频吗?
它理解内容,但不感知视频。
这种区别听起来有点咬文嚼字,直到你遇到它。如果你询问某人提出的论点,你会得到一个非常敏锐的答案,因为论点存在于语言中。如果你问屏幕上的两个人中谁在另一个人说话时点头,你得到的答案听起来很自信,但基本上是编造的。
所以我使用的规则是:如果答案存在于文字中,ChatGPT非常出色。如果答案存在于图片中、时间点上,或者存在于所说内容和所显示内容之间的空白处,那么请自行查看。对于中间地带,当你需要根据音频和视觉内容回答问题时,一个专门构建的AI视频观察器正在做与附加文件到聊天模型不同的工作。
ChatGPT能转录视频吗?
这一点我得直言不讳。不,不可靠,它不是这项工作的正确工具。
ChatGPT是一个语言模型,而不是一个语音识别系统。它能粗略地报告短片中说了什么,而且报告会读起来很流畅,这正是问题所在。流畅和准确是两回事。你不会得到那些让转录有用的东西:准确对齐的时间戳、在对话中保持一致的说话人标签,或者输出中的句子是否真的被说出的保证。
对于一个两分钟的片段,如果你只是想了解大概内容,那还行。但对于你打算引用、加字幕或采取行动的任何内容,请先通过实际的视频转文本转换器进行处理。之后再将转录文本交给ChatGPT。这个顺序是关键。
如果你正在选择使用什么来转录,AI转录工具的比较涵盖了主要选项的准确性和导出格式。
ChatGPT能总结视频吗?
能,这正是它发挥价值的地方。但有一个条件。
给它一份干净的文字稿,它就能生成一份非常好的总结:它能串联起5000字论证的脉络,挑出决策点,并为不同受众重组材料,无需二次指示。如果给它一个视频文件并提出同样的要求,它会总结它设法提取的样本,这意味着对于长时间录音,它会自信地描述前几分钟和其余部分的整体氛围。
失败是悄无声息的,这也是它危险之处。你不会收到错误提示。你只会得到一个看似合理的总结,却遗漏了在第34分钟做出的决定。
如果一份长视频的总结看起来内容单薄或异常偏重开头,那就是它的征兆。它总结的是一个样本,而不是整个视频。喂给它文字稿,然后重新提问。
要比较为此目的而专门构建的工具,AI视频总结工具的综述涵盖了专用总结工具的不同之处。
ChatGPT能翻译视频吗?
能,而且它在这方面表现非常好,只要你明白它翻译的是什么。
它翻译的是文本。所以真实的工作流程是先转录,修正文字稿,然后翻译。中间这一步是人们经常跳过的,而跳过这一步意味着你将自己的错误小心翼翼地翻译成了第二语言。英语中听错的产品名称在西班牙语中也变成了听错的产品名称,现在更难发现了。
ChatGPT胜过纯机器翻译的地方在于语气和语境。要求它保持正式语域,保留技术术语,或者缩短句子以适应字幕,它都能做到。这比粘贴到通用翻译器中是一个实实在在的优势。
对于字幕文件,你希望保留时间码,这意味着需要从视频翻译器生成SRT或VTT文件,而不是要求聊天模型重建它从未见过的时间码。
ChatGPT能观看YouTube链接吗?
粘贴URL与提供视频本身不同,这一点比此列表中任何其他问题都更容易让人困惑。
在浏览功能可用时,它可以访问页面。一个页面包含标题、描述、一些元数据,可能还有可见的字幕。那不是视频本身。所以你可能会得到一个答案,它引用了正确的话题,听起来很了解情况,但实际上是从描述框中拼凑出来的。
识别的关键在于特异性。问主持人12:40说了什么。如果答案自信却模糊,那它就从未获取过内容。当视频禁用了字幕、是私密的、有年龄限制或是一个直播回放时,页面上根本没有内容可以用来分析。
生成文字稿并粘贴进去。这只需额外一分钟,就能将猜测变成答案。
实际的上传限制是什么
这些是来自OpenAI文件上传常见问题的官方数据,它们解释了人们报告的大多数失败案例。
| 限制 | 值 | 对视频意味着什么 |
|---|---|---|
| 每个文件 | 512 MB | 一个1080p的屏幕录像很快就会达到这个限制 |
| 免费计划上传 | 每天3次 | 批量处理在免费版中无法实现 |
| 上传速率 | 每3小时80次 | 对个人用户来说足够,对管道来说则紧张 |
| 每个文件文本 | 200万个标记 | 一份文字稿永远不会接近这个上限 |
| 每用户存储 | 25 GB | 大约50个中等大小的录音 |
将最后两行结合起来看,论点不言自明。一份两小时会议的文字稿只有几百千字节,远低于200万个标记的上限。而同一会议的视频可能达到800 MB,这在开始之前就超过了文件限制。转换为文本并不是绕过限制的方法,而是消除了限制。
“免费版每天3次”这个数字也诚实地回答了你是否可以免费做这件事。你可以,三次,每天一次。
真正有效的工作流程
首先是文字稿。一切都由此展开。
首先提取文本
将录音上传到转录工具,如果音频中包含多个声音,则导出带有时间戳和说话人标签的文本。这是决定后续所有质量的步骤,因此不要直接跳过,将文件粘贴到聊天窗口中。
阅读足够的内容以发现错误
浏览专有名词、产品名称和数字。这些是转录容易出错的地方,也是总结会自信地重复的错误。在这里花两分钟可以避免你引用一些没人说过的话。
现在引入ChatGPT
粘贴已更正的文字稿,并提出你实际需要的问题:总结、行动项、翻译、博客大纲。这是它擅长的部分,现在它是在真实的基础上进行工作。
如果你想妥善处理第一步,ScreenApp可以一次性完成转录、总结和翻译,并导出为TXT、PDF、SRT或VTT。然后,你可以将所需的输出导入ChatGPT。它不是一个竞争工具,它是前置步骤。
同样的序列也适用于AI生成的内容,它有其自身的特点:将Gemini或Veo片段转换为文本会遇到不同的问题,主要是因为这些片段只有几秒钟长,通常根本没有对话。
值得保留的提示
一旦你有了转录文本,这四个提示就能涵盖大多数人的需求。调整并重复使用。
"用五点总结这份转录文本。涵盖全部内容,包括最后三分之一。引用任何决定或承诺的确切措辞,并明确说明是否有未解决的事项。"
"列出所有行动项、负责人以及提到的任何截止日期。如果未指定负责人,请写‘未分配’而非猜测。为每个行动项添加时间戳。"
"将此翻译成西班牙语。保持时间戳和说话人标签不变,产品名称保留英文,并且每行字幕保持在42个字符以内。"
"根据这份转录文本,生成四份输出:带标题的博客大纲、一篇200字以下的LinkedIn帖子、三个短视频钩子,以及一封为错过会议者准备的电子邮件摘要。只使用转录文本中的内容。"
其中三项提示中的“做这项工作”的短语是关于信息缺失时如何处理的指示。如果不加指示,模型会顺畅地填补空白。如果被告知要标记出来,它就会标记出来。
出错时
几乎所有关于此的投诉都可归结为以下之一,而且大多数并非真正的故障。
| 你所见 | 原因 | 解决方案 |
|---|---|---|
| 摘要遗漏结尾 | 它进行了采样,但没有观看 | 给它完整的转录文本 |
| 上传被拒绝 | 超出512 MB文件大小限制 | 改为上传转录文本 |
| 上传次数用尽 | 免费计划每天允许3次 | 粘贴文本,这不算作上传 |
| 来自链接的模糊回答 | 它阅读了页面,而不是视频 | 粘贴转录文本 |
| 通篇错误的名字 | 错误存在于转录文本中 | 在提问前纠正专有名词 |
| 虚构的屏幕文本 | 文本落在采样帧之间 | 截屏该帧,粘贴图像 |
| 说话人混淆 | 源文件中没有说话人分离 | 使用带有说话人标签的转录文本 |
我实际会怎么做
短片段,并且你想大致了解其中内容:上传并提问。三十秒钟的工作,足够好的答案,没有理由构建复杂的流程。
任何你将引用、发布、添加字幕或据此行动的内容:首先正确地转录,快速浏览转录文本以检查错误的名字,然后将其交给ChatGPT。多花的两分钟是你可以信任的摘要和读起来流畅的摘要之间的区别。
如果你只记住一句话:永远不要让它转录。这是它最不擅长的任务,而且输出足够流畅,你可能不会注意到。
常见问题
ChatGPT能看视频吗?
不像人那样。它从上传的片段中采样帧和音频,并根据该样本进行推理。短视频效果相当不错。长视频会被略过,而且它不会告诉你它略过了。
ChatGPT能转录MP4吗?
不可靠。它是一个语言模型,而不是语音识别。你可能会从短片段中得到一些可读的内容,但没有可靠的时间戳或说话人标签,也不能保证这些词语确实被说过。
ChatGPT 可以总结视频吗?
是的,这是它的优势之一,但总结的完整性取决于您提供的内容。从完整的文字记录来看,它确实很好。从长视频文件中,它会总结它采样到的部分。
ChatGPT 可以翻译视频吗?
它能很好地翻译文本。先转录,修正错误,然后翻译。它处理语气和技术术语比一般翻译器更好,这是在这里使用它的真正原因。
ChatGPT 可以分析 YouTube 链接吗?
它可以访问页面,即标题、描述和元数据。那不是视频本身。如果字幕被禁用或视频是私有的,则根本没有任何可用内容。请改为粘贴文字记录。
我可以上传多大的视频到 ChatGPT?
根据 OpenAI 的文档限制,每个文件上限为 512 MB。一个长时间的 1080p 屏幕录像很容易超出这个限制,这是从文字记录处理的又一个原因。
我可以在免费计划中做到这一点吗?
免费计划每天可上传三个文件。粘贴的文本不会以相同方式消耗该额度,因此基于文字记录的工作流程在免费账户上比上传视频走得更远。
ChatGPT能识别屏幕上显示的文本吗?
有时可以,如果文本在屏幕上停留的时间足够长,能够被采样帧捕获到。任何短暂闪现的内容都会被错过。当某个特定帧很重要时,请截图并粘贴图片。
ChatGPT能区分不同的说话者吗?
只有在你提供给它的转录文本中已经包含说话者标签时才可以。它无法自行从音频中分离出不同的声音,因此说话者区分(diarisation)必须在上游完成。
为什么我的摘要遗漏了视频的一半内容?
因为它只总结了一个样本,而不是整个录音。摘要明显偏重开头的经典迹象。向它提供完整的转录文本,然后重新提问。
ChatGPT能分析Zoom或屏幕录制吗?
同样的规则适用。导出录音,将其转录,然后从文本进行分析。会议录音通常很长且涉及多位说话者,这正是直接上传表现最差的情况。
分析视频最快速可靠的方法是什么?
转录,快速浏览查找错误的专有名词,然后将文本连同具体问题粘贴到ChatGPT中。这个过程只需几分钟,并且比我尝试过的任何捷径都更有效。