ChatGPT 能创建视频吗?Sora 停用后现在还有什么能用?
On this page
大多数回答这个问题的文章都在描述一个已不存在的产品。
所以,坦诚的答案是 ChatGPT 不是一个视频生成器,而且截至今年,OpenAI 根本不向消费者销售视频生成器。
它非常擅长的是渲染之外的一切:概念、剧本、镜头列表、您输入实际生成器的提示词、旁白文案、字幕和编辑计划。这占据了大部分工作。它只是不负责生成 MP4 文件的那部分。
快速解答
ChatGPT 编写剧本、故事板、提示词、字幕和旁白,并能生成静态图像。它不渲染视频。自 Sora 于 2026 年 4 月关闭以来,制作实际片段意味着使用独立的生成器,而 ChatGPT 使这些片段值得生成。
- 它可以: 编写剧本、故事板、提示词、字幕和制作静态图像
- 它不能: 渲染片段、编辑时间线或导出视频文件
- Sora: 应用程序自 2026 年 4 月 26 日起停用,API 于 9 月 24 日终止
- 最便宜的实际途径: 重新利用你已有的素材
简短回答
不,不是你所理解的那种。
在 ChatGPT 中输入“帮我制作一个关于 X 的视频”,你将得到一个剧本、一段视频描述或一系列场景创意。你不会得到一个可以上传到任何地方的文件。没有渲染按钮,没有时间线,没有导出功能。
让人困惑的是,这在过去几乎是真实的。Sora 是 OpenAI 的视频模型,它确实令人印象深刻,并且曾有一段时间,可以通过聊天提示在 OpenAI 自己的产品内部生成一个完整的片段。这条路线已于四月关闭。
Sora 发生了什么
OpenAI 于 2026 年 3 月 24 日宣布关闭,并于 4 月 26 日关闭了网页和应用程序体验。API 将于 2026 年 9 月 24 日随之关闭。
原因在于资金,这些数字对于产品事后分析来说异常直白。Sora 每天的运营成本约为一百万美元,在其整个生命周期中总收入约为 210 万美元。再加上与迪士尼的授权协议破裂、持续存在的版权和深度伪造问题,以及一家正在提高利润率的公司,这项决定或多或少是显而易见的。The Decoder 有更完整的时间线,如果你想了解的话。
如果你在 Sora 中生成了任何内容但尚未导出,API 将于 2026 年 9 月 24 日关闭,此后剩余内容将被删除。请在 sora.chatgpt.com/sunset 仍可用时导出。
有两个实际后果。你找到的任何关于如何在 ChatGPT 内部生成视频的教程,无论发布时间多近,都在描述一个已停用的产品。而且 OpenAI 目前没有消费者视频生成器,所以“ChatGPT 视频生成器”作为一个产品并不存在,只有通过其他模型实现的流程。
ChatGPT 实际做什么
将任务分解成几个阶段,情况就会更清楚。ChatGPT 涵盖了其中大部分。
| 阶段 | ChatGPT | 你得到什么 |
|---|---|---|
| 概念和角度 | 是 | 主题、钩子、结构 |
| 剧本和旁白 | 是 | 对话、旁白文案 |
| 故事板和镜头 | 是 | 带时间轴的场景表 |
| 生成提示词 | 是 | 供其他工具使用的详细提示词 |
| 静态图像 | 是 | 缩略图、帧、参考图 |
| 字幕和标题 | 是 | 字幕文本、描述 |
| 渲染片段 | 否 | 需要视频生成器 |
| 时间线编辑 | 否 | 需要编辑器 |
| 导出文件 | 否 | 没有可导出的内容 |
六个“是”,三个“否”。但它不能做的这三件事,正是你真正想要制作的,这就是为什么诚实的说法是“ChatGPT 做的是前期制作”,而不是“ChatGPT 制作视频”。
文本到视频,现实情况
“ChatGPT 文本到视频”指的是两种不同的含义,而搜索它的人通常想要的是第二种。
第一种是将文字转化为视频计划。粘贴一篇博客文章,要求一个 60 秒的剧本、一个场景分解以及每个场景的提示词。ChatGPT 在这方面非常出色,而这正是大多数人跳过的部分,因为它感觉像做作业。
第二种是将文字转化为渲染好的片段。这需要一个生成器。ChatGPT 只负责交接;它不进行渲染。
给出限制条件,而不是主题
“一段关于生产力的视频”只会得到模糊的内容。平台、时长、受众和一个具体信息才能得到可用的东西。这里是简报在发挥比模型更大的作用。
获得剧本后,将其剪短三分之一
初稿总是偏长,而且旁白阅读速度比页面上看起来要慢。要求一个目标字数而不是时长,因为字数是它实际可以达到的。
用表格将其分解成场景
时间戳、旁白、屏幕上显示的内容、镜头备注。表格会迫使它专注于具体内容而不是描述氛围,它将成为你的镜头列表。
将每一行转化为生成提示词
每个场景一个提示词,然后将它们带到你使用的任何生成器中。这是交接点,也是 ChatGPT 贡献的终点。
如果你还没有确定生成器,免费 AI 视频生成器综述涵盖了导出限制和水印,如果你目标是 YouTube,还有一份YouTube 专用比较。
从照片制作视频
ChatGPT 可以查看照片并进行描述,提出它可能如何移动的建议,并编写用于动画制作的提示。它无法进行动画制作。
这听起来像是一个细微的区别,但事实并非如此。一个图像到视频的提示必须说明什么保持固定,什么移动,而这正是大多数尝试失败的地方:人们描述他们想要的运动,却对保留主题只字不提,导致面部在剪辑中漂移。
一个值得重复使用的提示应该涵盖主题及其必须保持不变的部分,你想要的一个特定动作,摄像机的操作,背景的表现,灯光,持续时间以及长宽比。让 ChatGPT 根据你的照片来编写这样的提示,它会做得很好,因为它可以看到图像并描述其中的内容。
编写视频提示
这是页面上最具可移植性的内容,因为一个好的提示适用于任何能经受住时间考验的生成器。
公式:主题、动作、环境、视觉风格、拍摄类型、摄像机运动、灯光、情绪、持续时间、长宽比,以及要避免的内容。如果漏掉最后一点,你将花费积分重新生成。
“[Subject] [action] in [environment]. [Visual style] look, [shot type], [camera movement]. [Lighting], mood is [mood]. [Duration], [aspect ratio]. Keep [what must stay consistent] unchanged. Avoid [what you do not want].”
“A woman in a grey coat walks along a wet city street at night. Cinematic, medium tracking shot moving with her, neon reflections on the pavement, cool blue key light. Mood is calm and a little lonely. 8 seconds, 16:9. Keep her coat and hair consistent throughout. Avoid text, logos, and other pedestrians.”
“A matte black water bottle rotates slowly on a pale concrete surface. Clean commercial look, close-up, slow orbit around the subject, soft diffused light from the upper left. 6 seconds, 1:1. Keep the bottle shape and label position fixed. Avoid reflections that distort the label, and no hands in frame.”
“A pair of hands opens a notebook and starts writing at a wooden desk. Warm natural style, overhead shot, slow push in. Morning window light. 5 seconds, 9:16, with the action centred in the upper two thirds so captions can sit underneath. Avoid readable text on the page.”
人们遗漏的细节是每个例子中的最后一点:要避免什么,以及为字幕留出空间的位置。这两点都能节省重新生成的时间。
动画和解说视频
与所有其他内容一样,分工明确。ChatGPT 负责编写,其他工具负责绘制。
它在动画方面真正有帮助的地方是角色一致性,这正是破坏大多数AI生成动画序列的问题。让它编写一个详细的角色描述,锁定它,然后将完全相同的文本块粘贴到每个场景提示中。不是它的摘要,而是相同的文本。一旦你在场景之间进行意译,角色就会开始漂移。
特别是对于解说视频,有用的技巧是要求剧本和屏幕文本以两个单独的列呈现。旁白和字幕逐字逐句地重复是解说视频中最常见的错误,尽早将它们分开可以避免这个问题。
ChatGPT 能编辑视频吗?
不是视频本身。但它能提供视频编辑方案,是的,而这正是大部分工作所在。
给它一个转录文本,它会找出重复内容,告诉你开场哪里拖沓,提出带有时间戳的剪辑建议,重写笨拙的旁白部分,并生成章节标记。它不能做的是触及你的时间线。你需要将它的笔记带到编辑器中,自己进行剪辑。
转录文本是关键。关于 ChatGPT 能否处理现有视频的更详细说明,请参阅 ChatGPT 是否能观看和分析视频 指南;关于如何导入文件,请参阅 将视频上传到 ChatGPT。简而言之,它需要文本,所以首先将视频片段通过 视频转文本转换器 处理,然后以此为基础进行工作。
这也是,悄悄地,用AI制作视频最经济的方式。完全不生成新的素材,而是使用你已经录制好的内容,提取转录文本,然后让ChatGPT从中剪辑出三个短片。没有积分消耗,没有渲染队列,而且素材是真实的。
成本
“免费”仅限于规划阶段,并止步于此。
| 阶段 | ChatGPT免费提供 | 成本出现在何处 |
|---|---|---|
| 剧本和分镜 | 是 | 免费套餐的消息限制 |
| 提示 | 是 | 无 |
| 静态图片 | 有限 | 免费账户的每日上限 |
| 渲染片段 | 否 | 其他地方的按生成次数计费的积分 |
| 画外音 | 否 | 文本转语音订阅 |
| 编辑和导出 | 否 | 编辑器,或水印 |
所以“ChatGPT 能免费制作视频吗”的答案有些尴尬:它能完成的那一半是免费的,而需要付费的那一半才是真正制作视频的部分。关于 ChatGPT 订阅本身涵盖的内容,我们有 ChatGPT 定价的详细说明。
ChatGPT 与视频生成器对比
它们不是竞争对手。把它们视为替代品,是人们最终对两者都感到失望的原因。
视频生成器接收提示并返回像素。它不会对你的钩子是否有效发表意见,不记得你制作的最后一个视频,也不会告诉你剧本超出了三十秒。给它一个模糊的提示,它会精美地渲染出一个模糊的片段。
ChatGPT 则相反:它在结构、判断和语言方面很强,但无法生成单个帧。它会很乐意告诉你你的概念很混乱,这比另一次渲染更有价值。
这种组合之所以有效,是因为生成器的主要弱点是提示质量,而这正是 ChatGPT 的用途。大多数糟糕的 AI 视频并非模型故障。它只是某人向生成器输入了十一个词,然后寄希望于此。
ChatGPT 在内容再利用方面真正无可匹敌。将其指向一份现有文稿,它将一次性将一段录音重构为短脚本、博客大纲和五种字幕变体。没有生成器能做到这一点,这是它在视频工作流中回报率最高的用途。一个AI 视频摘要工具或一个AI 视频观看器可以让你更快地获取原始素材,但重构是 ChatGPT 的优势。
问题出在哪里
有六件事反复出错,而且都不是模型故障。
| 会发生什么 | 原因 | 解决方案 |
|---|---|---|
| 片段忽略提示 | 一次给出太多指令 | 每个片段一个动作,然后拼接 |
| 角色面部变化 | 每场景重新描述 | 每次粘贴相同的描述块 |
| 脚本过长 | 要求的是时长,而非字数 | 给出字数,大约每分钟 150 字 |
| 旁白听起来像机器人 | 未指定语气或受众 | 明确说话者和听众 |
| 字幕与音频不匹配 | 基于草稿脚本生成 | 为最终录音而非脚本添加字幕 |
| 画面中的文字模糊不清 | 生成器渲染文字效果差 | 在提示中禁止文字,编辑时再添加 |
最后一点值得深思。不要要求视频模型生成屏幕文字。生成干净的片段,然后后期添加文字,这样你就能控制字体,并且文字也会真正清晰可辨。
我实际会怎么做
如果你已经有素材,就从那里开始。转录它,将转录稿交给 ChatGPT,然后从一段录音中剪辑出三个短视频。这不花钱,素材真实,并且胜过你本周可能生成的任何东西。
如果你确实需要新素材,请使用 ChatGPT 生成脚本和每个场景的提示,然后将这些提示交给生成器。提示是质量的来源,而且提示是免费的。
我不会做的事情是等待 OpenAI 推出替代品。Sora 每天亏损约一百万美元,在其整个生命周期中总共只赚了 210 万美元。这不是一个能很快回归的产品。
FAQ
Can ChatGPT create videos?
不能。它能编写脚本、故事板、提示、字幕,并生成静态图像,但它不渲染视频,也不导出文件。制作视频片段意味着使用单独的生成器。
Does ChatGPT have a video generator?
不再有。Sora 是 OpenAI 的视频产品,其应用和网站已于 2026 年 4 月 26 日关闭,API 将于 2026 年 9 月 24 日终止。OpenAI 目前没有面向消费者的视频生成器。
Can ChatGPT make videos for free?
它能完成的部分在付费计划中是免费的,在免费层级中也大部分是免费的,但对图像生成有限制。渲染、画外音和编辑都在其他地方进行,而费用就产生在那里。
Can ChatGPT turn text into a video?
它将文本转化为视频计划:剧本、场景以及每个场景的一个提示词。将这些转化为动态画面需要一个生成器。两者都被称为文本转视频,这就是混淆开始的地方。
Can ChatGPT make a video from photos?
它可以分析一张照片,并从中编写一个强大的图片转视频提示词,包括哪些内容应该保持不变。动画本身是在图片转视频工具中完成的。
Can ChatGPT create animated videos?
它编写剧本、角色描述和场景提示词。为保持一致性,在每个场景中重复使用一个相同的角色描述,而不是重新措辞,后者会导致角色失真。
Can ChatGPT edit an existing video?
它可以根据转录文本规划编辑:带时间戳的剪辑、节奏注释、重写旁白、章节标记。它无法触及您的时间线,因此您需要在编辑器中应用这些更改。
What happened to OpenAI Sora?
OpenAI 于 2026 年 3 月 24 日宣布关闭,于 4 月 26 日关闭应用程序和网站,并将于 9 月 24 日终止 API。其运行成本约为每天 100 万美元,而其总收入约为 210 万美元。
Can I still export my Sora videos?
是的,直到 2026 年 9 月 24 日 API 关闭。在此之后留下的内容将被永久删除,所以现在就导出任何你想保留的东西。
Is ChatGPT better than a dedicated AI video generator?
它们做不同的工作。ChatGPT 处理结构、脚本和提示。生成器渲染帧。大多数令人失望的 AI 视频都源于弱提示,这正是 ChatGPT 填补的空白。
How do I turn a ChatGPT script into a video?
将脚本分解为场景表,为每个场景编写一个生成提示,渲染片段,然后在一个编辑器中用旁白和字幕将它们组合起来。
Why does my AI video ignore the prompt?
通常是因为一个片段中有太多指令。生成器能很好地处理一个清晰的动作,但处理多个动作则很差。将其分成单独的短片段并拼接起来。
Can ChatGPT add text on screen?
它负责撰写文字。不要让视频生成器来渲染它,因为生成视频中的文字通常会变得模糊不清。生成干净的片段,然后在剪辑中添加文字。
What is the cheapest way to make video with AI?
重新利用你已有的内容。转录现有录音,让 ChatGPT 将其重构为短脚本,并从真实素材中剪辑片段。完全不需要生成积分。