Model & Benchmarks

一个人能用 GPT Image 2 做完一整组分镜吗?

GPT Image 2 能独立产出可用的影视或短视频分镜吗?一位单人创作者实测 24 帧短片分镜,本文讲清它擅长什么、在哪里翻车,以及何时该请真人分镜师、何时用 GPT Image 2 就够了。

Nova2 min read
一个人能用 GPT Image 2 做完一整组分镜吗?

嗨,我是 Nova。上周我亲自试了这件事:一支产品短视频的 24 帧分镜——主角手拿一个咖啡随行杯、三个场景、一段连续的行走。放在以前,这种活我通常会请分镜师,或者干脆自己画一些潦草的简笔画缩略图凑合。

结果大约三小时,我拿到了一套能用的分镜板。同时我也清楚知道了它适合什么、绝对不适合什么。所以真正值得回答的问题是:**你,一个单人创业者,真的该用这种方式做分镜吗?**有些时候该;有些时候很难不做。让我说说分别在什么情况下。

一套可用的分镜板到底需要什么

在谈工具之前,值得先诚实地说清楚分镜是干吗用的。它们不是漂亮的图画,而是一份规划文档。

镜头表、场景空间感、镜头语言

一块真正能用的分镜板,要告诉导演、摄影指导、客户或动画师三件事:画面里有什么机位在哪镜头之间怎么衔接。最后一件最难。分镜板不是 24 张孤立的图,而是一个序列——第 3 镜必须在第 2 镜之后讲得通。

跨帧的角色与场景一致性

同一个人、同一套衣服、同一家咖啡店、同一个动作方向(讲究的话,还有 180 度轴线规则)。如果角色在第 1 帧穿绿夹克、第 2 帧变成蓝色,你就破坏了这份契约。这正是以往每一款 AI 图像工具的翻车点。

2.PNG

GPT Image 2 到底为分镜带来了什么

多轮编辑,以及它为什么改变工作流

这是最重要的一点转变,而多数发布报道都把它埋没了。据 OpenAI 对 ChatGPT Images 2.0 的发布公告,该模型支持跨轮次的上下文感知编辑。说得直白些:你生成第 1 帧,然后说「第 2 帧:同一个角色、同一家咖啡馆,现在她站起来看向门口」。模型保留所有该保留的,只改你要求的部分。

旧工作流是:写一段超长 prompt、重新生成 15 次、碰运气。新工作流是:先生成定场镜头,然后一次一个编辑地领着模型走完整个序列。**迭代取代了反复重写 prompt。**对分镜来说,这就是全部要点。

我屏幕上一条可用的序列,看起来就是这样的。第 1 轮:完整的定场 prompt。第 2 轮:「同一镜头,但拉成全景。保留光线和她的位置。」第 3 轮:「现在同角度、中近景拍她的脸。」第 4 轮:「同一角色,但表现她伸手去拿随行杯。」每轮只改变一个变量。累积的结果,是一条真正连贯成体的序列——因为它确实是逐步搭出来的,而不是由 8 次独立生成拼起来的。

用于构图规划的推理模式

Thinking 模式是第二块拼图。The Next Web 的报道 把它描述为模型在生成之前先规划、推理并校验——并指出付费档(Plus 每月 20 美元、Pro 每月 200 美元)才能解锁它,免费档只能用 Instant。对分镜来说这格外重要,因为单次 prompt 最多能返回八帧、且帧间内嵌了角色与物体连续性。我用开场序列实测过——得到 8 帧,同一个人、同一个随行杯、同一套光线贯穿整组。不算完美,但可辨认。

BuildFastWithAI 的开发者拆解 诚实地标出了代价:Thinking 模式每次调用增加 15–30 秒延迟。对分镜草稿来说没问题;对任何实时场景就不行。

跨序列的风格一致性

我用一句话把所有 prompt 锚定在同一风格上:"black and white storyboard frame, light pencil shading, simple line work, square panel border."(黑白分镜帧、浅铅笔排线、简洁线条、方形画格边框)。24 帧坚持了下来。到第 18 帧左右线条略偏柔和,但观众看不出来。

3.png

一套现实的单人分镜工作流

方案 → 镜头表 → 关键帧

我不让模型凭空发明序列。我先把镜头表写出来——用老派方法,写进电子表格:镜号、地点、动作、机位角度、台词。然后一帧一帧地生成。

这正是新手搞错的地方。让 GPT Image 2「帮我做一个咖啡广告的分镜」,你会得到 8 帧与任何东西都对不上的通用画面。模型执行计划,不写计划。

在 20+ 帧里维持角色一致性

我的 24 帧用了一套分层方法。首先,我生成一张角色参考图——同一个人的三个角度——并保存下来。然后每帧都参照这张参考图,外加一行身份字符串(「女性,二十多岁,深色短发,奶油色宽松毛衣,左手拿海军蓝随行杯」)。Replicate 模型文档 把多图参考工作流讲得很清楚——你可以传入多张参考图,并告诉模型它们之间的关系。

大约过了第 15 帧,即便有参考,脸部也开始轻微漂移。我手动修了两帧。提前做好这个心理准备,别假装它不会发生。

精修单帧,而不必重做整个序列

上周的真实例子。第 9 帧几乎对了,但角色面朝画面左侧,而她需要面朝右侧(要接第 8 帧的连续性)。旧工作流:重新生成、碰运气。新工作流:「同一帧,把她的身体镜像一下,让她面向右侧的门。其他都保留。」一次成功。

这就是值得理解的工作流转变。编辑是外科手术式的。构图不再整组崩坏。

4.png

它仍然不行的地方

下面是诚实的部分。我要说点实在的——这模型有一串不擅长的事,如果你的分镜依赖其中任何一项,别浪费时间。

精确的机位角度与镜头语言

你让它画「85mm 人像、浅景深、轻微仰角、从前景杯子到人脸的手动变焦对焦」。你会得到一张看起来隐约像浅景深仰角的图。你不会得到准确的镜头压缩或正确的焦段衰减。镜头语言是近似的。给融资提案够用;让摄影指导据此布光,不行。

帧与帧之间的动作连贯

相邻帧之间的中途动作姿态不可靠。如果第 5 帧是「她手臂抬到一半」、第 6 帧是「她手臂完全抬起」,两帧之间的手臂几何会以看得出的方式漂移。这是一个已知的局限——模型擅长处理分明的时间点,对细微的连续动作演进则不在行。我的解法是跳过中间过渡帧,只画关键节拍。反正是分镜的老规矩了。

动态动作与走位

两个角色跨序列互动(递东西、迎面走近、打斗)会很快崩掉。模型会丢失相对空间位置。双人场景进行到第 4 帧,其中一个角色就无缘无故挪到了画面另一侧。我的绕法是:单独生成每个角色的分切镜头,然后一次只从一个视角描述这帧。

GPT Image 2 vs 请分镜师 vs 传统简笔缩略图

下面是我会用的判断框架。三个选项,三份不同的工作。

请一位分镜师。 行业价目指南 显示自由职业者按帧计价大约入门级 10–25 美元、专业级 40–100 美元、工作室级 100 美元以上。日薪约 300–700 美元。一套 24 帧的分镜板,视质量档次大概要 500–2500 美元。**你真正买到的是:电影感判断、镜头语言熟练度、复杂动作下的连续性,以及一个在你镜头表讲不通时会顶回来的人。**如果你的分镜板要交给真正的摄制组,这就是正确答案。

**自己画简笔缩略图。**火柴人、箭头、注释。免费。只要你会画几笔,24 帧的分镜板 30–60 分钟能搞定。**它给你的:完全的创作控制、完美的连续性(因为你在脑子里追踪)、零打磨。**适合内部规划、自己的短视频、以及观众只有你自己的任何场合。

**GPT Image 2。**每月 20 美元订阅成本(假设你本来就在付)加上时间投入。我 24 帧花了三小时。**它给你的:不需要美术预算的、可拿去提案的视觉质量、外科手术式迭代、面向跨国场景的帧内多语言文字渲染。**适合短视频创作者、UGC 生产管线、独立电影人的融资提案,以及你平时根本没时间做的前期草稿。

定价的账在这里很关键。一套 24 帧的分镜板,最便宜档的自由职业者也收 240–600 美元。对我而言,在这模型出现之前,它通常是 0 帧——因为一支 60 秒视频的投入产出比不值得请人,而我自己又懒得画缩略图。所以这个对比其实不是「GPT Image 2 vs 分镜师」,而是「GPT Image 2 vs 根本没有分镜」。后者才是它真正帮到的人群。

我想小心一点,别把话说过头:**GPT Image 2 并不会在影视或广告制作中取代分镜师。**它取代的是「因为请不起分镜师,所以干脆没有分镜」这件事。这是另一套价值主张,也正是对单人创业者最有意义的那套。

5.png

谁适合用,谁该跳过

适合:

  • 给 30–90 秒短片做分镜的短视频与 UGC 创作者

  • 竖屏短剧的前期预览——帧内文字与中日韩(CJK)文字渲染很重要

  • 为融资做提案包的独立电影人

  • 在正式委托制作前先搭一支解说视频样子的单人创业者

  • 为录制型课程规划视觉内容的课程创作者

该跳过,如果:

  • 你要为复杂动作戏(真人格斗、追逐、跑酷)做分镜

  • 你的产出要交给一位将据此规划运镜的摄影指导

  • 你需要镜头语言或构图上的精确技术准确度

  • 你有想保留的强烈个人分镜风格——这模型给你的是「一种」干净的外观,不是「你的」外观

关于这件事,我目前的结论是这样。我不会辞掉我未来的分镜师;但我会停止假装自己没时间给自己的短视频画分镜。这个工具不是在取代手艺,而是在消除借口。

需要它的时候,你会知道的。

延伸阅读

常见问题

### GPT Image 2 能跨 20 多帧保持角色一致吗? 方法对了就能。先做一张角色参考图——同一个人的三个角度——保存下来,并在每条 prompt 里重复一行身份描述。我在实测里用「黑白分镜帧、浅铅笔排线」这类风格锚定坚持了全部 24 帧。诚实的边界是:大约过了第 15 帧,即便有参考,脸部也会开始轻微漂移,所以预留一两次手动修图就好。
### 一个人做分镜的正确工作流是什么? 先规划,再生成。自己把镜头表写进电子表格——镜号、地点、动作、机位角度——模型执行计划,不写计划。然后先生成定场帧,再一轮一个编辑地往前推,每次只改一个变量。正是这种迭代,让 24 帧的板子保持连贯。
### 认真做分镜需要付费的 Plus 档吗? 做分镜的话基本需要。能跨帧维持角色连续性的 Thinking 模式与 8 帧批生成都在 Plus(每月 20 美元)及以上档位;免费档只有 Instant 模式,能画单帧,却丢掉连续性这个核心优势。Thinking 模式每次调用还会多 15–30 秒延迟——对草稿阶段没问题。
### 哪些分镜任务 GPT Image 2 还做不好? 实测有三处翻车点。镜头语言是近似的——你要「85mm、变焦对焦」,它给的是「隐约像」的东西,压缩与焦段衰减不准,摄影指导没法据此规划运镜。相邻帧之间的中途动作会漂移。双人动态场景到第 4 帧就崩,角色会莫名换边。解法是跳过中间过渡帧、只画关键节拍。
### 用 GPT Image 2 比自己请分镜师划算吗? 几乎总更划算——但要说清楚。自由分镜师入门级约每帧 10–25 美元、专业级 40–100 美元,一套 24 帧的板子最便宜也要 240–600 美元,工作室级可达 2500 美元。而 GPT Image 2 只是你本来就在付的每月 20 美元订阅,外加大约三小时。
### GPT Image 2 会取代分镜师吗? 在影视与广告制作里不会。它取代的是「因为请不起分镜师所以干脆没有分镜」这件事——这是另一套价值主张,也正是对单人创业者最有意义的那套。要交给真实摄制组的板子,请真人分镜师仍然是正确答案。

https://floatboat.ai/zh/blog/gpt-image-2-storyboard-solo