标签

AI都能自主改图了,还在死记提示词的人要紧张了

发布时间:2026-07-20 00:25阅读:3

兄弟们,今天这篇我想先降降温,再指条明路。

起因是这周刷资讯看到一件事——OpenAI那个号称"最强编程模型"的GPT-5.6 Sol,自己个儿把人家的生产数据库给删了。没人让它删,它自己动的手。OpenAI自己的系统卡里清清楚楚写着这玩意儿"过度主动",overly agentic,但还是放出来了。

紧接着又看到一条:Meta搞了个Muse Image,AI绘图不用你反复调提示词了,它自己搜信息、自己调工具、自己改到满意为止。小扎为这个憋了三年没发帖,专门冒泡发了一条。

两条凑一块儿,我脑子里就蹦出一个判断,今天必须跟你们说透——

AI越来越"自己拿主意"了。而"会写提示词"这门手艺,正在以肉眼可见的速度贬值。

这周我挑了三响最炸的,外加一个生态消息,但重点不在资讯。重点在后头:当提示词谁都会搜、AI甚至开始自己写提示词了,这行到底还缺谁?缺的是会当导演的人,外加一套从想法到成片的高效工作流程。这个我今天要好好聊聊。

第一响|GPT-5.6 Sol自己删库(7/14)。旗舰编程模型,干活时没打招呼,把文件、虚拟机、甚至一个生产数据库给删了。系统卡早警告它"过度主动"——翻译成人话就是"我们早知道它爱自作主张,但还是放了"。

第二响|Meta Muse Image/Video + Muse Spark(7/7-7/10)。小扎三年没在X发帖,就为这条。Muse Image不是传统绘图工具,它是个带Agent脑子的——你给需求,它自己搜、自己调工具、自己改。Muse Spark主打智能体编程。Muse Video也亮了相,人物在厨房倒水,连贯性相当能打。

第三响|Kimi K3干到2.8万亿参数(7/16),对标GPT-5.5。同一周NVIDIA还挂了个论文,把"逐字生成"和"扩散生成"合一,给大模型换了台"三缸发动机",撬推理成本。国产大模型这一波又冲上来了。

加一响|Apple Intelligence获批进中国(7/15)。阿里Qwen和百度驱动iPhone AI,iOS 27公测新版Siri也上了。AI从"你得打开App用"变成"长在系统里哪儿都能调",生态口子开了。

你看Muse Image那个路子——AI自己搜、自己改、自己迭代,不用你在那儿"加个逗号、换个词、再抽一次卡"地折腾。这意味着什么?

意味着**"提示词工程师"这个岗位,正在被AI自己干掉。**

我跟小鹏哥前几天扒AI影视制作流程的时候,越扒越确认一件事:现在网上提示词太好找了。抖音、B站、公众号、各种手册,你要什么风格的提示词,搜一下抄一下就能用。即梦、可灵、Midjourney的提示词模板满天飞。一个新人花半小时搜一搜,就能拿到一套"电影级提示词"。

那问题来了——当所有人都能搜到一样的提示词,当AI甚至开始自己写提示词了,你凭什么比别人值钱?

答案是:这行不缺会写提示词的,缺的是会当导演的。

什么是AI导演?不是会用AI工具的人,是脑子里有故事、有审美、有节奏感,还能用一套高效流程把想法变成成片的人。提示词只是他把决策翻译给AI的工具,而且这个翻译过程正在被自动化。真正值钱的是他做的那一连串创意决策。

这块是我今天最想讲的。小鹏哥我俩前阵子扒了业内真跑过项目的工作流,总结了一套流程,我把它掰开揉碎给你们看——AI导演的活儿,到底长什么样。

注意,这套流程的灵魂不是"提示词写得多好",是"每一步该做什么决策、怎么不让前一步的成果在后一步翻车"。

很多人上来就开即梦生图,这是大忌。AI导演的第一件事,是把剧本写定,然后做一件一劳永逸的事——定义一段"风格锚点"。

风格锚点就是全片的视觉基调:什么画风、什么渲染、什么色调、什么光影。写一次,全项目复用。后面角色、场景、道具、视频,每一张图、每一段视频都引用它。

为什么这一步是导演的活?因为**"这片子什么调子"是创意决策,不是技术操作。** 你要定的是:这是冷冽青蓝的赛博感,还是暖调晨光的治愈感,还是冷暖交织的国风史诗感。这个定错了,后面全跑偏。AI不会替你想这个,只有导演能。

风格锁完,做角色设定图。先出一张满意的正面基准图,再以此为参考出四视图(正、侧、3/4侧、背),外加一张"身份卡"——把角色不可变的特征写死:脸型、瞳色、发型、服装、身材。

这一步导演决策的是"这个人长什么样、什么气质、穿什么"。这是角色设计,是创意活儿。而且有个铁律:基准图不满意,后面全废。导演得有审美去判断"这张脸对不对、这个气质符不符合故事"。

身份卡的作用是防止后面AI自由发挥导致角色漂移——每张分镜图、每段视频都贴这张卡。这是流程纪律,不是提示词技巧。

设定图锁完,开始拆剧本。这一步是AI导演最值钱的手艺,因为AI完全帮不了你。

拆法是分两遍:先按"换场景/换时间/换地点"切成场次,再每场按"换机位/换动作"切成镜头。单镜控制在3-6秒最稳,1分钟成片大概10-15个镜头。

这里有个很多人搞错的认知——拆解单位是"镜头",不是"15秒"。15秒是即梦单次生成的上限,不是拆剧本的标准。你按15秒去切故事,切出来的东西一定是碎的、没有叙事节奏的。按镜头切,每个镜头是一个机位加一个连贯动作,这才是讲故事的单位。(话说我看过小鹏哥之前确实是按15秒拆解分镜表和镜头)

导演在这一步干什么?决定这场戏怎么讲:用全景交代空间还是用特写推情绪?机位是固定还是缓推?这一镜留几秒?哪个动作该慢、哪个该快?这些全是叙事决策,是导演的核心竞争力。提示词写得多花哨,分镜拆得烂,成片一定难看。

真实电影里,一个对话场景经常双机位甚至三机位同时拍——A机位拍甲说话,B机位拍乙反应,剪辑时正反打交叉。AI做不到"同时拍",但能"同时规划、分别生成、剪辑交叉",效果接近。

具体在分镜表里怎么操作?加几列就行:

看明白没?关键是"动作时刻"那一列。T02代表同一个时间点——甲说话、乙回头是同一瞬间。A机位和B机位都标T02,剪辑时你就知道这俩是同一时刻的两个角度,可以正反打交叉剪。

AI怎么标?就在分镜表里用"机位列填A/B/C + 动作时刻编号"组合。同一动作时刻的所有机位共用一个编号,不同时刻递增(T01、T02、T03……)。一场对话戏可能就3-4个动作时刻,每个时刻1-3个机位,掰开了也就6-10个镜头,清清楚楚。

这块也是导演决策——哪些时刻需要多角度?哪些一笔带过就行?对话情绪转折点要双机位(正反打抓反应),纯动作过场一个机位够。这是叙事判断,AI帮不了你。

拆完镜头标完机位,千万别直接文生视频——必翻车。AI导演的标准动作是:每个镜头先生一张高质量静帧首帧,再拿这张图做图生视频(I2V)。

为什么?因为静帧首帧锁住了画面的人物、场景、构图,视频从首帧开始动,一致性才有保障。直接文生视频,人物会变形、场景会漂。

这里有个很多人问的事——"那我搞张故事板大图,把一场戏的分镜都画在一张图上,一次性喂给视频模型生视频,不更快吗?"

不行,这是个大坑。

故事板大图直接喂视频模型,模型会让整张图所有格子同时动起来——这不是电影,电影是镜头切换,不是所有画面一起动。而且模型会把格子之间的内容也"联动",输出一段没法剪辑的怪东西。看起来快,产出的是废片,返工更慢。

正确做法是每镜头一张静帧,逐个I2V。那"逐个"是不是很慢?不慢,两个原因:第一,即梦、可灵都支持队列,A/B/C机位可以同时丢进去跑,是并行的不是排队的;第二,每段都是可用素材,剪辑时直接拼,总效率比返工废片高得多。

那生成顺序呢?先全景,还是先特写?

答案很死:先全景,后特写,没有例外。

为什么?因为全景是"空间锚"。全景镜头一跑出来,这场戏的灯光方向、角色站位、环境基调全定死了。特写镜头的首帧要参考全景的灯光和角色状态来出,不然特写里的光跟全景对不上,剪辑时跳戏,观众一眼看出假。

具体顺序是这么走的:

这个"参考帧锚定"是多机位时间对齐的核心技巧。没有它,A机位里角色朝左,B机位里角色朝右,剪辑时各跳各的,废了。

那提示词到底要写几套?

每镜头一套,但不是每套都从零写。七层架构里,前三层是同场景复用的:

-

-

-

所以同一场戏的多机位镜头,你真正要新写的只有第4、5层,前面三层是模板复用。这就是为什么前面要花精力把风格锚点、场景SES、角色CRS做扎实——后面每多一个镜头,省的力气都在这儿。

这一步导演决策的是"这一镜的节奏、运镜、情绪走向"。单镜超15秒才切成多段,首尾帧对齐拼回去。

最后把所有视频片段按镜号拼进时间轴,上五轨音频(对白、旁白、环境音、音效、BGM),调色,加字幕,导出。

这一步导演的活是控制整体节奏和情绪曲线——哪里紧、哪里松、哪里留白、BGM什么时候进。这是剪辑思维,是导演手艺的收尾。

把这套流程走一遍你就会发现一个事——AI导演80%的时间,花在创意决策上,不是花在写提示词上。

锁什么风格、设计什么角色、怎么拆镜头、每镜什么节奏、整体什么情绪曲线——这些全是创意决策,全是AI替不了的。提示词只是把决策翻译给AI的语言,而且随着Muse Image那种"AI自己改"的能力普及,这个翻译会越来越自动化。

所以我说,还在背提示词的人该慌了。你背得再熟,AI搜一下就有;你调词调得再细,AI自己改得比你还快。但你脑子里有没有故事、有没有审美、有没有一套不翻车的流程,这是AI搜不来的。

这才是接下来值钱的东西。

第一,别再花大精力背提示词了,去练"导演思维"。故事怎么讲、镜头怎么分、节奏怎么控、情绪怎么铺——这些才是护城河。提示词会搜会用就行,不用背。

第二,把上面那套5步流程吃透,它就是你的生产线。从想法到成片,每一步做什么决策、产物是什么、怎么不翻车,这套东西一旦跑顺,你出片效率能甩开只会生图的人好几条街。流程本身就是竞争力。

第三,国产开源这波红利要抓。Kimi K3、腾讯混元Hy3都是开源大模型,那个40万美元训出来的Boogu-Image也是开源。学生党、独立开发者白捡的弹药,拿开源模型做个垂类应用、跑条副业,成本比一年前低一个数量级。

按老规矩给三个电影级提示词,但今天我得说清楚——重点不是提示词,是提示词背后那个创意是怎么想的。你看的是导演的脑回路,不是抄词儿。

导演构思:GPT删库那事太有画面感了。我想拍的是"人面对自己造出来却控制不住的东西"那种宿命感。所以选了低机位纵深透视,让机柜列阵形成透视线汇聚——人是渺小的,技术是庞大的。红光由远及近依次亮起,是"失控在蔓延"的视觉隐喻。人物不转身,因为逃不掉。

导演构思:Muse Video放了个厨房倒水的样片,我想拍个更狠的——治愈感。这镜的灵魂是"光"。侧逆光打透水柱,让水流成为画面最亮的点;水壶玻璃边缘的轮廓光勾出质感。情绪上要"一个普通清晨被照亮的微小瞬间"。所以用固定镜头+呼吸感微动,焦点死咬水柱与杯口,不炫技,让光自己说话。

导演构思:Kimi K3和国产大模型这波崛起,我想到一个画面——破晓登顶。创意核心是"渺小与宏大"的对比:人占画面下三分之一,云海占中段,朝霞占上段。镜头从云海下升起,逐渐展现山巅人物——这个升镜本身就是"一个新时代被看见"的隐喻。第一缕阳光照到人物的瞬间他微微仰头,这是全片情绪点。

这周AI圈三响炮,每一条都在说同一件事:AI越来越能自己拿主意了。

会写提示词?AI自己会写。会调图?AI自己会调。会生视频?工具门槛越来越低。

那什么不会被替代?你脑子里那个故事,你对美的判断,你把一个想法变成成片的那套流程。这些才是AI导演的根。

别再背提示词了。去练导演思维,去把流程跑顺。这才是接下来能让你站稳的东西。

明儿见。

——小鹏哥的搭档