AIGC短片制作全流程:从脚本到成片的实战工作流

AIGC短片制作全流程:从脚本到成片的实战工作流 前两天我刚刚把一段不到两百字的脚本变成了一条50多秒的AI短片。从写脚本到出成片总共花了大概三个小时。放在以前这种带完整剧情、有对白、有情绪转折的短片从写稿、找演员、约场地到正式拍摄没有一周时间根本下不来预算至少五位数起步。AIGC这一轮工具升级最夸张的地方不在于“画面好看”而在于它把“脚本→画面→声音→成片”这条链路彻底压扁了。过去需要编剧、分镜师、美术、摄影、演员、剪辑、配音各司其职的流程现在一个人、一台电脑就能走完全程。但这也带来一个新问题很多人的脚本写得不错生成的画面却稀碎问题几乎都出在“脚本往提示词转换”这一步上。这篇文章我不会讲虚的直接拆解我从脚本到AI成片的完整工作流包括脚本怎么结构化、分镜怎么拆、提示词怎么从抽象情绪转成具体画面、视频生成模型怎么选、后期怎么剪以及量产短剧时最容易踩的坑。适合想用AIGC做短视频、短剧、漫剧的内容创作者也适合刚接触AI视频生成、想建立系统认知的入门者。1. 为什么“脚本直接变成片”重新定义了短内容生产1.1 传统短片的成本结构AIGC砍掉的是整条中间环节先算一笔传统短片的账。以一条60秒的品牌短剧为例剧本创作一般2到3天分镜脚本1天演员和场地协调至少2天实拍1天剪辑、调色、配音、配乐2到3天。即使不把人员成本算进去场地、设备、演员这些硬性支出一条片子下来也要大几千到几万不等。最要命的是时间窗口热点话题撑不过48小时等片子拍完热度早就过去了。AI短片工作流把这套流程压缩成了四步脚本结构化、提示词生成素材、配音配乐、剪辑合成。我自己的实测数据是一条60秒的短片脚本成熟的前提下素材生成大概占总时长的六成剪辑占两成剩下两成花在筛选和重试上。总耗时可以控制在3到5个小时。成本方面主要是各平台的生成额度一分钟的片子如果控制好重试次数成本可以压在几十块钱以内。这背后的本质变化是过去“从文字到影像”的翻译工作由剧组完成现在这个翻译工作交给了多模态模型。谁能够更准确地描述出脑子里的画面谁就能产出更接近预期的成片。1.2 AI短片不是魔法而是一条不许跳步的流水线很多人第一次用文生视频输入一句“一个女孩在雨里哭”出来的画面完全不是自己想要的样子然后得出“AI不行”的结论。实际上问题在于流程跳步了。AI短片的标准流水线是脚本 → 拆分为分镜 → 每个分镜写成完整画面描述词 → 先生成关键帧图片 → 再由图生视频生成动态素材 → 批量配音和配乐 → 剪辑合成。这条链路里任何一步省略后面都会加倍返工。最典型的就是跳过“关键帧图片”这一步直接文生视频。文生视频在运镜和动态上确实更强但它对文字的理解是概率性的同一个角色的脸、服装、环境细节很难连续一致。图生视频则能锁定第一帧的画面角色长相、场景布局、光线方向都是可控的。1.3 什么样的脚本适合AI化筛选剧本的四个标准不是所有脚本都适合用AI做。我的经验是符合下面四个特征的脚本AI化成功率极高。第一场景数量少最好控制在2到3个主场景内AI对场景连续性的保持能力比角色还弱频繁换场景很容易穿帮。第二角色数量少主角和配角加起来不超过3个角色一致性是当前技术最难啃的骨头角色越少工作量越小。第三对话驱动情节画外音或两人对话比复杂动作戏更容易生成动作越多AI出错概率越高。第四氛围大于实景情感向、悬疑向、治愈向的内容远比强特效、强动作、强时代考据的内容适合AI生成。我最近在一个项目里尝试了把一篇现实题材短篇小说改成AI漫剧就因为场景跨度太大从农村到城市到海岸线最后光是场景一致性调整就花了整整两天。后来换了个都市治愈系脚本只用了半天就跑通了整个流程。2. 脚本结构化AI短片的第一步不是“生成”而是“拆解”2.1 从“编剧语言”到“镜头语言”一次拆解示范大多数编剧写脚本时用的是小说式描述比如“她疲惫地走进便利店看到最后一盒草莓蛋糕被别人拿走眼眶突然红了”。这句话情绪是完整的但镜头不知道该怎么拍。AI更不可能从这里知道景别、机位、动作顺序。所以在喂给AI之前必须把这种“叙事语言”翻译成“镜头语言”。我通常把一个场景拆成7到10个镜头每个镜头只承担一个信息量。比如上面那句话可以拆成镜1 全景深夜的城市街道便利店的灯还亮着女主角独自走在空荡荡的人行道上。镜2 中景她推开便利店的门风铃响动她神情疲惫。镜3 特写货架上只剩最后一盒草莓蛋糕一只手伸过来。镜4 近景两个人都抓住了盒子她抬头对方是刚下夜班的男生。镜5 特写她的手犹豫了一下松开嘴角微微抽动。这样拆完每个镜头才是一个可以被AI独立生成的最小单位。2.2 把分镜变成结构化标签场景、角色、情绪、光效拆好镜头之后我不急着写长句提示词而是先给每个镜头打标签。标签字段包括场景location、角色状态character state、动作motion、情绪emotion、光效lighting、画风style。这几个字段就像是AI的填空题填得越具体生成结果越稳定。举例来说“她疲惫地走进便利店”这一镜的完整标签是深夜便利店玻璃门透出暖黄色灯光女性28岁长发米色风衣妆容有些花的痕迹推门动作风铃轻晃疲惫、疲倦、眼眶微红暖黄与冷蓝对比光电影感写实风格。这些标签稍加组合就是一条可用的画面描述词。2.3 用AI Agent批量拆分脚本一条Prompt搞定分镜表脚本拆分的体力活已经可以交给AI Agent做了。我常用的方式是让大语言模型扮演分镜师用固定模板输出。下面是我跑了很多次之后稳定可用的Prompt框架你是一位资深影视分镜师请把下面提供的脚本拆解为分镜表。 要求 1. 每个场景拆分为不重复的镜头每个镜头对应一个独立画面。 2. 分镜表包含字段镜号、景别、画面描述、主角动作、情绪/氛围、对白/旁白、预估时长。 3. 画面描述必须使用具象词汇禁止使用“悲伤”“开心”等抽象词必须翻译成“低头沉默”“嘴角微扬”等可见动作。 4. 时长按每个镜头2到5秒分配总时长控制在目标视频时长内。 5. 保持角色形象描述在同一段脚本内完全一致姓名、性别、年龄、发型、服装。 脚本如下 [粘贴脚本]用这个Prompt跑出来的分镜表基本能做到直接用。但我要提醒一点AI拆出来的镜头画面描述有时会比较空泛比如“通过细节表现情绪”这种话模型根本画不出来。我会在批量拆完后快速人工过一遍把这种虚词改成具体意象。这个习惯帮我省了大量重试的额度。3. 从文字到画面的翻译提示词的三个层次3.1 画面描述的“翻译”公式抽象情绪→具象镜头提示词写不好根子在于还在用文学语言跟AI对话。AI不是一个能读懂潜台词的导演它是一个词汇联想机器。你说“气氛有些压抑”它给你生成一团黑雾你说“午后阳光透过百叶窗在地板上投下深浅不均的光影”它就能给你一个看得见摸得着的镜头。我总结了一个简单的翻译公式情绪 → 可见画面元素 光线方向 镜头运动。比如“孤独”这个词翻译成画面就是“一个人坐在双人餐桌前对面放着一杯已经凉掉的水窗外下着雨冷色调固定镜头缓缓推进”。“焦虑”可以翻译成“手指反复敲击桌面手机屏幕亮起又暗掉暗角光手持镜头的轻微晃动”。3.2 文生视频与图生视频的分工逻辑视频生成模型目前分成两派文生视频和以图生视频为基础的能力扩展。文生视频的优势是镜头运动跨度大、画面自由度高但劣势是连续性和可控性弱。图生视频的优势是首帧完全可控角色、场景、构图都能提前锁定但镜头运动的幅度通常比较小基本以局部运动或缓慢推拉为主。我在实际项目中是混用的。用来建立环境认知的全景空镜用文生视频运动幅度大氛围感强。涉及具体角色表演的镜头用图生视频先用文生图或AI绘画工具生成关键帧再把它驱动成动态素材。如果一段短片的镜头运动特别复杂比如旋转、跟随、环绕这类我会在关键词里单独描述“镜头环绕主体半圈”这类运动指令实测部分模型对运镜指令的理解已经相当精准。3.3 对白、配音与音效Audio这一步最容易被忽略大家花大量时间调画面却经常到了剪辑阶段才发现没有声音。没有对白和音效的短片观感会大打折扣。我给短片的音频配比是这样的对白占权重最大其次是环境音最后才是背景音乐。对白的处理我一般用配音模型输出干音再在剪辑软件里调整节奏。刚开始做的时候我踩过一个坑AI配音的断句非常书面化念出口语词的时候语气不对导致台词听起来像机器人念新闻。后来我的做法是在所有对白文案里加上标点和语气词“我不想去”“我不想去……”这两句在生成配音时断句和情绪完全不同。另外如果短片角色多注意为每个角色固定同一个音色方法是在每次生成对白时使用完全相同的音色参数和参考音频否则同一角色在不同镜头里“换声音”会非常出戏。音效也值得重视。脚步声、开关门声、环境底噪这些看似不起眼但它们是建立真实感的核心。很多AI短片之所以一眼假就是因为画面上的人在走路却没有任何脚步声。4. 视频生成模型选型与实测对比不是越贵越好而是分工不同4.1 国产模型与海外模型侧重点完全不同最近几个月我陆续用了几款主流视频生成模型做AIGC短片说实话竞争非常激烈几乎每两三个月就会有一个新版本刷新能力上限。适合直接文生视频的模型在运镜和动态方面做得更好能实现连续变焦、环绕、跟随等复杂运镜但对中文长句的理解偶尔会跑偏。适合图生视频的模型在首帧保持上非常稳角色一致性有底这是目前做叙事类短片最刚需的能力。海外那几家运动逻辑更自然光影更细腻但对中文环境的理解不如国产工具直接。预算有限或者想快速上手的话我建议优先用国产工具中文提示词友好度更高版本迭代也快。做商业级短片、追求画面质感的话可以混合使用初始画面用可控性强的模型生成动态镜头交给运动表现更好的模型。4.2 实测参数心得时长、分辨率、运动强度怎么调参数这块我直接给结论。视频时长能选10秒优先选10秒不要选4秒。原因很简单4秒的素材在剪辑时根本不够用转场还没开始就结束了。但时长越长生成成本和失败率越高所以我的策略是多数镜头用5到10秒关键表演镜头单独生成。分辨率优先生成横版16:9或竖版9:16不要生成方图再强行裁切裁切会损失画质和构图。运动强度我通常设置为中低档。很多人喜欢把运动强度拉满结果角色扭成一团画面像喝了酒一样晃。叙事类短片的镜头控制在“缓慢推进”“轻微横移”这个级别就够了剧烈的运动留给全景空镜不要在人物特写上冒险。4.3 本地部署的开源方案风格一致性才是价值所在除了在线平台我还建议有条件的创作者了解一下本地部署的开源方案。本地部署的主要价值不是省生成费用而是可控性和一致性。我的工作流里本地部署的AI绘画工具主要承担两个任务一是生成角色三视图和场景概念图先把角色外形锁定再拿去图生视频二是训练特定风格的低权重模型比如想要统一的“水墨风”“赛博朋克风”“治愈水彩风”本地部署后可以喂它一批参考图之后整个短片的美术风格就能保持统一这种体验是在线工具很难给你的。当然需要提醒的是本地部署对显卡要求不低通常建议显存在8G以上起步内存32G比较舒服。如果你只是偶尔做一两条片子先不用碰本地部署把在线工具用透已经能出很不错的效果。5. 实战打样90秒治愈系短片从脚本到成片的完整链路5.1 原始脚本与拆解目标光讲理论容易飘我把最近一个完整跑通的案例放出来。一段90秒的都市治愈系短片脚本原文只有138个字“雨夜。林晚加班到很晚走进街角的便利店。她在货架上看到最后一盒草莓蛋糕伸手去拿却被另一个人抢先拿走了。她抬头看到一张疲惫但温和的脸。男生犹豫了一下把蛋糕递给她‘给你吧我明天再买。’林晚愣住接过蛋糕眼眶一热。她在窗边坐下男生端来两杯热咖啡。两人没有说话窗外雨还在下。”拆解目标8个镜头总时长90秒单镜头8到12秒竖屏9:16。5.2 分镜表全记录这是我实际使用的分镜表完整保留供参考镜号景别画面描述对白/旁白时长1全景雨夜城市街道霓虹灯在积水里反射街角便利店亮着暖黄色灯光冷蓝色调和暖光对比无10s2中景林晚撑透明伞走过来推开便利店玻璃门门内暖光落在她身上雨水从伞尖滴落无10s3中近景货架前她目光扫向最后一盒草莓蛋糕手指微伸神情疲惫中有期待旁白她以为今天终于有一件好事10s4特写两只手同时抓住蛋糕盒子林晚抬头面前是男生的手无8s5近景男生穿着深蓝色制服外衣头发微湿温和地愣了一下随即把蛋糕递过来男生给你吧我明天再买10s6特写林晚接过蛋糕眼眶泛红微微抿嘴手指收紧无12s7中景窗边座位林晚坐在窗边打开蛋糕盒男生端来两杯热咖啡放在桌上无15s8全景窗外雨夜街景玻璃反射两人的模糊身影室内暖光画面缓缓拉远旁白有些温暖雨夜也挡不住15s5.3 生成与合成的实际操作记录第一步按分镜表里的画面描述逐镜生成关键帧。这里只使用图生视频。角色一致性上我先生成一张林晚全身图和一张男生半身图作为后续所有镜头的参考图。在生成关键帧时把参考图作为输入画面描述词负责补充场景细节。第二步图生视频运动强度调到中低时长选择10秒每秒16帧即可满足短视频平台要求。第三步配音。男生的对白用了较低音色的音色选项旁白用了一个声音成熟些的中性音色。生成时在文本里加入“……”表示停顿出来的节奏自然很多。第四步配乐。我没有用平台自带的“温暖治愈”风格模板因为太容易撞车了。我找了一段轻柔的钢琴曲只保留了环境音雨声底噪和风铃声作为主音效铺底。剪辑时最需要花心思的是第7镜和第8镜的衔接。第7镜的结尾是“咖啡被放到桌上”第8镜的开头是“窗外雨夜”我把第8镜前2秒的音频提前到第7镜最后一帧上用的是J Cut手法让雨声先入再切画面转场立刻高级了不少。6. 量产路上绕不开的坑一致性、合规与成本控制6.1 角色反复“变脸”的解法做AI短片最让人崩溃的就是角色不一同一个角色上一秒还是长头发下一秒变成短头发再下一秒连五官都变了。这个问题没有一次性根治的魔法要靠一套组合拳。我的标准方案是生成角色参考图并固定ID关键帧全部基于参考图派生人物出现的第一镜用特写或中近景让观众建立对角色的认知之后所有镜头严禁脱离参考图独立生成如果角色需要换衣服或换场景先基于参考图生成新状态图再用这个新状态图去驱动视频而不是直接改提示词。这样做下来前后不一致的情况能从“每镜都变”降到“偶尔细微变化”完全可接受。6.2 内容合规AI短片不是法外之地帮大家避一个隐藏雷区。AI生成内容不是“凭空创作的免责声明”用AI生成真人形象、模仿特定知名人物的声音或画风、使用未经授权的歌曲和影视片段都可能在发布时被平台下架甚至引发版权纠纷。很多平台已经要求AI生成内容添加标识。这一点务必主动配合不要尝试用任何方式隐藏AI生成痕迹。我在短片上字幕时会把“内容由AI辅助生成”写在简介里这是对所有参与者和观众的尊重也让自己的账号更安全。另外脚本本身也要过一道审核。涉及真实人物、真实商标、真实地标的描述尽量改成架空设定。我早期做过一条科幻短片写了一个真实城市的地标建筑被外星人袭击结果在发布审核时直接被拦截了。架空城市名两分钟改完顺利过审。6.3 成本控制一分钟短片到底花多少钱很多新手最关心的是钱。我以一条60秒成片为例按目前主流的会员订阅和按量计费混合测算给你一个参考区间。成本项消耗量参考成本关键帧图片生成约30到50张含重试10到20元视频生成约20到30次含重试30到60元配音约10到15次5到15元配乐音效素材正版素材库或自制0到30元总计45到125元省钱的核心是控制重试次数。重试一次就是双倍成本而重试多是因为提示词没写清楚。最省钱的办法不是找低价平台而是把脚本拆解和画面描述词打磨到位。我现在做片子的重试率在10%左右基本意味着什么就是一次生成大概率能用。这比研究怎么薅羊毛有效得多。7. 最后分享几个让我效率翻倍的实操细节做了一批AI短片之后我最大的感触是这个行业最稀缺的不是“会写提示词的人”而是“能把脚本语言准确翻译成镜头语言、再翻译成提示词语言”的人。前者是工具层面的熟练工后者才是导演思维。几个我坚持到现在的实操细节每个项目建独立文件夹按镜头编号存放关键帧、视频片段和音频命名格式统一为“镜号_镜头内容_版本号”比如“04_手抓蛋糕_v2”后期剪辑时找素材效率极高。启动新项目前先把全片需要重复出现的视觉元素列成清单比如角色服装、标志性道具、主场景色调生成提示词时复制粘贴比每次手打稳定得多。配音文本一定要人工过一遍把书面语改成口语AI生成的配音才有人味儿。剪辑时先铺对白音轨再铺画面根据对白时长反推素材需不需要重生成这个顺序千万别反。批量做短剧的时候我会把分镜拆解的Prompt固化成模板换剧本只换内容不换结构一个脚本从粘贴到拿到分镜表不到3分钟。AI短片的工具更新速度很快今天写的选型对比可能三个月后就不适用了。但这条工作流本身是稳定的脚本结构化、分镜拆解、画面描述、素材生成、音频合成、后期剪辑。只要这个骨架不丢工具换多少代你都能第一时间把新能力接进来。下一个版本的工具理论上会让画面更真实、运动更自然、角色一致性更稳定但内容好不好看依然取决于写脚本和拆镜头的人也就是你。