零基础AI视频制作全流程:从剧本分镜到成片,一个人半天搞定
做AI视频这件事我一开始也以为门槛很高。去年帮一个做手工皮具的朋友做产品短片预算请不起摄制组我就琢磨着用AI工具跑一遍全流程。结果第一版出来画面是挺唬人但人物手指头六根、镜头切换像PPT翻页朋友看完沉默了半天说要不还是我自己拿手机拍吧。那次之后我花了大概三个月把从剧本到成片的每个环节都拆开重做了一遍踩的坑足够写一本小册子。现在这套流程已经能稳定产出可用的短视频从写脚本到导出成片一个人一台电脑半天时间能搞定一条。这篇就把我摸索出来的完整链路摊开讲零基础也能跟着走重点不是教你点哪个按钮而是让你明白每一步为什么这么做、哪里最容易翻车。1. 先想清楚AI视频到底能做什么、不能做什么很多人对AI视频的期待是输入一句话出来一条大片。我实测下来这个期待在2024年之后确实部分实现了但部分这两个字很关键。你得先建立正确的预期否则后面每一步都会因为落差而反复返工。1.1 当前AI视频能力的真实边界目前主流的AI视频生成工具能力大致可以分成三档。第一档是文生视频给一段文字描述直接生成几秒到十几秒的动态画面。这类工具擅长的是氛围感镜头比如黄昏下的麦田随风摆动雨滴打在玻璃窗上出来的画面质感相当不错。但你要是让它生成一个人从椅子上站起来走到门口开门动作连贯性和物理合理性就会出问题人物可能走着走着腿就融化了。第二档是图生视频你先有一张静态图工具让这张图动起来。这个模式比文生视频可控得多因为画面的构图、人物长相、色调你已经定死了AI只负责加运动。我大部分项目都用这个模式尤其是需要角色一致性的场景。第三档是视频转视频拿一段现有视频做风格迁移或者重绘。这个对原始素材要求高零基础不太建议一上来就碰。提示如果你是完全零基础建议从图生视频切入先用AI绘图工具把关键帧画出来再让视频工具动起来。这样每一步都可控出问题也知道是哪一环的锅。1.2 一条AI视频的合理时长与镜头数我见过太多新手一上来就想做三分钟的完整故事结果做到一半就崩了。AI视频目前最舒服的单条时长是5到10秒超过15秒的连续镜头画面崩坏的概率急剧上升。所以正确的做法是把一条60秒的成片拆成8到12个短镜头每个镜头单独生成最后在剪辑软件里拼起来。这样做还有个好处就是每个镜头可以独立重试。某个镜头崩了你只需要重新生成那5秒不用把整条片子推倒重来。我一般会按下面的比例来规划镜头镜头类型占比作用生成难度环境空镜30%交代场景、转场缓冲低人物中近景40%承载叙事主体中特写道具20%强调细节、制造节奏低动态转场10%衔接段落中高这个比例不是死的但核心思路是用容易生成的空镜和特写来稀释难度把宝贵的人物镜头控制在必要范围内。1.3 零基础需要准备的工具清单工具不用多多了反而乱。我现在的固定搭配是四类工具各一个剧本与分镜任意文本编辑器就行我习惯用飞书文档方便随时改。图像生成负责出关键帧选一个你顺手的就行重点是要能保持角色一致性。视频生成图生视频为主选支持首尾帧控制的。剪辑与配音剪辑软件加一个AI配音工具配音这块后面会细说。硬件方面如果你主要用云端工具一台普通笔记本加稳定网络就够。如果要跑本地模型那显卡至少得12G显存起步这个门槛对零基础来说偏高建议先用云端。2. 剧本和分镜决定成片质量的地基我踩过最大的坑就是早期跳过剧本直接写画面提示词。结果就是每个镜头单看都挺美拼在一起完全不知道在讲什么。AI视频和实拍一样甚至更需要剧本因为AI不会帮你补逻辑你给什么它就生成什么。2.1 把一句话创意扩写成可执行的剧本假设你的创意是一个女孩在咖啡馆等人。这句话直接拿去生成出来的东西会很空洞。你需要把它扩写成有时间、地点、动作、情绪的段落。我的做法是先用最朴素的语言写一个动作流水账不追求文采只追求把动作拆清楚女孩推门走进咖啡馆环顾四周她走到靠窗的位置坐下她看了看手表神情有些焦急她端起咖啡杯望向窗外窗外街道上人来人往她的手机屏幕亮起是一条消息她看完消息表情放松下来这七步就是七个镜头每个镜头5到8秒拼起来大概40到50秒正好是一条短视频的体量。你看这个过程不需要任何AI知识就是正常的叙事拆解。2.2 分镜表把剧本翻译成AI能懂的指令有了动作流水账下一步是把它变成分镜表。分镜表要包含几个关键字段我一般用表格来管理镜号画面内容景别运镜时长备注1女孩推门进咖啡馆全景固定6s交代环境2走向窗边座位中景跟随5s人物背影3看手表特写固定4s手部动作4端杯望窗外近景缓慢推6s情绪镜头5窗外街景全景固定5s空镜转场6手机亮起特写固定4s屏幕内容7表情放松近景固定6s收尾这张表就是你后面所有操作的施工图。景别和运镜这两列特别重要因为它们直接决定你在图像生成和视频生成时该怎么写提示词。全景要交代环境提示词里就得有场景描述特写要突出细节提示词就得聚焦局部。2.3 为什么分镜要按景别交替来排这里有个新手常犯的错误连续好几个镜头都是中景人物。这样剪出来会非常平观众看着累。正确的做法是景别交替远、中、近、特来回切换制造视觉节奏。我一般遵循一个简单的规律环境空镜之后接人物中景人物动作之后接特写强调情绪高点用近景停留。上面那张分镜表就是按这个逻辑排的。你不需要学什么高深的镜头语言记住别让相邻两个镜头景别一样就够了。注意分镜阶段不要贪多。一条60秒的片子8到12个镜头是甜点区。超过15个镜头你的工作量和崩坏概率都会翻倍而观众其实感知不到那么细的节奏变化。3. 关键帧图像角色一致性的生死线分镜定好之后进入图像生成环节。这一步的目标是为每个镜头生成一张起始画面。为什么是起始画面因为后面图生视频时AI会以这张图为起点让它动起来。起始画面质量直接决定视频质量这一步偷懒后面全白搭。3.1 角色一致性为什么这么难AI绘图最大的痛点就是角色一致性。你生成第一张图女孩是圆脸短发生成第二张变成瓜子脸长发了。这是因为每次生成都是独立采样模型并不知道这两张图里应该是同一个人。解决思路有三条我按推荐度排序第一条是角色参考图。现在很多绘图工具支持上传一张角色参考图生成时锁定人物特征。你先花时间打磨出一张满意的角色定妆照后面所有镜头都拿它当参考。这是目前最稳的方案。第二条是固定种子加详细描述。把角色的外貌特征写成一段固定的描述词每次生成都原样粘贴同时固定随机种子。这个方法对简单角色有效但角色越复杂越容易漂移。第三条是后期换脸。先生成画面再用换脸工具统一角色。这个方法我不太推荐零基础用因为换脸本身有技术门槛而且容易出违和感。3.2 角色定妆照的打磨要点定妆照值得你花最多时间。我的经验是定妆照要满足几个条件正面或四分之三侧面、光线均匀、背景干净、表情中性。这样后面无论生成什么角度的镜头参考起来都稳定。描述词方面我习惯按年龄性别发型发色脸型五官服装气质的顺序来写。比如二十出头的年轻女性齐肩黑色短发圆脸大眼睛穿米色针织衫气质温和。这段描述要存下来每个镜头都带上。3.3 场景与道具图像的批量生成角色搞定之后场景和道具图就好办了因为它们不需要跨镜头保持一致。咖啡馆就是咖啡馆这次生成的和下次生成的有点差异也没关系观众不会在意。但有个细节要注意同一场景的不同镜头光线方向要一致。比如镜头1是白天窗外光从左边来那镜头4在同一位置也得是左边来光。这个在提示词里要明确写左侧自然光之类的描述否则剪在一起会有明显的光线跳变。我一般会把同一场景的所有镜头图像放在一起生成用相似的提示词这样光线和色调更容易统一。4. 图生视频让画面动起来的关键参数图像准备好之后进入图生视频环节。这是整个流程里最考验耐心的一步因为AI视频的随机性比图像大得多同一个提示词跑两次结果可能天差地别。4.1 运动提示词怎么写才有效图生视频的提示词和文生图不一样它主要描述的是运动而不是画面内容。画面内容已经由起始图定死了你只需要告诉AI怎么动。有效的运动提示词通常包含三个要素主体动作、镜头运动、环境动态。举个例子主体动作女孩缓缓端起咖啡杯镜头运动镜头缓慢向前推进环境动态窗外树叶轻轻摇动把这三者组合起来就是一段完整的运动提示词。注意动作要单一且缓慢不要写她快速站起来转身跑出去这种复杂动作AI处理不了。4.2 运动幅度参数的实际调节经验大部分图生视频工具都有一个运动幅度或者叫运动强度的参数。这个参数我踩过不少坑总结下来是这样的运动幅度适用场景风险低人物特写、情绪镜头画面几乎静止像照片中大部分常规镜头相对安全推荐默认高空镜、风景、转场画面容易崩坏变形我的建议是默认用中档人物镜头绝对不要用高档。空镜和风景可以适当调高因为即使变形观众也不太容易察觉。人物一旦变形尤其是脸部和手部一眼就能看出来。4.3 首尾帧控制让镜头衔接更顺滑进阶一点的做法是用首尾帧控制。你给AI一张起始图再给一张结束图AI负责生成中间的过渡。这样做的好处是镜头之间的衔接可以精确控制。比如镜头2是女孩走向座位镜头3是她坐下看手表。你可以把镜头2的结束画面和镜头3的起始画面做成同一张图这样两个镜头剪在一起就是无缝的。这个技巧在需要连续动作的场景里特别有用能大幅降低跳帧感。不过首尾帧控制对两张图的一致性要求很高如果两张图差异太大中间生成的画面会很诡异。所以这个技巧建议在流程熟练之后再尝试。4.4 生成失败时的排查顺序图生视频失败是家常便饭画面糊成一团、人物扭曲、颜色突变都可能发生。我总结了一个排查顺序按这个顺序试基本能定位问题先看起始图起始图本身有没有问题人物比例对不对如果起始图就有毛病先回去改图。再看运动幅度是不是调太高了降到中档或低档重试。然后看提示词动作是不是太复杂拆成更简单的动作。最后换种子以上都没问题那就是随机性问题换个种子重跑。这个顺序的逻辑是从确定性因素往随机性因素排查因为改起始图和参数是你能控制的换种子是碰运气。先排除可控因素再碰运气效率最高。5. 配音、配乐与剪辑把碎片拼成成片所有镜头生成完毕最后一步是组装。这一步很多人以为只是拖进剪辑软件拼起来其实配音和配乐的处理同样影响成片质感。5.1 AI配音的选型与调校配音这块如果你做的是有台词的片子AI配音现在的中文自然度已经相当可用了。选型上我关注三点音色是否贴合角色、断句是否自然、情感是否到位。音色贴合角色这个不用多说年轻女孩别配个大叔音。断句自然度是很多工具的短板长句子容易一口气念完不带喘气。我的做法是把长句拆成短句在标点处手动加停顿这样出来的效果自然很多。情感方面大部分工具支持调节语速和语调。我的经验是语速比正常说话稍慢一点点大概0.9倍速听起来更从容。语调不要调太满中等偏上就行太夸张会显得假。如果片子没有台词只有旁白那配音就更重要了因为观众全靠旁白理解内容。旁白文案要口语化别写成书面语念出来会别扭。5.2 配乐与音效的搭配逻辑配乐的作用是烘托情绪但很多人容易配过头。我的原则是配乐音量压到人声的三分之一以下让音乐成为背景而不是主角。选曲方面注意版权问题。我一般用免版权音乐库按情绪标签找比如温暖紧张轻松。一条片子里配乐不要频繁切换两到三段就够了切换点放在情绪转折处。音效是提升质感的小技巧。比如推门声、咖啡杯放下的声音、手机提示音这些细节音效加进去画面会立刻活起来。音效不用多每个关键动作配一个就行。5.3 剪辑节奏卡点与留白剪辑节奏这块新手最容易犯的错是每个镜头都卡在同一个时长。这样剪出来像机械翻页很死板。我的做法是让镜头时长有变化动作镜头短一点情绪镜头长一点。比如看手表的特写给3秒望窗外的近景给6秒。这种长短交替本身就制造了节奏。转场方面AI视频的镜头之间建议用硬切为主因为AI生成的画面本身就有一定的不连续感加花哨转场反而放大这种不连续。只有在场景切换时才用淡入淡出之类的柔和转场。卡点的话如果你配了音乐可以让镜头切换点落在音乐的重拍上。这个在剪辑软件里对着波形图操作就行不难。5.4 导出参数与平台适配导出的时候参数设置直接影响画质和文件大小。我常用的配置是分辨率1080P起步如果原始素材够清晰可以上2K帧率24帧或30帧和生成时保持一致码率8到12Mbps太低会糊太高文件太大格式MP4兼容性最好不同平台对视频规格有不同偏好竖屏平台用9比16横屏平台用16比9。这个在剪辑开始前就要定好中途改比例会重新构图很麻烦。6. 我踩过的那些坑和对应的解法前面讲的都是流程这一节专门讲坑。这些坑都是我实际做项目时踩出来的文档里不会写但每一个都能让你白干半天。6.1 人物手部崩坏的处理AI生成人物手部一直是重灾区。六根手指、手指融合、手指数量不对各种奇葩都有。我的处理办法分三层第一层是在起始图阶段就规避。如果分镜里有人物手部特写生成图像时就多跑几张挑手部正常的。手部正常的图视频生成时崩坏概率会低很多。第二层是用构图遮挡。让手部被杯子、衣袖、桌面挡住一部分观众看不清细节自然就不会发现崩坏。这是最省事的办法。第三层是后期修补。如果实在避不开就在剪辑时用局部模糊或者贴图遮一下。这个属于补救能不用就不用。6.2 镜头之间色调不统一的修复多个镜头拼在一起最容易出现的问题就是色调跳变。这个镜头偏暖下个镜头偏冷剪在一起很出戏。修复办法是在剪辑软件里做统一调色。先选一个基准镜头然后把其他镜头的色温、对比度、饱和度往基准上靠。大部分剪辑软件都有匹配颜色功能能自动对齐但自动的往往不够准还需要手动微调。预防的话在图像生成阶段就要注意。同一场景的镜头用相似的提示词尤其是光线描述要一致。我一般会在提示词末尾固定加一句暖色调柔和光线这样出来的图色调会统一很多。6.3 生成速度与成本的平衡AI视频生成很吃算力尤其是高分辨率、长时长的时候。我早期不懂每个镜头都拉满参数结果一天下来没生成几个镜头成本还高。后来我摸索出一个策略用低参数试错用高参数出片。也就是说先快速生成一版低分辨率的看效果动作对不对、构图行不行确认没问题了再用高参数重新生成一遍。这样试错成本大幅降低。另外生成任务可以排队。我一般晚上把一批镜头挂上去生成第二天早上收结果。这样不占用白天的工作时间效率高很多。6.4 版权与合规的注意事项这块必须单独说。AI生成的内容版权归属目前还在变化中但有几条底线要守住不要用明显带有他人肖像特征的参考图不要生成涉及真实品牌logo的画面配乐和音效要用有明确授权的素材生成的内容要符合公序良俗我一般会在项目开始前就把这些确认好避免做完之后发现不能用白忙一场。7. 从练习到实战给零基础的三条进阶路径流程讲完了最后说说怎么练。零基础最容易犯的错是一上来就做大项目结果卡在某个环节就放弃了。我的建议是分三步走。7.1 第一条路径单镜头练习先别想着做完整片子就练单个镜头。找一个简单的动作比如倒水翻书走路从写提示词到生成图像到生成视频完整走一遍。目标是搞清楚每个环节的输入输出关系。这个阶段不用追求质量追求的是跑通流程。跑通十个单镜头你对整个链路的理解就到位了。7.2 第二条路径三镜头短片单镜头熟练之后尝试做三个镜头的短片。三个镜头意味着你要处理镜头之间的衔接这是从会生成到会叙事的关键跨越。三镜头短片建议选最简单的场景比如开门进屋、坐下、看窗外。重点练景别交替和色调统一。7.3 第三条路径完整成片三镜头没问题了就可以上完整成片了。这时候你会发现前面练的东西全都用得上而且因为每个环节都单独练过出问题也知道去哪找原因。我自己的经验是从零基础到能独立产出可用的成片大概需要认真做五到八条练习片。这个时间投入不算长但前提是每条练习都要复盘搞清楚哪里做得好、哪里翻车了、下次怎么改。做AI视频这件事工具在变参数在变但底层逻辑不变先把故事想清楚再把画面拆细最后把碎片拼好。工具只是帮你把想法落地的锤子锤子好不好用是一回事你脑子里有没有那个形状是另一回事。我见过太多人把时间花在追新工具上结果连一个完整的分镜表都没写过。工具永远追不完但流程跑通一次你就有了自己的方法论换什么工具都能上手。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →