尧图精选

拆解463条爆款AI视频后,我开源了一套提示词模板与Skill包

🕒 发布时间:2026/10/2 9:45:55 📁 来源:尧图网络
去年年底开始试 AI 视频工具时我给自己定了个近乎自虐的任务把平台上能刷到的热门 AI 视频全部拆掉看别人到底是怎么写出那几条提示词的。陆陆续续攒了 463 条片子横跨口播、产品演示、剧情街拍、科普动画、带货切片几乎把能看到的风格都过了一遍。三月底我把这 463 条视频的拆解结果做成了一个可直接安装的 Skill 包和一套提示语模版全部开源。想自己上手玩 AI 视频或者想给 Coding Agent 配一套视频脚本能力的拿走就能用。这套东西不光是一份“提示词集合”它更像一本把爆款视频翻译成机器能理解语言的菜单。我会把这几个问题讲透为什么 463 条素材能被压缩成一套 Skill拆解过程中我到底记录了哪些字段具体怎么安装使用以及踩了哪些坑。文末我也会聊聊开源之后这套东西还能往哪些方向长方便你决定要不要把它接进自己的工作流。1. 整体设计为什么是“Skill 提示语模版”而不是一条现成的提示词1.1 463 个视频的筛选原则和数据来源先交代这些视频是怎么来的没这个前提后面所有方法论都会飘。我每周会固定花一天时间去刷短视频平台和 B 站的 AI 生成区同时关注了十几个搬运海外 AI 作品的账号再用关键词把文案、剧情、运镜、背景音乐拆开记录。我的筛选标准有三个播放量超过百万或者互动率明显高于同期作品确实是用 Midjourney、Runway、可灵、即梦这类工具生成核心画面而不是单纯加滤镜有可复现的结构也就是作品能在“开场钩子—画面推进—情绪转折—结尾留人”这条主线上对齐。淘汰了很多画面极好但结构完全涣散的作品。你 AI 视频做得再漂亮如果没有 3 秒内抓住人的设计收藏率通常很惨。463 这个数字不是凑的是我整理完第二个月月底一次性清点得到的。后来我把视频按“口播人设类 / 产品演示类 / 剧情混剪类 / 知识科普类 / 氛围转场类 / 带货切片类”六种大划分前两类占比最高因为这两个方向也是现在个人创作者和中小企业最常用的。1.2 Skill 与提示语模版各自承担什么角色这里要先解释一下 Skill 到底是什么。在 Claude Code、Cursor 这类 Agent 工具里Skill 是一套结构化的“操作手册”通常是 SKILL.md 加若干辅助文件。它不只是给大模型一段话而是告诉大模型“在什么场景下启用什么流程、调用什么模板、输出什么格式”。提示语模版则是具体的填空卡告诉模型第一句写什么、镜头怎么切、旁白用什么语气。两者关系你可以理解成Skill 是菜谱提示语模版是定量调料包。一开始我也试过直接把 463 个视频的爆款特征写成一页 8 千字的提示词丢给模型效果一塌糊涂。模型读是读完了但生成时会东一榔头西一棒子和高质量视频的结构完全对不上。把流程和模板分开之后优势立刻明显Skill 负责控制主线模板负责给出可改写的样例模型不会跑偏也不会因为信息太杂而折中。更实际的价值在于把这套结构扔给不同 Agent 工具都能用。Claude Code 认 SKILL.md 的规范格式Cursor 可以直接把 skills 目录放入工程目录普通 ChatGPT 用户就算没装 Agent也可以只抽里面的提示语模版手搓视频。开源就是想让两条路都通。1.3 拆解视频时我记录的四个核心维度很多人拆视频只看剧情或文案但我拆出的是一个“可计算”的四维结构。第一个维度是叙事结构我会标注时间段什么时候出钩子、什么时候上情绪高点、什么时候放记忆点。第二个维度是镜头语言记录景别变化、运镜方向、画面元素在每一条视频里怎么组织。第三个维度是节奏密度计算每个镜头时长统计信息量特别密的段落和故意留白的段落之间的比例。第四个维度是提示词特征即在什么画风、什么光照、什么运动描述下做出了那种质感。表格大概长这样方便你直观理解一个视频是怎么被解构成数据的维度记录方式对应生成阶段示例片段叙事结构时间段 行为标签文案生成0-3秒悬念提问8-12秒反转点镜头语言景别/运镜/主体描述画面提示词特写转全景推镜主体是手持灯的人节奏密度镜头秒数 转场方式分镜脚本每 2.4 秒一切叠化开场提示词特征风格修饰词组合画面生成拍摄于阴天柯达胶卷质感柔光你可能会问为什么把文案排第一因为我统计下来463 条视频里让人留到最后的原因七成和文案有关画面只是放大器。后面 Skill 设计里文案生成模块占了最大篇幅就是这个道理。2. 核心拆解从视频到 Skill我做了哪些关键动作2.1 把视频“翻译”成可复用文案和镜头的 SOP拆解不能靠感觉。我给自己定了一个五步流程先把完整视频的旁白和字幕逐字转出来然后按 3 秒一个单位给画面切片再把每个切片对应到文案的哪一句接着标记“这一句凭什么留在开头”最后反推出一整套“可替换的框架”。比如一条百万播放的科普视频旁白是“你知道每天陪你睡觉的枕头里有多少只螨虫吗”它对应的画面是一个显微镜下蠕动的特写。这个组合就是模板里的“危险提问 微观特写”结构任何冷知识主题都能套。这些记录累积成 463 条结构笔记之后我再做一个反向抽象。把所有笔记里的具体名词替换成占位符比如“螨虫”变成【主体 A】“枕头”变成【日常场景 B】。保留的句式、节奏、转折点就是通用的“骨架”。这套骨架是我做提示语模版的原材料。你拿个新主题来套这个骨架只要换掉占位符出来的脚本就自带爆款的底子。这里必须强调一个红线拆骨架可以直接抄别人原词不行。所有 template 里的句子都是我重新组织过的抽象结构不会跟原始视频文案撞车。开源项目搞成洗稿工具就丢人了这不是我的目的。2.2 Skill 包的目录到底长什么样看目录结构比看一百个字更直观。我打包出来是这样的ai-video-skill/ ├── SKILL.md # 核心手册告诉 Agent 何时启用、按什么流程走 ├── templates/ │ ├── 01-口播人设模板.md │ ├── 02-产品演示模板.md │ ├── 03-剧情混剪模板.md │ ├── 04-知识科普模板.md │ ├── 05-氛围转场模板.md │ └── 06-带货切片模板.md ├── prompts/ │ ├── 画面提示词风格库.md │ ├── 镜头运动提示词库.md │ ├── 旁白与配音风格库.md │ └── 转场特效提示词库.md ├── aux/ │ ├── 视频时长规划器.md │ ├── 钩子写法速查.md │ └── 节奏标注样例.json ├── examples/ │ ├── 产品30s-完整输出示例.md │ └── 科普60s-完整输出示例.md └── README.mdSKILL.md 是关键入口。我给它设定了非常窄的触发条件只有当用户要求生成视频脚本、分镜提示词、口播文案或者要求分析一段视频结构的时候模型才应该读取这个 Skill。平时绝不能加载避免和其他技能冲突。SKILL.md 里写死了输出格式必须先给一句话总览再给分镜表格再给画面提示词最后给可执行的旁白文案。这套顺序保证了输出一定是有层次感的东西不是堆砌一段华丽的段落。2.3 提示语模版内部的组成部件每个模板不是只有一段提示词就完了。以“产品演示”为例一个完整模板包含七个部件用户目标识别、时长规划器、钩子句生成器、分镜结构表、画面提示词、旁白文案、彩色建议。我用 30 秒产品演示模板给某个小家电写脚本时模型会自动按“问题开场 - 使用对比 - 功能特写 - 结果展示 - 结尾引导”五段式来组织分镜每一段都会从 prompts 目录里挑选匹配的画面提示词。从 463 条视频里我发现一个规律产品演示类视频前 3 秒直接拍产品特写的是最低级的做法播放量通常很差做得好的一定是先呈现一个使用场景中的痛点再带出产品。模版里我把这条规律写成了规则确保模型绝不会在开局丢出产品 logo。另外有一个部件很容易被忽略节奏标注样例。我会给每个模板附一段 JSON里面写着每个镜头应该持续几秒转场是硬切还是叠化。模型拿到这个 example 之后生成的分镜就不再是“镜头一、镜头二”这种没时间感的东西而是一张直接能对着开拍的表格。可以说这是整套工具最实用的一层设计。2.4 Skill 和普通提示词模板的边界划分我见过很多人把自己的提示词集合起名叫 Skill其实它只是个提示词文件夹。老实说这不算错但会浪费 Skill 的能力。真正的 Skill 需要具备三个要素明确的启用条件、内置的决策分支、固定的输出协议。比如我的 Skill 会根据用户给的目标时长自动选择“15 秒版本 / 30 秒版本 / 60 秒版本”中的对应分镜逻辑会判断用户给的是“现成文案”还是“只有一句话需求”分别走“优化润色”和“从零生成”两条路径还会在输出结尾附上一条“如果画面生成失败时的备选提示词”。这些决策分支让 Skill 变得像一个小型工作流而不是单纯的“填空题”。提示语模板则是整个系统里可以单独抽出来给人类用的部分两者解耦后无论是喂给 Agent 还是直接复制进视频生成工具都游刃有余。开源仓库里我把两者放在不同目录也在 README 里写清楚了各自的适用场景。3. 实操过程安装、调用与产出第一条 AI 视频3.1 环境准备Agent 工具怎么装载这套 Skill先说你手上得有什么。最省事的路线是装 Claude Code 或者 Cursor再用 Git 克隆开源仓库然后把整个ai-video-skill目录放进项目的.claude/skills或者cursor/skills目录。注意不同工具识别的路径名可能有差异我实测下来 Claude Code 认.claude/skills/ai-video-skillCursor 则是在项目根的.cursor/skills下创建同名目录。如果你两个都没装还有一种轻量玩法把仓库里的 templates 和 prompts 文件全部下载到本地 word 或备忘录里需要时直接打开复制。开源的意义就在这里重型和轻量路线都有人需要。安装完成后怎么确认 Skill 生效了我给 SKILL.md 写了非常强的“触发预设”你直接跟 Agent 说“帮我做一个 30 秒的咖啡机产品视频脚本文案”它应该自动加载文件夹里的模板。如果 Agent 完全没反应大概率是挂载路径出了偏差把目录结构重新对一遍确认 SKILL.md 在最外层而不是被套在子文件夹里。还有一件事仓库是 MIT 协议你可以放心改改完放进自己的工程项目也没问题。这点我特意在 README 里强调过因为很多开源项目协议写得很含糊二开的人心里没底。3.2 五步做出第一个可用的口播知识类视频脚本跟着完整流程走一遍大概五分钟能看到成品。第一步输入需求自己想好主题比如“为什么手机在低温下掉电极快”。第二步让 Agent 调用口播人设模板并把主题喂进去它应该输出标题、前 3 秒开头、分镜结构、旁白全稿。第三步把输出的分镜表中“画面提示词”部分抽出来贴进可灵或即梦按序号逐条生成画面。第四步把旁白全稿放进 TTS 工具生成配音。第五步剪映或 Premiere 按分镜表里标注的秒数把画面和配音对轨加上转场导出。以这条手机低温主题为例模板会生成类似这样的开头前 3 秒画面是一个户外雪地里握手机的近景旁白是“你在哈尔滨掏出手机电量掉得比血压还快问题不在电池在这个原理”。接下来 3 秒镜头切到主板特写配一句“锂离子在低温下集体躺平”。后面还有十几秒把原理讲完结尾是“下次去雪乡知道该给手机贴什么了吧”。这一整套就是模板自动组织出来的不是我逐字打的。我要提醒的是生成出来的画面提示词它默认是高质量风格比如“自然光、浅景深、体积光”如果你的视频生成工具出图很慢可以手动删掉一半修饰词。Diffusion 模型吃不了太多诅咒式堆词模版里我也写了“关键词上限控制”的提醒但模型偶尔还是会跑过头你顺手删一删就行。3.3 参数选择背后的计算思路为什么 Skill 里的 30 秒版本分镜是“开头 3 秒 痛点 5 秒 展示 14 秒 反转 5 秒 结尾 3 秒”这不是拍脑袋。我统计过 463 条视频中 30 秒片子的前 10 秒共性前 3 秒必须完成“吸引注意”第 4 到第 8 秒必须让观众明白讲的是什么第 9 秒开始的内容如果不出现新信息完播率骤降。这套时间分配本质上是对注意力曲线的拟合。60 秒版本更依赖节奏留白。我取样的数据里60 秒高完播视频的平均镜头时长是 3.7 秒而 30 秒高完播视频的平均镜头时长是 2.1 秒。这个差异就是模板中两种时长分镜表不一样的原因。Skill 内部针对不同时长写了单独的分镜策略表目的就是让模型不用自己临场算这些数字直接吃现成的统计结果。同样画面提示词风格库里的“暖色调”“冷色调”“仿胶片”“显微特写”也不是为了好看是我按场景统计出来的知识科普类爆款视频用显微特写的概率高达 63%产品演示类用冷暖对比例子的概率是 48%。你给的提示词如果没风格倾向生成画面会缺乏记忆点这是很多新手直接栽跟头的地方。3.4 定制成自己的风格至少改三处差异化是好但模板毕竟是公共产物直接用会撞风格。我自己使用时会改三处。第一语气。模板默认的旁白是“短句反问”风格如果你的受众是专业工程师我会把所有反问句换成“先说结论再给细节”。第二节奏。模板默认 30 秒给 15 个镜头如果你的团队剪辑风格偏慢把分镜段落的秒数提高到 3 秒以上。第三画面审美。模板里默认画风偏写实纪录片你可能需要全局替换成“高饱和度插画风”或“低饱和电影感”替换一次后所有模板都会继承新风格。这三个改动直接在模板文件的通用设置区操作就行不用重写整套逻辑。开源项目最友好的地方在于这种东西你可以随便改到面目全非只要最终文件能跑通那就是你自己的模板库了。4. 常见问题与排查技巧这套开源资源的使用实录4.1 安装和调用失败的十大原因速查很多人卡在第一步就疯狂问问题我这里整理成一个速查表你遇到类似情况直接对号入座现象大概率原因解决办法Agent 不识别 Skill目录嵌套多了一层确保 SKILL.md 在 skills 目录下直接可见模型输出时输出乱码未按 SKILL.md 中格式提取删除模型记忆后重新开始对话画面提示词生成后偏抽象风格修饰词过多手动删除 30% 的修饰词文案偏长超时读不完短视频工具对字数敏感选择模板里的“精简模式”生成的分镜没时间标注形态标注文件未生效检查 aux 下的节奏标注样例是否被读取两个 Skill 同时触发SKILL.md 的启用条件写得过宽在 SKILL.md 头部加“仅当用户明确提及视频脚本时”画面风格不统一提示词里没写全局风格锚点每个画面提示词开头加同一组风格词旁白和画面对不上分镜和文案割裂生成让模型先输出《分镜文案对照表》再执行下一步在 Cursor 里无法加载Cursor 版本过旧升级到支持 skills 的版本二开时改动导致报错模板引用了不存在的文件检查 prompts 目录下的文件名引用这些坑都是我自己在测试不同工具组合时真实遇到的。最典型的是第一条很多人把ai-video-skill文件夹直接解压到错了层级Agent 根本扫不到还以为是工具不支持白白折腾一晚上。4.2 提示词模板的七个翻车点模板虽然全但不代表你不会写错。我复盘自己连续生产 100 条脚本时翻过的车总结出七个高频点。提示词写得太短比如只写“夕阳下的城市”生成画面随机性极大模板里我要求至少包含主体、景别、光线、镜头运动、风格五个要素。提示词写得太长机械堆叠几十个修饰词在新版扩散模型下反而容易产生脏噪点模板里我做了关键词数量提醒。开头文案和结尾文案都很好但中间全是流水账模板增加了“中段必须有新信息”的校验要求。画面提示词没考虑字模渲染有文字产品图时经常出现乱码模板专门加了“移除所有自带文字水印”的建议。全部用大全景没有景别变化情绪张力全靠音乐硬顶模板的分镜表强制要求景别按“近—全—特—中”节奏排布。配音用 TTS 默认音色和视频调性不一致模板里附了音色选项建议表格。发布时没检查不同平台的比例竖版 9:16 和横版 16:9 输出的是同一套分镜模板里我区分了两套字段但需要你手动指定平台。这其中最隐蔽的是第四点即字模渲染问题。因为 463 个样本里凡是画面里需要出现文字信息的视频用 AI 视频工具直出文字几乎全军覆没只有极少数工具能勉强准确。后来我所有模板都在画面提示词末尾加了一句“画面内不要出现任何语言文字符号文字信息后续剪辑叠加”这条小小的约束把废片率降掉了两成。4.3 Skill 之间互相打架的处理方案我在开源社区的反馈里看到有人同时装了十个 Skill结果模型把“视频脚本生成”和“代码开发”两个技能搅在一起产出一种既不像脚本又不像代码的怪东西。这套问题的根源是绝大多数 Skill 没有写清触发边界。解决方案我在 SKILL.md 里做过示范开头第一段必须写“本 Skill 专注 AI 视频脚本和画面提示词生成不处理编程问题当用户同时提出视频和编程需求时先询问优先级”。实际用下来这句边界说明能解决 80% 的冲突。剩下 20% 的乱局出在模型对用户意图的误解上比如用户说“帮我做一个视频”模型可能启用视频 Skill但用户其实想表达“帮我分析这个视频的代码实现”。遇到这种情况我发现最好的办法不是继续调模型而是在 Agent 的规则文件里加一行先复述用户需求确认任务类型后再加载技能。这比任何提示词都管用。4.4 463 个视频里隐藏的“黄金 12 秒”拆到第 300 条左右时我逐渐意识到一个现象几乎所有完播率高的视频都有个共同段落我管它叫“黄金 12 秒”。这个段落一般出现在视频的第 10 秒到第 22 秒之间它必须完成一次情绪转折要么从问题转到反差要么从平铺转到惊讶要么从悬念转到答案。过了这个点观众如果愿意继续看基本就会看完过不了这个点前面钩子再好也白搭。所以模板里的 30 秒版本我在第 10 秒的位置强制安排一个“认知刷新点”也就是给出一条观众意想不到的新信息。例如咖啡机视频在那里写“你以为是萃取温度不够其实是你研磨度错了”。这个结构是从大量成功样本的共性中挖出来的比单纯说“要制造反差”具体得多。你直接把这个写作技巧用在自己任何短视频里即便不套用整套 Skill提升也是肉眼可见的。5. 开源之后这套东西还能往哪些方向长5.1 从“看视频”到“喂给 Agent”的闭环设计开源只是起点。我现在实际做的事情是让这套 Skill 自己会长进每生成一条新视频脚本我会把成品的数据表现回填进仓库里的“效果反馈.csv”包括完播率、点赞率、评论关键词。然后定期用这些数据去微调模板里的时间分配和钩子句式。这样并不是让模型变得更“聪明”而是让掌握数据特征的模板版次持续迭代。你二开的时候也可以照这个思路给自己设计一个“反馈→更新模板→再生成”的小循环。很多人开源完了就当甩手掌柜过两周模板就过时了。我不建议这样因为这个领域的变化以月为单位。今年上半年流行的镜头语言下半年可能就成了油腻复古。代码仓库里有记录更新日志的惯例模板库更应该有保持活跃度才是开源项目的生命力。5.2 不同群体怎么把手上的模板用出价值我试过大范围人群的使用方式给你按角色分类列一下短视频运营者最需要的是钩子句写法速查和分镜秒数规划器这两块能让选题效率翻倍。带货直播团队更应该关注产品演示模板和场景化痛点开头这两个组合几乎能直接套用到日化、小家电、耗材类产品上。课程讲师和知识博主用知识科普模板效果最明显它天然按“提问—原理—案例—总结”组织文案很难讲散。小说推文和本地信息号则适合剧情混剪模板它的中段节奏密度设计就是为留人设计的。产品经理终于可以从“给剪辑师傅写需求文档”的苦差里解放出来直接把产品参数扔给模板输出分镜表沟通成本直线下降。我自己另外做了一个很小众的用途给电商商家写视频号投放素材。因为商品上架快根本没有时间慢慢打磨创意模板的流水线化输出就特别有价值。一套工具在不同人手里用法天差地别这才是它开源后最有趣的地方。5.3 建自己的语料库时注意这些边界也许你看了这篇还想自己几万条视频回来拆。我建议你注意三件事。第一版权边界。你可以把一个视频的元素抽象成模板但不要未经授权把原片画面直接作为素材分发更不要让模型对着原视频逐句模仿。我先在模板里做到“抽象结构、不抄原词”就是给二开者打个样。第二样本偏向。你如果只收藏自己熟悉领域的视频模板就会非常窄。多引入不同类型的素材甚至故意拆几个播放量低但你喜欢的视频做负样本分析。第三记录成本。每拆 10 条视频至少要花两小时整理笔记不要高估自己的耐心用最简的表格记录。说到整理笔记我建议你从第一天就用统一的字段主题、时长、钩子句、转折点、镜头数、风格词、结尾形式。这样积累 100 条后做统计时才有的放矢不用回头重新翻原视频。别问我为什么知道我就是那个拆了 200 条后发现字段不统一、只能咬牙补录的人。5.4 后续三种可扩展的玩法给你一点灵感如果你想让这套系统发挥出更长期的价值我给你三个具体方向。第一接入长视频制作流程。现在仓库只解决 15 秒到 60 秒的短视频但你可以把模板里的分镜方法组合成完整的 5 分钟短片脚本框架思路是把三个 30 秒模板的头尾相接。第二结合多模态生成。把分镜表里的画面提示词直接用程序组装成批量生成任务跑一轮可灵或 Runway 的 API做批量素材生产。第三把它变成教学工具。我身边已有朋友拿着这套模板给大学生上 AIGC 入门课学生不需要会写提示词先会审核模型给出的分镜是否符合规范。这本质上是在培训“提示词审美”而不是在教“提示词记忆”。这些方向我未必全部亲自落地但开源项目的好处就是大家各自取一段去实验总有人能走出我没见过的路。最后再分享一个小技巧吧是开箱时最容易忽略的每当你用模板生成了一条满意的脚本把这条脚本连带当时的输入需求一起存回 examples 目录命名成“新主题-新日期.md”。几周之后这个目录就成了你自己的个性化样本库再次生成同类型内容时模型的输出会明显更顺着你的习惯来。那种“模板怎么越用越懂我”的体验就是开源项目拿来自己改最赚的地方。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →