Hyperframes 视频配音脚本写作指南:节奏、语气、数字发音与叙事结构
Hyperframes 视频配音脚本写作指南节奏、语气、数字发音与叙事结构【免费下载链接】hyperframesWrite HTML. Render video. Built for agents.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperframes导读本指南围绕 Hyperframes 项目hyperframes-creative技能集中的 narration 参考文档展开讲解为 HTML 视频合成composition编写配音脚本narration script / voiceover script的完整方法论从每秒字数与时长换算的节奏控制、自然语气的打磨、TTS 数字发音的规范化到产品视频的 Hook–Story–Proof–CTA 四段式结构。读完本文你将能为一条 15 秒社交广告或 60 秒产品宣传片写出可直接送入 Hyperframes 渲染管线、与画面呼吸感匹配的高质量配音稿并理解它与story-spine叙事原则、TTS 语音合成和 voiceover carve 音频处理的衔接方式。何时使用本文从创作工作流到配音稿narration.md是 skills/hyperframes-creative 技能集的一等参考文档其路由表明确将脚本节奏、语气、开场、数字发音Script pacing, tone, openings, number pronunciation分配给该文档处理见 SKILL.md。在 Hyperframes 的实际创作管线中配音稿的产生通常发生在这些场景产品发布视频product-launch-video 路由输入一段产品脚本或 brief输出 30–90 秒的推广片脚本可能是逐字配音稿verbatim VO或允许重构restructured由VO_MODE标记区分见 product-launch-video.md无面讲解视频faceless-explainer 工作流Step 3 在编写STORYBOARD.md的同时编写SCRIPT.mdStep 3.1 再由audio.mjs脚本基于配音稿生成 TTS 语音、逐词时间戳与 BGM见 faceless-explainer/SKILL.md任何包含配音或 TTS 的合成原文档的触发条件是组合中包含 voiceover 或 TTS 时阅读本文Read when the composition includes voiceover or TTS。换句话说本文是配音稿的内容层规范与story-spine.md叙事骨架、hyperframes-audio混音处理共同构成配音视频的完整链路。节奏控制以每秒 2.5 词为基准配音稿的第一步是确定说多快、说多少。narration.md 给出的核心基准是2.5 词/秒words per second这是自然的语速。由此可推导出常用时长的词数预算视频时长词数预算15 秒约 37 词30 秒约 75 词60 秒约 150 词三个补充原则值得特别注意为停顿留出空间。句与句之间的静默silence是特性而非冷场——它让观众有时间消化画面信息也让混音阶段有呼吸感。脚本应该比视频更短。原文档原文为 The script should feel SHORTER than the video画面需要视觉呼吸空间visual breathing room。词数预算应当被视为上限而非目标。用实际语速反推验证。原文档末尾的 62 秒示例脚本约 140 词折算为2.3 词/秒——比基准略慢正是为停顿和视觉呼吸留出空间的实证。这提示我们在写稿后要重新按实际语速核算总时长而不是机械地拿 2.5 词/秒去填满整个视频。从创作管线的角度配音稿的时长最终会与渲染结果对齐faceless-explainer工作流的audio.mjs sync-durations会以真实语音时长覆盖故事板的估算时长real voice duration wins; silent frames keep estimates所以节奏预算越接近真实语速后期同步的偏差就越小。语气写得像人而不是像宣传册TTS 和真人配音都遵循同一写作原则脚本的语气决定听众的信任感。narration.md 给出了四条可操作准则使用缩略形式its、youll、thats、weve——缩略语是口语的自然形态书面化的完整拼写it is、you will会显得僵硬变化句子长度短促有力的短句与较长的流畅长句交替形成节奏起伏大声朗读测试如果读起来机械robotic就重写避免术语除非受众本身期待术语比如面向开发者讲解 API 的场景。这一准则与叙事原则一脉相承。story-spine.md 强调voice 由工作流规定——例如 PR 视频保持朴素、不夸张的开发者语气价值优先是排序决策而非营销语域leading with value is an ordering decision, not a marketing register。也就是说自然语气的目的是让价值主张可信而不是把脚本包装成广告腔。数字发音TTS 逐字朗读写你想要的读音这是 TTS 配音最容易翻车的地方。TTS 是字面阅读器TTS reads literally——它读的是你写的字符而不是屏幕上显示的数字。原文档给出的原则是写你希望声音说出来的内容Write what you want the voice to say。规范化的数字发音对照表如下产品中显示脚本中应写成135more than one hundred thirty five$1.9Tnearly two trillion dollars99.999%ninety nine point nine percent200Mover two hundred million10xten timesAPIA P Istripe.comstripe dot com这张表的要点口语化改写优于机械拼读$1.9T若直接按字符读会变成混乱的字母串写成nearly two trillion dollars既准确又自然缩写与符号展开10x读作ten times、API逐字母读作A P I、域名中的点读作dot视觉显示精确数字配音讲近似值原文档明确写道 The visual can show the exact figure while the voice rounds it——画面上可以保留 99.999% 这类精确数字而配音只需说 ninety nine point nine percent。这正是 HyperframesHTML 渲染视频模型的核心优势画面由 HTML 精确控制配音稿独立于画面存在二者不必互相迁就。在实际管线中这份脚本会被直接送入 TTS如 HeyGen 的heygen-tts.mjs或离线的 Kokoro 引擎因此数字写法直接影响生成语音的正确性——把数字写成口语形式是从源头消灭读错数字类返工的最廉价手段。叙事结构Hook → Story → Proof → CTA对产品视频narration.md 给出了四段式结构骨架Hook钩子——这条产品有什么令人惊讶或印象深刻之处一个大胆的主张、一个挑衅性问题、一个对比或一个震撼的数字。这是开场第一句。要变换钩子类型——不要每次都默认用数据。Story故事——产品做什么谁在用保持具体concrete。Proof证明——数据、客户名称、社会认同。用产品自己的真实数字。CTA行动号召——观众应该做什么例如 Start building at stripe dot com.并非每条视频都需要四段齐全。15 秒社交广告可能是 Hook Proof CTA60 秒产品导览则四段全用并加大 Story 比重。这是结构选择的自由度也是原文档反复强调的按需裁剪。这一骨架与 story-spine.md 的价值优先叙事原则互为表里。story-spine 进一步收紧了 Hook 的语言规则Hook 必须说观众的语言outcome language——讲观众能得到什么而不是产品内部词汇。代码变更类视频的 Hook 里禁止出现文件名、函数名、API 名产品视频的 Hook 里禁止功能清单数字只在携带利害关系时使用cold starts 快 40%可以改了 23 个文件不行倒冰山结构reverse iceberg价值主张要在第二个节拍beat落地之后的一切都是为它服务的证据自查方法删掉所有证据节拍后剩余节拍仍能独立陈述价值——否则说明结构出了问题。因此 narration.md 的 Hook 是开场句形态story-spine 的 Hook 是开场句内容约束两者叠加才构成完整的开场设计。开场白前 3 秒定生死原文档对开场白的定位是全片最重要的一句话The most important sentence in the video必须在前 3 秒内制造张力、好奇或意外。四种经过验证的句式模式大胆主张bold claimThe financial infrastructure that powers the internet economy.挑衅式提问provoking questionWhat if your database could think?对比contrastYour AI agent already knows how to make videos. It just needs the right format.震撼数字shocking numberNearly two trillion dollars.——谨慎使用不是每条视频都该以数据开场。判定标准很直接如果开场是Welcome to Stripe或Introducing our product这类泛泛之词推倒重来start over。从 story-spine 的视角看这些模式全部服务于一个目标在第一拍回答我为什么要关心why should I care。对比式开场尤其适合 Hyperframes 这类开发者工具——你的 AI Agent 已经会做视频了它只是需要正确的格式同时完成了制造好奇和定位受众两件事。完整示例剖析一条 62 秒产品发布片的配音稿原文档提供了一个团队内部参考的 62 秒产品发布视频配音稿全文如下Your AI agent already knows how to make videos. It just needs the right format. This is Hyperframes. An open source framework. HTML in, video out. A div is a keyframe. Data attributes are your timeline. CSS is your look. G-Sap is your animation engine. Anything a browser can render can be a frame in your video. CSS animations. G-Sap. Lottie. Shaders. Three.js. Drop in music, sound effects, footage — it all composes together. No new framework for the agent to learn. Just HTML. The agent writes it. The renderer captures every frame as MP4. Its deterministic. Identical outputs, every time. Give your agent the CLI. Tell it what to make. Watch it build. Hyperframes. Go make something.这段脚本是全文方法论的浓缩样板可以逐层拆解节奏约 140 词 ÷ 62 秒 ≈2.3 词/秒低于 2.5 的基准为停顿与画面留出呼吸空间原文档明确标注了这一换算开场前两句即对比式 Hook——Your AI agent already knows how to make videos. / It just needs the right format. 制造好奇Agent 会做视频缺的只是一个格式结构Hook前两句→ StoryThis is Hyperframes...到 Anything a browser can render can be a frame in your video讲清产品是什么、怎么工作→ ProofIts deterministic. Identical outputs, every time.——确定性是可验证的技术主张→ CTAGive your agent the CLI. Tell it what to make. / Watch it build.语气全程使用 its、youll 式口语缩略语如 Its deterministic短句与长句交错——No new framework for the agent to learn. / Just HTML. 是典型的短促强调数字/专名发音若配音G-SapGSAP与Three.js这类专有名词需要在脚本阶段就确定读法MP4通常逐字母读作 M P four与技术事实一致脚本中 Data attributes are your timeline 对应 Hyperframes 用data-*属性驱动时间轴的机制The renderer captures every frame as MP4 对应确定性的逐帧渲染设计——配音稿的宣传主张与项目实际能力docs/concepts/data-attributes.mdx 等概念文档有详细说明严格对齐这正是 story-spine 强调的视觉/语言指向真实来源。配音稿与音频管线从文字到最终混音写好脚本只是第一步Hyperframes 的仓库证据展示了脚本进入音频管线的完整路径TTS 语音生成faceless-explainer工作流用node SKILL_DIR/scripts/audio.mjs --script ./SCRIPT.md --storyboard ./STORYBOARD.md将配音稿送入 TTS 引擎HeyGen 或离线 Kokoro产出语音、逐词时间戳word timings与audio_meta.json语音与音乐共存配音与音乐床music bed并存时hyperframes-audio/SKILL.md 提供的voiceover carve语音避让会在音乐床上只挖掉语音实际占用的频段而不是整体调低音乐——语音无需整个频谱只需要它实际占据的几个频段。data-fx-carve属性以 JSON 形式写在音乐元素上sources:[voiceover]强度默认 0.25约三频段 6 dB 凹陷可闻但不至于空洞0.5 时凹陷达 10 dB开始被听成一种效果0 为纯频谱处理。可视化操作与命令行的完整说明见 docs/studio/voiceover-carve.mdx字幕与画面同步基于配音稿生成的逐词时间戳同时驱动字幕captions.mjs build与画面节拍的节奏设计音频反应型画面可选若要让画面随配音节奏脉动audio-reactive.md 提供预提取音频数据frames[i].bands[]0–1 归一化频段振幅配合 GSAP 逐帧采样per-frame sampling viatl.call()的方案提取工具为 skills/hyperframes-creative/scripts/extract-audio-data.py。该方案强调预提取、确定性禁用Math.random()、禁用运行时分析与 Hyperframesidentical outputs, every time的确定性渲染哲学一致——这也正是示例脚本中 Proof 部分的底气所在。小结一份可执行的配音稿检查清单综合 narration.md 与相关参考文档一份合格的 Hyperframes 配音稿应通过以下检查节奏按 2.5 词/秒估算15s≈37 词、30s≈75 词、60s≈150 词并主动低于预算以留出停顿写完按实际语速反算总时长语气全文使用缩略语、长短句交错朗读一遍不机械术语只面向真正期待它的受众数字发音135、$1.9T、99.999%、200M、10x、API、域名等一律改写为口语形式让画面显示精确值、配音读近似值结构按 Hook→Story→Proof→CTA 组织15 秒短片可裁剪为三段Hook 与 story-spine 的观众语言 价值优先约束对齐开场前 3 秒必须制造张力/好奇/意外模式在大胆主张、挑衅提问、对比、震撼数字之间变换避免Welcome to…式开场与技术事实一致脚本中的主张须与项目实际能力对应确定性渲染、data-* 时间轴等不虚构性能数据或用户案例管线衔接确认VO_MODE逐字/重构、TTS 语音选择并将脚本送入audio.mjs完成语音、时间戳、BGM 与字幕的生成必要时配合 voiceover carve 让音乐为语音让路。【免费下载链接】hyperframesWrite HTML. Render video. Built for agents.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperframes创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →