Pixelle-Video 快速开始:从零生成你的第一个 AI 短视频
Pixelle-Video 快速开始从零生成你的第一个 AI 短视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video本篇指南是 Pixelle-Video 的实战入门教程面向已完成安装和配置、准备产出第一条视频的用户。你将学会如何启动 Web 界面、完成 LLM 与图像生成服务的首次配置并沿「输入主题 → 配置语音与视觉 → 一键生成 → 预览输出」的标准流程在数分钟内生成一条包含文案、配图、配音与 BGM 的完整短视频。读完本文你将能够独立跑通 Pixelle-Video 的核心创作链路并了解生成过程的底层流水线实现。启动 Web 界面Pixelle-Video 以 Streamlit 多页应用的形式提供 Web 界面入口位于 web/app.py。从源码结构看该入口通过st.navigation注册了「主页」与「历史」两个页面主页pages/1__Home.py为默认页负责渲染系统配置、流水线选项卡Tab与三栏创作界面见 web/pages/1__Home.py。根据你的安装方式选择对应的启动方式Windows 一键整合包用户如果你使用的是 Windows 一键整合包无需安装 Python、uv 或 ffmpeg只需双击运行start.bat打包模板见 packaging/windows/templates/start.bat浏览器会自动打开http://localhost:8501。从源码安装用户# 使用 uv 运行推荐会自动安装依赖 uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。提示源码运行依赖 Python 包管理器uv与视频处理工具ffmpeg两者的安装方式见 docs/zh/getting-started/installation.mdREADME 中也提供了 macOS / Ubuntu / Windows 的安装命令。web/app.py启动时会自动将项目根目录加入sys.path因此无需额外设置环境变量。认识三栏创作界面启动后主页采用经典的三栏布局对应 web/pipelines/standard.py 中st.columns([1, 1, 1])的实现左侧栏「 内容输入」 背景音乐BGM选择中间栏语音TTS设置、视频模板与媒体生成图像/视频工作流设置右侧栏「 生成视频」按钮、实时进度与视频预览。顶部还提供「⚙️ 系统配置」面板首次使用必填与内置 FAQ 侧边栏。理解这三栏的职责有助于你按后续步骤逐步完成配置。步骤一检查并保存系统配置首次使用时展开「⚙️ 系统配置」面板确认至少已配置以下两类服务LLM 配置用于生成视频文案通过下拉菜单选择 AI 模型预设如通义千问推荐性价比高、GPT-4o、DeepSeek或 Ollama本地运行完全免费选择预设后系统会自动填充base_url与model填入对应服务的 API Key。对应的配置文件为 config.example.yaml其llm段支持任何兼容 OpenAI SDK 的 APIllm: api_key: base_url: model: 该文件顶部注释给出了常用预设的取值参考通义千问 Qwen Max 使用https://dashscope.aliyuncs.com/compatible-mode/v1qwen-maxDeepSeek 使用https://api.deepseek.comdeepseek-chat本地 Ollama 使用http://localhost:11434/v1llama3.2。图像配置用于生成配图/视频片段支持两种生成来源来源配置项说明本地部署ComfyUI URL默认http://127.0.0.1:8188点击「测试连接」确认服务可用可选填 ComfyUI API Key云端部署RunningHub API Key无需本地 GPU可选配置并发限制1–10普通会员默认 1与实例类型24GB / 48GB 显存此外「系统配置」中还支持API 媒体模型配置当选择api/...直连工作流时可直接调用 DashScope、OpenAI、ARK、Kling、Seedream、Seedance 等供应商的图像/视频生成能力可配置 API Key、Base URL、本地代理开关以及「打印模型请求参数」调试选项。配置全部填写后点击「保存配置」即可。配置最终会写入config.yaml文件注意切勿将该文件提交到 Git。完整的配置项说明可参考 docs/zh/getting-started/configuration.md。步骤二输入主题在左侧栏的「 内容输入」区域实现见 web/components/content_input.py选择内容生成模式并输入创作素材选择「AI 生成内容」模式generate——输入主题AI 自动创作解说文案在文本框中输入一个主题例如为什么要养成阅读习惯可选设置场景数量分镜数默认 5 个分镜。从源码可见分镜数滑块的范围为 3–30默认值 5st.slider(..., min_value3, max_value30, value5)。若选择「固定文案内容」模式fixed则可直接粘贴完整文案跳过 AI 创作并可通过分割方式段落/行/句子控制分镜切分粒度。!!! tip 主题示例 - 为什么要养成阅读习惯 - 如何提高工作效率 - 健康饮食的重要性 - 旅行的意义左侧栏还支持背景音乐选择可选「无 BGM」、内置音乐如default.mp3或将自定义 MP3/WAV 等音频放入仓库根目录的bgm/文件夹后自动出现在下拉列表中并支持试听与音量调节默认音量 0.2范围 0–0.5。步骤三配置语音和视觉在中间栏完成语音与视觉两大部分设置实现见 web/components/style_config.py。语音设置TTS推理模式支持local本地直连默认与comfyui通过工作流两种模式TTS 工作流默认 Edge-TTS 即可。系统会自动扫描workflows/文件夹中的 TTS 工作流如selfhost/tts_edge.json、selfhost/tts_index2.json也可以自备 ComfyUI 工作流放入该目录音色与语速local 模式下可切换 Edge-TTS 多语言音色默认zh-CN-YunjianNeural语速滑块范围 0.5x–2.0x默认 1.2x音色清单定义在 pixelle_video/tts_voices.py参考音频可选上传 MP3/WAV/FLAC/M4A/AAC/OGG 格式的参考音频用于声音克隆适用于支持克隆的 TTS 工作流如 Index-TTS上传后可直接试听预览功能输入测试文本点击「预览语音」即可试听当前配置效果且支持带参考音频预览。视觉设置图像生成选择图像生成工作流默认即可支持本地部署selfhost/与云端 RunningHubrunninghub/工作流也支持api/...直连图像模型工作流需先在系统配置中填写对应供应商密钥设置图像尺寸默认 1024x1024单位为像素不同模型对尺寸有不同限制提示词前缀Prompt Prefix控制图像整体风格需使用英文例如Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style可点击「预览风格」测试效果。视频模板决定视频画面的布局与设计模板按命名规范分为三类static_*.html静态模板无需 AI 生成媒体纯文字样式image_*.html图片模板使用 AI 生成的图片作为背景video_*.html视频模板使用 AI 生成的视频作为背景按尺寸分组展示竖屏 / 横屏 / 方形点击「预览模板」可自定义参数测试效果推荐新手先选择竖屏 1080x1920 的模板默认模板为1080x1920/image_default.html见 config.example.yaml 中template.default_template可预览模板效果图仓库docs/images/目录按尺寸保存了各模板的中英文预览图WebUI 中会按当前语言自动匹配展示如需开发自己的模板可参照 templates/1080x1920/ 下的 HTML 实现并查阅 docs/zh/user-guide/templates.md。当选择video_*.html模板时还需选择视频生成工作流或 API 视频模型如 DashScope Wan、Kling、Seedance并可按模型能力设置分辨率、画幅比例、时长等参数。步骤四生成视频完成上述配置后点击右侧栏的「 生成视频」按钮实现在 web/components/output_preview.py。点击前系统会先校验配置是否完整config_manager.validate()以及输入文本是否为空若选择了视频模板却未选择视频工作流/API 模型会提示先选择后再生成。校验通过后页面会显示实时进度条与状态文本依次经历以下阶段生成文案生成配图每个分镜合成语音合成视频进度信息来自ProgressEvent事件回调例如「分镜 3/5 - 步骤 2/4: 生成插图」这类粒度提示事件定义见 pixelle_video/models/progress.py。进度条在完成前被限制在 99%全部完成后跳至 100%。!!! info 生成时间 生成一个 5 分镜的视频大约需要 2-5 分钟具体时间取决于LLM API 响应速度、图像生成速度、TTS 工作流类型、网络状况。步骤五预览视频生成完成后视频会自动在右侧栏播放。你可以看到 视频预览播放器并提供「⬇️ 下载视频」按钮⏱️ 视频时长含总生成耗时 文件大小 分镜数量 视频尺寸由所选模板路径解析得出视频文件保存在output/文件夹中。生成的视频元信息时长、大小、分镜数、尺寸会在预览区以一行摘要形式展示便于快速核对。了解生成流程的底层实现若想深入理解点击「生成视频」后发生了什么可从源码层面把握其执行链路入口WebUI 调用pixelle_video.generate_video(...)定义于 pixelle_video/service.py把左侧内容参数、中间栏样式参数与进度回调一并传入流水线编排标准流水线继承自 pixelle_video/pipelines/linear.py 中的LinearVideoPipeline采用模板方法模式将生成过程划分为八个生命周期阶段setup_environment环境准备→generate_content文案生成→determine_title标题确定→plan_visuals配图规划→initialize_storyboard分镜初始化→produce_assets素材生产图像/视频/语音→post_production后期合成BGM 与视频拼接→finalize结果落盘。各阶段的执行状态统一保存在PipelineContext中并在每个阶段通过progress_callback推送进度事件各原子能力文案由 LLM 服务pixelle_video/services/llm_service.py生成配图可走 ComfyUI/RunningHub 工作流或直连 API 模型pixelle_video/services/api_services/ 下按供应商拆分为 image/video/vlm 客户端语音由 TTS 服务pixelle_video/services/tts_service.py完成帧渲染与合成每个分镜由 HTML 模板渲染为画面帧pixelle_video/services/frame_html.py最终由视频处理模块拼接为成品视频pixelle_video/services/video.py。这一「文案 → 配图规划 → 逐帧处理 → 视频合成」的模块化设计意味着每个环节都可以按需替换换 LLM、换图像模型、换 TTS 工作流、换模板均不影响整体流程结构。下一步探索恭喜你已经成功生成了第一个视频 接下来你可以继续深入调整风格— 查看 自定义视觉风格教程通过提示词前缀与模板组合打造独特画面克隆声音— 查看 使用参考音频克隆声音教程用 Index-TTS 等克隆工作流复刻专属音色使用 API— 查看 API 使用指南将视频生成能力集成到自己的程序中开发模板— 查看 模板开发指南按static_/image_/video_命名规范创建自定义模板。更多全局配置项LLM 预设、ComfyUI/RunningHub、直连 API 供应商、默认模板等可对照 config.example.yaml 与 docs/zh/reference/config-schema.md 查阅遇到常见问题时可先阅读 docs/zh/troubleshooting.md 或使用 Web 界面侧边栏内置的 FAQ。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →