尧图精选

abogen 使用指南:将 EPUB、PDF 与文本一键转换为带同步字幕的高质量有声书

🕒 发布时间:2026/9/17 20:46:04 📁 来源:尧图网络
abogen 使用指南将 EPUB、PDF 与文本一键转换为带同步字幕的高质量有声书【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogenAbogenaudiobook generator 的缩写是一款基于 Kokoro-82M 为主线结合源码pyproject.toml、abogen/domain、abogen/webui深入讲解安装部署、桌面端与 Web 端双界面操作、容器化运行、LLM 归一化、Audiobookshelf 集成以及章节标记、元数据标签、时间戳文本等核心机制读完即可从零跑通完整的有声书生成流程。项目概览一个项目两套界面Abogen 提供两套界面当前功能集有所差异Web UI 包含更新颖的功能Supertonic TTS、LLM 归一化、Audiobookshelf 集成等仍在逐步合并进桌面应用。两套界面各有独立的启动命令命令界面特性abogenPyQt6 桌面 GUI稳定的核心功能abogen-webFlask Web UI核心功能 Supertonic TTS、LLM Normalization、Audiobookshelf Integration等上述入口命令在 pyproject.toml 中有明确定义abogen与abogen-pyqt指向abogen.pyqt.main:mainabogen-cli与abogen-web指向abogen.webui.app:main。值得注意的是abogen-cli与abogen-web指向同一个入口——也就是说命令行模式与 Web 服务共用一套后端实现。项目要求 Python 版本3.10, 3.13核心依赖包括kokoro0.9.4、misaki[zh]分词与语音学支持、spacy句子切分、ebooklibePub 解析、PyMuPDFPDF 解析、PyQt6桌面 GUI、FlaskWeb UI与static_ffmpeg音频编码等详见 pyproject.toml。安装指南前置依赖espeak-ng无论哪个平台都需要先安装espeak-ngKokoro 的语音学前端依赖Windows前往 espeak-ng 官方 latest release 页面下载并运行*.msi安装包Macbrew install espeak-ngLinuxsudo apt install espeak-ngUbuntu/Debian、sudo pacman -S espeak-ngArch、sudo dnf install espeak-ngFedora。Windows 安装方案一一键脚本推荐新手下载仓库 ZIP 包并解压双击运行根目录下的 WINDOWS_INSTALL.bat脚本会自动完成一切——在自包含环境中安装全部依赖含 CUDA无需预先安装 Python脚本会自动安装。注意仍需单独安装 espeak-ng。若丢失快捷方式程序本体位于python_embedded/Scripts/abogen.exe可直接运行。方案二使用 uv 安装# NVIDIA GPUCUDA 12.8— 推荐 uv tool install --python 3.12 abogen[cuda] --extra-index-url https://download.pytorch.org/whl/cu128 --index-strategy unsafe-best-match # NVIDIA GPUCUDA 12.6— 针对旧驱动 uv tool install --python 3.12 abogen[cuda126] --extra-index-url https://download.pytorch.org/whl/cu126 --index-strategy unsafe-best-match # NVIDIA GPUCUDA 13.0— 针对新驱动 uv tool install --python 3.12 abogen[cuda130] --extra-index-url https://download.pytorch.org/whl/cu130 --index-strategy unsafe-best-match # AMD GPU 或无 GPU — AMD 用户需在 Linux 下使用 ROCm 加速Windows 无 ROCm 支持 uv tool install --python 3.12 abogen方案三pip 安装备选mkdir abogen cd abogen python -m venv venv venv\Scripts\activate # NVIDIA GPU因 PyTorch 上游 issue 需先固定安装 2.8.0 版本 pip install torch2.8.0cu128 torchvision0.23.0cu128 torchaudio2.8.0 --index-url https://download.pytorch.org/whl/cu128 pip install abogenAMD GPU 暂不支持 Windows因 ROCm 无 Windows 版本需使用 Linux。这些 CUDA 变体与源码中的可选依赖定义一一对应查看 pyproject.toml 可看到cuda126/cuda对应 CUDA 12.8/cuda130/rocm四个 extra以及 pyproject.toml 中为每个变体声明的 PyTorch 下载索引pytorch-cuda-126、pytorch-cuda-128、pytorch-cuda-130、pytorch-rocm-64-nightly——这正是上述命令中--extra-index-url的来源。Mac 安装brew install espeak-ng # Apple SiliconM1、M2 等 uv tool install --python 3.13 abogen --with kokoro githttps://github.com/hexgrad/kokoro.git,numpy2 # Intel Mac uv tool install --python 3.12 abogen --with kokoro githttps://github.com/hexgrad/kokoro.git,numpy2pip 备选方案pip3 install abogen随后对 Apple Silicon 还需安装 Kokoro 的开发版包含 MPS 支持pip3 install githttps://github.com/hexgrad/kokoro.git。这也是 pyproject.toml 中[tool.uv.sources]对 darwin 平台从 git 拉取 kokoro 的原因。Linux 安装sudo apt install espeak-ng # Ubuntu/Debian # sudo pacman -S espeak-ng # Arch Linux # sudo dnf install espeak-ng # Fedora # NVIDIA GPU 或无 GPU — 无需加 [cuda] 后缀 uv tool install --python 3.12 abogen # AMD GPUROCm 6.4 uv tool install --python 3.12 abogen[rocm] --extra-index-url https://download.pytorch.org/whl/nightly/rocm6.4 --index-strategy unsafe-best-matchpip 备选创建虚拟环境后pip3 install abogenAMD 用户需先pip3 uninstall torch再以pip3 install --pre torch torchvision torchaudio --index-url https://download.pytorch.org/whl/nightly/rocm6.4替换 PyTorch。NVIDIA 用户无需额外安装 CUDA。桌面应用PyQt6运行与使用流程安装完成后终端执行abogen即启动桌面 GUI若使用WINDOWS_INSTALL.bat安装桌面上通常已有快捷方式。使用流程非常直观拖入任意 ePub、PDF、文本、Markdown 或字幕文件也可用内置文本编辑器直接编辑配置参数语速、音色或用语音混合器自建音色、字幕生成风格、输出格式、保存位置点击Start开始转换。核心配置选项选项说明输入框支持拖放ePub、PDF、.TXT、.MD、.SRT、.ASS、.VTT文件或使用内置文本编辑器队列选项可批量加入多个文件并各自独立配置详见下文队列模式语速可在0.1x到2.0x之间调整选择音色编码规则第一位字母代表语言如a美式英语、b英式英语第二位m代表男声、f代表女声语音混合器通过混合多个音色模型创建自定义音色支持 profile 系统保存音色预览处理前先试听所选音色生成字幕Disabled、Line、Sentence、Sentence Comma、Sentence Highlighting、1 word、2 words、3 words等数字代表每条字幕的字数音频输出格式.WAV、.FLAC、.MP3、.OPUS压缩率最佳和M4B含章节字幕输出格式SRT (standard)、ASS (wide)、ASS (narrow)、ASS (centered wide)、ASS (centered narrow)将单个换行替换为空格将文本中孤立的换行替换为空格适用于存在伪换行的文本保存位置保存到输入文件旁、保存到桌面、选择输出文件夹这些选项在源码中有严格的类型约束与默认值管理。例如字幕模式、输出格式与输入格式均定义为枚举类型见 abogen/domain/enums.pySubtitleMode支持Disabled / Line / Sentence / Sentence Comma / Sentence HighlightingOutputFormat支持wav / mp3 / flac / opus / m4b其中WAV、FLAC判定为无损格式InputFormat将输入区分为书籍类epub/pdf/txt/md与字幕类srt/ass/vtt两类底层转换逻辑据此分流。书籍处理选项选项说明章节控制从 ePUB 或 Markdown 中选择具体章节PDF 可选择章节 页码每章单独保存将电子书每一章保存为独立音频文件创建合并版本生成合并全部章节的单一音频文件若未勾选每章单独保存此为默认行为保存到带元数据的项目文件夹将转换结果保存到项目文件夹并附带可用元数据文件菜单选项选项说明主题System/Light/Dark三种主题配置每条字幕最大字数设置每条字幕条目的最大单词数配置章节间静音时长设置章节之间的静音间隔秒配置日志窗口最大行数设置日志窗口最多显示的行数独立章节音频格式独立章节的音频格式wav/flac/mp3/opus创建桌面快捷方式一键在桌面创建快捷方式打开配置目录打开存放配置文件的目录打开缓存目录打开存放已转换文本文件的缓存目录清除缓存文件删除转换或预览过程中产生的缓存文件字幕间使用静音间隙让语音自然延续到字幕间的静音间隙中避免不必要的音频加速针对字幕文件输入关闭时则加速音频以适配字幕指定的精确时间区间字幕速度调整方式TTS Regeneration重生成音频质量更好或FFmpeg Time-stretch快速变速速度更好针对字幕文件输入使用 spaCy 做句子切分启用后用 spaCy 检测句子边界比单纯按标点切分更准确避免把 Mr. 或 Dr. 误切。非英语文本在音频生成前切句英语文本在字幕生成时切句以改善时机与可读性。仅在字幕模式为Sentence或Sentence Comma时生效预下载模型与音色以离线使用打开窗口展示可用模型与音色点Download all下载全部所需模型与音色实现完全离线使用禁用 Kokoro 联网阻止 Kokoro 从 HuggingFace Hub 下载模型或音色适用于离线场景启动时检查更新程序启动时自动检查更新恢复默认设置将所有设置恢复为默认值spaCy 句子切分与字幕生成的配合在源码中体现为两条路径非英语文本走spacy_pre_tts_segmentation在 TTS 前切句见 abogen/domain/conversion_pipeline.py英语文本则走_process_spacy_sentences在字幕生成时基于带时间戳的 token 切句见 abogen/domain/subtitle_generation.py。语音混合器Voice Mixer语音混合器允许你混合多个音色模型创建自定义音色调整每种音色的权重并将自定义音色保存为 profile 以备后用。它让你能创建独一无二、个性化的声音。其底层即 README 路线图中提到的voice formula功能混合不同音色模型的公式机制对应 abogen/domain/voice_utils.py 中的formula_from_kokoro_entry与 abogen/domain/voice_resolution.py 中的 profile 解析逻辑。队列模式Queue ModeAbogen 支持队列模式可一次批量转换多个文件可直接用队列管理器中的Add files按钮或拖放方式添加文本文件.txt与字幕文件.srt、.ass、.vttPDF、EPUB、Markdown 文件则需在主窗口输入框添加后点击Add to Queue队列中每个文件保留加入时的配置快照——之后修改主窗口配置不会影响已在队列中的文件勾选Override item settings with current selection可强制所有队列项使用主窗口当前配置覆盖其保存的设置悬停文件可查看其配置。加入队列后Abogen 会自动依次处理每个条目并按各自配置输出。Web 应用WebUI启动与使用abogen-web随后浏览器打开http://localhost:8808拖入文档即可。任务由后台 worker 执行浏览器会自动刷新进度。使用流程上传文档拖放或点上传按钮选择音色、语言、语速、字幕风格与输出格式点击Create job任务立即出现在队列中实时查看进度与日志完成后下载音频/字幕文件可随时取消或删除任务并可下载日志用于排障。多个任务顺序执行worker 依次处理。容器镜像部署从仓库根目录可直接构建轻量容器镜像docker build -t abogen . mkdir -p ~/abogen-data/uploads ~/abogen-data/outputs docker run --rm \ -p 8808:8808 \ -v ~/abogen-data:/data \ --name abogen \ abogen访问http://localhost:8808。上传的源文件存放在/data/uploads生成的音频与字幕出现在/data/outputs。构建细节可参考 abogen/webui/Dockerfile镜像基于nvidia/cuda:12.6.3-cudnn-runtime-ubuntu22.04支持通过TORCH_INDEX_URL/TORCH_VERSION/USE_GPU三个 ARG 控制 PyTorch 版本与 CUDA 索引、是否安装onnxruntime-gpuSupertonic 使用 ONNX Runtime 做 CUDA 加速并以非 root 用户UID 1000运行。容器环境变量变量默认值用途ABOGEN_HOST0.0.0.0Flask 服务绑定地址ABOGEN_PORT8808HTTP 端口ABOGEN_DEBUGfalse启用 Flask 调试模式ABOGEN_UPLOAD_ROOT/data/uploads上传文件的存储目录ABOGEN_OUTPUT_ROOT/data/outputs生成音频与字幕的目录ABOGEN_OUTPUT_DIR的旧别名ABOGEN_OUTPUT_DIR/data/outputs容器内渲染音频/字幕的路径ABOGEN_SETTINGS_DIR/config容器内 JSON 设置/配置路径ABOGEN_TEMP_DIR/data/cacheDocker或平台缓存目录容器内临时音频工作文件路径ABOGEN_UID1000容器运行 UID对齐宿主机用户ABOGEN_GID1000容器运行 GID对齐宿主机组ABOGEN_LLM_BASE_URL用于预填设置 → LLM面板的 OpenAI 兼容端点ABOGEN_LLM_API_KEY传递给上述端点的 API 密钥ABOGEN_LLM_MODEL刷新模型列表时默认选中的模型ABOGEN_LLM_TIMEOUT30服务端 LLM 请求超时秒ABOGEN_LLM_CONTEXT_MODEsentence默认提示上下文窗口sentence/paragraph/documentABOGEN_LLM_PROMPT预填进 UI 的自定义归一化提示模板使用-e VARvalue即可在启动容器时设置这些变量。若要匹配文件权限可先执行id -u与id -g获取本机 UID/GID 填入ABOGEN_UID/ABOGEN_GID。Docker Compose默认启用 GPU仓库根目录的 docker-compose.yaml 开箱即支持 GPU 主机需先安装 NVIDIA Container Toolkitdocker compose up -d --build关键构建/运行旋钮TORCH_VERSION— 固定与驱动匹配的 PyTorch 版本留空则用所配索引上的最新版TORCH_INDEX_URL— 更换 PyTorch 下载索引以适配不同 CUDA 构建ABOGEN_DATA— 存储上传/输出的宿主机路径默认./data。CPU-only 部署注释掉 compose 文件中的deploy.resources.reservations.devices块以及可选的runtime: nvidia行即可。若更偏好传统 CLIdocker build -f abogen/Dockerfile -t abogen-gpu . docker run --rm \ --gpus all \ -p 8808:8808 \ -v ~/abogen-data:/data \ abogen-gpu使用 Compose 时在.env中设置ABOGEN_SETTINGS_DIR、ABOGEN_OUTPUT_DIR、ABOGEN_TEMP_DIR为要挂载的宿主机目录Compose 会分别映射到容器内/config、/data/outputs、/data/cache。非音频类缓存如 Hugging Face 下载默认留在容器内部缓存/tmp/abogen-home/.cache只有转换临时数据会触及挂载的ABOGEN_TEMP_DIR。启动前请确保各宿主机目录存在且对配置的 UID/GID 可写。LLM 辅助文本归一化Abogen 可将棘手的撇号与缩写交给 OpenAI 兼容的大语言模型处理在设置 → LLM中配置输入端点 base URLOllama、OpenAI 代理等及所需 API 密钥。填服务器根路径Ollama 为http://localhost:11434——Abogen 会自动追加/v1/...同时也接受已以/v1结尾的输入点击Refresh models加载模型目录选择默认模型并调整超时或提示模板用预览框测试提示词后保存设置。Normalization 面板可用当前配置合成一段简短音频预览。在 Docker 或 CI 中运行时可用.env文件中的ABOGEN_LLM_*变量自动预填表单仓库提供的.env.example内含本地 Ollama 服务器的示例值。Audiobookshelf 集成Abogen 可把成品有声书直接推送到 Audiobookshelf。在设置 → 集成 → Audiobookshelf中配置Base URL— Audiobookshelf 服务器的 HTTPS 源可含路径前缀例如https://abs.example.com或https://media.example.com/abs。不要追加/apiLibrary ID— 目标 Audiobookshelf 库的标识符从 ABS 库设置页复制Folder名称或 ID— 库内的目标文件夹。可输入与 Audiobookshelf 显示完全一致的文件夹名Abogen 自动解析为正确 ID或直接粘贴原始folderId也可点Browse folders拉取可用文件夹并填充API token— 在 Audiobookshelf 的Account → API tokens中生成的个人访问令牌。连接成功后可对后续任务启用自动上传或从队列对单个任务触发上传。Nginx Proxy Manager 反向代理检查清单当 Audiobookshelf 位于 Nginx Proxy ManagerNPM之后时需确保 API 路径与请求头原样到达后端创建指向 ABS 容器/主机的Proxy Host默认转发端口13378在SSL标签启用证书若仅允许 HTTPS 则勾选Force SSL在Advanced标签追加以下配置片段保证 bearer token、客户端 IP 与大体积上传能穿越代理proxy_set_header Host $host; proxy_set_header X-Real-IP $remote_addr; proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for; proxy_set_header X-Forwarded-Proto $scheme; proxy_set_header X-Forwarded-Host $host; proxy_set_header X-Forwarded-Port $server_port; proxy_set_header Authorization $http_authorization; client_max_body_size 5g; proxy_read_timeout 300s; proxy_connect_timeout 300s;关闭Block Common Exploits部分 NPM 版本会剥离 Authorization 请求头在主代理界面启用Websockets SupportAudiobookshelf 的 Web UI 依赖它同时保持反向代理配置一致性若 Audiobookshelf 挂在路径前缀下如/abs添加一个Location: /abs/的Custom Location并把Forward Path设为/。该重写会在流量到达后端前剥离/abs前缀使外网的/abs/api/...在后端变成/api/...。Abogen 的 Base URL 字段填写带前缀的同一 URL。保存代理配置后在运行 Abogen 的机器上测试 APIcurl -i https://abs.example.com/api/libraries \ -H Authorization: Bearer YOUR_API_TOKEN若仍返回Cannot GET /api/...说明代理在改写路径复查Custom Locations表/abs/的Forward Path应为空并在发起 curl 请求时查看 NPM 的 access/error 日志确认后端看到的是完整/api/librariesURL。返回 JSON 的 libraries 列表即代表 API 路由正确。随后可在 Abogen 设置中使用Browse folders确认库内容、运行Test connection校验库并解析文件夹并在已完成任务上使用 Send to Audiobookshelf 按钮。JSON 端点需要机器可读的状态更新时dashboard 使用的辅助端点可直接复用GET /api/jobs/id— 以 JSON 返回任务元数据、进度与日志行GET /partials/jobs— 以 HTML 渲染实时任务列表htmx 轮询用GET /partials/jobs/id/logs— 仅渲染日志窗口。这些端点对应 abogen/webui/routes 下的路由实现jobs、main 等模块。两套界面共有的核心特性章节标记Chapter Markers处理 ePUB、PDF 或 Markdown 文件时Abogen 会先将其转换为缓存目录中的文本文件。点击Edit实际就是在编辑这些转换后的文本文件。这些文本文件中包含如下标记CHAPTER_MARKER:Chapter Title章节标记的作用允许你按章节将文本拆分为独立音频文件出错时只需重新处理特定章节无需重跑整个文件节省时间。你也可以手动为纯文本文件添加标记以享受同样收益CHAPTER_MARKER:Introduction This is the beginning of my text... CHAPTER_MARKER:Main Content Heres another part...处理该文本时Abogen 会自动识别这些标记并询问是否每章单独保存、是否创建合并版本。源码层面的实现见 abogen/domain/text_chapters.pyparse_chapters_from_text使用正则CHAPTER_MARKER:(.*?)忽略大小写切分文本且保留第一个标记之前的内容并命名为 Introduction若存在。没有标记的文本则整体作为单一章节处理。元数据标签Metadata Tags与章节标记类似可以为M4B文件添加元数据标签对支持元数据的有声书播放器很有用可写入标题、作者、年份等信息。Abogen 处理 ePUB、PDF 或 Markdown 文件时会自动添加这些标签但也可手动添加到文本文件开头METADATA_TITLE:Title METADATA_ARTIST:Author METADATA_ALBUM:Album Title METADATA_YEAR:Year METADATA_ALBUM_ARTIST:Album Artist METADATA_COMPOSER:Narrator METADATA_GENRE:Audiobook METADATA_COVER_PATH:path/to/cover.jpgMETADATA_COVER_PATH用于把封面图嵌入生成的 M4B 文件。Abogen 会自动从 EPUB 与 PDF 中提取封面并添加此标签。底层实现见 abogen/domain/metadata_extraction.py 的extract_metadata_from_text它按METADATA_KEY:value模式解析上述全部 8 个字段并由build_ffmpeg_metadata_args映射为 ffmpeg 元数据参数注意year映射为 ffmpeg 的date键未填字段有默认值标题/专辑回退为文件名、艺术家为 Unknown、作曲者为 Narrator、流派为 Audiobook。此外apply_m4b_chapters_with_mutagenabogen/domain/audio_helpers.py负责把章节信息写入 M4B。基于时间戳的文本文件与字幕转音频类似Abogen 能自动识别包含HH:MM:SS、HH:MM:SS,ms或HH:MM:SS.ms格式时间戳的文本文件。检测到时间戳后Abogen 会询问是否用其控制音频时间。这适用于制作需要精确控制每段朗读时机的旁白、脚本或逐字稿。文本格式如下00:00:00 This is the first segment of text. 00:00:15 This is the second segment, starting at 15 seconds. 00:00:45 And this is the third segment, starting at 45 seconds.重要说明时间戳必须为HH:MM:SS、HH:MM:SS,ms或HH:MM:SS.ms格式如00:05:30表示 5 分 30 秒00:05:30.500表示 5 分 30.5 秒毫秒部分可选精度最高 1/1000 秒第一个时间戳之前的文本如有自动从00:00:00开始使用时间戳时字幕生成模式设置将被忽略。该机制的解析入口是 abogen/domain/subtitle_processor.py 的parse_subtitle_fileis_timestamp_textTrue时按时间戳行切分文本段并且时间戳文本的每条字幕在无明确结束时间时使用is_auto_end逻辑自动推导结束时刻。支持的语言Kokoro 目前内置以下语言音色编码首字母对应# a American English美式英语 # b British English英式英语 # e Spanish es西班牙语 # f French fr-fr法语 # h Hindi hi印地语 # i Italian it意大利语 # j Japanese日语pip install misaki[ja] # p Brazilian Portuguese pt-br巴西葡萄牙语 # z Mandarin Chinese普通话pip install misaki[zh]日语需额外安装misaki[ja]中文需misaki[zh]misaki[zh]已是 pyproject.toml 中的默认依赖。在源码 abogen/domain/enums.py 的Language枚举中实际定义了远超上述列表的语言集合含德语、俄语、韩语、阿拉伯语、土耳其语等三十余种且每种语言都有display_name与 CJK 判定is_cjk。所有语言都支持字幕生成supports_subtitle_tokens恒为 True但注意Abogen 为所有语言生成字幕不过词级字幕模式如 1 word、2 words、3 words 等仅对英语可用因为 Kokoro 只为英语文本提供逐词时间戳 token。非英语语言使用基于时长的回退方案支持句子级与逗号级模式Line、Sentence、Sentence Comma。指南与故障排查MPV 播放配置官方强烈推荐使用 MPV 播放音频文件因为它支持无视频轨也能显示字幕。推荐的mpv.conf# --- MPV Settings --- save-position-on-quit keep-openyes audio-displayno # --- Subtitle --- sub-ass-overrideno sub-margin-y50 sub-margin-x50 # --- Audio Quality --- audio-spdifac3,dts,eac3,truehd,dts-hd audio-channelsauto audio-samplerate48000 volume-max200用 Abogen 产出制作演示视频仓库的 demo/README.md 记录了官方演示视频52 秒仅 736kB的制作方法用 Abogen 生成.ass字幕设置中选ass(centered narrow)字幕格式与.wav音频配合一张背景图bg.jpg再以 FFmpeg 合成。推荐命令需先安装 FFmpegffmpeg -loop 1 -framerate 24 -i bg.jpg -i demo.wav -vf assdemo.ass -c:v libx264 -pix_fmt yuv420p -preset slow -crf 18 -c:a aac -b:a 192k -movflags faststart -shortest demo.mp4若追求更小体积可用 VP9/Opus 的.webm版本。素材示例bg.jpg、demo.ass、demo.wav均在仓库 demo 目录下。命令行排障模式遇到问题时可改用命令行模式启动以查看详细错误abogen-cli若用 Windows 安装脚本安装则进入python_embedded/Scripts运行abogen-cli.exe。命令行模式会输出详细错误信息请携带错误信息与问题描述在项目 Issues 页面提交。常见问题与解决方案CUDA GPU is not available. Using CPU 警告该提示意味着 PyTorch 未能使用 GPU 而回退到 CPU。Windows 上 Abogen 仅支持带 CUDA 的 NVIDIA GPUAMD GPU 在 Windows 不支持仅在 Linux 配 ROCm 可用。有兼容 NVIDIA GPU 仍出现该警告时# 在包含 python_embedded 的 Abogen 文件夹终端执行 python_embedded\python.exe -m pip install --force-reinstall torch2.8.0cu128 torchvision0.23.0cu128 torchaudio2.8.0 --index-url https://download.pytorch.org/whl/cu128若你的老款 NVIDIA GPU 不支持 CUDA 12.8可换装 CUDA 12.6 版本把索引换成cu126、版本号改为2.8.0cu126。AMD GPU 用户需使用 Linux 并遵循上面的 Linux/ROCm 指引。uv 安装的用户可直接重装换版本uv tool uninstall abogen uv tool install --python 3.12 abogen[cuda126] --extra-index-url https://download.pytorch.org/whl/cu126 --index-strategy unsafe-best-match # 若仍不行再试 cuda130Linux 下 The script abogen-cli is installed in /home/username/.local/bin which is not on PATHecho export PATH\/home/$USER/.local/bin:\$PATH\ ~/.bashrc source ~/.bashrcNo matching distribution found请使用受支持的 Python3.10 至 3.12推荐用 uv 安装Linux 上也可用 pyenv 管理多版本 Python。[WinError 1114] A dynamic link library (DLL) initialization routine failed常见于无 GPU 支持的虚拟机中运行 Abogen。Windows 安装脚本用户python_embedded\python.exe -m pip install --force-reinstall torch2.8.0cu128 torchvision0.23.0cu128 torchaudio2.8.0 --index-url https://download.pytorch.org/whl/cu128pip 安装用户则在虚拟环境终端执行pip install torch2.8.0 torchaudio2.8.0 torchvision0.23.0 --index-url https://download.pytorch.org/whl/cu128日语音频不工作日语可能需要额外配置疑似与 Kokoro 的日语支持额外依赖有关参见 issue #56。卸载 Abogen从设置菜单进入Open configuration directory与Open cache directory删除对应目录pip 安装pip uninstall abogenpip cache purgeuv 安装uv tool uninstall abogenuv cache clearWindows 安装脚本用户直接删除包含 Abogen 的整个文件夹即可所有内容都在python_embedded内不产生其他目录espeak-ng 需单独卸载。开发者贡献与许可证开发者可在解压仓库后执行以下命令以可编辑模式安装并构建pip install -e .[dev] # 可编辑模式安装含构建依赖 python -m build # 可选在 dist 目录构建包 abogen # 打开 GUIuv 用户可改用uv venv --python 3.12uv pip install -e .uv build。注意需使用 Python 3.10 至 3.12。更深入的架构说明可参考 docs/developer-guide.md、docs/tts-plugin-architecture.md 与 docs/testing.md项目自带覆盖领域层、WebUI 与插件契约的完整测试套件见 tests。项目遵循 MIT 许可证见 LICENSE其核心 TTS 引擎 Kokoro 采用 Apache-2.0 许可允许商业使用、修改、分发与私有使用。关于项目名称abogen是audiobook generator的缩写。结语从一条uv tool install命令到完整的批量有声书生产线Abogen 将 ePUB/PDF/文本转语音的复杂度收敛为高度可配置的图形界面与容器化服务桌面端侧重单机批量与精细控制章节拆分、音色混合、词级字幕Web 端则叠加了 LLM 归一化、Supertonic TTS 与 Audiobookshelf 推送等前沿能力。无论你是想快速把手头的电子书变成睡前有声读物还是搭建一套自动化的内容配音流水线都可以从本文的安装、配置与故障排查清单出发结合仓库源码深入定制。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →