
三步把电子书变成有声书ebook2audiobook 完整上手指南【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook通勤末班地铁上眼睛又酸了那本 500 页的小说书签还停在第 47 页——如果你也想让书开口说话那电子书转有声书这件事值得试试。开源项目ebook2audiobook下文简称 E2A能把你的电子书一键读出来自动切章节、带元数据、支持语音克隆还能读 1158 种语言。下面按拿到手 → 跑起来 → 玩出花样的顺序带你走完整个过程。一堆闲置电子书E2A 帮你解决什么不用看参数表直接说它对日常使用意味着什么文件进有声书出丢进去一本 epub出来的是分好章节、带好元数据的音频不用手动拆段落。不必只用机械音录 1~5 分钟自己的声音它就能克隆你的音色朗读就算录音有背景噪音它也会自动把声音洗干净。不局限于中英1158 种语言和方言可选书的语言和你想听的语言不一致时还能先翻译再合成。老机器也能跑最低 2GB 内存 / 1GB 显存就能启动MacApple Silicon、Windows、Linux 都支持显卡覆盖 CUDA、ROCm、XPU、Jetson 等。三步上手从下载到你第一本有声书第一步拿到项目git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook第二步启动Windows双击ebook2audiobook.cmd缺什么依赖它会自动装。Linux / macOS终端执行./ebook2audiobook.command。启动后浏览器会打开 Gradio 网页界面默认http://localhost:7860不想本地装环境的话Notebooks/ 目录里还有现成的 Colab 和 Kaggle 版笔记本云端直接跑。第三步转换两种方式任选界面模式在 Input Options 页上传电子书、选语言和 TTS 引擎、可选上传声音参考文件点 Convert 就行。无头模式适合脚本化、批量跑./ebook2audiobook.command --headless --ebook /path/to/book.epub --language eng --voice /path/to/ref.wavWindows 把命令换成ebook2audiobook.cmd参数一样。--voice可省略省略就用默认声音想看全部参数加--help跑一遍就行。转换完成时会得到一个播放器直接在页面试听满意再下载默认输出 m4b带完整元数据。四个核心能力拆解章节自动切分长篇小说也能一章一章听E2A 会自动检测章节边界每个章节单独生成音频片段再拼成完整有声书。想拿到最准的章节效果用.epub或.mobi文件最稳。两个提醒EPUB 本身没有标准的章节规范目录页、版权页这种不想听的内容建议转换前先手动删掉。支持 20 多种格式.epub、.mobi、.azw3、.fb2、.pdf、.txt、.docx、.html、.odt甚至.png/.jpg/.tiff这类图片文件。扫描件也能读OCR 兜底书是扫描版 PDF或者干脆就是一堆文字截图E2A 内置 OCR 扫描对 PDF / JPG / PNG / BMP / TIFF 里以图片形式存在的文字先识别再合成。下面这张就是典型的待识别手写体文本页语音克隆用自己的声音读电子书录一段 1~5 分钟的音频wav 为主语言 24000Hz、其他语言 22050Hz通过界面上传或命令行--voice传入即可。背景有杂音、有音乐没关系参考音频会自动降噪处理。内置的声音列表以英文为主克隆任意语言的声音则是你自己的事。1158 种语言 8 个 TTS 引擎语言怎么填--language用 ISO-639-3 代码eng、ita、deu也兼容两字母代码。想跨语言听书时加--translate 目标语言它会先用 argostranslate 翻译全书再合成翻译后的产物带_语言码后缀单独存放不会和原文件混在一起。引擎怎么选XTTSv2多语言 零样本克隆默认主力、Bark、VITS、Tacotron2、Tortoise、GlowTTS、YourTTS、Fairseq。纯 CPU 机器上现代大引擎偏慢建议换 YourTTS、Tacotron2 这类轻量引擎换取速度。进阶玩法批量、微调与更细的控制批量转换--ebooks_dir指一个目录目录里的书全部转换。配一个--voice_mapJSON书路径 → 声音文件路径每本书还能用不同的声音./ebook2audiobook.command --headless --ebooks_dir ./ebooks --language eng \ --voice_map voices.json用你自己训练的模型--custom_model传入一个 zipXTTSv2 需含config.json、model.pth、vocab.json、ref.wavzip 里的ref.wav就是朗读时使用的声音。训练侧Notebooks/finetune/xtts/ 里有 Colab / Kaggle 两个一键微调 XTTSv2 的笔记本想折腾更多模型VITS、GlowTTS、Piper 等可以看 components/Universal_TTS_Finetune/ 里的一整套训练配方和 Web GUI。SML 标签在文本里插入标签做细粒度控制——[break]短停顿、[pause]长停顿、[pause:3]固定 3 秒、[voice:/path/to/ref.wav]...[/voice]局部切换声音。想要全自动插入参考 components/E2A-SML/ 的自动标注方案。几个顺手的小功能--session断点续传上次中断的转换可以接着跑。--abs_url/--abs_api_token/--abs_library转完直接推到 Audiobookshelf 书架。输出格式默认 m4b在 lib/conf.py 里可改可选 mp3、flac、wav、ogg、aac 等单声道/立体声也能选。嫌装依赖麻烦项目自带 Docker / Compose / Podman 配置一条命令构建好自包含镜像。调参与避坑实用清单音频参数都在 Audio Generation Preferences 页调节常用项如下参数作用建议Temperature越高越有创造力越低越稳定截图默认 0.65先不动它Repetition Penalty抑制重复语句默认 2.5 即可Speed语速0.5–3默认 1Top-k / Top-p越低输出越保守生成越快追求速度再往下调避坑清单按踩坑频率排GPU 没被识别先查驱动再用项目根目录的detect_gpus.py自检设备类型。CPU 转换太慢这不是 bug是模型特性。换 YourTTS / Tacotron2 等轻量引擎牺牲一点音质换速度。依赖装不上直接用官方 Docker 镜像环境完全自包含还支持 headless 模式。音频被截断多半是句子切分逻辑的问题项目维护者需要母语者反馈去 issue 区报一下能帮到他们。脚本停了重跑网页界面要手动刷新一次让前端连上新进程。GUI 里想取消转换点电子书上传组件上的 [X]。硬件参考最低 2GB RAM / 1GB VRAM推荐 8GB / 4GBApple Silicon 走 MPSWindows 下 Docker 需要开虚拟化。适合谁通勤党和睡前听书的人把手机里吃灰的 epub 一键变成能戴耳机听的 m4b。视力不便者纸质书扫描件、图片版 PDF 也能转成有声内容。内容创作者 / 机构批量目录转换 多声音映射 直推 Audiobookshelf做音频库的效率工具。语言学习者先--translate再听等于附带一套发音材料。挑一本你最近没读完的 epub跑一条 headless 命令——下班的时候它就是一本现成的有声书。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考