PP-TTS 语音合成模型下载与部署实践:FastSpeech2 声学模型与 HiFiGAN 声码器的获取、推理与 Benchmark 全指南 人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载PP-TTS 是飞桨PaddlePaddle开源的流式语音合成系统默认由 FastSpeech2 声学模型与 HiFiGAN 声码器两大组件构成。本文以仓库中 下载文档 为核心完整给出两个官方推理模型的下载地址、文件体积与用途并结合 模型介绍、训练与推理 Benchmark 以及 Gradio 在线演示应用讲清从模型获取、环境安装、命令行推理到 Web 服务部署的完整链路。读完本文你将能够独立下载并运行 PP-TTS 的中文混英语音合成系统并理解其底层模型结构与性能基准。一、PP-TTS 模型总览两大组件各司其职根据 模型信息文件 的定义PP-TTS 属于智能语音 / 语音合成Speech Synthesis任务基于 PaddleSpeech 工具包实现采用 Apache 2.0 开源协议。其语音合成基本流程为文本输入 → 文本前端 → 声学模型FastSpeech2→ 声码器HiFiGAN→ 波形输出。PP-TTS 的组件分工如下组件角色说明文本前端文本处理采用基于规则的中文文本前端系统对文本正则、多音字、变调等中文场景进行了优化声学模型特征生成对 FastSpeech2 模型的 Decoder 进行改进使其可以流式合成声码器波形生成支持对 GAN 类声码器HiFiGAN进行流式合成推理引擎性能优化使用 ONNXRuntime 推理引擎优化模型推理性能使系统在低压 CPU 上也能达到 RTF1满足流式合成要求其中流式合成Streaming Synthesis是 PP-TTS 的核心卖点结合改进的 FastSpeech2 Decoder、可流式的 GAN 声码器与 ONNXRuntime 推理引擎系统可以边合成边输出音频满足商业语音交互场景如智能客服、语音播报的低延迟需求。二、官方推理模型下载核心内容以下两个模型是 PP-TTS 默认提供的推理模型分别对应声学模型与声码器来源为 下载文档 中的官方表格模型名称模型简介模型体积下载地址fastspeech2_mix语音合成声学模型388MBhttps://paddlespeech.bj.bcebos.com/t2s/chinse_english_mixed/models/fastspeech2_mix_ckpt_0.2.0.ziphifigan_csmsc语音合成声码器873MBhttps://paddlespeech.bj.bcebos.com/Parakeet/released_models/hifigan/hifigan_csmsc_ckpt_0.1.1.zip两个文件合计约 1.26GB均为推理用模型inference model压缩包。其中fastspeech2_mix是中英混音Chinese-English mixed声学模型支持在单次合成中混入中英文文本hifigan_csmsc是基于 CSMSC中文标准普通话语音库训练的高保真声码器。2.1 下载与解压实操你可以直接使用wget下载这两个官方模型包并解压# 下载声学模型 fastspeech2_mix388MB wget https://paddlespeech.bj.bcebos.com/t2s/chinse_english_mixed/models/fastspeech2_mix_ckpt_0.2.0.zip unzip fastspeech2_mix_ckpt_0.2.0.zip # 下载声码器 hifigan_csmsc873MB wget https://paddlespeech.bj.bcebos.com/Parakeet/released_models/hifigan/hifigan_csmsc_ckpt_0.1.1.zip unzip hifigan_csmsc_ckpt_0.1.1.zip说明在实际使用中通过 PaddleSpeech 的TTSExecutor调用合成时工具会自动完成模型的下载与加载无需手动解压手动下载更适合离线环境部署或对模型文件做二次处理如转换为 ONNX 格式。三、环境准备与安装PP-TTS 推理依赖 PaddleSpeech 工具包。从 Gradio 应用的依赖清单 可以看到推荐的运行环境组合pip install paddlepaddle2.3.2 pip install paddleaudio1.0.1 pip install paddlespeech1.2.0 pip install gradio此外PaddleSpeech 依赖nltk包而 nltk 数据有时会因网络原因下载失败。模型介绍文档建议从百度服务器手动拉取 nltk 数据wget https://paddlespeech.bj.bcebos.com/Parakeet/tools/nltk_data.tar.gz tar zxvf nltk_data.tar.gz四、命令行推理一段代码完成中英混音语音合成PP-TTS 的核心推理接口是 PaddleSpeech 的TTSExecutor调用方式与 模型介绍文档 中的示例一致from paddlespeech.cli.tts import TTSExecutor tts_executor TTSExecutor() wav_file tts_executor( text热烈欢迎您在 Discussions 中提交问题并在 Issues 中指出发现的 bug。此外我们非常希望您参与到 Paddle Speech 的开发中, outputoutput.wav, amfastspeech2_mix, vochifigan_csmsc, langmix, spk_id174)各关键参数的作用与取值说明如下参数作用本示例取值text待合成的文本支持中英混写上述示例文本output输出音频文件路径output.wavam声学模型Acoustic Model名称对应下载表格中的 fastspeech2_mixfastspeech2_mixvoc声码器Vocoder名称对应下载表格中的 hifigan_csmschifigan_csmsclang语言类型mix表示中英混合mixspk_id说话人 ID174为中文语音库中的一个说话人编号174推理完成后会在当前目录生成output.wav可用IPython.display.Audio直接播放验证import IPython.display as dp dp.Audio(output.wav)需要说明的是am与voc参数指定的正是第一节下载表格中的两个官方推理模型二者必须配套使用——fastspeech2_mix负责将文本转换为声学特征hifigan_csmsc负责将声学特征合成为最终波形。五、Gradio Web 演示应用一键体验与二次开发仓库还提供了基于 Gradio 的在线演示应用源码见 APP/app.py。其核心逻辑与命令行推理完全一致from paddlespeech.cli.tts import TTSExecutor tts_executor TTSExecutor() def speech_generate(text: str): assert isinstance(text, str) and len(text) 0, Input Chinese-English text... wav_file tts_executor( texttext, outputoutput.wav, amfastspeech2_mix, vochifigan_csmsc, langmix, spk_id174) return wav_file应用使用gr.Blocks()搭建界面包含文本输入框gr.Textbox、Submit / Clear 按钮与音频输出组件gr.Audio启动配置见 APP/app.ymlsdk: gradio sdk_version: 3.4.1 app_file: app.py license: apache-2.0 device: cpu从配置可以看到该演示应用默认在 CPU 设备上运行这也印证了 PP-TTS 面向低压 CPU 场景优化的定位。运行python app.py即可在本地启动 Web 服务输入任意中英混写文本并点击 Submit即可实时返回合成音频。六、性能与训练 Benchmark仓库 benchmark_cn.md 给出了两个模型的推理吞吐指标ips即每秒处理的序列数模型名称模型简介模型体积ipsfastspeech2_mix语音合成声学模型388MB135 sequences/sechifigan_csmsc语音合成声码器873MB30 sequences/sec6.1 训练软硬件环境官方训练 Benchmark 的软硬件环境如下FastSpeech2 模型训练2 GPUs每 GPU batch size 为 64HiFiGAN 模型训练1 GPU每 GPU batch size 为 16Python 版本3.7.0Paddle 版本v2.4.0rc0训练机器8x Tesla V100-SXM2-32GB24 core Intel(R) Xeon(R) Gold 6148100Gbps RDMA network6.2 常用训练数据集语言数据集音频信息描述中文CSMSC48KHz, 16bit单说话人女声约12小时具有高音频质量中文AISHELL-344.1kHz16bit多说话人218人约85小时音频质量不一致有的说话人音频质量较高英文LJSpeech-1.122050Hz, 16bit单说话人女声约24小时具有高音频质量英文VCTK48kHz, 16bit多说话人110人约44小时音频质量不一致有的说话人音频质量较高这些数据集分别覆盖中英文、单/多说话人场景是 FastSpeech2 与 HiFiGAN 训练时的常用语料来源。七、模型原理简析理解两个下载模型的底层结构有助于在更换模型或调参时做出正确判断。依据 模型介绍文档 的原理章节7.1 声学模型 FastSpeech2与原始论文相比PaddleSpeech TTS 实现使用phone 级别的 pitch 和 energy与 FastPitch 类似合成结果更加稳定PP-TTS 对 FastSpeech2 的 Decoder 进行了改进使其支持流式合成这是其区别于普通 FastSpeech2 的关键。7.2 声码器 HiFiGANHiFiGAN 是高保真、高效率的生成对抗式声码器其两大设计要点多周期判别器Multi-Period DiscriminatorMPD与多尺度判别器Multi-Scale DiscriminatorMSD共同增强 GAN 判别器甄别合成/真实音频的能力多感受野融合模块交替使用带洞卷积和普通卷积增大感受野在保证合成音质的同时显著提升推理速度解决 WaveNet 类模型推理慢的问题。相关论文引用信息article{ren2020fastspeech, title{Fastspeech 2: Fast and high-quality end-to-end text to speech}, author{Ren, Yi and Hu, Chenxu and Tan, Xu and Qin, Tao and Zhao, Sheng and Zhao, Zhou and Liu, Tie-Yan}, journal{arXiv preprint arXiv:2006.04558}, year{2020} } article{kong2020hifi, title{Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis}, author{Kong, Jungil and Kim, Jaehyeon and Bae, Jaekyoung}, journal{Advances in Neural Information Processing Systems}, volume{33}, pages{17022--17033}, year{2020} }八、注意事项模型配套使用fastspeech2_mix与hifigan_csmsc必须成对使用声学模型输出特征、声码器负责重建波形缺一不可中英混音能力langmix与fastspeech2_mix模型配合才支持在单次合成中混入中英文文本运行环境本文的命令与参数以仓库当前记录的环境PaddleSpeech 1.2.0、Paddle 2.3.2/2.4.0rc0、Python 3.7为准不同版本下参数行为可能略有差异离线部署如需离线环境可提前按第二节方式下载模型包并解压PaddleSpeech 会自动识别本地缓存的模型文件。通过以上内容你可以从零完成 PP-TTS 两个官方推理模型的下载、环境安装、命令行合成与 Web 演示部署并对其性能基准与底层原理有完整的认识。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐PaddleSpeech TTSParakeet技术指南声学模型、声码器选型与 FastSpeech2 Parallel WaveGAN 推理全流程PaddleSpeech TTSParakeet技术指南声学模型、声码器选型与 FastSpeech2 Parallel WaveGAN 推理全流程人工智能语音音频PaddleSpeech 流式 TTS 推理实战inference_streaming.py 源码解析与 fastspeech2 声码器静态模型合成PaddleSpeech 流式 TTS 推理实战inference_streaming.py 源码解析与 fastspeech2 声码器静态模型合成 本文人工智能语音音频NLP媒体生成PP-MSVSR 视频超分模型下载与使用全指南权重获取、Benchmark 与部署实践PP MSVSR 视频超分模型下载与使用全指南权重获取、Benchmark 与部署实践 PP MSVSR 是飞桨 PaddleGAN 自研的多阶段视频超分V人工智能深度学习计算机视觉NLP语音上一篇GNU Radio信道模拟实战指南从零搭建多径衰落与噪声干扰仿真系统下一篇Traceur Compiler终极指南Unicode属性转义\p{...}语法完整解析创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考