VoiceStudio 安装后如何用参考音频完成第一次声音克隆? VoiceStudio 安装后如何用参考音频完成第一次声音克隆【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudioVoiceStudio 是一款开源、完全本地运行的声音工具给它一段参考音频就能用同一个声音朗读任意文本无需账号、API key 或云端服务。安装完成后默认 TTS 引擎OmniVoice开箱即支持 zero-shot 声音克隆所以第一次克隆不需要再装任何模型核心流程只有三步准备一段干净的参考音频 → 在 Voice Clone 工作区合成 → 试听并保存为 Voice Profile。安装前提各平台的安装入口见 README.md最低要求覆盖的是默认本地工作流最低推荐系统Windows 10 x64 · macOS 13.3 Apple Silicon · Linux x86_64glibc 2.39当前受支持的 OS 版本内存8 GB16 GB磁盘10 GB 可用20 GB SSDGPU可选支持 CPU 模式NVIDIA CUDA 或 Apple Silicon用 GPU 时建议 8 GB VRAM平台要点macOSApple Silicon 才能跑本地后端Intel Mac 只有 UI无法运行本地 Python 后端PyTorch 不再提供 Intel-Mac wheel。首次启动若被 Gatekeeper 拦截右键VoiceStudio.app→Open即可属一次性确认。详见 macOS 安装文档。Windowsx64无管理员权限时选择Current_User版本 MSI。AMD GPU 在 Windows 上只能跑 CPU。详见 Windows 安装文档。LinuxAppImagex86_64 glibc 2.39。详见 Linux 安装文档。Docker镜像仅linux/amd64。详见 Docker 文档。首次启动会自动完成三件事创建受管的 Python 环境、同步依赖、下载默认模型权重macOS 源码构建约 2.4 GB。启动画面会显示每一步的实时进度之后启动复用这些环境不再重复下载。准备一段合格的参考音频克隆是 zero-shot 的参考音频只是提示不是训练数据。参考音频的声学特征会被原样复刻——带混响或噪音的片段会克隆出带混响、带噪音的结果。项目文档给出的参考音频标准见 real-time-voice-cloning 迁移指南 与 generation-parameters.md长度3 秒就能工作5–15 秒连续干净的单人语音是最佳区间约 8 秒最理想。更长并不会提升质量。内容与形式单人、无背景音乐、近距离收音、安静环境WAV、MP3、M4A、FLAC、OGG 均可直接拖入无需转码或提取嵌入。有背景音的素材应用内置的人声分离Demucs和说话人分离可以先拆分但干净的单人片段仍是最好的输入。在应用内录音也可以Voice 面板里选择麦克风和 Mono/Stereo录音时输入电平表会确认是否收到了可用信号监视是可视的不会从扬声器回放麦克风。第一次克隆的操作步骤启动 VoiceStudio在 Launchpad 选择Voice Clone卡片或在 Voice 工作区把 Define voice 设为From audio工作区有三个标签From audio用于克隆、By design用于设计声音、Convert用于语音转换。拖入参考音频或点Record读两三句。输入要朗读的文本、选择语言点Generate/Synthesize Audio。满意的话点Save as Voice Profile——这个声音之后可在生成、配音、有声书和 API 中直接复用无需重新上传。默认引擎是 OmniVoice无需任何配置。它有几点行为需要提前知道见 OmniVoice 引擎文档权重首次使用时才下载并共享给配音、听写等场景不会二次加载输出为 24 kHz 单声道音频自动应用统一的高通 压缩 mastering 链参考片段如果没配文本应用会在首次使用时自动转写并保存转录结果配了转录的片段限 20 秒无转录时可在最多 75 秒内搜索检测到语音的片段更长的片段需要先裁剪编码后的声音引用会缓存在数据目录的prompt_cache/重启后同一声音的首次生成会跳过重新编码。如果参考声音仍不够像且你拥有大量录音升级路径不是加长参考音频zero-shot 条件输入超出短窗口后不再利用额外音频而是对内置模型做离线微调参见 training 与 data preparation。判断生成是否成功与常见问题第一次生成很慢多半不是卡死而是首次调用在下载数 GB 的权重。想避免首次等待可以提前在Model CatalogueTTS 标签页 → 对应引擎的 Weights安装模型。引擎显示不可用展开该行Why?面板并点Learn more会跳转到对应引擎的文档页查看实际要求若你之前切换过引擎可用Model Catalogue或OMNIVOICE_TTS_BACKENDomnivoice切回默认引擎。小显存 GPU4 GB 级别OmniVoice 的显存下限是 6 GB低于该值的 CUDA/ROCm 卡会回落到 CPU 级别的计算预算渲染可能从几秒变几分钟可换 OmniVoice GGUF 等轻量引擎。模型下载慢或网络受限文档见 downloading-models.md包括受限网络下的镜像选择与分段下载机制。安装层面出错运行Settings → About → Run self-check或查 install troubleshooting应用内错误界面有Open docs for this error按钮可直接跳转到对应文档段落。生成结果可以直接在应用内试听仓库里也提供了本地生成的 克隆示例音频对应参考音频backend/assets/samples/demo_voice.wav可供对照。确认满意并保存 Voice Profile 后同一声音即可用于生成、配音、多角色剧本和http://localhost:3900/v1的 OpenAI 兼容 APIvoice字段填保存的 profile ID。【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考