
不使用云端密钥时HyperFrames 如何用 Kokoro 与 MusicGen 本地生成旁白和背景音乐【免费下载链接】hyperframesWrite HTML. Render video. Built for agents.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperframesHyperFrames 允许在无账号、无云端 API 密钥的情况下在本地创建和渲染视频。语音和音乐两条媒体链路都会在这种情况下回退到本地引擎旁白由 KokoroKokoro-82M54 个声音生成背景音乐由 MusicGenfacebook/musicgen-small生成全程不调用托管生成 API。本文给出这条完全离线的操作路径确认本地回退生效、安装 Python 依赖、用 CLI 生成旁白并提取逐词时间戳、通过媒体工作流生成背景音乐最后用文档给出的检查命令验证环境。引擎是如何决定用本地模型的HyperFrames 对每类媒体能力按固定顺序选择第一个可用提供者first-match-wins顺序定义见 authentication 文档能力提供者顺序密钥本地引擎的依赖语音TTSHeyGen → ElevenLabs → KokoroHEYGEN_API_KEY→HYPERFRAMES_API_KEY→~/.heygen/credentials然后是ELEVENLABS_API_KEYpip install kokoro-onnx soundfile音乐BGMHeyGen library → Lyria → MusicGenHeyGen 凭据然后是GEMINI_API_KEY→GOOGLE_API_KEYpip install transformers torch soundfile numpy只有当上面的云端密钥全部不存在时Kokoro 和 MusicGen 才会被选中。文档明确说明No key configured is a normal state for local work——没有配置密钥是本地正常工作的状态。注意一个容易忽略的细节npx hyperframes tts本身就是本地 Kokoro CLINo API key, nothing leaves the machine。托管的 HeyGen 和 ElevenLabs 声音是由捆绑的媒体工作流辅助函数选择的不是由这个命令选择的。所以无论你是否登录tts走的都是本地 Kokoro。第一步确认当前环境处于无凭据状态凭据的解析顺序是HEYGEN_API_KEY→HYPERFRAMES_API_KEY→~/.heygen/credentials由hyperframes auth login写入权限0600。要确保走本地引擎先检查凭据状态npx hyperframes auth status该命令显示当前生效凭据的来源和已验证身份当你处于未登录状态时它同时会告诉你语音和音乐将使用哪个本地引擎。脚本里加--json可以得到{ configured, recommended_action, offline_engines }其中offline_engines就是离线引擎列表npx hyperframes auth status --json如果这里显示了 HeyGen 凭据想让本地引擎接管需要删除凭据该命令会移除~/.heygen/credentials中保存的凭据TTY 下需要确认npx hyperframes auth logout第二步安装本地引擎的 Python 依赖Kokoro 和 MusicGen 都运行在 Python 侧依赖检查对应的是 Python 模块是否可导入Kokoro 需要kokoro_onnx和soundfileMusicGen 需要transformers、torch、soundfile和numpy见 引擎判定实现。安装命令来自文档# Kokoro本地 TTS pip install kokoro-onnx soundfile # MusicGen本地背景音乐 pip install transformers torch soundfile numpy这两条命令会把包装进你当前选定的 Python 环境可能包括较大的torch。装完后用doctor验证它会报告本地 TTS 和 BGM 模型的状态npx hyperframes doctordoctor检查 CLI 版本、Node.js、CPU、内存、磁盘、whisper-cpp、本地 TTS 和 BGM 模型、FFmpeg、Chrome、Docker 等项目。本地引擎依赖缺失时auth status给出的安装提示也正是上面这两条 pip 命令。第三步用本地 Kokoro 生成旁白tts命令的完整用法见 CLI 参考# 直接传入文本 npx hyperframes tts Welcome to HyperFrames # 指定声音和输出文件 npx hyperframes tts Intro --voice bf_emma --output narration.wav # 控制语速默认 1.0 npx hyperframes tts Slow and clear --speed 0.8 # 从脚本文件生成 npx hyperframes tts script.txt # 列出所有可用声音 npx hyperframes tts --list主要参数参数说明--output, -o输出路径默认当前目录下的speech.wav--voice, -v声音 ID用--list查看全部--speed, -s语速倍数默认 1.0--lang, -l发音器 localeen-us、en-gb、es、fr-fr、hi、it、pt-br、ja、zh不传时从声音 ID 推断--list列出声音后退出--json以 JSON 输出结果声音 ID 的首字母代表语言a美式、b英式、e西班牙语、f法语、h印地语、i意大利语、j日语、p巴西葡语、z普通话。所以--voice ef_dora直接就是西班牙语--lang只在你故意让文本和发音器不匹配比如用法国音读英文时才需要。media-and-audio 文档给出了内容类型到 Kokoro 声音的映射建议af_heart、af_nova适合产品演示am_adam、bf_emma适合教程af_sky、am_michael适合营销。首次运行注意本地引擎在依赖和模型文件安装完成后才完全离线Their first use may download model files——首次生成会下载模型文件之后不再调用托管 API。顺手生成逐词字幕时间戳旁白一旦生成可以用本地转写拿到逐词时间戳供字幕对齐Kokoro 离线组合中就是 Whisper for word-level caption alignmentnpx hyperframes transcribe narration.wavtranscribe默认引擎是auto装了 Parakeet 用 Parakeet否则用 whisper.cpp全程本地。输出是[{text, start, end}]形式的逐词数组会写入项目的transcript.json项目里有字幕 HTML 时会自动修补进去。这一步让字幕跟着旁白走成为可执行的时间点而不是靠肉眼估计。第四步让背景音乐走本地 MusicGen与tts不同音乐没有独立的hyperframes music命令——它是通过捆绑的媒体工作流agent 工作流/skills解析的。工作流在生成前会运行hyperframes auth status并告诉你它要走哪条路径当 HeyGen 凭据和GEMINI_API_KEY/GOOGLE_API_KEYLyria都不存在时落到的就是本地 MusicGenfacebook/musicgen-small。media-and-audio 文档对音乐请求的措辞给了明确建议同时给出情绪mood和响度目标loudness target因为流水线可以按目标值做 ducking 和归一化。文档中的示例措辞Add subtle electronic BGM, kept under −18 dB so it stays beneath the voiceover.Upbeat tech-launch music bed at a low level, ducking under narration.反面示例是add background music——文档指出这会返回一首和旁白抢声的全音量音乐正确写法是给出流水线可以执行的混音指令例如subtle background music, ducked ~12 dB under the voice。验证结果按文档给出的检查方式从三个层面确认环境层面npx hyperframes doctor的报告中包含本地 TTS 和 BGM 模型一行的状态npx hyperframes auth status --json的offline_engines字段直接列出未登录时语音/音乐使用的本地引擎。产物层面tts生成的narration.wav或你指定的--output路径可以直接播放试听。文档的通用建议是Listen before building the final edit——先在最终剪辑之前试听措辞、发音或演绎有问题时改脚本或声音说明而不是绕着坏读剪。成片层面按 voice-and-audio 指南的完整声音检查正确的声音和源录音被使用、人名/声明/字幕准确、旁白在最响的音乐段落中依然清晰、开场没有过大的音量惊吓、音乐和氛围音是刻意收尾而不是停在文件边缘。最后一条验证命令npx hyperframes render --output output.mp4渲染出一个 review 文件后听一遍不看画面——文档指出视觉不再争夺注意力时音频问题通常更容易发现。边界与限制离线是首次下载模型后的离线依赖和模型文件装好之前首次tts和首次 MusicGen 生成会联网下载模型文件装好之后不再调用托管生成 API。密钥优先级只要HEYGEN_API_KEY、HYPERFRAMES_API_KEY或~/.heygen/credentials中存在任意一项HeyGen 就会接管语音和音乐ELEVENLABS_API_KEY会抢先于 Kokoro 接管语音GEMINI_API_KEY/GOOGLE_API_KEY会抢先于 MusicGen 接管音乐。想保持纯本地就要确认这些变量和凭据文件都不存在。语言范围Kokoro 的--lang只支持文档列出的 localeen-us、en-gb、es、fr-fr、hi、it、pt-br、ja、zh声音 ID 首字母决定了它的语言。音乐走工作流而非直接命令MusicGen 的触发点在媒体工作流的 provider 选择里本文不承诺hyperframes有单独的 music 子命令——CLI 参考中的完整命令列表里没有它音乐能力经由auth status报告的路径和媒体工作流执行。【免费下载链接】hyperframesWrite HTML. Render video. Built for agents.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperframes创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考