V3SP3R 多模态输入全解析:语音、拍照、TTS,让 AI 看到你所见 【免费下载链接】V3SP3RAI Flipper control项目地址https://gitcode.com/gh_mirrors/v3s/V3SP3R点击查看免费下载V3SP3RVesper是一款为 Flipper Zero 打造的 AI 控制应用其多模态输入能力让你可以用语音下达指令、用拍照让 AI 分析眼前画面并通过 TTS 语音播报听到 AI 的回答。本文带你快速理解 V3SP3R 的语音输入、拍照分析、TTS 播报与智能眼镜集成四大能力帮你把手机变成 Flipper Zero 的「AI 大脑」。多模态输入总览四种方式与 AI 对话传统应用靠菜单和按钮交互V3SP3R 则支持四种输入通道全部汇聚到同一个 AI 对话引擎输入方式说明入口 语音输入手机麦克风实时转文字边说边显示Chat 页面麦克风按钮 拍照分析从相册选图或现场拍照AI 看懂画面内容Chat 页面图片按钮 智能眼镜语音转写 摄像头拍照 唤醒词全程免手持Mentra 眼镜桥接⌨️ 文字输入常规文本输入可与图片、语音混合发送Chat 输入框所有输入最终都由 AI 编排器 VesperAgent.kt 统一处理整体架构可参考官方文档 docs/architecture.md。语音输入开口说话指令自动进输入框语音识别由 SpeechRecognitionHelper.kt 实现它封装了 Android 原生SpeechRecognizerAPI采用自由句式识别并开启部分结果实时回显——你说到一半文字就同步出现在输入框里。语音输入的工作原理状态机驱动识别过程用SpeechState状态机管理包含空闲Idle、监听中Listening、处理中Processing、得到结果Result、出错Error五种状态实时音量反馈监听时会捕获音频电平RMS可用于 UI 声波动画智能容错识别到「没检测到语音」「超时」等无结果场景时不会报错而是安静回到空闲状态只有麦克风权限缺失、网络错误等才提示自动追加识别结果由 ChatViewModel.kt 监听自动拼接到现有输入文本之后方便你「说一句 补几个字」混合输入语音输入使用步骤打开 Chat 页面允许麦克风权限按住/点击麦克风按钮直接说出想做的事如「查看我的电池电量」松手后识别结果自动填入输入框检查无误后发送 语音识别使用系统语言跟随Locale.getDefault()在安静的环境下准确率最高。拍照分析让 AI 看到你所见V3SP3R 支持把图片直接发给 AI——拍下遥控器、设备铭牌、信号标签AI 就能「看懂」你正在看什么。图片处理逻辑集中在 ChatViewModel.kt 中有几个贴心的细节图片预压缩发送前会根据尺寸计算采样率inSampleSize避免超大图片直接撑爆内存视频自动抽帧如果你选了视频文件会自动抽取一帧作为图片发送数量限制待发送图片有上限MAX_PENDING_IMAGES防止内存问题先描述、再推理OpenRouterClient.kt 会先用快速视觉模型如 Gemini Flash把图片转成文字描述再交给主 Agent 决策多个视觉模型候选自动降级重试一个失败会尝试下一个拍照分析使用步骤在 Chat 页面点击图片按钮从相册选择或现场拍摄图片显示为输入区的待发送附件可以只发图片AI 主动描述也可以配上文字指令例如「这个遥控器能模拟吗」「帮我读出设备标签上的信息」发送后 AI 会结合画面内容回答甚至直接调用工具操作 Flipper Zero 眼镜用户拍的照片同样走这条管线照片会先作为「待发送图片」出现在输入区等 30 秒内你说出指令就自动组合发送超时则默认以「What am I looking at?」询问 AI。TTS 语音播报AI 开口说话AI 的回答不只是文字——V3SP3R 内置 TTS 服务见 ElevenLabsTtsService.kt实现类OpenRouterTtsService核心特点流式低延迟播放音频以 PCM 流式返回、边收边播不用等整段合成完零额外成本门槛直接复用你已配置的 OpenRouter API Key无需单独的 TTS 密钥10 种音色可选从温柔的 Shimmer、自然的 Coral到沉稳的 Onyx、英式叙事感十足的 Fable完整音色表见 ElevenLabsTtsService.kt智能文本清洗播报前自动剥离 Markdown、代码块、链接和图片占位符只读自然语言避免「朗读星号井号」的尴尬TTS 设置方法进入 Settings 页面开启 TTS 开关对应 SettingsStore.kt 中的ttsEnabled选择你喜欢的音色ttsVoiceId打开「自动播报」ttsAutoSpeak后每条 AI 新消息完成时会自动朗读智能眼镜连接期间会自动让位避免两处同时出声智能眼镜集成Mentra 眼镜免手持操控 Flipper这是 V3SP3R 最有「极客感」的多模态玩法——通过 Mentra 智能眼镜戴上眼镜即可语音控制 Flipper Zero。整体链路眼镜麦克风/摄像头 → mentra-bridge 桥接服务(WebSocket) → Vesper App → Flipper Zero 眼镜 HUD 显示/AI 语音 ← mentra-bridge ← Vesper App核心实现分布在两个位置手机端GlassesIntegration.kt 负责把眼镜消息接入对话管线GlassesBridgeClient.kt 是带自动重连最多 10 次、指数退避的 WebSocket 客户端桥接端mentra-bridge/ 是一个 Node.js 服务项目其中的 glasses-adapter.ts 同时适配 MentraOS SDK 和通用 WebSocket 协议的眼镜眼镜模式四大能力语音转写直通眼镜麦克风转写的最终结果直接作为用户消息发给 AI开启自动发送时关闭则先填入输入框供你确认免手持语音审批高风险操作需要确认时AI 会通过眼镜播报「需要审批低风险/中风险说 yes 批准或 no 拒绝」你用一句话就能批准/取消正则匹配见 GlassesIntegration.ktAI 主动拍照request_photo工具AI 判断需要画面时会向眼镜发起拍照请求收到照片后先用视觉模型描述再继续推理语音摘要播报长回答不会整段念出来而是先由 LLM 压缩成一句 20 词以内的口语化总结再播报进度状态思考中、正在执行工具等也会以简短旁白同步到眼镜智能眼镜设置步骤在电脑/服务器上部署桥接服务进入mentra-bridge/目录执行npm install npm run build npm start打开 Vesper 的 Settings开启 Smart GlassesglassesEnabled并填入桥接的 WebSocket 地址开启自动连接glassesAutoConnectApp 启动时会自动连上桥接按需调整glassesAutoSend语音是否自动发送、静音开关等快速上手检查清单想体验的能力前置条件关键设置语音输入麦克风权限无需额外开关拍照分析OpenRouter API Key无需额外开关TTS 播报OpenRouter API KeySettings → TTS 开关 音色智能眼镜桥接服务已部署Settings → Smart Glasses 桥接地址延伸阅读整体架构说明docs/architecture.mdAI 编排与图像描述OpenRouterClient.kt、VesperAgent.kt眼镜消息协议VOICE_TRANSCRIPTION、CAMERA_PHOTO、AI_RESPONSE等类型定义GlassesBridgeClient.kt桥接服务入口mentra-bridge/src/index.ts⚠️ 安全提示多模态输入会让 AI 直接操作硬件V3SP3R 对每个动作做风险分级破坏性操作必须显式确认所有操作都会写入审计日志可在 Audit 页面查看。请仅在你拥有或获得授权的设备上使用。掌握语音、拍照、TTS 和眼镜集成这四条通道后V3SP3R 的多模态输入才算真正「满血」——不再受屏幕和手指限制AI 看到你所见、听到你所言然后用声音把结果告诉你。赞分享【免费下载链接】V3SP3RAI Flipper control项目地址https://gitcode.com/gh_mirrors/v3s/V3SP3R点击查看免费下载相关推荐语音合成中的多模态输入gh_mirrors/tts/TTS结合文本与图像语音合成中的多模态输入gh_mirrors/tts/TTS结合文本与图像 1. 痛点与挑战传统TTS的表达瓶颈 在语音合成Text to Speech,人工智能语音音频深度学习语音合成与多模态交互gh_mirrors/tts/TTS结合语音与视觉语音合成与多模态交互gh_mirrors/tts/TTS结合语音与视觉 引言语音合成的视觉化挑战 在当今的人机交互领域语音合成Text to Speec人工智能语音音频深度学习NSIS与其他安装工具对比为什么Nullsoft Scriptable Install System是最佳选择NSIS与其他安装工具对比为什么Nullsoft Scriptable Install System是最佳选择 在Windows软件分发领域选择合适的安装开发工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考