基于ESP32S3主控的AI语音遥控器(开源)
市面上的蓝牙语音遥控器方案普遍依赖厂商私有云服务,用户无法自行部署和定制语音处理逻辑。本项目的立项目标是从零打造一款完全开源、可自主部署的 AI 语音遥控器,覆盖从硬件 PCB 设计到云端后台的全链路,让开发者和硬件爱好者可以低成本复现并自由扩展。
核心功能模块包括四个部分:(1)硬件层:基于 ESP32-S3 模组自制 2 层 PCB,集成 PDM MEMS 麦克风、MAX98357A I2S 音频功放、TP4065 锂电池充电管理和 USB Type-C 接口,成品可装入市售遥控器外壳,单台 BOM 成本约 75-95 元;(2)固件层:基于 ESP-IDF v5.4 开发,实现 BLE HID 遥控(键盘/鼠标/多媒体)、SoftAP WiFi 配网(支持多组 WiFi 记忆)、PDM 麦克风采集、I2S 音频播放、HTTPS 语音管线和 OTA 双分区固件升级;(3)Android APP:作为语音桥接端,通过 UDP 接收 ESP32 的音频流,HTTP POST 转发给云端后台处理,再将 TTS 合成的音频回传给遥控器播放,同时提供蓝牙连接管理、WiFi 配网界面和远程日志查看功能;(4)PHP 云端后台:实现可插拔的 ASR→LLM→TTS 语音处理管线,支持 FunASR(免费语音识别)、微软 Edge TTS(免费语音合成)和 DeepSeek 等 OpenAI 兼容大模型 API,并提供 OTA 固件版本管理后台和 API 日志监控面板。
业务流程为:用户按下遥控器语音键 → ESP32 PDM 麦克风采集 16kHz PCM 音频 → 优先通过 UDP 发送给 Android APP 桥接转发(本地模式),若 APP 不可达则自动切换为 HTTPS 直连云端(云端模式)→ Web 后台依次执行语音识别(FunASR,约 1 秒)、大模型生成回复(DeepSeek,约 1.5 秒)、语音合成(Edge TTS,约 0.7 秒)→ PCM 音频通过 HTTP 响应返回 → ESP32 I2S 播放语音回复。整个流程端到端延迟约 3-4 秒。遥控器同时支持 BLE HID 标准协议,可直接控制 PC、电视、智能家居设备的方向键、确认键和多媒体按键。
人工智能