余音是一款面向情感陪伴、记忆留存与数字声音复刻场景的 AI Web 平台,目标是让用户以更自然、可持续的方式保留重要关系中的语言风格、共同记忆和声音体验。用户可创建人物档案,录入性格特点、经历、聊天片段与纪念内容,并通过录音或上传音频创建专属声音预设。平台支持文字和语音双模态对话:语音输入自动转写,结合人物设定、长期记忆和近期上下文生成回复,再以对应声音合成为可播放语音。
核心功能包括账号与人物管理、记忆资料沉淀、会话历史、文本/语音聊天、声音复刻与预设切换、音频播放及删除管理。产品采用“本地优先、云端增强”的模型策略:基础模式使用本地 ASR/TTS,进阶模式可按体验与成本切换豆包、Qwen Audio、MiniMax 等服务。用户路径为“创建账号—建立人物与记忆—授权上传参考声音—选择交互模式—持续对话与沉淀记忆”,兼顾沉浸感、成本控制和隐私边界。
本人独立完成余音从产品设计、前后端开发、AI 模型接入到服务器部署的全链路实现。前端使用 Expo Web 构建响应式聊天与声音管理界面;后端以 FastAPI 提供鉴权、人物档案、会话、音频处理与模型编排接口,PostgreSQL 保存用户、记忆、消息和声音预设等结构化数据。生产环境部署在 Ubuntu + RTX 5080 服务器,用户数据本地存储,并通过 Cloudflare Tunnel 提供 Web 访问。
AI 链路采用模块化路由:接入豆包大语言模型生成角色化回复,本地 Qwen3 ASR/TTS 提供低成本基础能力,并支持豆包 ASR、Qwen Audio TTS Flash/Plus、MiniMax TTS 等多种云端组合,已实现 4 类模型方案的可切换配置与故障回退。为控制上下文成本和角色一致性,我实现了最近 24 条消息窗口、每 12 条消息自动摘要、长期记忆检索与注入机制;常规语音回复链路测试约为 5–8 秒。难点主要在于声音克隆的模型隔离、远程声音 ID 生命周期、语音链路延迟和云端调用成本,解决方式是按模型分离声音预设、复用有效声音 ID、设置本地优先策略并预留套餐扣次与用量账本能力。