1.传统桌面宠物仅具备基础动画效果,交互形式单一、陪伴感薄弱,随着大语言模型与情感语音合成技术的发展,用户对具备智能对话、情绪反馈、环境感知能力的桌面陪伴产品需求日益增长。本项目旨在打造一款融合 Live2D 形象渲染与多模态 AI 能力的桌面宠物应用,为用户提供高沉浸感的桌面陪伴与交互体验。
2.涵盖 Live2D 模型渲染、LLM 智能对话、情感驱动语音合成、系统状态监控、屏幕视觉分析、事件管理器五大核心模块,支持自定义角色提示词与多平台大模型切换。
3.应用启动后,前端进程自动拉起对话、语音、监控三个独立后端进程,在桌面渲染支持拖拽的 Live2D 角色,实现自动眨眼、眼球追鼠等基础动画;用户输入对话时,请求经 ZeroMQ 发送至 LLM 后端,生成带情感标签的回复并流式展示在对话气泡中,同步驱动 TTS 后端合成对应情感风格的语音实时播放;监控后端持续采集 CPU、内存等硬件状态与前台窗口信息,结合多模态视觉分析结果,在低电量、高负载等场景触发宠物主动搭话;空闲达到设定时长后宠物会概率进入睡眠状态,点击可唤醒并触发起床台词,形成完整的自主交互闭环。
采用四进程分离的模块化架构,基于 ZeroMQ 实现本机低延迟进程间通信,将前端渲染、LLM 对话、语音合成、系统监控四个能力域解耦为独立进程,通过 REQ/REP 模式处理同步调用,PUB/SUB 模式分发流式文本与音频数据,同时设计独立健康检查端口实现进程心跳检测,具备良好的故障隔离能力与功能扩展性。
前端基于 PySide6 搭建无边框透明桌面窗口与交互 UI,通过 OpenGL 与 live2d-py 实现 Live2D Cubism 2.x/3 + 全版本模型渲染;LLM 后端基于 httpx 对接 OpenAI 兼容大模型 API,实现流式对话与 6 层情感标签解析;TTS 后端集成 GPT-SoVITS 实现情感感知的流式语音合成;监控后端通过 psutil 采集系统硬件数据,mss+Pillow 实现内存级屏幕截图与编码,对接多模态视觉 API 完成屏幕内容理解。
独立完成项目整体架构设计与全栈开发,落地了统一 Pydantic 消息协议、流式音频播放引擎、事件驱动的自主交互系统等核心逻辑;实现 5 种内置性格与自定义角色卡配置能力,兼容 Ollama、DeepSeek 等多平台大模型;项目已开源并迭代至 v4.8 版本,覆盖对话、语音、系统监控、视觉分析等全场景交互能力。
一是多进程流式传输存在时序不同步与阻塞风险,通过设计 “流式广播 + 终态确认” 的双通路通信模式,加入超时重连与健康检查机制,解决了数据阻塞与进程失联问题;二是 LLM 输出的情感标签格式不稳定,通过构建 6 层回退解析链路,从严格 JSON 格式到宽松正则匹配逐层降级,大幅提升了情感标签提取的成功率;三是屏幕视觉分析耗时较长易阻塞监控主循环,将视觉调用放入独立工作线程与任务队列解耦,硬件广播与视觉分析异步执行,既保障了监控数据实时性,又实现了智能视觉交互能力。
注:项目在开源到github前进行了非常长时间的本地迭代,因此github上的commit记录不多,时间跨度不长。