项目描述:该系统是一个集成WebRTC实时音视频通信、大语言模型(LLM)与语音合成(TTS)技术的智能语音对话平台。旨在构建一个不仅能对话,更能主动使用工具(Tools) 执行任务的智能助手。通过引入函数调用技术,AI可以理解用户语音指令的深层意图,提供了远超传统问答机器人的交互体验。
技术栈:采用前后端分离的现代化架构。后端架构:基于Spring Boot + Spring AI实现LLM大模型,客户端以及用户管理,前端架构基于 Vue 3 + TypeScript + WebRTC开发,使用自定义Tools (Java Functions) + 外部API 实现LLM大模型的音色,语速,RAG知识库,天气查询,邮件发送等功能的实现。
负责方面:我主要是负责于LLM大模型的基本框架实现。实现了LLM大模型的流式与非流式的输出操作,挂断,中止等操作,以及tools的使用流程,实现了与RustPBX媒体服务器的对接方案。项目上线前期负责系统联调与故障排查,实现对LLM大模型代码进行模拟测试操作,覆盖率达85%。