本项目是一款面向智慧文旅场景的数字人 AI 导游产品(国家级比赛项目),旨在解决传统景区讲解人力成本高、交互单一、游客个性化问答难以满足等痛点。系统以大语言模型为核心,结合面部驱动与语音合成技术,打造出可实时对话、形象逼真的智能文旅数字人,为游客提供沉浸式、低延迟的多模态语音交互体验。
核心功能模块包括:1)景区知识问答:基于 RAG 知识库对景区文档进行自动切片与向量化存储,游客可通过自然语言就景点历史、路线、服务设施等进行实时提问;2)数字人形象交互:对接面部驱动与语音合成模型,实现口型同步、音视频流式渲染的拟人化讲解;3)多模型智能调度:在大语言模型与多模态模型之间协同工作,兼顾响应速度与视觉分析需求;4)游览数据分析:异步归档游览历史,并对游客对话趋势与情感进行量化分析,为景区运营提供数据支撑。
业务流程为:游客发起语音/文字提问 → 系统语义检索知识库并生成回答 → 驱动数字人以音视频形式实时呈现 → 后台异步归档与分析交互数据,形成体验闭环。
整体采用前后端分离架构,后端基于 Spring Boot 4.0 + Spring AI 构建,围绕"高可用、低延迟、可扩展"进行设计,将大模型能力、知识检索、多媒体渲染与异步任务解耦为独立模块。
我作为核心后端开发,主要负责:
1)RAG 与智能问答:基于 Spring AI 封装 VectorSearch 接口,实现景区文档的自动切片与向量化存储,显著提升问答的语义检索准确度。
2)模型调度与流式渲染:将提示词模板集中存储于 Redis 并支持动态更新,避免硬编码,实现提示词的热更新与统一管理;对接 MuseTalk v1.5 与 Cosyvoice 3,在 RTX 5090 算力下实现 25fps 音视频流的稳定返回,将端到端对话延迟控制在 5 秒以内。
3)架构解耦与异步化:引入 RabbitMQ 将文档向量化解析、游览历史归档等重载任务异步处理,保障对话接口高可用;并借助大模型异步分析游客对话趋势与情感波动,实现体验量化。
遇到的难点与解决方案:面对音视频实时渲染延迟高的问题,通过 Redis 缓存提示词 + RabbitMQ 异步卸载重载任务的组合方案,成功将端到端延迟压缩至 5 秒内,保障了交互流畅度与系统稳定性。