项目描述:基于 Spring AI + 通义千问 + pgvector 构建的企业级 RAG 知识库问答系统。支持多格式文档解析、异步向量化存储、层次化语义检索与流式对话。用户可上传 PDF / Markdown / TXT 文档,通过自然语言查询获得带来源引用的答案。
技术栈:Spring AI、Spring Boot、Mybatis-plus、PostgreSQL + pgvector、DashScope (通义千问+QwenVL)、Apache Tika 等。
我负责的部分:
⚫ 多策略文档解析引擎:设计策略模式解析器链,根据文件类型自动路由到 Text / Markdown / PDF 解析器。PDF 解析集成 Tika 文字提取+ PDFBox 图片抽取+ Qwen-VL 多模态描述。
⚫ 层次化父子分块与检索:基于文档结构进行智能分块,按章节生成父块,超长父块自动拆分子块,检索时关联父块返回完整上下文作为 LLM 输入。
⚫ 异步文档处理管道:上传即返回任务 id,通过@Async +状态表异步完成完整流程,前端可轮询进度,避免大文件阻塞 HTTP 线程。引入指纹去重和事务删除,保证数据一致性。
⚫ 流式 RAG 对话与来源追溯:基于 SSE 实现流式对话,同时返回内容流和引用来源。结合 PostgreSQL 持久化多轮对话历史,支持会话恢复和上下文窗口控制。
项目描述:基于 Spring AI + 通义千问 + pgvector 构建的企业级 RAG 知识库问答系统。支持多格式文档解析、异步向量化存储、层次化语义检索与流式对话。用户可上传 PDF / Markdown / TXT 文档,通过自然语言查询获得带来源引用的答案。
技术栈:Spring AI、Spring Boot、Mybatis-plus、PostgreSQL + pgvector、DashScope (通义千问+QwenVL)、Apache Tika 等。
我负责的部分:
⚫ 多策略文档解析引擎:设计策略模式解析器链,根据文件类型自动路由到 Text / Markdown / PDF 解析器。PDF 解析集成 Tika 文字提取+ PDFBox 图片抽取+ Qwen-VL 多模态描述。
⚫ 层次化父子分块与检索:基于文档结构进行智能分块,按章节生成父块,超长父块自动拆分子块,检索时关联父块返回完整上下文作为 LLM 输入。
⚫ 异步文档处理管道:上传即返回任务 id,通过@Async +状态表异步完成完整流程,前端可轮询进度,避免大文件阻塞 HTTP 线程。引入指纹去重和事务删除,保证数据一致性。
⚫ 流式 RAG 对话与来源追溯:基于 SSE 实现流式对话,同时返回内容流和引用来源。结合 PostgreSQL 持久化多轮对话历史,支持会话恢复和上下文窗口控制。