一、立项背景与目标
针对企业内部海量非结构化文档(PDF、Word、Markdown)检索效率低、传统客服/问答系统准确率差及大模型容易产生“幻觉”的问题,本项目旨在搭建一套具备高准确率、低延迟、可溯源的企业级智能知识库问答与多Agent任务协同系统,助力企业实现智能化降本增效。
二、软件功能与核心模块
1. 多源文档智能解析与向量化:支持复杂PDF/表格解析、OCR文字识别及父子文档(Parent-Child)动态切块策略。
2. 混合检索(Hybrid Search)与重排序(Rerank):结合BM25关键词检索与Dense向量语义检索,通过Rerank模型进行Top-K重排序,确保检索精准度。
3. 多Agent协同决策:基于LangGraph构建路由Agent,自动识别用户意图并分发至知识检索、数据分析或外部API调用模块。
4. 流式响应与安全风控:基于SSE实现流式打字机效果,集成Guardrails防幻觉机制与敏感词过滤,支持回答引文溯源(Citation)。
三、业务流程与功能路径
用户输入提问 -> 意图识别/Agent路由分发 -> 混合检索知识库向量数据库 -> Rerank模型精筛上下文 -> Prompt组装与大模型(DeepSeek/GPT-4)推理 -> 幻觉校验与流式返回 -> 展示回答及原文出处引用。
一、整体架构与设计思路
系统采用前后端分离架构,后端基于 Python FastAPI 异步框架构建 RESTful API 与 SSE 流式接口;算法链路采用 LangChain + Milvus 向量数据库作为核心组件,底座大模型支持 DeepSeek/Qwen 本地化私有部署与 API 混合调度;采用 Redis 实现对话 Context 上下文缓存与并发限流。
二、“我”的负责模块与量化成果
1. RAG检索 Pipeline 深度优化:设计 Parent-Child Chunking 与 Hybrid Search(BM25 + BGE-Large-zh)混合检索方案,使知识库检索召回率(Recall@5)达到 94.2%,相比单一向量检索提升 35% 的回答准确率。
2. 高并发与性能调优:使用 Python asyncio 异步重构算法服务链路,结合 LLM 流式输出(SSE),将首 Token 响应时间(TTFT)从 2.8秒 缩短至 0.45秒;通过并发控制与 Redis 缓存优化,单节点支持 500+ QPS。
3. 语义缓存与成本控制:设计 Semantic Cache(语义缓存)模块,对高频重复提问实现毫秒级直接命中,命中率达 28%,有效节省了约 30% 的大模型 API 调用成本。
三、“我”遇到的难点/坑及解决方案
1. 难点:复杂PDF跨页表格/图片解析丢失上下文导致检索失效。
解法:引入 PaddleOCR + Unstructured 深度提取框架,将表格提取后统一转为 Markdown 语法格式存入向量库,保持了结构化数据的语义完整性。
2. 难点:专有名词/产品型号等精确词汇在向量检索中命中率低。
解法:引入 RRF(Reciprocal Rank Fusion)算法融合 BM25 稀疏向量与 Dense 密集向量,并后接 Cross-Encoder Rerank 模型,解决了向量检索对精确字面匹配不敏感的问题。
3. 难点:大模型长文本推理中的“大海捞针”与幻觉拒答控制。
解法:构建幻觉检测与溯源验证模块,强制要求 Prompt 携带元数据 Context;当检索相似度低于阈值时强制触发转人工或拒答机制,确保回答真实可信。