面向企业内部制度、产品资料、操作手册等长文档的智能知识库问答系统。用户可通过网页上传 PDF、Word、PPT、TXT、Markdown 等资料,系统自动完成文档解析、结构化切片、元数据提取和索引构建。
系统采用向量检索与 BM25 关键词检索融合的混合检索策略,召回与问题最相关的内容,并展示文件名、页码、章节等来源信息。接入大语言模型后,系统仅基于检索到的上下文生成答案;资料不足时明确回答“不知道”,降低模型幻觉风险。
适用于行政制度查询、财务报销问答、客服知识库、产品培训、运维文档检索等企业知识管理场景。
1. 使用 Python + FastAPI 实现本地 Web 服务,提供文件上传、文档入库、检索与问答接口。
2. 实现 PDF、DOCX、PPTX、TXT、Markdown 多格式解析;PDF 保留页码,PPT 保留幻灯片编号,DOCX 表格转换为 Markdown。
3. 设计结构感知的递归切片策略,优先按标题、段落和句子边界切分,并保留文件名、路径、页码、章节、切片序号等元数据。
4. 实现向量相似度检索与 BM25 关键词检索,并通过加权 RRF 融合排序,提高专业术语和语义问题的召回质量。
5. 提供可选的 BGE 重排序模型接口,以及 OpenAI GPT-4o-mini 问答能力,回答附带可追溯来源。
6. 支持 Docker 部署、配置化模型参数、日志记录和重复入库时按来源替换旧索引。