为了工作效能提升,需要构建一个公司内部知识库系统。本项目旨在构建一个能够统一理解和检索文本、图像以及图文对话的智能系统。能够将文本、图像及图文对输入转换为统一的向量表示,支持灵活的“Any2Any”跨模态检索(如文搜图、图搜文、图文搜图文等)。
1、单文本和图片嵌入,以及文本+图片嵌入,从而实现 Any2Any。基于多模态的Agent来控制RAG最后的响应,使其同时出现文本和图片,并保证多模态数据在一个向量空间实现搜索和索引。
2、采用Sentence_transformers私有化部署Qwen多模态大模型,对图片和文本进行密集向量化。创建密集向量Dense和稀疏向量Sparse的索引。
3、实现上下文工程来提高响应速度,使用Redis来保存短期上下文记忆和长期上下文记忆,并且每轮交互后,通过异步线程任务机制,把长期记忆上下文再次存入向量数据库中。这样可以实现短期记忆使用文本摘要提取,长期上下文可以使用语义+全文检索的方式提取,保证提取上下文的精度。