【AI大模型应用开发】【项目实战】14.RAG智慧问答项目-(二)项目工具之OllamaLangChainMilvus向量数据库

【AI大模型应用开发】【项目实战】14.RAG智慧问答项目-(二)项目工具之OllamaLangChainMilvus向量数据库

一.Ollama大模型高效管理工具

具体使用见【聊天机器人项目】4.Ollama的安装与使用

二.LangChain基础知识

1.LangChain基础知识

具体使用见:【AI大模型应用开发】【基础】7.LangChain基础知识入门

2.LangChain核心包

  • langchain-core:聊天模型和其他组件的基础抽象。
  • 集成包(例如 langchain-openai、langchain-anthropic 等):重要的集成被拆分为轻量级的独立包,由 LangChain 团队和集成方共同维护

  • langchain:包含链(chains)、智能体(agents)和检索策略,这些构成了应用的认知架构

  • langchain-community:由社区维护的第三方集成

  • langgraph:一个编排框架,用于将 LangChain 组件组合成可用于生产的应用,支持持久化、流式处理及其他关键特性

3.环境准备

本项目以LangChain+Qwen进行学习,需要提前安装

pip install openai pip install langchain pip install modelscope

借助阿里云-百炼平台(需要申请API Key 以及Secret Key):

大模型服务平台百炼控制台

三.Milvus向量数据库

目标

  • 理解什么是向量数据
  • 理解Milvus和Mysql的区别和联系
  • 掌握Milvus数据库的增删改查

mysql的索引:深入理解mysql索引机制

1.什么是Milvus数据库

Milvus 是一款开源的向量数据库(2019年提出),其唯一目标是存储、索引和管理由深度神经网络和其他机器学习(ML)模型生成的大规模 嵌入向量

作为一个专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引。与现有的关系型数据库主要处理遵循预定义模式的结构化数据不同,Milvus 从底层设计用于处理从非结构化数据转换而来的嵌入向量。

随着互联网的发展和演变,非结构化数据变得越来越常见,包括电子邮件、论文、物联网传感器数据、Facebook 照片、蛋白质结构等等。为了使计算机能够理解和处理非结构化数据,使用嵌入技术将它们转换为向量,Milvus 存储和索引这些向量,Milvus 能够通过计算它们的相似距离来分析两个向量之间的相关性,如果两个嵌入向量非常相似,则意味着原始数据源也很相似

作用:专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引

使用场景:存储【向量】数据,并进行【相似度】查询

2.关键概念

分类:

  • 结构化:里面的数据,字段固定,内容固定

  • 半结构化:【json、xml】等,有结构,但是内容不固定

  • 非结构化:【图片、音频、视频、文本】等数据

在现实世界,80%+的数据是非结构化数据,而这些数据如果想进行检索,就需要转化为向量后使用向量数据库存储和查询

(1).非结构化数据

非结构化数据包括图像、视频、音频和自然语言等信息,这些信息不遵循预定义的模型或组织方式。这种数据类型占据了世界数据的约 80%,可以使用各种人工智能(AI)和机器学习(ML)模型将其转换为向量

(2).嵌入向量

嵌入向量是对非结构化数据(如电子邮件、物联网传感器数据、Instagram 照片、蛋白质结构等)的特征抽象,数学上,嵌入向量是一个浮点数或二进制数的数组。,现代的嵌入技术被用于将非结构化数据转换为嵌入向量

比如:

输入: ["自然语言处理很有趣"] -> 输出: [[0.023, -0.128, 0.845, -0.031, 0.215, ...]] # 384维向

(3).向量相似度搜索

向量相似度搜索是将向量与数据库进行比较,以找到与查询向量最相似的向量的过程,使用近似最近邻搜索算法加速搜索过程,如果两个嵌入向量非常相似,那么原始数据源也是相似的

(4).Collection 和 Field

与传统数据库引擎类似,可以在Milvus中创建数据库,并为某些用户分配权限来管理它们,那么这些用户就有权管理数据库中的集合,一个 Milvus 集群最多支持64 个数据库

在关系数据库中,表和字段的结构可以与Milvus中的Collection和Field进行对应:

Milvus关系数据库描述
Collection集合相当于关系数据库中的表,用于组织数据
Field字段字段Schema相当于表中的列
is_primary主键在Field Schema中标记为主键对应该列的主键
dtype数据类型字段的数据类型,如INT, VARCHAR等
max_length最大长度对应VARCHAR类型字段的最大字符数
dim-向量字段的维度没有直接对应,但可以视为特殊数据处理

注意:1个collection最多支持4个向量Field

创建一个collection要分两步:

  1. 创建一个collection schema,指定collection的一些属性,比如是否开启动态字段等

  2. 给collection schema添加field schema

1).Field schema

Field schema 是字段的逻辑定义,在定义集合架构和管理集合之前需要定义的第一件事就是定义 Field schema

Milvus 集合中仅支持一个主键字段

属性描述备注
name要创建的集合中的字段名称String,必填
dtype字段的数据类型必填
description字段描述String,选填
is_primary是否设置该字段为主键字段Boolean (true or false) 主键字段必填
auto_id(主键字段必填)切换以启用或禁用自动 ID(主键)分配TrueFalse
max_length(VARCHAR 字段必需)允许插入的字符串的最大长度。[1, 65,535]
dim向量的维数∈[1, 32768]
is_partition_key该字段是否是分区键字段布尔值(true 或 false
2).collection schema

collection schema 是 collection 的逻辑定义,需要在定义collection schema 之前定义 field schema

属性描述备注
field集合中要创建的字段必填
description集合描述String,选填
partition_key_field设计用作分区键的字段的名称String, 选填
enable_dynamic_field是否启用动态模式Boolean (true or false)
  • partition_key_field:分区字段,数据量比较大时用于物理隔离数据,让检索性能更快(一般用不到)

  • enable_dynamic_field:是否允许动态模式, 允许用户在插入数据时添加 Schema 中未预定义的字段,这些字段会自动存储为 JSON 格式,无需预先声明结构

3.为什么选择 Milvus?

  • 在处理大规模数据集的向量搜索时具有高性能
  • 开发者优先的社区,提供多语言支持和工具链
  • 云扩展性和高可靠性,即使出现故障也不会受到影响
  • 通过将标量过滤与向量相似度搜索配对,实现混合搜索

4.支持哪些索引和度量

索引(Milvus的索引是加载到内存中的, 因为在使用Milvus时开销很大, 只有在内存中速度才能提升起来)是数据的组织单位,在搜索或查询插入的实体之前,必须声明索引类型相似度度量,如果未指定索引类型,则 Milvus 将默认使用暴力搜索

索引类型

要知道索引类型相关知识,需要先了解 KMeans算法以及监督学习

  • 监督学习:有标注的标签, 常见:分类、回归

  • 无监督学习:没有标注的标签,常见:聚类算法、 word2vec

  • 半监督学习:有一部分有标签,一部分没有标签

  • 自监督学习:数据集中取出一部分作为标签训练模型(MLM、NSP)

大多数由 Milvus 支持的向量索引类型使用近似最近邻搜索(ANNS),包括:

  • FLAT:FLAT最适合在小型,百万级数据集上寻求完全准确和精确搜索结果的场景

  • 这是最简单的索引方式,进行暴力搜索(brute-force),可以保证精确度,但效率低,尤其在数据量大时,适合场景:在小型、百万级数据集上寻求完全精确的搜索结果

  • IVF_FLAT:是一种基于倒排的索引方法,广泛用于在大规模数据集上实现高效的近似最近邻搜索,它适用于在精度和查询速度之间寻求平衡的场景

  • 聚类 :IVF_FLAT通过聚类算法(如k-means)将高维空间中的向量划分为多个子空间(簇),每个簇包含一组相似的向量,并且每个簇会有一个代表向量,通常是簇的中心点
    • 倒排索引 :为每个簇创建倒排索引,每个向量会被映射到它所属的簇,这样在查询时,系统只需关注与查询向量相似的簇,而不需要搜索整个高维空间,从而显著降低搜索的时间复杂度。
    • 查询处理 :
      • 查询时,IVF_FLAT首先将查询向量分配到距离最近的簇中心(即子空间)

      • 然后在该簇内执行精确的线性搜索,从而查找与查询向量相似的向量

      • <