一.Ollama大模型高效管理工具具体使用见【聊天机器人项目】4.Ollama的安装与使用二.LangChain基础知识1.LangChain基础知识具体使用见:【AI大模型应用开发】【基础】7.LangChain基础知识入门2.LangChain核心包langchain-core:聊天模型和其他组件的基础抽象。集成包(例如 langchain-openai、langchain-anthropic 等):重要的集成被拆分为轻量级的独立包,由 LangChain 团队和集成方共同维护langchain:包含链(chains)、智能体(agents)和检索策略,这些构成了应用的认知架构langchain-community:由社区维护的第三方集成langgraph:一个编排框架,用于将 LangChain 组件组合成可用于生产的应用,支持持久化、流式处理及其他关键特性3.环境准备本项目以LangChain+Qwen进行学习,需要提前安装pip install openai pip install langchain pip install modelscope借助阿里云-百炼平台(需要申请API Key 以及Secret Key):大模型服务平台百炼控制台三.Milvus向量数据库目标理解什么是向量数据库理解Milvus和Mysql的区别和联系掌握Milvus数据库的增删改查mysql的索引:深入理解mysql索引机制1.什么是Milvus数据库Milvus 是一款开源的向量数据库(2019年提出),其唯一目标是存储、索引和管理由深度神经网络和其他机器学习(ML)模型生成的大规模嵌入向量作为一个专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引。与现有的关系型数据库主要处理遵循预定义模式的结构化数据不同,Milvus 从底层设计用于处理从非结构化数据转换而来的嵌入向量。随着互联网的发展和演变,非结构化数据变得越来越常见,包括电子邮件、论文、物联网传感器数据、Facebook 照片、蛋白质结构等等。为了使计算机能够理解和处理非结构化数据,使用嵌入技术将它们转换为向量,Milvus 存储和索引这些向量,Milvus 能够通过计算它们的相似距离来分析两个向量之间的相关性,如果两个嵌入向量非常相似,则意味着原始数据源也很相似作用:专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引使用场景:存储【向量】数据,并进行【相似度】查询2.关键概念分类:结构化:里面的数据,字段固定,内容固定半结构化:【json、xml】等,有结构,但是内容不固定非结构化:【图片、音频、视频、文本】等数据在现实世界,80%+的数据是非结构化数据,而这些数据如果想进行检索,就需要转化为向量后使用向量数据库存储和查询(1).非结构化数据非结构化数据包括图像、视频、音频和自然语言等信息,这些信息不遵循预定义的模型或组织方式。这种数据类型占据了世界数据的约 80%,可以使用各种人工智能(AI)和机器学习(ML)模型将其转换为向量(2).嵌入向量嵌入向量是对非结构化数据(如电子邮件、物联网传感器数据、Instagram 照片、蛋白质结构等)的特征抽象,数学上,嵌入向量是一个浮点数或二进制数的数组。,现代的嵌入技术被用于将非结构化数据转换为嵌入向量比如:输入: ["自然语言处理很有趣"] - 输出: [[0.023, -0.128, 0.845, -0.031, 0.215, ...]] # 384维向(3).向量相似度搜索向量相似度搜索是将向量与数据库进行比较,以找到与查询向量最相似的向量的过程,使用近似最近邻搜索算法加速搜索过程,如果两个嵌入向量非常相似,那么原始数据源也是相似的(4).Collection 和 Field与传统数据库引擎类似,可以在Milvus中创建数据库,并为某些用户分配权限来管理它们,那么这些用户就有权管理数据库中的集合,一个 Milvus 集群最多支持64 个数据库在关系数据库中,表和字段的结构可以与Milvus中的Collection和Field进行对应:Milvus关系数据库描述Collection表集合相当于关系数据库中的表,用于组织数据Field字段字段Schema相当于表中的列is_primary主键在Field Schema中标记为主键对应该列的主键dtype数据类型字段的数据类型,如INT, VARCHAR等max_length最大长度对应VARCHAR类型字段的最大字符数dim-向量字段的维度没有直接对应,但可以视为特殊数据处理注意:1个collection最多支持4个向量Field创建一个collection要分两步:创建一个collection schema,指定collection的一些属性,比如是否开启动态字段等给collection schema添加field schema1).Field schemaField schema是字段的逻辑定义,在定义集合架构和管理集合之前需要定义的第一件事就是定义Field schemaMilvus 集合中仅支持一个主键字段属性描述备注name要创建的集合中的字段名称String,必填dtype字段的数据类型必填description字段描述String,选填is_primary是否设置该字段为主键字段Boolean (trueorfalse) 主键字段必填auto_id(主键字段必填)切换以启用或禁用自动 ID(主键)分配True或Falsemax_length(VARCHAR 字段必需)允许插入的字符串的最大长度。[1, 65,535]dim向量的维数∈[1, 32768]is_partition_key该字段是否是分区键字段布尔值(true或false)2).collection schemacollection schema是collection的逻辑定义,需要在定义collection schema之前定义field schema属性描述备注field集合中要创建的字段必填description集合描述String,选填partition_key_field设计用作分区键的字段的名称String, 选填enable_dynamic_field是否启用动态模式Boolean (trueorfalse)partition_key_field:分区字段,数据量比较大时用于物理隔离数据,让检索性能更快(一般用不到)enable_dynamic_field:是否允许动态模式, 允许用户在插入数据时添加 Schema 中未预定义的字段,这些字段会自动存储为 JSON 格式,无需预先声明结构3.为什么选择 Milvus?在处理大规模数据集的向量搜索时具有高性能开发者优先的社区,提供多语言支持和工具链云扩展性和高可靠性,即使出现故障也不会受到影响通过将标量过滤与向量相似度搜索配对,实现混合搜索4.支持哪些索引和度量?索引(Milvus的索引是加载到内存中的, 因为在使用Milvus时开销很大, 只有在内存中速度才能提升起来)是数据的组织单位,在搜索或查询插入的实体之前,必须声明索引类型和相似度度量,如果未指定索引类型,则 Milvus 将默认使用暴力搜索索引类型要知道索引类型相关知识,需要先了解KMeans算法以及监督学习监督学习:有标注的标签, 常见:分类、回归无监督学习:没有标注的标签,常见:聚类算法、 word2vec半监督学习:有一部分有标签,一部分没有标签自监督学习:数据集中取出一部分作为标签训练模型(MLM、NSP)大多数由 Milvus 支持的向量索引类型使用近似最近邻搜索(ANNS),包括:FLAT:FLAT最适合在小型,百万级数据集上寻求完全准确和精确搜索结果的场景这是最简单的索引方式,进行暴力搜索(brute-force),可以保证精确度,但效率低,尤其在数据量大时,适合场景:在小型、百万级数据集上寻求完全精确的搜索结果IVF_FLAT:是一种基于倒排的索引方法,广泛用于在大规模数据集上实现高效的近似最近邻搜索,它适用于在精度和查询速度之间寻求平衡的场景聚类:IVF_FLAT通过聚类算法(如k-means)将高维空间中的向量划分为多个子空间(簇),每个簇包含一组相似的向量,并且每个簇会有一个代表向量,通常是簇的中心点倒排索引:为每个簇创建倒排索引,每个向量会被映射到它所属的簇,这样在查询时,系统只需关注与查询向量相似的簇,而不需要搜索整个高维空间,从而显著降低搜索的时间复杂度。查询处理:查询时,IVF_FLAT首先将查询向量分配到距离最近的簇中心(即子空间)然后在该簇内执行精确的线性搜索,从而查找与查询向量相似的向量