看图学AI:知识表示中数据的检索 📅 发布时间:2026/9/4 21:47:49 👁 浏览次数: 本文要点文本检索的方法将文本数据予以检索的这个过程, 被称作模式匹配。于数据库或者文档里对文本展开检索之际, 在模式匹配这一基础之上, 还能够运用AND以及OR这般的布尔检索, 还有向量空间模型的参数, 以此来使检索范围得到缩小。使用向量空间模型还能一并检索相似文档或相关文档。包括完全一致, 前方一致, 后方一致以及部分一致等样式的典型模式匹配方式。在进行部分一致检索时能够采用逐次逼近检索的方式图1。图1 文本检索我们能够运用Boyer - Moore算法当作字符串搜索算法, 它会依据搜索结果越过某些匹配的起始位置, 以此提升逐次逼近检索的效率, 此外, 正则表达式等语法描述也能够用来开展复杂匹配。举例来说, 于grep命令里运用Bitap算法, 能够如同正则表达式那般开展模糊检索, 除此之外存在多种检索算法。数据库检索当于检索数据库里所存储的数据之际, 我们一般会运用逐次贴近检索或者分块检索的方式。分块检索乃是将数据划分成m块, 于每一个较小的块内部展开逐次逼近检索, 接着针对整体进行逐次逼近检索, 借由这般的方式来判定数据跟检索条件是否相匹配的办法。因而, 运用二分法插入排序能够提升检索效率。就在MySQL以及等主要的数据库管理系统当中, 去创建索引这件事, 是能够提高检索效率的句号。作索引结构, 创建索引那时候, 最常用拿来用的是B树的变种B树参照那幅图2这种东西, 是这样的。图2 B树的结构这种树结构被称作平衡多叉树B树的搜索开端是根节点, 用于指出方向的针指向叶节点叶节点存放着数据, 并且所有叶节点有着相同的深度在插入或者删除数据的状况下, B树会自我调整以此维持平衡。全文检索要是在数据库检索期间, 当字段类型属于数值型, 或者是较小的数据类型时, 通过创建索引, 这能够把检索效率提升起来。可是要是在文本欠缺一致性的情形下强行运用索引, 那么就会出现数据量增多之类的问题。此时就必须使用全文搜索引擎。全文搜索引擎存在多种, 具体情况如表1所展示的那样。表1 全文搜索引擎倒排索引我们在开展全文检索这个行为的时候, 得借助索引把出现过特定某个单词的文档给存储起来, 还要存储单词于文档里出现的位置这类信息, 图3。图3 倒排索引之所以我们既能够运用KVS, 又能够采用关系型数据库管理系统, 是因为所要保存的是单词, 是出现过该单词的文档还是单词在文档中出现的位置等信息的键值对。能够运用分离器把语句划分成字词或者规定长度的字符序列。分离器于划分语句之际, 能够把词素剖析的收成、相关词汇项目依据相邻间隔的有限个词项概括而成以反映语言模型、空白以及标点记号等当作分隔标识。小波矩阵在开展文本检索之际, 于数组领域内检索元素之时, 运用小波矩阵数据结构, 则可以促使检索速度获得加快提升图4。图4 小波树和小波矩阵小波矩阵跟小波变换存在着不同的概念, 小波矩阵会将数据划分成两部分, 以此来构建一棵二叉小波树, 把数值数组里大于或者等于某个数值的元素设定成1, 小于该数值的元素设定成0。于是数组元素就被划分成了两个数组, 随后对这两个数组开展同样的操作, 这般迭代之后便得到了一个由0和1构成的二叉树, 这个二叉树既能当作二进制文件来处理, 又能够作为文本文件进行处理。称作小波矩阵的是, 表示上述数值的矩阵。小波树以及小波矩阵, 能应用于创建索引和图形网络分析, 应用范围极大。BWT检索字符串于大型文本文档之中时, 运用BWT即块排序压缩, 为负号形式实行检索助于提升检索效能。并且运用FM - Index此压缩查询算法来予以检索了一番也能够起到提高检索效率这般的效用之处喔。BWT针对需要去进行转换的字符串, 去开展循环移位操作, 每一次循环移位1位, 进而生成跟字符数目相等的循环字符串, 紧接着再把所有的循环字符串依照字典序来进行排序, 之后记录排序完成后每个循环字符串的最后一个字符, 由这些字符所组成的字符串便是BWT的输出。块, 排序算法的维基百科里, 有cacao变换后成ccoaa的例子, 重复循环排序过程, 能得到原始字符串, 变换后, 相似字符位置连续, 所以BWT可作压缩算法预处理器用, 已整合到bzip2命令中, 如果用普通方法变换, 变换后文本所需内存容量远大于原始文本, 故算法中有提高内存使用效率设计。经过BWT变换的字符串, 能够被用于检索, 在这个时候, 原字符串之中会增添一个结束符号。利用FM - Index去检索字符串, 能够提升检索速度, 特别是于DNA序列等文本文档当中, 鉴于字符种类少, 存在着大量相同字符串, 故而运用FM - Index可提高检索效率, 用1个字符代表1个碱基, 人类基因组大概有3 GB的数据量, BWA -是一款序列比对软件, 它借助BWT建立索引, 并且结合FM - Index展开完全一致检索, 进而迅速识别出特定的碱基序列。该软件还可以调整模糊检索的功能和检索结果不匹配时的惩罚项。——————————————————