选择 打开 改范围 完整检索页

pgsql.cc 提供对 postgresql.org 官网内容的中文翻译,由 Pigsty 团队维护。

受支持版本: 当前版本 (18) / 17 / 16 / 15 / 14
测试与开发版本: 19 / devel
不受支持的版本: 13 / 12 / 11 / 10 / 9.6 / 9.5 / 9.4 / 9.3 / 9.2 / 9.1 / 9.0
历史版本PostgreSQL 9.2 已于 2017 年 11 月结束社区维护,本页译文保留供仍在使用旧版本的读者参考。新系统请看当前版本

12.9. GiST 和 GIN 索引类型 #

有两种索引可以用来加速全文搜索。 请注意,索引对于全文搜索并非强制要求,但在定期搜索某一列的情况下,通常是可取的。

CREATE INDEX name ON table USING gist(column);

创建基于 GiST(广义搜索树)的索引。 column可以是tsvectortsquery类型。

CREATE INDEX name ON table USING gin(column);

创建基于 GIN(广义倒排索引)的索引。 column必须是tsvector类型。

这两种索引类型之间存在显著的性能差异,因此理解它们的特性很重要。

一个 GiST 索引是有损的,这表示索引可能产生假匹配,并且有必要检查真实的表行来消除这种假匹配(PostgreSQL在需要时会自动做这一步)。GiST 索引之所以是有损的,是因为每一个文档在索引中被表示为一个定长的签名。该签名通过将每个词 hash 到一个 n 位串中的一位,再将所有这些位进行 OR 运算来生成,结果是一个 n 位的文档签名。当两个词 hash 到同一个位位置时就会产生假匹配。如果查询中所有词都有匹配(真或假),则必须检索表行查看匹配是否正确。

有损性导致的性能下降归因于不必要的表记录(即被证实为假匹配的记录)获取。因为表记录的随机访问是较慢的,这限制了 GiST 索引的实用性。假匹配的可能性取决于几个因素,特别是不同词的数量,因此推荐使用词典来缩减这个数量。

GIN 索引对标准查询不是有损的,但其性能以对数方式依赖于不同词的数量。 (不过,GIN 索引只存储tsvector值的词(词位),而不存储它们的 权重标签。因此,在使用涉及权重的查询时需要一次表行重新检查。)

在选择使用哪种索引类型(GiST 还是 GIN)时,请考虑这些性能差异:

  • GIN 索引的查找大约比 GiST 快三倍

  • GIN 索引的构建大约比 GiST 慢三倍

  • GIN 索引的更新比 GiST 索引略慢,但如果禁用了快速更新支持则要慢大约 10 倍(详见第 55.3.1 节

  • GIN 索引比 GiST 索引大两到三倍

根据经验法则,GIN 索引最适合静态数据,因为查找更快。 对于动态数据,GiST 索引的更新更快。具体来说,当不同词(词位)的数量 在 100,000 以下时,GiST 索引对动态数据非常好而且快; 而 GIN 索引能更好地处理 100,000 以上的词位,但更新较慢。

注意GIN索引的构建时间常常可以通过增加maintenance_work_mem来改进,而GiST索引的构建时间则对该参数不敏感。

对大集合分区并正确使用 GIN 和 GiST 索引允许实现带在线更新的快速搜索。分区可以在数据库层面上使用表继承来完成,或者通过将文档分布在服务器上,并使用 dblink 模块收集搜索结果来完成。后者是可能的,因为排名函数只使用本地信息。

提交更正

译文有误、术语不当或页面显示问题,请到译文仓库 pgsty/pgdoc 报告译文问题。 英文原文本身的问题,请在当前版本的对应页面向上游反馈;上游不再修订已结束维护的版本。