pgsql.cc 提供对 postgresql.org 官网内容的中文翻译,由 Pigsty 团队维护。
CREATE INDEX — 定义一个新索引
CREATE [ UNIQUE ] INDEX [ CONCURRENTLY ]nameONtable[ USINGmethod] ( {column| (expression) } [opclass] [, ...] ) [ WITH (storage_parameter=value[, ... ] ) ] [ TABLESPACEtablespace] [ WHEREpredicate]
CREATE INDEX 在指定表上构建一个名为 index_name 的索引。索引主要用于提升数据库性能(但使用不当也可能导致性能下降)。
索引的键字段指定为列名,或者指定为写在圆括号中的表达式。 如果索引方法支持多列索引,则可以指定多个字段。
索引字段可以是根据表行中一个或多个列值计算得到的表达式。 该特性可用于根据基础数据的某种变换来快速访问数据。例如, 在upper(col)上计算的索引可让子句 WHERE upper(col) = 'JIM'使用索引。
PostgreSQL提供了索引方法 B-树、hash、GiST 和 GIN。用户也可以定义自己的索引 方法,但这相当复杂。
当WHERE子句存在时,会创建一个 部分索引。部分索引只包含表中一部分行的索引项, 通常这一部分比表的其余部分更适合建立索引。例如,如果一个表同时包含 已开票和未开票订单,而未开票订单只占整个表的一小部分,但这一部分又经常 被访问,就可以只对这部分创建索引来提升性能。另一种可能 的应用是将WHERE与UNIQUE结合使用, 以便在表的一个子集上强制唯一性。更多讨论请见 第 11.7 节。
WHERE子句中使用的表达式只能引用底层表的列,但 它可以使用所有列,而不仅仅是被索引的列。当前, WHERE中也禁止使用子查询和聚合表达式。同样的 限制也适用于作为表达式的索引字段。
所有在索引定义中使用的函数和操作符都必须是“不可变的”, 也就是说,它们的结果只能依赖其参数,而不能受任何外部因素影响 (例如另一个表的内容或当前时间)。这种限制确保索引的行为定义明确。 要在索引表达式或WHERE子句中使用用户定义的函数, 记得在创建该函数时将其标记为不可变。
UNIQUE使系统在创建索引时(如果数据已经存在)以及每次添加数据时, 检查表中的重复值。任何会导致重复项的插入或更新操作都会报错。
CONCURRENTLY使用此选项时,PostgreSQL将在构建索引时不获取任何会阻止对表进行并发插入、更新或删除的锁;而标准索引构建会阻塞对表的写入(但不会阻塞读取),直到构建完成。使用此选项时有几个注意事项需要了解—请参见并发构建索引。
name要创建的索引名称。此处不能包含模式名称;索引始终创建在其父表所在的同一模式中。
table要建立索引的表名(可以是模式限定名)。
method要使用的索引方法的名称。选择包括 btree、hash、gist 和 gin。默认方法是 btree。
column一个表列的名称。
expression一个基于表中一个或多个列的表达式。通常必须像语法中所示那样写在 外围圆括号中。不过,如果该表达式是函数调用形式,则可以省略圆括号。
opclass一个操作符类的名称。详见下文。
storage_parameter索引方法专用存储参数的名称。有关详细信息见下文。
tablespace在其中创建索引的表空间。如果未指定,将使用 default_tablespace;如果 default_tablespace为空字符串,则使用数据库的 默认表空间。
predicate部分索引的约束表达式。
WITH子句可以为索引指定存储参数。每一种索引方法都可以有各自允许的存储参数集合。内置的索引方法都只接受一个参数:
FILLFACTOR索引的填充因子是一个百分比,用于确定索引方法将尝试把索引页填充到多满。对于 B-树,在初始构建索引期间,以及向右扩展索引(最大键值)时,叶页都会填充到该百分比。如果之后页面变得完全填满,就会进行拆分,导致索引效率逐渐下降。B-树使用默认填充因子 90,但可以选择 10 到 100 之间的任意值。如果表是静态的,填充因子 100 最适合将索引的物理大小降至最低;但对于频繁更新的表,较小的填充因子更适合减少页面拆分的需要。其他索引方法以不同但大致类似的方式使用填充因子;默认填充因子因方法而异。
创建索引可能会干扰数据库的正常运行。通常 PostgreSQL会锁住要建立索引的表,阻止其写入, 并通过一次扫描完成整个索引构建。其他事务仍可读取该表,但如果它们试图 在表中插入、更新或删除行,就会阻塞直到索引构建完成。如果系统是在线生 产数据库,这可能产生严重影响。对非常大的表建立索引可能需要很多小时, 即便是较小的表,索引构建也可能在一段对生产系统而言不可接受的时间内阻 止写入者操作。
PostgreSQL支持在不阻止写入的情况下构建索引。 这种方法通过在CREATE INDEX中指定 CONCURRENTLY选项来启用。使用该选项时, PostgreSQL必须对该表执行两次扫描,此外还 必须等待所有现有事务结束。因此,这种方法比标 准索引构建需要更多总工作量,完成时间也明显更长。不过,由于它允许在构 建索引期间继续进行正常操作,所以这种方法适合在生产环境中新增索引。当 然,创建索引带来的额外 CPU 和 I/O 负载也可能拖慢其他操作。
如果在表的第二次扫描期间出现问题,例如唯一索引中的唯一性冲突,CREATE INDEX命令将失败,但会留下一个“无效”索引。由于该索引可能不完整,查询时会忽略它;但是,它仍会带来更新开销。在这种情况下,建议的恢复方法是删除索引,然后重新尝试执行CREATE INDEX CONCURRENTLY。(另一种可能性是重建索引,使用REINDEX。但是,由于REINDEX不支持并发构建,此选项不太有吸引力。)
并发构建唯一索引时的另一项注意事项是,在第二次表扫描开始时,唯一性约 束就已经开始对其他事务生效了。这意味着在该索引可供使用之前,其他查询 就可能报告约束违规,甚至在索引构建最终失败的情况下也是如此。另外,如 果第二次扫描确实失败了,那个“无效”索引之后仍会继续强制 执行其唯一性约束。
也支持并发构建表达式索引和部分索引。计算这些表达式时发生的错误, 可能导致与上文所述唯一性约束违规类似的行为。
普通索引构建允许同一表上的其他普通索引构建并行进行,但一张表上一次只能进行一个并发索引构建。在这两种情况下,期间都不允许对该表进行其他类型的模式修改。另一个区别是,普通CREATE INDEX命令可以在事务块中执行,而CREATE INDEX CONCURRENTLY不能。
关于索引何时能被使用、何时不被使用以及什么情况下它们有用的信息请 见第 11 章。
目前,只有 B-树和 GiST 索引方法支持多列索引。默认最多可指定 32 个字段。(构建PostgreSQL时可以更改此限制。)目前只有 B-树 支持唯一索引。
索引的每一列都可以指定一个操作符类。操作符类标识索引用于该列的操作符。例如,四字节整数上的 B-树 索引会使用int4_ops类;此操作符类包含四字节整数的比较函数。实际上,列数据类型的默认操作符类通常已足够。操作符类存在的主要原因是,某些数据类型可能有多个有意义的排序方式。例如,我们可能希望按绝对值或实部对复数数据类型排序。我们可以为该数据类型定义两个操作符类,并在创建索引时选择合适的类。有关操作符类的更多信息,请参见第 11.8 节和第 33.14 节。
使用DROP INDEX删除索引。
默认情况下,索引不会被用于IS NULL子句。在这类情况 下使用索引的最佳办法,是创建一个使用IS NULL谓词的 部分索引。
早期版本的PostgreSQL还提供过一种 R-tree 索引方法。该方法已经被移除,因为它相对于 GiST 方法并无明显优势。如果 指定了USING rtree,CREATE INDEX 会将其解释为USING gist,以简化旧数据库向 GiST 的转换。
创建 B-树索引,列为title,所在表为films:
CREATE UNIQUE INDEX title_idx ON films (title);
要在表达式lower(title)上创建一个索引,以便高效执行 不区分大小写的搜索:
CREATE INDEX lower_title_idx ON films ((lower(title)));
要创建一个具有非默认填充因子的索引:
CREATE UNIQUE INDEX title_idx ON films (title) WITH (fillfactor = 70);
要在表films的列code上创建一个索引, 并让该索引驻留在表空间indexspace中:
CREATE INDEX code_idx ON films (code) TABLESPACE indexspace;
要在不阻止对表执行写操作的情况下创建索引:
CREATE INDEX CONCURRENTLY sales_quantity_index ON sales_table (quantity);
CREATE INDEX是 PostgreSQL的语言扩展。SQL 标准中没有关于 索引的规定。
译文有误、术语不当或页面显示问题,请到译文仓库 pgsty/pgdoc 报告译文问题。 英文原文本身的问题,请在当前版本的对应页面向上游反馈;上游不再修订已结束维护的版本。