选择 打开 改范围 完整检索页

pgsql.cc 提供对 postgresql.org 官网内容的中文翻译,由 Pigsty 团队维护。

受支持版本: 当前版本 (18) / 17 / 16 / 15 / 14
测试与开发版本: 19 / devel
不受支持的版本: 13 / 12 / 11 / 10 / 9.6 / 9.5 / 9.4 / 9.3 / 9.2 / 9.1 / 9.0
历史版本PostgreSQL 9.1 已于 2016 年 10 月结束社区维护,本页译文保留供仍在使用旧版本的读者参考。新系统请看当前版本

52.6. 索引代价估算函数 #

amcostestimate 函数会收到描述某种可能索引扫描方式的信息,其中包括已经确定可用于该索引的 WHERE 子句和 ORDER BY 子句列表。它必须返回访问该索引的代价估算,以及 WHERE 子句选择率的估计值(也就是在索引扫描期间将从父表中检索出的行所占比例)。对于简单情况,代价估算器几乎所有工作都可以通过调用优化器中的标准例程来完成;之所以提供 amcostestimate 函数,是为了让索引访问方法能够提供与索引类型有关的专门知识,以便在可能时改进标准估计。

每个 amcostestimate 函数都必须具有下面的签名:

void
amcostestimate (PlannerInfo *root,
                IndexOptInfo *index,
                List *indexQuals,
                List *indexOrderBys,
                RelOptInfo *outer_rel,
                Cost *indexStartupCost,
                Cost *indexTotalCost,
                Selectivity *indexSelectivity,
                double *indexCorrelation);

The first five parameters are inputs:

root

The planner's information about the query being processed.

index

正在被考虑的索引。

indexQuals

索引限制条件子句的列表(隐含地做了 AND);NIL 列表表示没有可用的限制条件。注意该列表包含顶部带 RestrictInfo 节点的表达式树,而不是裸表达式。

indexOrderBys

可索引的 ORDER BY 操作符的列表,若无则为 NIL。注意该列表包含表达式树,而不是 ScanKey。

outer_rel

如果该索引正被考虑用于连接的内层索引扫描,则为规划器关于 连接外侧的信息;否则为 NULL。当不为 NULL 时,部分限定子句将是与该关系的连接子句,而 不是简单的限制子句。此外,代价估算器应预期该索引扫描会对外层 关系的每一行重复一次。

最后四个参数是按引用传递的输出参数:

*indexStartupCost

设为索引启动处理的代价。

*indexTotalCost

设为索引处理的总代价。

*indexSelectivity

设为索引选择率。

*indexCorrelation

设为索引扫描顺序与底层表顺序之间的相关系数。

请注意,代价估算函数必须用 C 编写,而不能用 SQL 或任何可用的过程语言,因为它们必须访问规划器/优化器的内部数据结构。

索引访问代价应使用 src/backend/optimizer/path/costsize.c 所用的参数 来计算:顺序磁盘块访问的代价为 seq_page_cost,非顺序 访问的代价为 random_page_cost,而处理一个索引行的代价 通常取为 cpu_index_tuple_cost。此外,对于索引处理 (尤其是 indexQuals 本身的求值)期间调用的每个比较 操作符,都应计入 cpu_operator_cost 的适当倍数。

访问代价应包括与扫描索引本身有关的全部磁盘和 CPU 代价,但包括取出或处理由索引标识出的父表行的代价。

启动代价是整个扫描总代价中必须在开始取第一行之前先付出的那一部分。对大多数索引来说,这可以视为零;但启动代价较高的索引类型可能希望把它设为非零。

indexSelectivity 应设为在索引扫描期间将从父表中检索出的行的估计比例。对于有损查询,这个值通常会高于实际通过给定限定条件的行比例。

indexCorrelation 应设为索引顺序与表顺序之间的相关性(范围从 -1.0 到 1.0)。该值用于调整从父表取行代价的估计。

在连接的情况下,返回的数值应是该索引任意一次扫描的预期平均值。

代价估算

一个典型的代价估算器会按如下步骤进行:

  1. 根据给定的限定条件,估计并返回将被访问的父表行所占的比例。 在没有索引类型相关知识的情况下,使用标准优化器函数 clauselist_selectivity()

    *indexSelectivity = clauselist_selectivity(root, indexQuals,
                                               index->rel->relid,
                                               JOIN_INNER, NULL);
    
  2. 估计扫描期间将被访问的索引行数。对于许多索引类型,它等于 indexSelectivity 乘以索引中的行数,但也可能更多。 (注意,索引的大小(页数和行数)可以从 IndexOptInfo 结构体中获得。)

  3. 估计扫描期间将读取的索引页面数。它可能仅仅是 indexSelectivity 乘以索引总页面数。

  4. 计算索引访问代价。一个通用估计器可能会这样做:

    /*
     * Our generic assumption is that the index pages will be read
     * sequentially, so they cost seq_page_cost each, not random_page_cost.
     * Also, we charge for evaluation of the indexquals at each index row.
     * All the costs are assumed to be paid incrementally during the scan.
     */
    cost_qual_eval(&index_qual_cost, indexQuals, root);
    *indexStartupCost = index_qual_cost.startup;
    *indexTotalCost = seq_page_cost * numIndexPages +
        (cpu_index_tuple_cost + index_qual_cost.per_tuple) * numIndexTuples;
    

    不过,上述做法没有考虑连接情况下重复索引扫描之间索引读取的 摊销效果。

  5. 估计索引的相关性。对于单列上的简单有序索引,这个值可以从 pg_statistic 中取得。如果相关性未知,保守估计应为零(即无相关性)。

代价估算器函数的示例可在 src/backend/utils/adt/selfuncs.c 中找到。

提交更正

译文有误、术语不当或页面显示问题,请到译文仓库 pgsty/pgdoc 报告译文问题。 英文原文本身的问题,请在当前版本的对应页面向上游反馈;上游不再修订已结束维护的版本。