TigerData 发布 pg_textsearch 1.0 BM25 引擎
PostgreSQL 内置的 ts_rank 缺少逆文档频率与词频饱和,排序质量受限。TigerData 发布的 pg_textsearch 1.0 直接在 PostgreSQL 页面上实现完整 BM25 评分,用 Block-Max WAND 优化 top-k 查询,WAL、复制与 VACUUM 都照常工作。厂商测试称短查询比 ParadeDB 快 2.4 到 6.5 倍,目前不支持短语查询,只有 OR 语义。
pgsql.cc 提供对 postgresql.org 官网内容的中文翻译,由 Pigsty 团队维护。
当天收录 32 条。
PostgreSQL 内置的 ts_rank 缺少逆文档频率与词频饱和,排序质量受限。TigerData 发布的 pg_textsearch 1.0 直接在 PostgreSQL 页面上实现完整 BM25 评分,用 Block-Max WAND 优化 top-k 查询,WAL、复制与 VACUUM 都照常工作。厂商测试称短查询比 ParadeDB 快 2.4 到 6.5 倍,目前不支持短语查询,只有 OR 语义。
MVCC 把删除的行留成死元组,vacuum 既要回收空间,也要冻结旧行避开事务号回卷。文章梳理了 autovacuum 的触发条件:死元组超过阈值 50 加表行数的 0.2 倍,千行表约 250 次更新即触发。作者建议按表把 autovacuum_vacuum_scale_factor 降到 0.1,用 cost_delay 与 cost_limit 控制 I/O 冲击,再用 pg_stat_user_tables 观察死元组。
备库集群让整个 Patroni 集群跟随另一个集群:一个节点作 standby leader 从主集群复制,其余节点再从它级联复制,可用于灾备、跨机房迁移与就近只读。Umut TEKIN 给出的关键配置是 standby_cluster 的 host、port 与 primary_slot_name。要注意复制槽不会自动创建,与主集群共用 etcd 时 scope 必须不同,提升前先确认 LSN 追平。
每个人都要记住主机、端口、库名和用户,而真实库名往往不是同事口头的叫法。Lætitia AVROT 介绍 pg_service.conf 这份 INI 格式的命名连接配置:用户级放 ~/.pg_service.conf,系统级放在 pg_config --sysconfdir 下,写好一段 [prod] 后 psql service=prod 即可连上。按环境拆文件而服务名保持一致,密码交给权限 0600 的 .pgpass。
Deepak Mahto 梳理了这个二十多年老工具的完整路径。评估阶段用 SHOW_REPORT 导出 HTML 报告,给出对象清单、复杂度分级与人天估算;迁移阶段按对象类型导出表、约束、序列、索引与视图;之后用 TEST、TEST_COUNT、TEST_DATA 三级校验。类型改写靠 MODIFY_TYPE、REPLACE_AS_BOOLEAN 等指令,函数索引与 interval 分区仍要人工善后。
把 AI 代理从演示搬进生产,卡住企业的往往不是模型而是数据与运维。EDB 发布新一代 Postgres AI Factory:Agent Studio 基于 Langflow 重写以简化代理搭建,向量基础设施改用 VectorChord 提升检索性能,企业部署的安全能力也有加强。EDB 的定位是让机构基于自己掌握的数据构建代理,填补概念验证与可上生产系统之间的落差。
WarehousePG 性能经基准验证,实时运营分析提速,向量库与代理能力增强,另有运维自动化更新。
作者认为扩容与故障转移应交给策略驱动的自动化,AI 代理只适合做分析、分类与建议。
Melanie Plageman 的补丁已提交,改为访问时设置可见性映射,David Rowley 提出后续清理。
热元组搜索移入新的 heapam_indexscan.c,Andres Freund 的意见集中在命名与批缓存回收。
Masahiko Sawada 主张与手动 VACUUM 一致默认开启,Daniil Davydov 认为海量表实例应显式开启。
最终交换阶段被 AccessShareLock 挡住时只能等到锁超时,讨论中提议主动取消冲突会话。
视图对外暴露 autovacuum 评分,争议在于关闭 autovacuum 的表是否仍应显示评分。
test_aio 读取了只在断言构建里赋值的字段,修复已随提交 8519251ee975 推送。
补丁让 WaitReadBuffers 返回是否等待过 IO,评审担心并行位图堆扫描出现性能回退。
基于 PostgreSQL 的 MPP 架构改用容量计费而非自动扩缩,官方口径是成本更可预测。