Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Benchmarking Vector Databases: pgvector vs. Lan...
Search
tsho
September 03, 2026
Technology
100
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Benchmarking Vector Databases: pgvector vs. LanceDB
tsho
September 03, 2026
More Decks by tsho
See All by tsho
Google IO 2026で進化をとげた Google AI Studio
tsho
0
18
20260321_エンベディングってなに?RAGってなに?エンベディングの説明とGemini Embedding 2 の紹介
tsho
0
260
AI Agentにおける評価指標とAgent GPA
tsho
1
550
Scale SciPy with jax.shard_map - jax.shard_mapで SciPy をスケール
tsho
0
160
Developer Advocate / Community Managerなるには?
tsho
0
850
25/04/12 - Build with AI Hands-on Appendix
tsho
1
100
Unit testしてますか?
tsho
1
680
Other Decks in Technology
See All in Technology
いま、生成AIにKaggleをどこまで 任せられるか — ROGIIコンペでの進め方とTips
k951286
1
1.1k
いま好きなこと 最初はそんなに好きじゃなかった #tamagawadev
nishiuma
1
210
Driving AI Adoption Using In-House GPUs to Serve Qwen
po3rin
2
330
Bet AI Day 2026丨Production-Ready AI Agents — エンタープライズの実務を任せるための設計と運用
layerx
PRO
2
1.7k
なぜSRE・セキュリティは評価されないのか?守りの組織を事業成長エンジンに変えた実践
cscengineer
PRO
0
350
APIセキュリティを組織で実現するには~注力する点と設計・実装に入れたい対策~
riiimparm
3
880
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
170
はじめてのDatabricks:技術者向けワークショップ / beginner-workshop
databricksjapan
PRO
0
110
AIエージェントの開発・提供におけるセキュリティリスクの論点と対策
flatt_security
1
320
AI時代に、プロダクトの数だけ積み上がる所有コストをどうエンジニアリングするか / Engineering the Cost of Ownership
kzkmaeda
0
300
「重なり」は迎える側がつくる ― 人もAIエージェントも歓迎するプロダクトエンジニアリング ―
go0517go
PRO
0
130
Bill One 開発エンジニア 紹介資料
sansan33
PRO
7
20k
Featured
See All Featured
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
68
57k
Designing Experiences People Love
moore
143
24k
Paper Plane
katiecoart
PRO
2
53k
Getting science done with accelerated Python computing platforms
jacobtomlinson
2
460
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
37
6.6k
How to Talk to Developers About Accessibility
jct
2
530
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
How GitHub (no longer) Works
holman
316
150k
SEO for Brand Visibility & Recognition
aleyda
0
4.7k
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
510
The AI Search Optimization Roadmap by Aleyda Solis
aleyda
1
6.1k
Tell your own story through comics
letsgokoyo
1
1.1k
Transcript
pgvector vs LanceDB パフォーマンス比較 / Benchmarking Vector Databases: pgvector vs.
LanceDB @PostgreSQLアンカンファレンス #pgunconf tsho / Sho Tanaka
自己紹介 Name: tsho (Sho Tanaka) Affiliation: Snowflake Role: Lead Developer
Advocate X: tshowis Achievements: Devoxx 2026, OSSummit Tokyo, Seoul etc 専門はML, AIの評価とか Google Developer Expert AI/ML (JAX, TPU etc) 本発表は所属する組織とは関係なく、 個人の見解と調べたことを発表いたします。
Tl;dr 状況 既に Postgres があり、 QPS が高い フィルタ + ベクトルの
複合検索が中心 推奨 根拠 pgvector 8 並行で 1.8 倍、ACID・バックアップ・権限 管理が全部ついてくる LanceDB または パフォーマンスチューニン グされたpgvector prefilter が予測可能。 pgvector は ANALYZE / iterative_scan 必須 単発レイテンシ最優先 (エージェントのメモリ等) LanceDB 同 recall で約 2 倍速、in-process でネット ワークなし データが数百万件超・ 運用チームは DBA pgvector Postgres の運用資産(レプリケーション、 監視)をそのまま流用
pgvectorとは? PostgreSQL の extension の一つで、 PostgreSQL のまま vector columnを追 加できる。
最新 ver: v0.8.6 スター数:22.9k *9/1現在 GitHub - pgvector/pgvector: Open-source vector similarity search for Postgres
LanceDBとは? マルチモーダルなどに特化したレイクハウス用のエ ンジンで、AI/ML アプリケーション向けに作られた (と言っても、通常のDBのindex, 検索など幅広く対 応している) コアエンジンはLance formatのrepoで管理されて いる
https://github.com/lancedb/lancedb https://github.com/lance-format/lance
実験概要: pgvector vs LanceDB COMPARISON TARGETS BENCHMARK SETUP 検証対象のデータベース データ・検証環境
pgvector v0.8.6 🔬 データ規模: 10万件 PostgreSQLの拡張機能。既存 RDB環境にシー ムレスにベクトルカラムを追加可能。 📐 次元数: 1,536次元 LanceDB v0.36.0 AI/MLアプリ向けのサーバーレス /埋め込み型 ベクトルDB。カラムナ形式採用。 DBpeida entitiesの英語のテキスト, tite link 🛠 主要検証項目: ・データ投入&インデックス構築速度 ・単一クエリの Recall-Latency 曲線 ・並行負荷(マルチスレッド)検証 ⚠ 実験の制約事項に関する注意書き 今回のベンチマーク検証は特定のハードウェア・インデックス設定条件下で実施されています。実験の制 約上、リソース割り当てや設定変更が全体のパフォーマンス計測値に影響を与えているため、実稼働環 境での評価時は実機検証を推奨します。
結果1:データ投入&インデックス構築速度の比較 LanceDB 優勢 インデックス構築時間の比較 (秒) 構築速度に約 15倍の大差 1.1 秒 (IVF_HNSWを利用。投入は一瞬)
・LanceDBは、データ投入からインデックス(HNSW)作 成完了まで僅か1.1秒。IVF_HNSWを使って、クラスタ ごとにHNSWを構築し、効率的な一括書き込みが強み を発揮。 17.2 秒 (投入 1.4秒 + HNSW構築 15.8秒) ・pgvectorは計17.2秒(投入 1.4秒、HNSW構築 15.8 秒)を要する。RDBの行指向処理とインデックス生成の オーバーヘッドが要因。 LanceDB pgvector
結果2:単一クエリにおける Recall-Latency 性能比較 LanceDB 優勢 同一Recall基準でLanceDBが約2倍高速 ・検索効率: LanceDBは、高い再現率( Recall 0.95以上)を維持した状態でもレイテンシの増加
が極めて緩やかであり、終始 pgvectorを圧倒。 ・グラフの傾向: LanceDBは、フラットに安定した 超低遅延検索を提供可能。 pgvectorはefの値が 増加するに従い、 latencyが比較的増加傾向。
結果3:マルチスレッドにおける QPS・性能比較 Pgvector 優勢 マルチスレッド環境下では pgvectorが優勢 ・pgvectorの強み :PostgreSQL本来の堅牢なマル チプロセス/スレッド管理機構により、複数同時クエリ に対してもリソースを効率配分。並行ロード時でも極
めて安定したスループット( QPS)を維持可能。 ・LanceDBの課題 :サーバーレスの特性上、クライア ント側の並行スレッドが増加すると内部ロック競合や I/Oオーバーヘッドが生じ、単一クエリ時ほどの圧倒 的速度差が縮まる傾向。
Tl;dr 状況 既に Postgres があり、 QPS が高い フィルタ + ベクトルの
複合検索が中心 推奨 根拠 pgvector 8 並行で 1.8 倍、ACID・バックアップ・権限 管理が全部ついてくる LanceDB または パフォーマンスチューニン グされたpgvector prefilter が予測可能。 pgvector は ANALYZE / iterative_scan 必須 単発レイテンシ最優先 (エージェントのメモリ等) LanceDB 同 recall で約 2 倍速、in-process でネット ワークなし データが数百万件超・ 運用チームは DBA pgvector Postgres の運用資産(レプリケーション、 監視)をそのまま流用
詳細はブログにて https://implicit-none.com/ja/pgvector-vs-lancedb-benchmark/
Thank you