Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Go × SIMDで高速化するベクトル検索 ~ルーフラインモデルでSIMDが効く境界を探れ! ~

Sponsored · SiteGround - Reliable hosting with speed, security, and support you can count on.
Avatar for po3rin po3rin
September 11, 2026

Go × SIMDで高速化するベクトル検索 ~ルーフラインモデルでSIMDが効く境界を探れ! ~

Avatar for po3rin

po3rin

September 11, 2026

More Decks by po3rin

Other Decks in Programming

Transcript

  1. Hiromu Nakamura Hiromu Nakamura AI-UX/MLOps TechLead AI/MLOps Engineer. Interested in

    Information Retrieval Nagoya Univ ~ Graduate School of Science M3, Inc. AI・ML Team MLOps & Data Engineering po3rin LayerX Inc. AI-UX/MLOps TechLead
  2. 1 Accelerating Vector Search with Go and SIMD ワークショップ用Repository https://github.com/po3rin/gocon2026-simd-search

    GitHub CodeSpaces だけ先に起動させておきましょう (立ち上げに少し時間がかかるため)。
  3. 2 Accelerating Vector Search with Go and SIMD Go ×

    SIMD ワークショップへようこそ!!!
  4. Accelerating Vector Search with Go and SIMD 7 SIMDって何? (1)

    内積を普通に書くとこうなります。 fl 1命令で oat32 を1個。これをスカラ処理と呼びます。
  5. 8 Accelerating Vector Search with Go and SIMD SIMDって何? (2)

    SIMD(Single Instruction, Multiple Data)は、 1 命令で複数のデータを まとめて処理する CPU の機能。 fl 256bit のレジスタには oat32 が 8 個入ります。
  6. 9 Accelerating Vector Search with Go and SIMD Go 1.27

    の SIMD パッケージ (1) GOEXPERIMENT=simd を付けると simd/archsimd が使えます(実験的機能)。 アセンブリも cgo も書かず、メソッド呼び出しがほぼそのまま 1 つの CPU 命令になりま す。FMA(Fused Multiply-Add)1 命令で 8 要素ぶんが片付きます。
  7. Accelerating Vector Search with Go and SIMD archsimd で覚えることは 3

    つ ① 型がデータの形 Float32x8 = oat32 を 8 レーン = 256bit。型を選ぶことが、使う命令幅 とレーン数を選ぶことになる ② メソッド = 1 命令 MulAdd → VFMADD、DotProductPairs → VPMADDWD ③ 実行時にガード 未対応 CPU で呼ぶと SIGILL で落ちる。archsimd.X86.AVX2() などのガー ドで確認してから使う (左が Go のメソッド名、右はコンパイルされて出てくる x86 の機械語の命令名) 対応は amd64、arm64、WebAssembly。 fl 10
  8. 11 Accelerating Vector Search with Go and SIMD ポータブルな simd

    パッケージ 1.27 で入った simd パッケージは型名からレーン数が消えます (Float32x8 -> Float32s) レーン数は実行時に CPU が決めます。
  9. 14 Accelerating Vector Search with Go and SIMD やみくもに SIMD

    を足しても、効かないことのほうが多い。 何で詰まっているかを測ることが重要 そのための道具がルーフラインモデル🚗
  10. 15 Accelerating Vector Search with Go and SIMD ルーフラインモデル (1)

    ルーフ(上の線)がマシンが出せる速度の限界。左がメモリ帯域で決まる斜線、右が演算ピークで決まる水平線。 ルーフはマシンによって決まる。ルーフの計算方法はワークショップに記載。
  11. Accelerating Vector Search with Go and SIMD 16 内積のスカラ全探索はルーフラインモデルでどこか? ベースライン

    2.15 GFLOP/s は、メモリ帯域から決まる上限(約 10)にすら届いていない。 算術強度 … メモリから 1 バイト運ぶごとに何回計算するか * 計算:掛け算 1 回 + 足し算 1 回 = 2 op * 運ぶ量:DRAM から運ぶ要素は oat32 なので 4 byte fl fl fl fl 算術強度 = 2 op ÷ 4 byte = 0.5 op/byte
  12. 17 Accelerating Vector Search with Go and SIMD SIMDにしてもメモリ律速で止まる!! 全探索は

    35.7 ms → 7.9 ms(4.5x)。速くなったがまだ上があるぞ。
  13. 20 Accelerating Vector Search with Go and SIMD 今日学んだこと *

    Go + SIMD の使い方。 * ルーフラインモデルの使い方 * (検索の世界の入り口)
  14. 21 Accelerating Vector Search with Go and SIMD 「SIMD ってやつを使ってるのに速くならない😭」と諦めず、

    計測してボトルネックを突破していく、 そうやって SIMD と仲良くしていきましょう。