Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Driving AI Adoption Using In-House GPUs to Serv...

Avatar for po3rin po3rin
September 04, 2026

Driving AI Adoption Using In-House GPUs to Serve Qwen

Avatar for po3rin

po3rin

September 04, 2026

More Decks by po3rin

Other Decks in Technology

Transcript

  1. Driving AI Adoption Using In-House GPUs to Serve Qwen Qwen

    Meetup Tokyo LayerX Hiromu Nakamura (@po3rin) 2026/09/04
  2. Hiromu Nakamura Hiromu Nakamura AI-UX/MLOps TechLead AI/MLOps Engineer. Interested in

    Information Retrieval Nagoya Univ ~ Graduate School of Science M3, Inc. AI・ML Team MLOps & Data Engineering po3rin LayerX Inc. AI-UX/MLOps TechLead
  3. 1 Driving AI Adoption Using In-House GPUs to Serve Qwen

    社内AIコスト爆あがり😭 * トークンをとにかく使え!!のフェーズは終わり。。。 * トークン利用量を増やしながらコストは下げるという 直感的には逆のことをやっていく必要がある
  4. 2 Driving AI Adoption Using In-House GPUs to Serve Qwen

    💻 社内GPUサーバーを使おう! * ちょっと前にML学習用に買ったもの (RTX 6000 Ada × 4) * 従量課金を固定費へ (電気代はかかるが) * LayerXでは一部のワークロードをすでに社内GPU上での推論に移行している
  5. 3 Driving AI Adoption Using In-House GPUs to Serve Qwen

    Qwen3.8 27Bが超主力!! 今日話すこと * Qwenでどのようなワークロードを置き換えているか * どのような推論基盤を構築したか * どのようにスループットを上げているか
  6. Driving AI Adoption Using In-House GPUs to Serve Qwen 🪏

    移すタスクを見極める3軸 * 頻度(一日に何回走るか) * 難易度(フロンティア級の推論が要るか) * 許容条件(どこまでの待ち時間やタスク失敗を許せるか) 👀 狙い目は高頻度かつ低 中難易度で、応答時間と精度の許容幅が大きいタスク!! ~ 4
  7. 5 Driving AI Adoption Using In-House GPUs to Serve Qwen

    💼 Qwenで置き換えたワークロード * 軽量なコーディングタスク (OpenCodeを使ったSub Agentとしての呼び出し) * Claude Codeの実行権限判定 (Qwen3.6 35B-A3B) * ブラウザ自動動作確認/QA (Qwen3.8 27B) 🗓 今後は、社内AI Gateway経由でビジネス側にも展開していく予定
  8. 6 Driving AI Adoption Using In-House GPUs to Serve Qwen

    例: Qwen3.8 27BとMidscene.jsを使った自動QA * Midscene.jsのChrome拡張を入れてQwen3.8 27Bを呼べるように設定 * localの変更中、dev, stgにデプロイされたらQAが走るように * QA完了したら、チケットに操作中のスクショや動画を自動で添付してレポート 📝 Claude in Chromeだとスクショがトークンを結構消費してしまうので 社内GPU基盤に逃がせるのはでかい!!
  9. Driving AI Adoption Using In-House GPUs to Serve Qwen 3.

    Open-weight model inference infrastructure
  10. 7 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 AI推論基盤 on 社内GPU * RTX 6000 Ada 48GB × 4 * GPUサーバー上にk8sを立てている * KubeAIを導入しscale-to-zero (使ってない時はPodを落とす) * 推論基盤はvLLM * Twingate経由でアクセスできるように
  11. 8 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 Qwen3.8 27Bのデプロイ (1) * Qwen3.8 27B BF16は48GBに乗らない * Tensor Parallel=2 で乗せ切る
  12. 9 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 Qwen3.8 27Bのデプロイ (2) * TP=2だとGPUを跨ぐので、NUMAを跨が ないようなPod起動が重要 * SHM/directでホスト共有メモリを 中継してコピーする
  13. Driving AI Adoption Using In-House GPUs to Serve Qwen 🪏

    Qwen3.8 27B + DFlash2 (1) * Qwen3.8 27Bを普通に使うと32tok/sほどしか出ない。。。 * Speculative decodingだ!!(最近vLLMでDFlash2がサポートされた) https://inco.ai/blog/d ash2/ fl 10
  14. 11 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 Qwen3.8 27B + DFlash2 (2) * Speculative decodingが得意とされているコード生成で4.19xのデコード速度 * 採択率の高いタスクならかなり良い!!
  15. 12 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 Qwen3.8-Flash-Next + FreeToken (1) * Qwen3.8-Flash-Nextも載せたいなぁ。。。 * FreeTokenだ!(*1) (2026/8後半にQwen3.8-Flash-Next対応!) * FreeTokenはGPUのメモリ容量に応じて重みを GPU / ホスト RAM に良い感じに階層配置 してくれる君 *1: https://arxiv.org/abs/2608.16157
  16. 13 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🪏 Qwen3.8-Flash-Next + FreeToken (2) * FreeTokenにちょうどいいサイズのMoEモデル * DeepSeek-V4-Flash-0731との比較でもかなり速い (サイズが違うのは前提として) * MoEキャッシュにexpertが51%乗るのがデカい (DeepSeek-V4-Flash-0731は22%) *1: https://arxiv.org/abs/2608.16157
  17. 14 Driving AI Adoption Using In-House GPUs to Serve Qwen

    🙌 Qwenと社内GPU基盤でコスト削減に成功 * 個人のQA利用だけでも一日4000円ほど削減できている。 * 社内展開して、全社でのAI利用を後押し。ビジネス職種でも使えるようにAI Gateway整備中 * Qwen3.8 27Bが良すぎる。
  18. 15 Driving AI Adoption Using In-House GPUs to Serve Qwen

    😫 課題 * 全社員を捌くにはまだスループットが足りない。GPU欲しい。 * Qwen3.8-Flash-Next + FreeTokenがKubeAIに乗らない(FreeTokenをサポートしてない) ので、KubeAIのサポート状況に完全依存している構成をやめるのも一手。
  19. 16 Driving AI Adoption Using In-House GPUs to Serve Qwen

    📚 社内AI推論基盤について詳しく知りたい方へ * ローカルLLM特集の4章として寄稿してます * QwenによるClaude Code権限判定 * どのタスクをOpen-Weightに流すかを決めるための監視基盤 * スループット計測 * HAMiによるGPU相乗り構成 https://gihyo.jp/magazine/SD/archive/2026/202609
  20. Driving AI Adoption Using In-House GPUs to Serve Qwen Qwen

    Meetup Tokyo LayerX Hiromu Nakamura (@po3rin) 2026/09/04