Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Driving AI Adoption Using In-House GPUs to Serv...
Search
po3rin
September 04, 2026
Technology
170
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Driving AI Adoption Using In-House GPUs to Serve Qwen
po3rin
September 04, 2026
More Decks by po3rin
See All by po3rin
検索設計から 推論設計への重心移動と Recall-First Retrieval
po3rin
5
2.3k
LLMで複雑な検索条件アセットから脱却する!! 生成的検索インタフェースの設計論
po3rin
4
1.5k
C-Shared Buildで突破するAI Agent バックテストの壁
po3rin
0
530
嗚呼、当時の本番環境の状態で AI Agentを再評価したいなぁ...
po3rin
0
620
Temporal Knowledge Graphで作る! 時間変化するナレッジを扱うAI Agentの世界
po3rin
7
2.4k
自作LLM Native GORM Pluginで実現する AI Agentバックテスト基盤構築
po3rin
2
1.2k
麻雀点数計算問題生成タスクから学ぶ Single Agentの限界と Agentic Workflowの底力
po3rin
5
3.2k
LLMOpsのパフォーマンスを支える技術と現場で実践した改善
po3rin
8
1.3k
LLMは麻雀を知らなすぎるから俺が教育してやる
po3rin
5
3k
Other Decks in Technology
See All in Technology
Data Hubグループ 紹介資料
sansan33
PRO
0
3.2k
Hub & Spoke 環境のネットワークルーティングを分解してみる
tsuyataku
1
490
Introduction to Sansan, inc / Sansan Global Development Center, Inc.
sansan33
PRO
0
3.2k
Bet AI Day 2026丨Agentは、「金融」という巨大産業の何を変えられるのか
layerx
PRO
0
490
LLMアプリ、 雰囲気で運用してませんか? 〜LLMOpsの現在地〜
taka_aki
1
660
いま、生成AIにKaggleをどこまで 任せられるか — ROGIIコンペでの進め方とTips
k951286
0
650
Bet AI Day 2026丨バクラク Autopilot、業務システムの再設計
layerx
PRO
1
760
人気商品が「ちゃんと買える」をつくる ー ECの負荷改善
ykagano
1
180
Claude Teamプランの コスト最適化を考える
rfdnxbro
2
870
Bet AI Day 2026丨AIを「使う」から、AIが「働く」へ ― LayerXが進める「組織AI」の社会実装
layerx
PRO
2
1.4k
Sansan Engineering Unit 紹介資料
sansan33
PRO
1
5k
デザイナーとPdMが自分でデプロイする ― Amplify Hosting の PR プレビューで回す仮説検証
kakehashi
PRO
2
100
Featured
See All Featured
Believing is Seeing
oripsolob
1
200
Designing for humans not robots
tammielis
254
26k
Building Flexible Design Systems
yeseniaperezcruz
330
41k
Accessibility Awareness
sabderemane
1
190
HU Berlin: Industrial-Strength Natural Language Processing with spaCy and Prodigy
inesmontani
PRO
0
680
How to Think Like a Performance Engineer
csswizardry
28
2.8k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
47
8.3k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
56
3.5k
Claude Code のすすめ
schroneko
67
230k
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
510
Test your architecture with Archunit
thirion
2
2.4k
SEO for Brand Visibility & Recognition
aleyda
0
4.7k
Transcript
Driving AI Adoption Using In-House GPUs to Serve Qwen Qwen
Meetup Tokyo LayerX Hiromu Nakamura (@po3rin) 2026/09/04
Hiromu Nakamura Hiromu Nakamura AI-UX/MLOps TechLead AI/MLOps Engineer. Interested in
Information Retrieval Nagoya Univ ~ Graduate School of Science M3, Inc. AI・ML Team MLOps & Data Engineering po3rin LayerX Inc. AI-UX/MLOps TechLead
Driving AI Adoption Using In-House GPUs to Serve Qwen 1.
Introduction
1 Driving AI Adoption Using In-House GPUs to Serve Qwen
社内AIコスト爆あがり😭 * トークンをとにかく使え!!のフェーズは終わり。。。 * トークン利用量を増やしながらコストは下げるという 直感的には逆のことをやっていく必要がある
2 Driving AI Adoption Using In-House GPUs to Serve Qwen
💻 社内GPUサーバーを使おう! * ちょっと前にML学習用に買ったもの (RTX 6000 Ada × 4) * 従量課金を固定費へ (電気代はかかるが) * LayerXでは一部のワークロードをすでに社内GPU上での推論に移行している
3 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8 27Bが超主力!! 今日話すこと * Qwenでどのようなワークロードを置き換えているか * どのような推論基盤を構築したか * どのようにスループットを上げているか
Driving AI Adoption Using In-House GPUs to Serve Qwen 2.
Workloads running with Qwen
Driving AI Adoption Using In-House GPUs to Serve Qwen
移すタスクを見極める3軸 * 頻度(一日に何回走るか) * 難易度(フロンティア級の推論が要るか) * 許容条件(どこまでの待ち時間やタスク失敗を許せるか) 👀 狙い目は高頻度かつ低 中難易度で、応答時間と精度の許容幅が大きいタスク!! ~ 4
5 Driving AI Adoption Using In-House GPUs to Serve Qwen
💼 Qwenで置き換えたワークロード * 軽量なコーディングタスク (OpenCodeを使ったSub Agentとしての呼び出し) * Claude Codeの実行権限判定 (Qwen3.6 35B-A3B) * ブラウザ自動動作確認/QA (Qwen3.8 27B) 🗓 今後は、社内AI Gateway経由でビジネス側にも展開していく予定
6 Driving AI Adoption Using In-House GPUs to Serve Qwen
例: Qwen3.8 27BとMidscene.jsを使った自動QA * Midscene.jsのChrome拡張を入れてQwen3.8 27Bを呼べるように設定 * localの変更中、dev, stgにデプロイされたらQAが走るように * QA完了したら、チケットに操作中のスクショや動画を自動で添付してレポート 📝 Claude in Chromeだとスクショがトークンを結構消費してしまうので 社内GPU基盤に逃がせるのはでかい!!
Driving AI Adoption Using In-House GPUs to Serve Qwen 3.
Open-weight model inference infrastructure
7 Driving AI Adoption Using In-House GPUs to Serve Qwen
AI推論基盤 on 社内GPU * RTX 6000 Ada 48GB × 4 * GPUサーバー上にk8sを立てている * KubeAIを導入しscale-to-zero (使ってない時はPodを落とす) * 推論基盤はvLLM * Twingate経由でアクセスできるように
8 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8 27Bのデプロイ (1) * Qwen3.8 27B BF16は48GBに乗らない * Tensor Parallel=2 で乗せ切る
9 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8 27Bのデプロイ (2) * TP=2だとGPUを跨ぐので、NUMAを跨が ないようなPod起動が重要 * SHM/directでホスト共有メモリを 中継してコピーする
Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8 27B + DFlash2 (1) * Qwen3.8 27Bを普通に使うと32tok/sほどしか出ない。。。 * Speculative decodingだ!!(最近vLLMでDFlash2がサポートされた) https://inco.ai/blog/d ash2/ fl 10
11 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8 27B + DFlash2 (2) * Speculative decodingが得意とされているコード生成で4.19xのデコード速度 * 採択率の高いタスクならかなり良い!!
12 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8-Flash-Next + FreeToken (1) * Qwen3.8-Flash-Nextも載せたいなぁ。。。 * FreeTokenだ!(*1) (2026/8後半にQwen3.8-Flash-Next対応!) * FreeTokenはGPUのメモリ容量に応じて重みを GPU / ホスト RAM に良い感じに階層配置 してくれる君 *1: https://arxiv.org/abs/2608.16157
13 Driving AI Adoption Using In-House GPUs to Serve Qwen
Qwen3.8-Flash-Next + FreeToken (2) * FreeTokenにちょうどいいサイズのMoEモデル * DeepSeek-V4-Flash-0731との比較でもかなり速い (サイズが違うのは前提として) * MoEキャッシュにexpertが51%乗るのがデカい (DeepSeek-V4-Flash-0731は22%) *1: https://arxiv.org/abs/2608.16157
Driving AI Adoption Using In-House GPUs to Serve Qwen 4.
Conclusion
14 Driving AI Adoption Using In-House GPUs to Serve Qwen
🙌 Qwenと社内GPU基盤でコスト削減に成功 * 個人のQA利用だけでも一日4000円ほど削減できている。 * 社内展開して、全社でのAI利用を後押し。ビジネス職種でも使えるようにAI Gateway整備中 * Qwen3.8 27Bが良すぎる。
15 Driving AI Adoption Using In-House GPUs to Serve Qwen
😫 課題 * 全社員を捌くにはまだスループットが足りない。GPU欲しい。 * Qwen3.8-Flash-Next + FreeTokenがKubeAIに乗らない(FreeTokenをサポートしてない) ので、KubeAIのサポート状況に完全依存している構成をやめるのも一手。
16 Driving AI Adoption Using In-House GPUs to Serve Qwen
📚 社内AI推論基盤について詳しく知りたい方へ * ローカルLLM特集の4章として寄稿してます * QwenによるClaude Code権限判定 * どのタスクをOpen-Weightに流すかを決めるための監視基盤 * スループット計測 * HAMiによるGPU相乗り構成 https://gihyo.jp/magazine/SD/archive/2026/202609
Driving AI Adoption Using In-House GPUs to Serve Qwen Qwen
Meetup Tokyo LayerX Hiromu Nakamura (@po3rin) 2026/09/04