Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
自分で立ててみるLLMサービス
Search
Sponsored
·
Ship Features Fearlessly
Turn features on and off without deploys. Used by thousands of Ruby developers.
→
世良泰明
October 05, 2026
Technology
110
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
自分で立ててみるLLMサービス
2026/10/5 さくらの夕べ 地域コミュニティナイト - 小江戸らぐ & LOCAL編 -
世良泰明
October 05, 2026
More Decks by 世良泰明
See All by 世良泰明
Jetson Orin Nanoとk3sとローカルLLMで音声文字起こしシステム作ってみた
y_sera15
0
77
ホームラボ紹介
y_sera15
0
310
Serendie Design Systemを使ってWebアプリケーションを開発してみた
y_sera15
0
170
Kubernetesの公式ドキュメントを翻訳してみた
y_sera15
0
82
ラズパイ奮闘記 その1
y_sera15
0
83
metrics-serverをセキュアなTLSでデプロイしてみた
y_sera15
0
720
EKS勉強会
y_sera15
1
190
自宅k8s構築日記 冬休み編
y_sera15
0
330
自宅k8sクラスター構築日記
y_sera15
0
280
Other Decks in Technology
See All in Technology
Databricksメトリクスビューはじめてのもくもく会
taka_aki
0
200
Google Cloud Next Tokyo 26登壇時のスクリプト
recruitengineers
PRO
0
200
HolmesGPTで始めるSREエージェント入門!プラットフォームの障害調査はAIにお任せ 〜
leveragestech
PRO
0
150
Snapshot Testing in Practice: Predictable and Reliable SwiftUI Views
fespinoza
0
120
Lambda MicroVMsが分からなすぎたので使い所を1から考えてみた
tsukuboshi
2
390
使いこなすために知っておきたい Azure SRE Agent アンチパターン
torumakabe
2
350
IoTデバイスを繋げるプロトコルMatterをAndroidで使用する方法
harutiro
0
120
オンラインゲームのシステム全体像 - コロプラ 2026年度 新卒研修
colopl
0
570
いちAWSエンジニアのAI活用を振り返る #devio2026 / devio osaka 2026 kawahara
masahirokawahara
2
380
Incremental HTTP
kazuho
5
2k
個別開発で終わらせない。 現場の課題をプロダクトの強さに変える StockmarkのFDE
ktkrhr
0
590
[AWS 秋のクラウドオペレーション祭り 2026]AWS DevOps Agentで変わるリリースと運用対応 ~リリース管理機能と Directed actions のご紹介~
furuton
2
870
Featured
See All Featured
WCS-LA-2024
lcolladotor
0
840
SEOcharity - Dark patterns in SEO and UX: How to avoid them and build a more ethical web
sarafernandez
0
300
Prompt Engineering for Job Search
mfonobong
0
480
How to Grow Your eCommerce with AI & Automation
katarinadahlin
PRO
2
310
Measuring & Analyzing Core Web Vitals
bluesmoon
9
1k
Why Your Marketing Sucks and What You Can Do About It - Sophie Logan
marketingsoph
0
420
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
74
42k
Ethics towards AI in product and experience design
skipperchong
2
410
A designer walks into a library…
pauljervisheath
211
25k
Are puppies a ranking factor?
jonoalderson
2
4k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
510
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
133
20k
Transcript
自分で触って立ててみるLLMサービス 2026/10/5 さくらの夕べ 地域コミュニティナイト - 小江戸らぐ&LOCAL編 世良泰明
自己紹介 名前: 世良泰明(せら やすあき) 職業: インフラエンジニア(?) k8sを使って開発するお仕事 某製造業@横浜 社会人6年目 参加コミュニティ:
- 小江戸らぐ - クラウドネイティブ界隈など twitter: @y_sera15 自宅K8sクラスター Intel NUC 3台 + Synology NAS
小江戸らぐ 20年続くLinuxユーザーコミュニティ - 月1のオンライン勉強会(たまにオフも) - OSS, Linuxなどテーマ自由で 各々の最近の取り組みを共有 - 次回は10/10(土)
14:00~ さくらインターネットさんには サーバーをお借りしてお世話になってます
今日のお話 • LLMを自分で動かしてみるお話 • AIサービスについて • 構成要素 • 高火力DOKを使ったAIコーディングの仕組み構築
質問 みなさん、AI使ってますか? - Chat GPT - Google Gemini - Github
Copilot - Claude Code - jev - dots などなど...
質問 みなさん、AI使ってますか? - Chat GPT - Google Gemini - Github
Copilot - Claude Code - jev - dots などなど... これらはあくまで「サービス」なので、エンジニアなら中の仕組みは知っておきたい
AIサービスの仕組み AIサービス PC AIチャット インターネット LLMモデル 周辺サービス AIコーディング 推論エンジン HW(GPU等
) チャットログ管理 インターネット検索 webUI などなど 本来のAIの仕組みと、サービスがやってくれていることの境目が分からなくなりがち → ローカルLLMなら自分で組み立てられる
推論エンジン LLMを動かすソフトウェア PC やっていること AIチャット - 推論処理 - キャッシュ管理 -
API提供(OpenAI互換) インターネット 代表的なOSS AIコーディング - vLLM - サーバー向け - 並列処理が可能 - (まともに動かすなら)GPU必須 AIサービス LLMモデル 周辺サービス 推論エンジン HW(GPU等 ) チャットログ管理 インターネット検索 webUI などなど - llama.cpp - 小規模環境向け - CPUだけでも動く - 入門はOllamaかLLM Stdio越し - その他最近話題のもの(一部モデルのみ対応) - Strata: 一般PC向け - Tensorfold: DGX SparkとMacに特化 モデルを動かすにはそれなりの計算リソースが必要 → 特に、GPUのメモリ(VRAMが鍵)
LLMモデル AIの本体 PC 実体はただの数値パラメータの集まり - オープンなモデル: Huggingfaceで公開 AIチャット - パラメータ数:
数十億(1B)~数千億(100B) インターネット - (※↑一般人が手に届く範囲ではの話) - (ざっくり)1B ≒ 1GBのメモリ/VRAM必要 AIサービス LLMモデル 周辺サービス - 提供形態: - safetensor: vLLM(等)向け AIコーディング - gguf: llama.cpp系向け 推論エンジン 代表的なモデル - Gemma4 シリーズ(2B~31B) HW(GPU等 ) - 2026/4にGoogleがリリース - 複数のサイズが提供されている - 日本語がしっかりしてる - Qwen3.x シリーズ - アリババが提供 - 最新の3.8は2026/8にリリース - コーディングが得意 チャットログ管理 インターネット検索 webUI などなど モデルを動かすにはそれなりの計算リソースが必要 → 特に、GPUのメモリ(VRAMが鍵)
我が家の参考例 VSCode + Cline(拡張機能) Qwen3.8 27B NVFP4 - vLLMのAPIエンドポイントを指定 PC
- チャットで指示してローカルでコード生成 - AIサービス LLMモデル AIコーディング 自宅NW vLLM - 推論エンジン HW(GPU等) → そんなあなたにちょうど良いサービスが... コンテナで稼働させている HWに合わせてNvidia GPU用 のものを選択 APIエンドポイントが 立ち上がる DGX Spark - 128GBユニファイドメモリ - そんなリッチな環境無いから私には無理かも...? 2026/8に出たモデル コーディング目的で使用 有効桁を落とした(量子化した) モデルを使用 → サイズ/処理速度に影響 (GPUに100GB程割当て可能) CPU: arm64 GPU: Nvidia blackwell
さくらの高火力DOK リッチなGPUを積んだコンテナが使い放題(従量課金) H100プランの場合 - 料金: 1000円/1h - スペック: VRAM80GB, メモリ192GB
- 初めての人は3000円分のクレジット付き ※ 一部界隈でV100が流行っているようですが, V100は古いGPUのため生成AI向きでは無いので 今回は見なかったことにします (さくらのサービスとしてもV100プランは2027年に廃止予定)
使い方 1. さくらインターネットに登録・サインイン 2. hugging faceのアカウント・認証トークン作成 3. Dockerhubでアクセストークンの作成 4. 高火力DOKでコンテナ起動
5. ローカルからアクセス 今回は、 - モデル: unsloth/Qwen3.8-27B-NVFP4 - 推論エンジン: vLLM - 活用方法: AIコーディング(VSCode + Cline) で実施する流れを紹介
アクセストークンの作成(Hugging Face) Hugging Face 1. アカウントを作成 2. アカウント設定画面の Access Tokens
-> Create new tokenをクリック 3. Token Type: Readとして作成 4. トークンを控える
アクセストークンの作成 DockerHub 1. アカウントを作成 2. アカウント設定画面の Personal Access Tokens ->
Generate new tokenをクリック 3. Token Type: Readとして作成 4. トークンを控える
コンテナレジストリの認証情報の登録 高火力DOKのレジストリー認証情報の画面で Dockerhubの認証情報を登録 レジストリ認証情報設定後 ホスト名: docker.io ユーザー名: <dockerhubに登録したユーザー名> パスワード: <先程取得したアクセストークン>
コンテナのデプロイ タスクの画面から、コンテナをデプロイ イメージ: vllm/vllm-openai:v0.31.0-ubuntu2404 HTTPポート: 8000 起動直後のログ レジストリ認証情報: <先程登録したDockerhubのもの> プラン:
H100(80GB) 最大時間: 1h 環境変数: - HF_TOKEN: <HuggingFaceのトークン> - コマンド(以下改行消して入力): unsloth/Qwen3.8-27B-NVFP4 --enable-auto-tool-choice --tool-call-parser=qwen3_coder --reasoning-parser=qwen3 --max-model-len=262144 --speculative-config='{"method": "mtp", "num_speculative_tokens": 3}' --enable-prefix-caching --trust-remote-code --max-num-seqs=8 起動直後にモデルのダウンロード& vLLMは最初にVRAMへモデルを展開するため起動に時間がかかる
コンテナのデプロイ しばらく待って、ログに Info: Application startup complete と表示されたら準備完了
疎通確認 一旦ここまでで疎通確認 以下コマンドを実施 curl –s <URL>/v1/models | jq OpenAI互換のAPIにて、 モデル一覧が取得できる
(今回だとunsloth/Qwen3.8-27B-NVFP4)
VSCodeの設定 1. VSCodeにて、Clineという拡張機能を追加 2. バックエンドのAIを設定 API Provider: OpenAI Compatible Base
URL: <前述のURL>/v1 Model ID: unsloth/Qwen3.8-27B-NVFP4
AIコーディング Clineの拡張機能のチャット欄から、やって欲しいことを入力 → コードが主力される
AIコーディング Clineの拡張機能のチャット欄から、やって欲しいことを入力 → コードが主力される 画像の例は簡単なタスクだが、 Claudeとかと同じくらい しっかり働いてくれる
まとめ AIサービスの仕組みを知るべく、モデルを自分でデプロイする流れを紹介 AIサービス PC AIチャット インターネット LLMモデル 周辺サービス AIコーディング 推論エンジン
HW(GPU等 ) チャットログ管理 インターネット検索 webUI などなど LLMモデルや推論エンジン、コーディングツールをいろいろ差し替えてみたりすると楽しいです