Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
AWS Inferentiaに入門して 徳得を積む
Search
mu7889yoon / Yuta Nakamura
July 08, 2025
Programming
200
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AWS Inferentiaに入門して 徳得を積む
mu7889yoon / Yuta Nakamura
July 08, 2025
More Decks by mu7889yoon / Yuta Nakamura
See All by mu7889yoon / Yuta Nakamura
Terraform標準の組織で AWS CDKをどう使うか
mu7889yoon
1
470
AWS CodeArtifact だいぶディープ
mu7889yoon
0
62
本当の”仕事”を手放せる未来が見えた
mu7889yoon
0
280
今だから言える(?) Q Developer Pro のクレジットが神ってた話
mu7889yoon
0
150
API Gateway→Lambda→AgentCore を再考する
mu7889yoon
0
36
MCPで決済に楽にする
mu7889yoon
1
250
Lambdaを使い倒す
mu7889yoon
0
130
~Everything as Codeを諦めない~ 後からCDK
mu7889yoon
3
1.5k
Stately
mu7889yoon
1
170
Other Decks in Programming
See All in Programming
全PRの83%がAIレビューだけでマージできるようになった開発組織はその後どうなったか
athug
1
1.3k
型も通る、synthも通る、それでも危ない 〜AIのCDKの権限とコストを機械で検証する〜 / It Passes Type Checks, It Passes Synth Checks, but It’s Still Risky — Automatically Verifying Permissions and Costs in AI’s CDK —
seike460
PRO
1
520
Detecting Compromised CI with eBPF and Cilium Tetragon
lizrice
0
120
yield再入門 #phpcon
o0h
PRO
0
920
AI時代に設計が 最大の生産性レバーになる 意図駆動開発とデータを消さない設計|Don't Delete Your Data or Your Intent — Design as the Deepest Lever in the AI Era
tomohisa
1
570
5分で問診!Composer セキュリティ健康診断
codmoninc
0
830
【やさしく解説 設計編・中級 #6】良いアーキテクチャとは ~ 一本の登り道の、行き先 ~
panda728
PRO
0
200
ルールを書いて終わらせないハーネスエンジニアリング
yug1224
4
1.8k
琵琶湖の水は止められてもNet--HTTPのリトライは止められない / You might be able to stop the water flow of Lake Biwa but you can't stop Net::HTTP retries
luccafort
PRO
0
540
その節約、円になってますか?
isamumumu
1
670
改善しないと、タスクが回らない。 “てんこ盛りポジション” を引き継いだ情シスの、入社3ヶ月の業務改善録
krm963
0
250
人間の目はかわらない、だからJPEGは30年もつ
yuzneri
12
18k
Featured
See All Featured
Tell your own story through comics
letsgokoyo
1
1k
The Pragmatic Product Professional
lauravandoore
37
7.4k
Utilizing Notion as your number one productivity tool
mfonobong
4
500
Large-scale JavaScript Application Architecture
addyosmani
515
110k
Reality Check: Gamification 10 Years Later
codingconduct
0
2.2k
The Psychology of Web Performance [Beyond Tellerrand 2023]
tammyeverts
49
3.5k
Building a Modern Day E-commerce SEO Strategy
aleyda
45
9.2k
Google's AI Overviews - The New Search
badams
0
1.1k
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
610
A designer walks into a library…
pauljervisheath
211
24k
Paper Plane
katiecoart
PRO
2
52k
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
72
41k
Transcript
JAWS-UG京都 AWS Summit Japan 2025 re:Cap LT大会 AWS Inferentiaに入門して 徳得を積む
中村 勇太 / mu7889yoon
経歴 2024年3月 大阪電気通信大学 卒業 2024年4月 株式会社シーズ 入社 2025年6月 Japan AWS
Jr. Champions 2025 好きなAWSサービス AWS Step Functions / Amazon Lightsail 中村 勇太 / mu7889yoon 2
AWS Inferentia is… - 低コストで高性能な推論を実現するために、AWSが独自開発したチップ - ざっくり言うとAWSが用意した機械学習モデルの推論の最適解 https://aws.amazon.com/jp/ai/machine-learning/inferentia/
(前までの) AWS Inferentia のイメージ - LLMモデルのアーキテクチャによって制限ありそう - LLMモデルのコンパイル大変そう https://pages.awscloud.com/summit-japan-2025-aws-expo-booth.html#aws-builders-fair
(Builders’ Fair訪問後の) AWS Inferentia のイメージ - LLMモデルのアーキテクチャによって制限ありそう → LlamaForCausalLM、MistralForCausalLMに対応 -
LLMモデルのコンパイル大変そう。 → 非MLエンジニアでもコンパイルできる仕組みを用意している。 → フレームワークによってはより簡単にコンパイル可能
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 - EC2 Infインスタンス利用 1🉐ポイント https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/
EC2 Infでの推論を試す 1. インスタンス起動 2. vLLM + Neuron の Docker
ビルド → 約10分 3. モデルのダウンロード → 約2分(モデル次第) 4. モデルのコンパイル → 約10分(同上) 5. 🎊 Coding Time 🎉 - EC2 Infインスタンス利用 1🉐ポイント https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-amazon-ec2-instances-with -aws-ai-chips/ ここから🉐ポイントの香りがする
得得構成
得得構成 1. インスタンス起動 2. 🎊 Coding Time 🎉 - EC2
Infインスタンス利用 - us-east-1利用 - スポットインスタンス利用 - AMI利用によるDockerビルドのスキップ - AMI利用によるモデルのダウンロード・コンパイルのスキップ 🎊🎊🎊 5🉐ポイント 🎊🎊🎊
まとめ - Builders’ Fair 1を聞いたら 10が返ってくるような濃密な時間が過ごせる - Llama / Mistral
アーキテクチャの推論は、 EC2 Infインスタンスの利用が最適 - Qwenに対応すればよりHAPPY - 量子化モデルの使用は力およばず未検証 → さらに🉐になる可能性 - 専用の推論サーバーを持つ 嬉しさ - 小さいモデルにプログラム書かせるのも楽しい - ホームユースにも夢が広がる
参考ページなど AI チップ - Amazon Inferentia - AWS https://aws.amazon.com/jp/ai/machine-learning/inferentia/ Serving
LLMs using vLLM and Amazon EC2 instances with AWS AI chips https://aws.amazon.com/jp/blogs/machine-learning/serving-llms-using-vllm-and-am azon-ec2-instances-with-aws-ai-chips/ Neuron Community - Vol.2 (7/15 ハイブリット開催) https://aws.amazon.com/startups/events/neuron-community-02 Neuron Calculator — AWS Neuron Documentation (便利) https://awsdocs-neuron.readthedocs-hosted.com/en/latest/general/calculator/neuro n-calculator.html
ありがとうございました 「もっと🉐積めるよ!」があれば懇親会でお話ししましょう!
付録 : 初めの構成 VS 得得構成 共通条件 EC2 Inf2.8xlarge EBS 300
GB Out 100 GB / 月