Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
deeplakeによる大規模データのバージョン管理と深層学習フレームワークとの接続
Search
Ringa_hyj
December 31, 2024
Technology
110
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
deeplakeによる大規模データのバージョン管理と深層学習フレームワークとの接続
Ringa_hyj
December 31, 2024
More Decks by Ringa_hyj
See All by Ringa_hyj
DVCによるデータバージョン管理
ringa_hyj
0
400
Hydraを使った設定ファイル管理とoptunaプラグインでのパラメータ探索
ringa_hyj
0
230
ClearMLで行うAIプロジェクトの管理(レポート,最適化,再現,デプロイ,オーケストレーション)
ringa_hyj
0
260
Catching up with the tidymodels.[Japan.R 2021 LT]
ringa_hyj
3
880
多次元尺度法MDS
ringa_hyj
0
400
因子分析(仮)
ringa_hyj
0
210
階層、非階層クラスタリング
ringa_hyj
0
160
tidymodels紹介「モデリング過程料理で表現できる説」
ringa_hyj
0
680
深層学習をつかった画像スタイル変換の話と今までの歴史
ringa_hyj
0
500
Other Decks in Technology
See All in Technology
次世代ランサムウェア対策の考察 / 20260704 Mitsutoshi Matsuo
shift_evolve
PRO
5
1.7k
生成AI活用によるODC欠陥分析の分類高速化の実践と導入効果 / 20260703 Suguru Ishii
shift_evolve
PRO
2
100
依頼文化をやめる日 EM視点で語るPlatform EngineeringとInclusive SRE / Discussing Platform Engineering and Inclusive SRE from an EM's Perspective
shin1988
4
3.4k
攻撃者がいなくてもAIエージェントはインシデントを起こす
nomizone
0
200
“全部コピーしない”ファイルデータの活用 : — FSx for ONTAP × S3 Tables × Icebergで作るメタデータカタログ
yoshiki0705
0
520
記録をかんたんに、提案をパーソナルに ── AIであすけんが目指すもの
oprstchn
0
170
NDIAS CTF 2026 問題解説会資料
bata_24
0
180
スタートアップにおけるアジャイルの実践について #shibuyagile
murabayashi
3
2.1k
Oracle Exadata Database Service on Cloud@Customer X11M (ExaDB-C@C) サービス概要
oracle4engineer
PRO
2
8.3k
知らん間に、回ってる
ming_ayami
0
270
Compose 新機能総まとめ / What's New in Jetpack Compose
yanzm
0
140
AIDLC_ヤフーショッピングの取り組み
lycorptech_jp
PRO
0
550
Featured
See All Featured
Bioeconomy Workshop: Dr. Julius Ecuru, Opportunities for a Bioeconomy in West Africa
akademiya2063
PRO
1
170
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
Between Models and Reality
mayunak
4
360
Technical Leadership for Architectural Decision Making
baasie
3
430
Thoughts on Productivity
jonyablonski
76
5.2k
The Illustrated Guide to Node.js - THAT Conference 2024
reverentgeek
1
410
Public Speaking Without Barfing On Your Shoes - THAT 2023
reverentgeek
1
450
For a Future-Friendly Web
brad_frost
183
10k
WENDY [Excerpt]
tessaabrams
11
38k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
630
Getting science done with accelerated Python computing platforms
jacobtomlinson
2
250
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
35
2.5k
Transcript
紹介 1/3 deeplakeの目的は・・・ AIプロジェクトを効率化するデータ管理プラットフォーム こんな経験はありませんか? • 大規模な動画/画像/テキストデータセットのバージョン管理に時間を費やしている • データセットをローカルにダウンロードする必要があり、開発着手まで時間が必要 •
チーム間で共有する際、フォーマットの統一や整合性の確保に手間がかかる • 異なるMLフレームワーク間でデータセットを移行する際に変換作業が必要になる はじめに
紹介 2/3 • Local • Deep Lake Storage • AWS
S3 • Microsoft Azure • Google Cloud import deeplake deeplake.ingest_classification() deeplake.ingest_coco() deeplake.ingest_yolo() deeplake.ingest_kaggle() deeplake.ingest_dataframe() deeplake.ingest_huggingface() import deeplake ds = deeplake.empty('./dataset_local') ds.create_tensor('images', htype='image’, sample_compression='jpeg') ds.append(....) ds.commit() import deeplake ds = deeplake.deepcopy(src_dataset_path, dest_dataset_path) ds = deeplake.load('./my_dataset_path') • 定型フォーマットを関数で読み込むことが可能 • 作成したデータは様々な保存先に接続することが可能 定型フォーマット データ作成 up/down load データセット作成
紹介 3/3 • 公開されている様々なデータセットを簡単に利用可能 • pytorch, tensorflowのデータセットとして読み込み、即座に訓練が可能 • 大規模なデータをすべて読み込むのでなく部分的に読み込み訓練に使用するこ とが可能なためメモリを圧迫しない
※LLMフレームワーク(LlamaIndex, LangChain)や物体検知(MMDetection)等のオープンソースパッケージとのシームレスな接続も可能 import deeplake ds = deeplake.deepcopy(src_dataset_path, dest_dataset_path) ds = deeplake.load('./my_dataset_path') train_loader = ds.pytorch(num_workers = 8, transform = transform, batch_size = 32, tensors=['images', 'labels'], shuffle = True) train_loader = ds.tensorflow(...) 深層学習フレームワークとの接続