Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
データベース15: ビッグデータ時代のデータベース
Search
Y. Yamamoto
PRO
July 27, 2026
Science
470
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
データベース15: ビッグデータ時代のデータベース
1. ビッグデータの特徴
2. NoSQL
講義ノートURL
https://dbnote.hontolab.org/content/nosql/01.html
Y. Yamamoto
PRO
July 27, 2026
More Decks by Y. Yamamoto
See All by Y. Yamamoto
データベース14: B+木 & ハッシュ索引
trycycle
PRO
0
720
データベース12: 正規化(2/2) - データ従属性に基づく正規化
trycycle
PRO
0
1.5k
データベース11: 正規化(1/2) - 望ましくない関係スキーマ
trycycle
PRO
0
1.4k
データベース10: 拡張実体関連モデル
trycycle
PRO
0
1.4k
データベース09: 実体関連モデル上の一貫性制約
trycycle
PRO
0
1.6k
機械学習 - ニューラルネットワーク入門
trycycle
PRO
0
1.1k
データベース08: 実体関連モデルとは?
trycycle
PRO
0
1.5k
機械学習 - SVM
trycycle
PRO
2
1.2k
機械学習 - K近傍法 & 機械学習のお作法
trycycle
PRO
1
1.6k
Other Decks in Science
See All in Science
(2025) Balade en cyclotomie
mansuy
0
650
1. CPC理論の展開と集合的知能モデル(JSAI2026 KS-27 集合的予測符号化と新たな知性の時代)
hayashiyus884
1
300
プロジェクト「Azayaka」のSARの数式とジオメトリ
syuchimu
0
380
「念のためのログ保存」を組織全体でやめるためのポリシーと仕組み作り
i2tsuki
4
310
摂理と合理の肉体改造 — AI時代の減量を支える観測・制御・継続
kiyoshi
0
740
先端因果推論特別研究チームの研究構想と 人間とAIが協働する自律因果探索の展望
sshimizu2006
3
960
明治薬科大学講義_ビッグデータ解析を支えるデータベース技術とクラウドコンピューティング
ktatsuya
1
130
因果推論と機械学習
sshimizu2006
1
1.2k
Conversation is the New Dashboard: 属人性を排除する第4世代BIツールの勢力図
shomaekawa
1
610
Bリーグのショットデータを活用した得点期待値モデルの構築 / Construction of expected points model using shot data of B.LEAGUE
konakalab
0
160
Non-Gaussian, nonlinear causal discovery with hidden variables and application
sshimizu2006
0
160
Van Dare naar Durf
voginip
0
260
Featured
See All Featured
A designer walks into a library…
pauljervisheath
211
24k
Building a Scalable Design System with Sketch
lauravandoore
463
34k
Designing for humans not robots
tammielis
254
26k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
55
3.4k
Done Done
chrislema
186
16k
Leo the Paperboy
mayatellez
8
1.9k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
420
Data-driven link building: lessons from a $708K investment (BrightonSEO talk)
szymonslowik
1
1.2k
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.2k
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
2.9k
Mobile First: as difficult as doing things right
swwweet
225
10k
Pawsitive SEO: Lessons from My Dog (and Many Mistakes) on Thriving as a Consultant in the Age of AI
davidcarrasco
0
190
Transcript
NoSQL ⼭本 祐輔 名古屋市⽴⼤学 データサイエンス研究科
[email protected]
第15回 データベース 〜 ビッグデータ時代のデータベース
講義ノート https://bit.ly/3xqTSds
関係データベース ⼤規模データを 正しく適切に管理・処理 どこまで大規模なデータに耐えられる?
情報爆発 → ビッグデータ時代の到来
1秒間に⽣成されるソーシャルメディア数 出典: https://spectralplex.com/how-much-content-is-uploaded-to-the-internet-per-second/ X (旧Twitter) Instagram 5800 件/秒 1100 件/秒
Snapchat 35,000 件/秒 750,000 件/秒 WhatsApp 銀⾏取引 in ⽇本 (= 675万件/⽇) https://www.zenginkyo.or.jp/abstract/efforts/system/zengin-system 78.1件/秒
単に巨大なデータ ビッグデータ ≠
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの量 1GB x 1 = 1GB 1KB x 1,000,000 =
1GB … データ集合(集団)の特徴を捉えるには 量(数)がより重要 < データ集合に 関する情報量
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの多様性 … データが多様でないと データ集合から多様な価値を取り出せない < 価値の多様性 …
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの発⽣速度(頻度) ある時期のこと しか分からない データの発生頻度が高いと、データ集合の 特徴を時間的な解像度を高く捉えられる < 時間 時間 時間を考慮して, 集団の特徴を捉えられる
有⽤度 (⻑期的な視点,季節要因,リアルタイム性)
ビックデータの特徴 High Volume High Velocity High Variety データの量が圧倒的に多い データの発生頻度が大きい データの発生源/種類が多様
ビッグデータを扱うサービスでは、データの厳密な⼀貫性 よりも⾼速にデータを処理し結果を返すことが優先される 関係データベースでは 対応が難しい… データの⼀貫性に拘る
関係データベースとNoSQL 関係 データベース NoSQL ◦ データの正しさを厳密に管理 × 超⼤規模データを扱うのは困難 × 正しさの管理をある程度諦める
◦ ⼤規模・多様なデータを ⾼速・柔軟に処理 ▲ 性能向上は スケールアップで対応 ◦ 性能向上は スケールアウトで対応
システムを物理的に性能向上させる⽅法 スケールアップ スケールアウト 計算機のスペックを強化 計算機の台数を増やす CPUなど 強化 計算機を 増やす ◦
⼿間が少ない × 性能向上に限度あり × ダウンタイムがある ◦ 性能アップの上限がない × ダウンタイムがない × 分散処理が前提になる
関係データベースとNoSQL 関係 データベース NoSQL ◦ データの正しさを厳密に管理 × 超⼤規模データを扱うのは困難 × 正しさの管理をある程度諦める
◦ ⼤規模・多様なデータを ⾼速・柔軟に処理 相互補完的 RDBとNoSQLはケースに応じて使い分けるべき ▲ 性能向上は スケールアップで対応 ◦ 性能向上は スケールアウトで対応 ビッグデータ対応はNoSQLの⽅が向いている
様々なNoSQLデータベース key 1 2 key 1 2 key 1 2
{ “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, } } { “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, } } キー・ バリュー型 列指向 ドキュメント 指向 グラフ 複雑なデータを表現 ⾼速なデータ処理
キー・バリュー型データベース Key Value user_xxxx {address: 瑞穂区, age: 22} user_yyyy {address:
昭和区, age: 18} user_zzz {age: 29} product_xxx {price: 250} … § 重複のない「キー」と値「バリュー」のペアを格納 § データに厳密な制約を設けない § キー値に対応するバリューを受け取ることに特化 § データ構造の単純化によりデータ処理を超⾼速化
列指向データベース Key Value cxxx0001 cxxx0002 cxxx0003 … 書籍名 データベース入門 出版日
2009/05 価格 2200 タイトル はじめての機械学習 出版日 2015/05 著者 北 千種 価格 2500 著者 山畑 滝子 川澄 桜 タイトル データベース講義 出版日 2024/04 価格 xxx 著者 姓 名 山本 祐輔 カラムファミリー カラムファミリー内には カラムを⾃由に設定できる § キー・バリュー型DBの拡張 § バリューの中にキー・バリュー構造のデータを保持 § データ構造を柔軟化しつつ、データ処理を超⾼速化
ドキュメント指向データベース § XMLやJSONなどの⽊構造のデータを管理 § データ追加時にデータ構造を柔軟に変更可能 (多様なデータに対応できる) <students> <student> <name>⼭畑 滝⼦</name>
<birthdate>2003/12/01</birthdate> <gender>⼥</gender> <department>経済学部</department> </student> <student> <name> <family_name>川澄</family_name> <first_name>桜</first_name> </name> <birthdate>2001/07/07</birthdate> <gender>⼥</gender> <department>医学部</department> <scholarships> <scholarship> <name>YASSO</name> <registered_at> 2023/05/01</resgistered_at> </scholarship> </scholarships> </student> </students> { “students”: [ “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, “department”: “経済学部” }, “student”: { “name”: { “family_name”: “川澄”, “first_name”: “桜” }, “birthdate”: 2001/07/07”, “gender”: “⼥”, “department”: “医学部”, “scholarship”: [ “scholarship”: { “name”: “YASSO”, “registered_at”: “2023/05/01” } ] ] } XMLドキュメント JSONドキュメント
グラフデータベース § あらゆるデータをグラフ構造で管理 § エンティティ間にある多様な関係の表現に最適 § グラフ探索アルゴリズムで複雑な問合せも⾼速に処理 愛知県 名古屋 南京
トリノ シドニー 県庁所在地 姉妹都市 姉妹都市 姉妹都市 ⽇本 県 ラグランジュ アボガドロ 出⾝ 出⾝ 物理 専⾨ 専⾨ 数学 名古屋 ⼤学 国⽴⼤学 ⼩林誠 出⾝校 専⾨