Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Data Is All You Need
Search
Elith
September 07, 2023
Technology
350
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Data Is All You Need
Elith
September 07, 2023
More Decks by Elith
See All by Elith
Elith Company & Recruiting Deck
elith
1
1k
2026.01ウェビナー資料
elith
0
440
株式会社Elith_会社紹介資料
elith
1
660
Gitの使い方とチーム開発
elith
1
180
【W&B ミートアップ#19】AI エージェントは何に使うべきか - エージェント周りの分類の整理と利用すべき場面 -
elith
0
470
【Elith開催】ITSC 2024論文発表ウェビナー
elith
0
96
[ECCV2024読み会] 衛星画像からの地上画像生成
elith
1
1.7k
生成AI グローバルトレンド実務で活かす新規事業構築の5つの方法
elith
0
310
今、知っておきたい! 生成AIエージェントの世界
elith
3
1.2k
Other Decks in Technology
See All in Technology
多層防御と最⼩権限で実現する、安全なAIエージェント設計パターン
lycorptech_jp
PRO
1
220
Deploying a Full-Stack Bun-Native Framework on Cloudflare Workers
7nohe
0
110
深夜のクラウド懺悔室 1:29:300 or 1:0:0
kazzpapa3
0
190
薬剤師(ドメインエキスパート)と一緒に育てる薬局向けAIアシスタント
kakehashi
PRO
2
120
『止めない』を設計する — 制約の中で、事業の根幹を支える判断
hiroyaterui
0
230
AI活用の現在地、 ちゃんと見えてますか?/XPfest-2026
visional_engineering_and_design
0
170
多摩川(.dev)ランニング入門 / Tamagawa.dev#3
fujiwara3
3
410
Where Is JetBrains AI Heading- — Central CLI, Air Alpha, and the Agentic Development Stack
x5gtrn
PRO
0
150
PfEingのアプローチで働こう
rindrics
0
200
Bet AI Day 2026丨AIを「使う」から、AIが「働く」へ ― LayerXが進める「組織AI」の社会実装
layerx
PRO
3
2.8k
AIで開発は速くなったのに、なぜ現場は楽にならないのか 〜あなたの組織のボトルネックを突き止めるワークショップ〜
jacopen
1
280
設計の世代交代を乗り越える、14年続くAndroidアプリの開発戦略
sansantech
PRO
1
150
Featured
See All Featured
Deep Space Network (abreviated)
tonyrice
0
290
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
580
A designer walks into a library…
pauljervisheath
211
25k
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
490
How to Align SEO within the Product Triangle To Get Buy-In & Support - #RIMC
aleyda
2
1.8k
Building Adaptive Systems
keathley
44
3.2k
Avoiding the “Bad Training, Faster” Trap in the Age of AI
tmiket
0
230
YesSQL, Process and Tooling at Scale
rocio
174
15k
Producing Creativity
orderedlist
PRO
348
41k
VelocityConf: Rendering Performance Case Studies
addyosmani
331
25k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
67
58k
Highjacked: Video Game Concept Design
rkendrick25
PRO
1
450
Transcript
Data Is All You Need 株式会社Elith CEO & CTO Koki
Inoue
LLMの学習データ 一般利用可能なオープンソースデータセット • CommonCrawl:3.3TB ◦ Webサイトからアーカイブされた多言語データセット • Colossal Clean Crawled
Corpus(C4):783GB ◦ Googleによりクリーンに処理された CommonCrawlデータセット • Github:328GB ◦ Apach, BSD, MITライセンスで配布されるプロジェクトを対象 • ArXiv:92GB ◦ 170万件のArXiv論文から構成 • Gutenberg , Books3:85GB ◦ Gutenberg:パブリックドメインの電子書籍 (100,000以上のタイトル)から構成 ◦ Book3:197.000冊の電子書籍から • Stack Exchange:78GB ◦ Stack Overflowの質問・回答から構成 2 日本語LLM学習への応用方法 • 和訳 • 日本語テキストだけの利用 ◦ cc-100, mC4等
LIMA: Less Is More for Alignment LIMAは750,000tokensの学習データで良い性能を出した • LIMAはLLaMa 65Bをファインチューニングしたもの
• ドメインの多様性を確保し、高品質なデータを利用 3 合計 1,000例
Textbooks Are All You Need コード生成タスクにおいて、 少量の高品質データ と小さいモデルサイズで高性能モデルが作成できる • ネットで集めたドキュメントがしっかりした高品質データセット
: 6B tokens • GPT-3.5で生成した高品質データセット : 1B tokens程度 • Pythonの演習と回答のデータセット : 180M tokens程度 4
Llama 2: Open Foundation and Fine-Tuned Chat Models 教師あり学習 •
アノテーターに依頼し高品質データ 27,540件を作成し学習(Supervised Fine-Tuning (SFT)) 5
データアノテーション市場 6 • 海外のアノテーション市場は $1,545Mから$13,922M(9倍)まで大きくなる • 日本のアノテーション市場は $73Mから$1,363M(18倍)まで大きくなる
まとめ 性能の良いモデルを作成するためにはデータは不可欠である。 紹介した3つ論文から ①少数の高品質データ、② LLMから生成したデータ を利用することでより性能の良い LLM開発ができる可能性がある。 これからはプレイヤーとして、 LLMのデータアノテーション領域が熱い。 強いLLMプレイヤーはデータアノテーション事業者にもなり得る。
Data Is All You Need。 7