Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ローカルAITuber勢の現在地と未来
Search
Sald ra
June 06, 2023
Technology
0
430
ローカルAITuber勢の現在地と未来
2023/06/06に開催された「第二回AITuberLT大会 」での登壇資料です。
Sald ra
June 06, 2023
Tweet
Share
More Decks by Sald ra
See All by Sald ra
2024/12/05 AITuber本著者によるAIキャラクター入門 - AITuberの基礎からソフトウェア設計、失敗談まで
sr2mg4
2
650
2023/07/26 - AITuberコミュニティの 開放性と閉鎖性
sr2mg4
1
19
AIキャラについての諸考察
sr2mg4
1
260
2023 AIAD忘年会LT 資料
sr2mg4
0
750
2023/09/23 「AIキャラクターの言動に深みを持たせる」
sr2mg4
2
990
AIキャラクター開発の側面から見る 新機能実装・検証の高速化の必要性
sr2mg4
1
870
Other Decks in Technology
See All in Technology
Wantedly での Datadog 活用事例
bgpat
1
580
オプトインカメラ:UWB測位を応用したオプトイン型のカメラ計測
matthewlujp
0
190
マイクロサービスにおける容易なトランザクション管理に向けて
scalar
0
170
Opcodeを読んでいたら何故かphp-srcを読んでいた話
murashotaro
0
300
サーバーなしでWordPress運用、できますよ。
sogaoh
PRO
0
120
バクラクのドキュメント解析技術と実データにおける課題 / layerx-ccc-winter-2024
shimacos
2
1.1k
10分で学ぶKubernetesコンテナセキュリティ/10min-k8s-container-sec
mochizuki875
3
370
生成AIをより賢く エンジニアのための RAG入門 - Oracle AI Jam Session #20
kutsushitaneko
4
270
宇宙ベンチャーにおける最近の情シス取り組みについて
axelmizu
0
120
GitHub Copilot のテクニック集/GitHub Copilot Techniques
rayuron
38
16k
【re:Invent 2024 アプデ】 Prompt Routing の紹介
champ
0
160
PHP ユーザのための OpenTelemetry 入門 / phpcon2024-opentelemetry
shin1x1
3
1.4k
Featured
See All Featured
[Rails World 2023 - Day 1 Closing Keynote] - The Magic of Rails
eileencodes
33
2k
Practical Orchestrator
shlominoach
186
10k
Stop Working from a Prison Cell
hatefulcrawdad
267
20k
The Web Performance Landscape in 2024 [PerfNow 2024]
tammyeverts
2
290
The Myth of the Modular Monolith - Day 2 Keynote - Rails World 2024
eileencodes
17
2.3k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
169
50k
The Art of Programming - Codeland 2020
erikaheidi
53
13k
Code Review Best Practice
trishagee
65
17k
Thoughts on Productivity
jonyablonski
68
4.4k
Building Flexible Design Systems
yeseniaperezcruz
327
38k
Facilitating Awesome Meetings
lara
50
6.1k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
44
6.9k
Transcript
ローカルAITuber勢 の現在地と未来 Sald_ra(サルドラ) 2023/06/05
自己紹介 サルドラ • Web系出身のエンジニア • AITuber「さくら」開発・運営 • あいちゅーばーわーるど運営 • AITuberLT大会運営
• 「ローカルLLMに向き合う会」会長 • ローカルAITuber勢 • LLM転職者
ローカルAITuber勢とは?
ローカルAITuber勢とは? AIとの応答部分を、OpenAIやRinnaのAPIを用いず自前で用意、 手元のPCで応答させるAITuber勢のこと うちの子である「さくら」はローカルAITuber勢です
メリットとデメリット
一般的に知られている メリットとデメリット メリット • 通信失敗がなく安定している • APIの値段がかからないので、かなり格安で運用できる デメリット • 精度が悪い。会話にならないようなことを話してしまう
• 参入難易度が高い
自分が感じてる メリットとデメリット メリット • 通信失敗がなく安定している • 特定のモデルに依存しない • APIでないので、モデルが手元にあればずっと運用できる デメリット
• 精度が「少し」悪い • 参入難易度が高い • 部屋が暑くなる
「精度」って なんだろう?
AIにおける「精度」ってなんだろう 自分は「あるタスクを達成するための精度」だと考えている 分類や翻訳、生成等… 例えば「ChatGPT」は「自然と感じる回答の生成」がタスク 対話文生成が主な機能だったが、出力結果の情報精度が良すぎて別の使われ方をされている気はする
AITuberの「精度」って なんだろう?
AITuberの「精度」って 「キャラに沿った発言をしてくれること」
AITuberの「精度」 AITuberの「精度」は「キャラに沿った発言をしてくれること」 語尾が「にょ」のAITuberに「お勧めの九州のスポットは?」と聞いたとき、 どっちの方が「精度が良い」だろう? 1. お勧めの九州のスポットは福岡です。昔からある寺院を見に行けます。 2. 最近この辺に来たからよくわからないにょ!今度うさだに聞いておくにょ!
ローカルAITuberの精度について ここ数か月でローカルAITuberの精度は変化している! 課題点はあるが、 一問一答形式であれば問題なく雑談ができるレベルに到達している。 上記ツイートは30億パラメータ(1b-rinna)
精度が良くなったきっかけは? 「ファインチューニング時に食わせたデータの質」が大事! 同じパラメータ数のモデルでも、 データセットの質を上げるだけで一気に精度が上がる。 上記は左がデータセットにこだわる前、右がこだわりだした後 どちらも10億パラメータ これでも本当に「精度は悪い」?
とにかくデータセットが大事
現行の日本語データセットの特徴 日本語のデータセットは少しだけ問題を抱えている • 日本語のデータセットは主に以下の特徴がある ◦ 膨大で汎用的だが、質が凄い高いわけではない ▪ dollyやoasst1 ◦ 高品質だが全てお嬢様による回答になる
▪ OjousamaTalkScriptDataset 「小規模で良いので高品質なデータ」の需要が上がる一方で、 ニュートラルな口調且つ高品質なデータセットがない
ないなら作るしかない
小規模高品質データセット製作PJ 「sakura_dataset」
sakura_dataset(鋭意製作中) • 超小規模(500)データセット • MITライセンスのデータセットをDeepLで翻訳、手動修正 • ニュートラルな口調の回答に統一 • AITuberに最適
sakura_dataset sakura_datasetに加えて100セット程度の台詞データを付け足すと、 AITuber用のデータセットが完成するようになる →気軽にローカルAITuberが作れるように!
結局ローカルAITuber勢の未来は どうなるの?
少なくともお先真っ暗ではない
ただし、もう少し 「自分で」やりたいことを やっていく必要がある
今後とも頑張っていきましょう