Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ローカルAITuber勢の現在地と未来
Search
Sald ra
June 06, 2023
Technology
0
410
ローカルAITuber勢の現在地と未来
2023/06/06に開催された「第二回AITuberLT大会 」での登壇資料です。
Sald ra
June 06, 2023
Tweet
Share
More Decks by Sald ra
See All by Sald ra
AIキャラについての諸考察
sr2mg4
1
240
2023 AIAD忘年会LT 資料
sr2mg4
0
650
2023/09/23 「AIキャラクターの言動に深みを持たせる」
sr2mg4
2
970
AIキャラクター開発の側面から見る 新機能実装・検証の高速化の必要性
sr2mg4
1
850
Other Decks in Technology
See All in Technology
テクニカルライターのチームで「目標」をどう決めたか / MVV for a Team of Technical Writers
lycorptech_jp
PRO
3
140
プロダクト開発の貢献をアピールするための目標設計や認知活動 / Goal design and recognition activities to promote product development contributions.
oomatomo
5
1k
Microsoft 365 でデータセキュリティを強化しよう
sophiakunii
2
410
令和最新版 Perlコーディングガイド
anatofuz
5
4.2k
Databricks Appのご紹介
databricksjapan
0
500
Kubernetes Meetup Tokyo #67 - KEP-3619: Fine-grained SupplementalGroups Control / k8sjp67-kep-3619
everpeace
0
290
シェルとPerlの使い分け、 そういった思考の道具は、どこから来て、どこへゆくのか?v1.1.0
fmlorg
0
660
今日から始める技術的負債の解消
leveragestech
3
400
塩野義製薬様のAWS統合管理戦略:Organizations設計と運用の具体例
tkikuchi
0
270
Qdrant を用いた検索改善施策の紹介 / Search Engineering Tech Talk 2024 Summer
visional_engineering_and_design
2
260
Perlで始めるeBPF: 自作Loaderの作り方 / Getting started with eBPF in Perl_How to create your own Loader
takehaya
1
1.1k
今こそ変化対応力を向上させるとき 〜ログラスが FAST に挑戦する理由〜 / Why Loglass is Talking on the Challenge of Agile Framework FAST
shioyang
0
240
Featured
See All Featured
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
46
2.1k
No one is an island. Learnings from fostering a developers community.
thoeni
19
2.9k
Code Review Best Practice
trishagee
63
17k
YesSQL, Process and Tooling at Scale
rocio
167
14k
The MySQL Ecosystem @ GitHub 2015
samlambert
250
12k
Optimising Largest Contentful Paint
csswizardry
31
2.8k
Building Applications with DynamoDB
mza
90
6k
Agile that works and the tools we love
rasmusluckow
327
21k
VelocityConf: Rendering Performance Case Studies
addyosmani
325
23k
Facilitating Awesome Meetings
lara
49
6k
Web Components: a chance to create the future
zenorocha
310
42k
Writing Fast Ruby
sferik
626
60k
Transcript
ローカルAITuber勢 の現在地と未来 Sald_ra(サルドラ) 2023/06/05
自己紹介 サルドラ • Web系出身のエンジニア • AITuber「さくら」開発・運営 • あいちゅーばーわーるど運営 • AITuberLT大会運営
• 「ローカルLLMに向き合う会」会長 • ローカルAITuber勢 • LLM転職者
ローカルAITuber勢とは?
ローカルAITuber勢とは? AIとの応答部分を、OpenAIやRinnaのAPIを用いず自前で用意、 手元のPCで応答させるAITuber勢のこと うちの子である「さくら」はローカルAITuber勢です
メリットとデメリット
一般的に知られている メリットとデメリット メリット • 通信失敗がなく安定している • APIの値段がかからないので、かなり格安で運用できる デメリット • 精度が悪い。会話にならないようなことを話してしまう
• 参入難易度が高い
自分が感じてる メリットとデメリット メリット • 通信失敗がなく安定している • 特定のモデルに依存しない • APIでないので、モデルが手元にあればずっと運用できる デメリット
• 精度が「少し」悪い • 参入難易度が高い • 部屋が暑くなる
「精度」って なんだろう?
AIにおける「精度」ってなんだろう 自分は「あるタスクを達成するための精度」だと考えている 分類や翻訳、生成等… 例えば「ChatGPT」は「自然と感じる回答の生成」がタスク 対話文生成が主な機能だったが、出力結果の情報精度が良すぎて別の使われ方をされている気はする
AITuberの「精度」って なんだろう?
AITuberの「精度」って 「キャラに沿った発言をしてくれること」
AITuberの「精度」 AITuberの「精度」は「キャラに沿った発言をしてくれること」 語尾が「にょ」のAITuberに「お勧めの九州のスポットは?」と聞いたとき、 どっちの方が「精度が良い」だろう? 1. お勧めの九州のスポットは福岡です。昔からある寺院を見に行けます。 2. 最近この辺に来たからよくわからないにょ!今度うさだに聞いておくにょ!
ローカルAITuberの精度について ここ数か月でローカルAITuberの精度は変化している! 課題点はあるが、 一問一答形式であれば問題なく雑談ができるレベルに到達している。 上記ツイートは30億パラメータ(1b-rinna)
精度が良くなったきっかけは? 「ファインチューニング時に食わせたデータの質」が大事! 同じパラメータ数のモデルでも、 データセットの質を上げるだけで一気に精度が上がる。 上記は左がデータセットにこだわる前、右がこだわりだした後 どちらも10億パラメータ これでも本当に「精度は悪い」?
とにかくデータセットが大事
現行の日本語データセットの特徴 日本語のデータセットは少しだけ問題を抱えている • 日本語のデータセットは主に以下の特徴がある ◦ 膨大で汎用的だが、質が凄い高いわけではない ▪ dollyやoasst1 ◦ 高品質だが全てお嬢様による回答になる
▪ OjousamaTalkScriptDataset 「小規模で良いので高品質なデータ」の需要が上がる一方で、 ニュートラルな口調且つ高品質なデータセットがない
ないなら作るしかない
小規模高品質データセット製作PJ 「sakura_dataset」
sakura_dataset(鋭意製作中) • 超小規模(500)データセット • MITライセンスのデータセットをDeepLで翻訳、手動修正 • ニュートラルな口調の回答に統一 • AITuberに最適
sakura_dataset sakura_datasetに加えて100セット程度の台詞データを付け足すと、 AITuber用のデータセットが完成するようになる →気軽にローカルAITuberが作れるように!
結局ローカルAITuber勢の未来は どうなるの?
少なくともお先真っ暗ではない
ただし、もう少し 「自分で」やりたいことを やっていく必要がある
今後とも頑張っていきましょう