Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
音声B紹介ポスター@音響学会ビギナーズセミナー
Search
Sponsored
·
Ship Features Fearlessly
Turn features on and off without deploys. Used by thousands of Ruby developers.
→
Taiki Nakamura
March 08, 2022
Technology
510
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
音声B紹介ポスター@音響学会ビギナーズセミナー
Taiki Nakamura
March 08, 2022
More Decks by Taiki Nakamura
See All by Taiki Nakamura
【ICASSP2024】音声変換に関する全論文まとめ【Parakeet株式会社】
supikiti
0
1k
研究会発表資料.pdf
supikiti
4
810
DDPM解説スライド.pdf
supikiti
0
4.7k
Hydra, MLflow, Optunaの組み合わせで手軽に始めるハイパーパラメータ管理
supikiti
7
4.3k
hydra-mlflow-optuna
supikiti
4
7.5k
Interspeech2020_読み会_nakamura
supikiti
0
710
Other Decks in Technology
See All in Technology
【CEDEC2026】ゲームシナリオライターを支援するAIツール開発の実践 ― 設計とプロンプトの工夫 ―
cygames
PRO
1
840
Data Hubグループ 紹介資料
sansan33
PRO
0
3.2k
AIペネトレーションテスト・ セキュリティ検証「AgenticSec」紹介資料
laysakura
2
9k
JavaScript 研修 (2026)
recruitengineers
PRO
2
540
強化学習「理論」入門
enakai00
3
3.6k
『三匹の子ぶた』から学ぶネットワークセキュリティの昔と今 / Network Security: Then and Now Through the Lens of The Three Little Pigs
nttcom
1
2.9k
同じWAFが、攻撃の“形”は弾く── 正当な“形”の不正は通す
kuroneko13
0
190
モバイルアプリ開発概論2026
recruitengineers
PRO
5
590
サイバー捜査員研修(後半)
nomizone
1
870
[ChatGPT Work LT]事務作業が苦手な人のための バックオフィスの「半」自動化
chimaki_iot
0
280
今こそ聞きたいソフトウェア設計 ドメイン駆動設計再入門
masuda220
PRO
17
7.3k
え?フロントエンドエンジニアの ワイがインフラも!?
puku0x
1
570
Featured
See All Featured
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
990
SEO for Brand Visibility & Recognition
aleyda
0
4.7k
Designing Dashboards & Data Visualisations in Web Apps
destraynor
232
55k
How to Think Like a Performance Engineer
csswizardry
28
2.7k
A Modern Web Designer's Workflow
chriscoyier
698
190k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
YesSQL, Process and Tooling at Scale
rocio
174
15k
The Director’s Chair: Orchestrating AI for Truly Effective Learning
tmiket
1
270
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
16k
Tell your own story through comics
letsgokoyo
1
1k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
460
End of SEO as We Know It (SMX Advanced Version)
ipullrank
3
4.4k
Transcript
音声B 分野紹介 東大院・情報理工 中村泰貴
音声B(音声合成・音声変換) ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 1 音声合成とは 音声を人工的に作り出す技術
音声合成に関する代表的な研究範囲 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 2 どんな情報からどんな音声を生成するかで分野が細分化 テキスト音声合成(Text-to-Speech: TTS) 音声変換(Voice Conversion: VC)
歌声合成(Singing Voice Synthesis) マルチモーダル音声合成 こんにちは TTS VC 合成モデル 歌詞 + 合成モデル こんにちは 口唇情報に基づく音声合成(Lip-to-Speech) 合成モデル 唇の動き 脳波信号に基づく音声合成(EEG-to-Speech) 合成モデル
音声の持つ情報 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 3 パラ言語情報 話し手が意図的に付与するテキスト化できない情報(感情等) 言語情報 何を話しているかといったテキスト化できる情報 非言語情報 非意図的に付与されるテキスト化できない情報(声質等)
音声変換では入力された音声のこれらの一部を変換する技術
音声変換の代表的な研究範囲 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 4 声質変換(名探偵コナンの蝶ネクタイ型変成器) 非言語情報(声質など)のみを変換 感情変換 パラ言語情報(感情など)のみを変換 音韻変換 言語情報(発言内容)のみを変換
/i/ /u/
音声合成に関するサービス/製品 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 5 テキスト音声合成 [1] 音声変換 [2] 歌声合成 [3]
[1] Coefont 社 homepage より, https://coefont.cloud/ [2] AIで声質を“美少⼥”化⾳声変換サービス「七声ニーナ」、DeNAが試験提供, https://www.itmedia.co.jp/news/articles/2105/12/news123.html [3] NEUTRINO homepage より, https://n3utrino.work/
近年のテキスト音声合成技術 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 6 こんにちは 言語特徴量 抽出 音声特徴量 予測 音声生成
1995 〜 2016年:複数要素から構成される音声合成システム こんにちは 音声特徴量予測 + 音声生成 2017年〜:アテンション機構による End-to-End 音声合成 こんにちは 2019年〜:音素継続長機構による End-to-End 音声合成 音声特徴量予測 + 音声生成 低音質 個別に学習させる必要 並列計算不可 合成失敗の場合あり 並列計算可能 -> 高速 合成失敗の場合なし
近年の声質変換技術 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 7 1対1音声変換(One-to-One VC) VC (任意)対1音声変換(Any-to-One VC) VC
入出力いずれも学習データに含まれる話者 入力が学習データに含まれない話者 入力された音声から ①話した内容 と ②韻律 を抽出 & 声質は取り除く *声質を取り除きつつ①と②を抽出する VC を学習するのは困難 限られたデータ 事前に大規模データで自己教師あり学習した特徴量を応用し * を実現
近年の声質変換技術 ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 8 自己教師あり学習 特徴抽出 大量の音声データ VC 特徴抽出 大人数の話者が含まれる大規模データを用いて波形から
話した内容と韻律を内包する情報を抽出するよう学習 音声を用いた 様々な技術へ応用 することが可能 Any-to-One VC 自己教師あり学習で得られる特徴量を導入することで高品質化
まとめ ⽇本⾳響学会2022年春季研究発表会 ビギナーズセミナー 9 ▪ 本スライドの内容 音声合成 & 音声変換とは 音声合成
& 音声変換の代表的な研究範囲 音声合成 & 音声変換のサービス/製品 近年の音声合成 & 音声変換 ▪ おまけ(実際に手を動かしてみたい人向けのツールやデータ) 日本語テキスト音声合成向けデータセット:JSUT (10 hours, 1 speaker, studio recording) 日本語音声変換向けデータセット:JVS(24 hours, 100 speakers, studio recording) 日本語歌声合成データセット:東北きりたんコーパス(50 songs, 1 singer) End-to-End 音声合成(変換)ツール:ESPnet, https://github.com/espnet/espnet 統計的パラメトリック音声合成ツール: nnmnkwii, https://github.com/r9y9/nnmnkwii