Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
AI最新論文読み会2022年まとめ
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
医療AI研究所@大阪公立大学
December 07, 2022
Science
620
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AI最新論文読み会2022年まとめ
AI最新論文読み会2022年まとめ
医療AI研究所@大阪公立大学
December 07, 2022
More Decks by 医療AI研究所@大阪公立大学
See All by 医療AI研究所@大阪公立大学
GPTの解説:ミートアップ用
ailaboocu
0
540
AI最新論文読み会2022年12月
ailaboocu
0
660
AI最新論文読み会2022年11月
ailaboocu
0
640
AI最新論文読み会2022年8月
ailaboocu
0
710
AI最新論文読み会2022年7月
ailaboocu
0
730
AI最新論文読み会2022年6月
ailaboocu
0
760
AI最新論文読み会2022年5月11日
ailaboocu
0
790
AI最新論文読み会2022年4月
ailaboocu
1
820
AI最新論文読み会2022年3月
ailaboocu
0
730
Other Decks in Science
See All in Science
Toward Causal Scientific Discovery with AI
sshimizu2006
0
180
Where does the rigor go? Research software and the future of trustworthy science.
arfon
0
240
Massey Ratings for Match Outcome Prediction in Table Tennis: Evidence of Greater Stability than the ITTF World Ranking
konakalab
0
150
医療 LLM ベンチマークの現在地:多面的評価 と日本ローカライズ
analokmaus
1
690
AIPシンポジウム 2025年度 成果報告会 「因果推論チーム」
sshimizu2006
3
640
ハミルトン・ヤコビ方程式の解の性質と物理的意味
enakai00
0
900
データベース06: SQL (3/3) 副問い合わせ
trycycle
PRO
1
1.1k
Controller Design for Symbolic Input-Output Systems Using Feedforward Neural Networks
konakalab
0
110
Utiliser Bitcoin sans Internet
rlifchitz
0
380
YouTubeにおける撤回論文の参照実態 / metascience-meetup2026
corgies
3
360
presen_司法書士学員会.pdf
tagtag
PRO
1
100
社内で活躍できるデータサイエンティストになるために
aikinohara
1
170
Featured
See All Featured
What's in a price? How to price your products and services
michaelherold
247
13k
Easily Structure & Communicate Ideas using Wireframe
afnizarnur
194
17k
SERP Conf. Vienna - Web Accessibility: Optimizing for Inclusivity and SEO
sarafernandez
2
1.6k
Thoughts on Productivity
jonyablonski
76
5.4k
A Modern Web Designer's Workflow
chriscoyier
699
190k
Rails Girls Zürich Keynote
gr2m
96
14k
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
Color Theory Basics | Prateek | Gurzu
gurzu
1
470
Applied NLP in the Age of Generative AI
inesmontani
PRO
4
2.5k
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.6k
Art, The Web, and Tiny UX
lynnandtonic
304
22k
The Curious Case for Waylosing
cassininazir
1
510
Transcript
େࡕެཱେֶɹ২ాେथ AI࠷৽จಡΈձ 20221·ͱΊ
2022·ͱΊ AI࠷৽จಡΈձ ɾϝΠϯ ConvNeXt (2݄ൃද): ͍͍͢࠷ۙͷߴੑೳϞσϧ GLIDE (1݄ൃද)ɹςΩετtoը૾ੜ Imagic (11݄ൃද)ɹࡉ͔ͳमਖ਼
AudioLM (10݄ൃද): ԻੜϞσϧ Socratic Models (5݄ൃද): ൚༻AI (AGI) ɾͦͷଞ Wav2Vec 2 (7݄ൃද): NeuroAI?Brain-inspired AI (AIͱਓؒͷͷؔΛ୳Δ) Algorithmic Imprint (7݄ൃද): AI࡞ऀͷྙཧ
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech
Socratic model Diffusion
2022·Ͱ·ͱΊ Self-Attention 2017 2018 BERT 2020 DETR ViT GPT3 2021
CLIP wav2vec 2 w2v-BERT BigSSL 2019 GPT2 SwinT DDPM ADM
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV AudioLM Speech Socratic
model Diffusion ConvNeXt
ConvNeXt: CNN x SwinTransformer ը૾ྨϞσϧͷstate-of-the-art
ConvNeXt: CNN x SwinTransformer ͷ·ͱΊ: ϕʔεResNet
ConvNeXt ·ͣॳΊʹɻ
ConvNeXt ֤εςʔδͷ܁Γฦ͠ΛSwinTʹ͚ۙͮΔ
ConvNeXt 4×4 non-overlapping convolution ΈࠐΈͷύονԽ
ConvNeXt Depthwise convolutionಋೖޙɺ෯Λ͛Δ
ConvNeXt Inverted bottleneck(Narrow→Wide→Narrow)ߏͷಋೖ TransformerͰ֦େ4ഒΛ༻ɻ※MobileNetͰ֦େ6ഒɻ શମͱͯ͠ͷܭࢉྔݮΔ͕ɺConvͷԋࢉ૿Ճɻ SwinTͰίί
ConvNeXt Depthwise convolutionͷҠಈ ※Depthwise ConvolutionͰେ͖ͳΧʔωϧαΠζ͏ͨΊ Ұ࣌తʹConvͷԋࢉྔݮগͰੑೳѱԽɻ SwinTͰίί MSAϒϩοΫ͕FFNΑΓઌ಄ʹ͋Δ
ConvNeXt SwinTransformerͷΧʔωϧαΠζ(7)ΛਅࣅΔ Depthwise convolutionͷ ΧʔωϧαΠζେ͖͍ͯ͘͘͠ɻ 7Ͱੑೳ͕(SwinTͱಉ͡) ↓
ConvNeXt ࡉ͔ͳSwinT or ViTͷΛಋೖ ReLU→GELU NormalizationݮΒ͢ BN→LN μϯαϯϓϧΛΓ͠
ConvNeXt ݁Ռ
ConvNeXt ResNetΛSwinTransformerԽͯ͠ɺ CNN͚ͩͰState-of-the-artग़ͨΑɻ
None
2022·ͱΊ Text AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech Socratic model
Diffusion GLIDE, Imagic
GLIDE Stable Di ff usionͷجૅϞσϧ
Diffusion model ੜϞσϧ
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓ ҆ఆԽɺߴղ૾Խ ݴޠΛѻ͏
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓
DDPM: diffusion modelͷ࢝·Γ DNN Image Noise Image +
Noise ਪͨ͠ Noise ࣌ࠁใ ೋޡࠩ ࠷খԽ
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓
ADM: ϞσϧΛ2ͭʹ͚ͯɺߴղ૾Խʹޭɻ Base Upsampler ྨ ߴղ૾ Classi fi er guidance
(CNN)
GLIDE = CLIP x Diffusion model Di ff usion modelͷྺ࢙
DDPM ADM GLIDE CLIP ↓
CLIP: ը૾ͱςΩετͷڮ͠
CLIP: ը૾ͱςΩετͷڮ͠ ը૾ͱςΩετΛൺֱͰ͖ΔΑ͏ʹಛมͰ͖ΔϞσϧ ViT: Image Transformer: Text ίαΠϯྨࣅ
ADM Base Upsampler ྨ ߴղ૾ Classi fi er guidance (CNN)
GLIDE = ADM-basedʹCNNΛCLIPʹมߋ ADM-basedʹCNNΛCLIPʹมߋ Base Upsampler ྨ ߴղ૾ Classi fi
er guidance (CLIP)
Imagic: Stable DiffusionͷվྑςΫχοΫ Stable Di ff usionͷվྑςΫχοΫ
Imagic Overview
None
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt Speech Socratic
model Diffusion AudioLM
AudioLM ԻͷੜϞσϧ
AudioLM = w2v-BERT x SoundStream Overview ɾจষͱΦʔσΟΦͷؒʹҰରଟͷ͕ؔ͋Δɻ ɾΦʔσΟΦςΩετʹൺͯ͠σʔλྔ͕ଟ͍ɻ
SoundStream ԻΛྔࢠԽ͢Δ
w2v-BERT Contrastive LearningͱMasked Language ModelingͷΈ߹Θͤ
None
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech
Diffusion Socratic model
Socratic models طଘֶशࡁΈϞσϧΛΈ߹Θͤͨ(४ʁ)൚ਓೳϞσϧ
Socratic models Overview Language is an intermediate representation
Socratic models Overview طଘͷVLM (Visual Language Model)ɺLMs (Large Language Model)
ɺ ALMs (Audio Language Model)ͷಉ࢜ が ɺߏԽ͞ΕͨରΛߦ͏ɻ ͦͯ͠ɺ ビデ ΦαʔνɺΩϟ プ γϣϯੜɺ ビデ ΦQ&A (ະͷλεΫ)ɺকདྷͷߦಈ༧ଌΛ͜ͷରۭؒͷ৽͍͠ࢀՃऀͱͯ͠ѻ͏ ɻ
Socratic models ྫࣔ̍ɿجຊฤ
Socratic models ྫࣔ̎ɿԠ༻ฤ
Socratic models ιΫϥςεରͱʁ
None
Others: NeuroAIᶃ ͷػೳͱݴޠϞσϧͷରԠΛ୳Δ
Others: NeuroAIᶃ શମ૾: Wav2Vec 2Λֶश͠ɺͦͷ݁Ռ͔ΒfMRIͷBOLDΛ༧ଌ͢ΔWΛ࡞ɾ݁Ռݕূ
Others: NeuroAIᶃ ฏۉԽͨ͠ͷ׆ੑͷදݱɻ
Others: NeuroAIᶃ ϞσϧͷϨΠϠʔͷਂ͞ͱͷ෦ҐʹରԠ͕͋ͬͨɻ
Others: NeuroAIᶄ ͔ΒݴޠΛੜ͢Δ
Others: NeuroAIᶄ ϞσϧͷτϨʔχϯάηογϣϯ 81िؒʹΘͨΓ50ճͷηογϣϯ ݽཱޠλεΫͱจষλεΫ λʔήοτͷ୯ޠจষ͕ը໘্ͷจࣈͱͯ͠ ඃݧऀʹࢹ֮తʹఏࣔ͞Εඃݧऀ ͦͷ୯ޠจষΛੜ͠Α͏ͱͨ͠ɻ ݽཱޠλεΫͰɺ50ݸͷӳ୯ޠηοτ͔Βݸʑͷ୯ޠΛੜɻ จষλεΫͰɺ50୯ޠηοτ͔ΒͳΔӳޠจ͔Β୯ޠྻΛੜɻ
Others: NeuroAIᶄ Ϟσϧͷ݁Ռ จষ75%ͷਫ਼ ୯ޠ93%ͷਫ਼
None
Others: AI Ethics ྙཧ
Algorithmic Imprint Ξϧ ゴ Ϧ ズ ϜʹΑΔ が ൃੜͨ͠߹ͷҰൠత で
߹ཧతͳରࡦͱͯ͠ɺͦͷ༗ͳӨڹ が ͞Βʹൖ͢ΔͷΛ ぐ ͨΊʹ Ξϧ ゴ Ϧ ズ Ϝͷ༻ఀࢭ が Α͘ߦΘΕΔ が ɺఀࢭ͔ͨ͠Βͱݴͬͯެฏੑɺઆ໌ɺಁ໌ੑɺྙཧͷ が ͳ͘ͳΔ Θ͚ で ͳ͍ →͜ͷ༗ͳΞϧ ゴ Ϧ ズ ϜͷӨڹɺΞϧ ゴ Ϧ ズ ϜআҎ߱͘Өڹ͠ଓ͚Δ(Ξϧ ゴ Ϧ ズ Ϝͷࠟ) ྫ: ӳࠃΛڌͱ͢Δߴߍͷଔۀূॻࢼݧ で ͋ΔGCEࢼݧͷΞϧ ゴ Ϧ ズ ϜʹΑΔධՁΛऔΓר͘(2020) ▪ ど ͷΑ͏ͳࢼݧ͔? ɾ 160͔ࠃҎ্ で ࣮ࢪ͞Ε͍ͯΔ(ͦͷଟ͘ӳࠃͷݩ২ຽ)ࠃࡍతʹೝΊΒΕͨࢼݧ ɾ AϨ ベ ϧͷඞવత で ͋ΓɺେֶͷೖֶʹෆՄܽͳׂΛՌͨ͢ ▪ܦҢ ɾCOVID-19ͷେྲྀߦʹΑΓGCEࢼݧΛಜ͢ΔӳࠃʹຊڌΛஔ͘४ػؔ で ͋ΔOfqualର໘ࢼݧΛதࢭͨ͠ ɾࢼݧͷΘΓʹɺֶߍ で ͷੜెͷաڈͷɺڭࢣͷධՁΛ༻ͯ͠Ξϧ ゴ Ϧ ズ Ϝ で Λ࡞ͨ͠ →݁Ռɺੈքతͳ߅ٞߦಈ が ຄൃ͠ɺΞϧ ゴ Ϧ ズ Ϝআ͞Εͨ ɹڭࢣଆ: ͦͦաڈͷੜెͷධՁΛه͍ͯ͠ͳ͍ ɹੜెଆ: ʹରͯ͠ਅʹऔΓΜ で ͍ͳ͔ͬͨ(ࢼݧ が શͯͳͷ で લͷ30~60ʹษڧ͢Δੜె が ଟ͍) ɾΞϧ ゴ Ϧ ズ Ϝআ͞Εͨ が ɺֶੜͷ࠶ධՁߦΘΕͳ͔ͬͨɻ ͢ͳΘͪɺ࠾ํ๏มΘͬͨ が ɺΞϧ ゴ Ϧ ズ ϜͷӨڹΛେ͖͘ड͚͍ͯͨ(Ξϧ ゴ Ϧ ズ Ϝͷࠟ)
Algorithmic Imprint ▪Algorithmic Imprint(Ξϧ ゴ Ϧ ズ Ϝͷࠟ)Λҙࣝͨ͠Ξϧ ゴ Ϧ
ズ Ϝͷઃܭ ʮΞϧ ゴ Ϧ ズ ϜͷࠟʯΛҙࣝͨ͠ઃܭͷߟ͑ํʹΑΓɺΞϧ ゴ Ϧ ズ Ϝ։ൃ プ ϩηεΛΑΓެฏ で ࣾձٕज़తͳ ใʹج づ ͍ͨͷʹ͢Δ͜ͱ がで ͖Δɻ (1)Ξϧ ゴ Ϧ ズ ϜͷӨڹ Ξϧ ゴ Ϧ ズ Ϝআͨ͠ޙʹརؔऀʹӨڹΛٴ ぼ ͢ɻ։ൃऀͱӡӦऀΞϧ ゴ Ϧ ズ ϜΛআ ͢Δ だ ͚ で ͳ͘ɺΞϧ ゴ Ϧ ズ ϜʹΑΔةΛੋਖ਼͠ɺઆ໌ が ࣋ଓͯ͠ཁٻ͞ΕΔɻ (2)Ξϧ ゴ Ϧ ズ Ϝઃܭͷઆ໌ ։ൃऀʮΞϧ ゴ Ϧ ズ ϜͷࠟʯͷӨڹΛड͚ΔਓʹΛΑΓೝࣝ で ͖ΔΑ͏ʹ͢Δ べ ͖ で ͋Δɻ (3)AIྙཧ ガ バ φϯε で ิڧ͢Δ ٕज़తͳհೖ だ ͚ で Λݮ͢Δ͜ͱ で ͖ͳ͍ɻ ʮΞϧ ゴ Ϧ ズ ϜͷࠟʯΛҙࣝͨ͠Ξϧ ゴ Ϧ ズ ϜઃܭΛ దͳAI ྙཧ ガ バ φϯε で ิ͢Δɻ
None
2023ʹ͍ͭͯ ʮզʑͷݚڀࣨʹ͔͠Ͱ͖ͳ͍͜ͱʯΛɻ Ҿ͖ଓ͖ษڧձ։࠵͢Δɻ ҩֶͷൺॏΛॏ͘͢Δɻ ҩྍը૾ݚڀ༻ϞσϧͷνϡʔτϦΞϧɾϋϯζΦϯ