Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
RSJ2024「基盤モデルの実ロボット応用」チュートリアルA(河原塚)
Search
Kento Kawaharazuka
September 06, 2024
Research
3
740
RSJ2024「基盤モデルの実ロボット応用」チュートリアルA(河原塚)
既存の基盤モデルを実ロボットに応用する方法について
Kento Kawaharazuka
September 06, 2024
Tweet
Share
More Decks by Kento Kawaharazuka
See All by Kento Kawaharazuka
RSJ2024学術ランチョンセミナー「若手・中堅による国際化リーダーシップに向けて」資料 (河原塚)
haraduka
0
250
RSJ2023「基盤モデルの実ロボット応用」チュートリアル1(既存の基盤モデルを実ロボットに応用する方法)
haraduka
4
1.7k
Other Decks in Research
See All in Research
Weekly AI Agents News!
masatoto
29
43k
Elix, CBI2024, スポンサードセッション, Molecular Glue研究の展望:近年の進展とAI活用の可能性
elix
0
110
地理空間情報と自然言語処理:「地球の歩き方旅行記データセット」の高付加価値化を通じて
hiroki13
0
120
メタヒューリスティクスに基づく汎用線形整数計画ソルバーの開発
snowberryfield
3
670
非ガウス性と非線形性に基づく統計的因果探索
sshimizu2006
0
460
クロスセクター効果研究会 熊本都市交通リノベーション~「車1割削減、渋滞半減、公共交通2倍」の実現へ~
trafficbrain
0
320
ECCV2024読み会: Minimalist Vision with Freeform Pixels
hsmtta
1
340
EBPMにおける生成AI活用について
daimoriwaki
0
240
文化が形作る音楽推薦の消費と、その逆
kuri8ive
0
210
リモートワークにおけるパッシブ疲労
matsumoto_r
PRO
6
4.7k
CUNY DHI_Lightning Talks_2024
digitalfellow
0
250
情報処理学会関西支部2024年度定期講演会「自然言語処理と大規模言語モデルの基礎」
ksudoh
10
2.3k
Featured
See All Featured
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
656
59k
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
Large-scale JavaScript Application Architecture
addyosmani
510
110k
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
44
9.4k
Building Flexible Design Systems
yeseniaperezcruz
328
38k
Unsuck your backbone
ammeep
669
57k
Automating Front-end Workflow
addyosmani
1366
200k
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
28
4.4k
Measuring & Analyzing Core Web Vitals
bluesmoon
5
190
The Myth of the Modular Monolith - Day 2 Keynote - Rails World 2024
eileencodes
19
2.3k
Typedesign – Prime Four
hannesfritz
40
2.5k
Evolution of real-time – Irina Nazarova, EuRuKo, 2024
irinanazarova
6
490
Transcript
1 2022.09.06 RSJ2024 基盤モデルの実ロボット応用 チュートリアルA 河原塚健人1, 松嶋達也1, 宮澤和貴2 (1東京大学, 2大阪大学)
本オーガナイズドセッションの目的 • ロボットのシステム構築が圧倒的に簡単に. 波に乗るしかない. • 海外の研究に置いて行かれないように最新情報をキャッチアップ • 国内で最新情報を共有して立ち向かう・追い越す 2
オーガナイザー 3 河原塚 健人 東京大学 松嶋 達也 東京大学 宮澤 和貴
大阪大学
これまでの活動(1) • 特集号「Real-World Robot Applications of Foundation Models」 @Advanced Robotics
4 • Survey Paper • NLP2024併設ワークショップ: 大規模言語モデルの実世界応用
これまでの活動(2) 5 • Cooking Robotics Workshop @ICRA2024
基盤モデルの実ロボット応用OS 6 RSJ2023 • 3セッション / 21件の発表 • 7機関: 東大,
慶應, 早稲田, 名工大, 立命館, 金沢大, 中部大 RSJ2024 • 4セッション / 27件の発表 • 20機関: 東大, 慶應, 早稲田, 阪大, 京大, Sony, RIKEN AIP, ATR, NII, TCRDL, 産総研, 名工大, 立命館, 創価大, トヨタ自動車, 富士通, 都 立大, 金沢工業, 中部大, ドワンゴ 様々な機関が基盤モデルを使うようになってきた
本チュートリアルの構成 チュートリアルA (河原塚) • 既存の基盤モデルの実ロボット活用例 チュートリアルB (松嶋) • ロボット基盤モデルを作る取り組み チュートリアルC
(宮澤) • 基盤モデルの対話活用について 7 大きな進展はない かなり進展がある 去年の資料 「基盤モデルの実ロボット応用」チュートリアル 去年の資料 「基盤モデルの実ロボット応用」チュートリアル 新規
活用可能な基盤モデルの種類@RSJ2023 8 Visual Prompting 全体的な性能アップ
活用可能な基盤モデルの種類(1) 9 GPT-4o Imagen3 全体的な性能アップ SAM 2
活用可能な基盤モデルの種類(2) 10 PIVOT [S. Nasiriany+, 2024] MOKA [F. Liu+, 2024]
Visual Prompting
活用可能な基盤モデルの種類(3) 11 Depth Anything [L. Yang+, 2024] FoundationPose [B. Wen+,
2024] MeshAnything [Y. Chen+, 2024] 4M [D. Mizrahi+, 2024] URDFormer [Z. Chen+, 2024] 多様なモダリティ
基盤モデルのロボット活用方法@RSJ2023 12
基盤モデルのロボット活用方法@RSJ2023 13 1. CLIPやDeticで認識/LLMで動作計画 2. Affordance/Rewardを構築して強化学習/MPC 3. マップやシーングラフを構築して動作計画 4. センサと制御入力の関係をデータ拡張/学習
チュートリアルBに譲る
基盤モデルのロボット活用方法(1) 14 Eureka [J. Ma+, 2023]
基盤モデルのロボット活用方法(1) 15 Eureka [J. Ma+, 2023]
基盤モデルのロボット活用方法(2) 16 DrEureka [J. Ma+, 2024]
我々の事例@2024 18
我々の事例 – VLMによる食材状態認識 19 [K. Kawaharazuka+, RA-L2024]
我々の事例 – LLM/VLMによる料理ロボット 20 [N. Kanazawa+, Advanced Robotics]
我々の事例 – LLMとPDDLの融合 • LLMとVLMでPDDL(Planning Domain Definition Language)を記述 21 [K.
Shirai+, ICRA2024]
我々の事例 – VLMと動作指令の統合 22 [K. Kawaharazuka+, Humanoids2023]
我々の事例 – 事前知識無しのナビゲーション 23 [K. Kawaharazuka+, Advanced Robotics]
まとめ • チュートリアルA • 既存の基盤モデルの実ロボット活用例 • 一方でRSJ2023からそこまで大きな進展はない • 活用可能な基盤モデルの種類 •
各基盤モデルの性能向上 / よりマルチモーダルへ • 基盤モデルの活用方法 • 基盤モデル×強化学習 / ロボット基盤モデル • 我々の研究事例 • 連続状態認識 / レシピ解釈 / PDDL / 運動指令との融合/ ナビゲーション 25