Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[RSJ26] Flow as Flow: Modeling Robot Velocity F...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
Technology
220
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
200
[RSJ26] AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
keio_smilab
PRO
0
140
[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields
keio_smilab
PRO
0
170
[RSJ26] Hierarchy-Aware Multimodal Retrieval-Augmented Generation for Embodied Question Answering
keio_smilab
PRO
1
180
[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes
keio_smilab
PRO
0
210
[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
keio_smilab
PRO
0
49
[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?
keio_smilab
PRO
0
300
[Journal club] FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
keio_smilab
PRO
0
38
[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
keio_smilab
PRO
1
78
Other Decks in Technology
See All in Technology
あけおめLINE 傾向とその対策
nasa9084
0
110
AIエージェントを最高のパートナーに育てる方法|評価と判断軸を育てる5つのステップ
koichiaoki
1
140
作品が生態系になった ─ Mini Tokyo 3D から世界へ
nagix
0
190
今話題のAI「Jev」って何? 宇宙最速で学ぶ会
minorun365
PRO
26
15k
事業課題から技術的負債に向き合う
sansantech
PRO
2
1.9k
10Xに技術的負債をもたらした「2つの境界の歪み」その構造と解消への営み
10xinc
0
2k
Screen Lens - 今見てる画面を翻訳する
komagata
0
320
LLMに渡さなかった仕事
nanaism
0
400
越境するなら専門用語を使うな高校校歌 / If you wanna cross border, you shouldn't use jargon
vtryo
0
140
現場で役立つ技術負債の効果的な返済方法
masuda220
PRO
9
4.3k
CLIライブラリ開発を支える技術
htnabe
0
120
【技術的負債conf】事業成長に伴う技術的負債の説明責任とAIによるモニタリング、認知的負債について
i35_267
3
1.7k
Featured
See All Featured
The Language of Interfaces
destraynor
162
27k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
203
76k
We Have a Design System, Now What?
morganepeng
55
8.3k
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
35
2.8k
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
Data-driven link building: lessons from a $708K investment (BrightonSEO talk)
szymonslowik
1
1.3k
Leadership Guide Workshop - DevTernity 2021
reverentgeek
1
370
Tips & Tricks on How to Get Your First Job In Tech
honzajavorek
1
740
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
410
職位にかかわらず全員がリーダーシップを発揮するチーム作り / Building a team where everyone can demonstrate leadership regardless of position
madoxten
69
65k
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Making Projects Easy
brettharned
120
6.8k
Transcript
物理速度場と確率速度場の統合による Flow Matching に基づく物体操作 慶應義塾⼤学 妹尾幸樹 ⼋島⼤地 髙⽊裕輔 ⼾倉健登 杉浦孔明
Motivation: ⼈間動画をロボット基盤モデルの学習に活⽤したい 背景︓テレオペレーションによるデータの⼤規模化は困難 (投資額が⼤きすぎる) ▪ Gemini Robotics︓1年で数千時間 J ⼈間動画: 収集コスト低,ウェブ上にも⼤量に存在
本研究︓Robot flow を潜在表現として⽤いて⼈間動画から学習 ▪ cf. [Kambara+, RA-L26], [Kaichi+, IROS26] EPIC KITCHEN [Damen+, ECCV18] Data Pyramid [Ye+, 26] Robot flow 2
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ① ② 3
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ① ② ⽬標画像 初期画像
② 物体操作︓Robot flow,観測 → ロボットの関節⾓ 4
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ② 観測画像 ① 5
関連研究︓既存⼿法は速度場を粗く近似 ⼿法 特徴 Track2Act [Bharadhwaj+, ECCV24] ⽬標画像に基づくフロー⽣成,ウェブ動画から学習 Im2Flow2Act [Xu+, CoRL24]
LILAC [Kambara+, RA-L26] ⾔語指⽰⽂に基づいて物体中⼼のフローを⽣成 L ロボット動作を有限差分でモデル化 → 速度場の粗い近似にとどまる Track2Act [Bharadhwaj+, ECCV24] 6
提案 : Flow Matching に基づくロボットフローのモデル化 Flow Matching [Lipman+, ICLR23]︓⽣成空間における速度場 (確率フロー)
をモデル化 確率フロー Robot flow 7
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 8
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 9
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 10
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 𝒙 11
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 12
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 ℒ = 𝔼!,𝒙,𝝃! 𝒗 𝒙, 𝝃! , t − 𝒗% 𝒙, t ▪ 推論 予測 ! 𝒙! = 𝒙' + - 𝒗% 𝒙( , 𝜏 𝑑𝜏 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 & ' 13
実験設定︓⼈間動画からフローを学習 n フロー⽣成︓⼈間動画とロボット動画を⽤いて訓練 (on H200) Something Something V2 49,257 サンプル
EPIC KITCHEN 54,938 サンプル Fractal 87,212 サンプル Bridge V2 60,064 サンプル n 物体操作︓HSRを⽤いて13種類のタスクで評価 (260試⾏/⼿法) … 14
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act [Xu+, CoRL24] 37.14 51.48 44.14 38.15 5,580 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 15
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot Fractal Bridge V2 DROID 提案⼿法 21.23
27.11 35.89 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 Im2Flow2Act [Xu+, CoRL24] 37.14 FLIP [Gao+, ICLR25] 66.17 Fanuc Manipulation 推論時間 [ms]↓ 40.73 22.46 33倍⾼速 27.37 44 1,430 51.48 44.14 38.15 5,580 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 16
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 Zero-shot In-domain 初期画像 17
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 L エンドエフェクタのフローを⽣成出来ず Zero-shot In-domain 初期画像
18
ベースの移動を含む動作でもフローを適切に⽣成&実⾏ 初期画像 ⽬標画像 Robot flow 物体操作 19
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 20
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 +10 平均 21
まとめ︓⼈間動画から学習可能な物体操作⼿法 n ⾔語指⽰⽂設定への拡張 n 9/4 10:44~ @⼤会議室A (OS21 基盤モデル時代における Physical
AI [5/6]) n “Flow Matching および変化キャプショニングに基づく物体操作の学習” n 背景 n ロボットデータの⼤規模化は困難 n ⼈間動画をロボット基盤モデルの学習に活⽤したい n 提案︓Robot flow を確率フローとしてモデル化 n 結果︓ゼロショット設定においても適切に⽣成 22
Appendix 23
Diffusion Transformer (DiT) に基づくモデル構造 ▪ Flow Generation︓⾃⼰回帰 Flow Matching に基づく⽣成
▪ Action Generation︓Robot flow を条件とする Flow Matching Policy 24
⾃⼰回帰⽣成による⾼速化 通常の拡散モデル ▪ ⽣成ステップ≠フローステップ L ⽣成には多段の逆拡散過程 (~250 ステップ程度) Flow as
Flow ▪ ⽣成ステップ=フローステップ J ⽣成にはわずか8ステップ 25
提案⼿法はモデル構造に依らず適⽤可能 ⼿法 In-domain Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act+FaF 33.21 42.96 38.87 26.51 230 Im2Flow2Act 37.14 51.48 44.14 38.15 5,580 FLIP+FaF 38.77 48.34 38.54 26.79 17 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 26
フロー⽣成タスクにおけるエラー分析 (100サンプル) エラーカテゴリ サンプル数 中間時刻における経路誤り 39 正解データにおける不適切な⾏動 21 対象物体の認識誤り 20
終端位置の誤り 16 正解データにおけるトラッキングエラー 4 27