Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[RSJ26] Flow as Flow: Modeling Robot Velocity F...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
Technology
100
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
Semantic Machine Intelligence Lab., Keio Univ.
PRO
August 28, 2026
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
75
[RSJ26] AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
keio_smilab
PRO
0
38
[RSJ26] NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields
keio_smilab
PRO
0
24
[RSJ26] Hierarchy-Aware Multimodal Retrieval-Augmented Generation for Embodied Question Answering
keio_smilab
PRO
0
53
[MIRU26] Open-Vocabulary Intention-Guided Object Detection in Diverse Scenes
keio_smilab
PRO
0
180
[Journal club] Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
keio_smilab
PRO
0
44
[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?
keio_smilab
PRO
0
260
[Journal club] FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
keio_smilab
PRO
0
33
[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
keio_smilab
PRO
1
67
Other Decks in Technology
See All in Technology
AI駆動開発を組織で促すために
lycorptech_jp
PRO
7
8.5k
EMの役割で 変わったこと・変わらなかったこと
sansantech
PRO
0
190
現場の暗黙知を継承するAIエージェント — 対話から生まれる長期記憶と Skills
atsukish
0
110
Claude Codeの体系的な理解と知識のフック
oikon48
7
5.9k
atproto spaces概要
yamarten
0
110
フィジカルAIの知識ゼロの僕でも AIを使えばここまでできた
tatsuya1970
0
200
ClaudeCodeでセキュリティ監視業務を半自動化_1年の運用でわかったAIに任せる設計の5つのポイント
kintotechdev
3
870
hookで自作する Claude Code の「実況ボード」
shinyasaita
2
210
指示待ちから変化に応じるClaude Codeへ!~環境からAgentへの帰り道を作る~
gotalab555
7
1.4k
全社に広がるMCPサーバーを、 どう安全に管理するか MCPass開発の舞台裏
mtpooh
3
170
markdown-poster Introduction
kazamori
0
380
サーバー常駐型の 簡易障害調査AI エージェントを作ってみた話
masayoshi
1
250
Featured
See All Featured
Embracing the Ebb and Flow
colly
88
5.1k
エンジニアに許された特別な時間の終わり
watany
108
250k
Collaborative Software Design: How to facilitate domain modelling decisions
baasie
1
290
Primal Persuasion: How to Engage the Brain for Learning That Lasts
tmiket
0
430
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
690
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
220
A better future with KSS
kneath
240
18k
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
530
How to make the Groovebox
asonas
2
2.4k
End of SEO as We Know It (SMX Advanced Version)
ipullrank
3
4.4k
Exploring anti-patterns in Rails
aemeredith
3
480
The Spectacular Lies of Maps
axbom
PRO
1
950
Transcript
物理速度場と確率速度場の統合による Flow Matching に基づく物体操作 慶應義塾⼤学 妹尾幸樹 ⼋島⼤地 髙⽊裕輔 ⼾倉健登 杉浦孔明
Motivation: ⼈間動画をロボット基盤モデルの学習に活⽤したい 背景︓テレオペレーションによるデータの⼤規模化は困難 (投資額が⼤きすぎる) ▪ Gemini Robotics︓1年で数千時間 J ⼈間動画: 収集コスト低,ウェブ上にも⼤量に存在
本研究︓Robot flow を潜在表現として⽤いて⼈間動画から学習 ▪ cf. [Kambara+, RA-L26], [Kaichi+, IROS26] EPIC KITCHEN [Damen+, ECCV18] Data Pyramid [Ye+, 26] Robot flow 2
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ① ② 3
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ① ② ⽬標画像 初期画像
② 物体操作︓Robot flow,観測 → ロボットの関節⾓ 4
問題設定︓フロー⽣成を媒介とした物体操作 ① フロー⽣成︓初期画像,⽬標画像 → Robot flow ② 物体操作︓Robot flow,観測 →
ロボットの関節⾓ ② 観測画像 ① 5
関連研究︓既存⼿法は速度場を粗く近似 ⼿法 特徴 Track2Act [Bharadhwaj+, ECCV24] ⽬標画像に基づくフロー⽣成,ウェブ動画から学習 Im2Flow2Act [Xu+, CoRL24]
LILAC [Kambara+, RA-L26] ⾔語指⽰⽂に基づいて物体中⼼のフローを⽣成 L ロボット動作を有限差分でモデル化 → 速度場の粗い近似にとどまる Track2Act [Bharadhwaj+, ECCV24] 6
提案 : Flow Matching に基づくロボットフローのモデル化 Flow Matching [Lipman+, ICLR23]︓⽣成空間における速度場 (確率フロー)
をモデル化 確率フロー Robot flow 7
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 8
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 9
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 10
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝝃! 𝝃̇ ! 𝒙 11
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 12
提案 : Flow Matching に基づく Robot flow のモデル化 ▪ Flow
as Flow︓Robot flow を確率フローとしてモデル化 J 時間発展するロボット動作の連続な速度場をモデル化 ▪ 訓練 (正解軌道へ引き戻す速度場を学習) 𝒗 𝒙, 𝝃! , t = 𝝃̇ ! − 𝑘 𝒙 − 𝝃! J 分布外のサンプルにも頑健 ℒ = 𝔼!,𝒙,𝝃! 𝒗 𝒙, 𝝃! , t − 𝒗% 𝒙, t ▪ 推論 予測 ! 𝒙! = 𝒙' + - 𝒗% 𝒙( , 𝜏 𝑑𝜏 𝝃! 𝝃̇ ! 𝒙 𝒗 𝒙, 𝝃! , 𝑡 & ' 13
実験設定︓⼈間動画からフローを学習 n フロー⽣成︓⼈間動画とロボット動画を⽤いて訓練 (on H200) Something Something V2 49,257 サンプル
EPIC KITCHEN 54,938 サンプル Fractal 87,212 サンプル Bridge V2 60,064 サンプル n 物体操作︓HSRを⽤いて13種類のタスクで評価 (260試⾏/⼿法) … 14
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act [Xu+, CoRL24] 37.14 51.48 44.14 38.15 5,580 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 15
定量的結果︓4つのベンチマークで既存⼿法を上回る In-domain ⼿法 Zero-shot Fractal Bridge V2 DROID 提案⼿法 21.23
27.11 35.89 Track2Act [Bharadhwaj+, ECCV24] 64.32 47.29 Im2Flow2Act [Xu+, CoRL24] 37.14 FLIP [Gao+, ICLR25] 66.17 Fanuc Manipulation 推論時間 [ms]↓ 40.73 22.46 33倍⾼速 27.37 44 1,430 51.48 44.14 38.15 5,580 50.73 43.10 28.31 35 評価指標︓Average Displacement Error (↓) Fractal [Brohan+, RSS23] Bridge V2 [Walke+, CoRL23] DROID [Khazatsky+, RSS24] Fanuc Manipulation [Zhu+,23] 16
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 Zero-shot In-domain 初期画像 17
定性的結果︓Zero-shot 設定においても適切に⽣成 ⽬標画像 ベースライン⼿法 提案⼿法 L エンドエフェクタのフローを⽣成出来ず Zero-shot In-domain 初期画像
18
ベースの移動を含む動作でもフローを適切に⽣成&実⾏ 初期画像 ⽬標画像 Robot flow 物体操作 19
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 20
実機実験︓13タスクの平均成功率で既存⼿法を上回る 提案⼿法 +10 平均 21
まとめ︓⼈間動画から学習可能な物体操作⼿法 n ⾔語指⽰⽂設定への拡張 n 9/4 10:44~ @⼤会議室A (OS21 基盤モデル時代における Physical
AI [5/6]) n “Flow Matching および変化キャプショニングに基づく物体操作の学習” n 背景 n ロボットデータの⼤規模化は困難 n ⼈間動画をロボット基盤モデルの学習に活⽤したい n 提案︓Robot flow を確率フローとしてモデル化 n 結果︓ゼロショット設定においても適切に⽣成 22
Appendix 23
Diffusion Transformer (DiT) に基づくモデル構造 ▪ Flow Generation︓⾃⼰回帰 Flow Matching に基づく⽣成
▪ Action Generation︓Robot flow を条件とする Flow Matching Policy 24
⾃⼰回帰⽣成による⾼速化 通常の拡散モデル ▪ ⽣成ステップ≠フローステップ L ⽣成には多段の逆拡散過程 (~250 ステップ程度) Flow as
Flow ▪ ⽣成ステップ=フローステップ J ⽣成にはわずか8ステップ 25
提案⼿法はモデル構造に依らず適⽤可能 ⼿法 In-domain Zero-shot 推論時間 [ms]↓ Fractal Bridge V2 DROID
Fanuc Manipulation 提案⼿法 21.23 27.11 35.89 22.46 44 Track2Act 64.32 47.29 40.73 27.37 1,430 Im2Flow2Act+FaF 33.21 42.96 38.87 26.51 230 Im2Flow2Act 37.14 51.48 44.14 38.15 5,580 FLIP+FaF 38.77 48.34 38.54 26.79 17 FLIP [Gao+, ICLR25] 66.17 50.73 43.10 28.31 35 26
フロー⽣成タスクにおけるエラー分析 (100サンプル) エラーカテゴリ サンプル数 中間時刻における経路誤り 39 正解データにおける不適切な⾏動 21 対象物体の認識誤り 20
終端位置の誤り 16 正解データにおけるトラッキングエラー 4 27