Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
EgoX: Egocentric Video Generation from a Single...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
peisuke
August 28, 2026
150
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
EgoX: Egocentric Video Generation from a Single Exocentric Video
第67回 コンピュータビジョン勉強会@関東「CVPR2026読み会(前編)」
peisuke
August 28, 2026
More Decks by peisuke
See All by peisuke
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
peisuke
0
270
VGGT: Visual Geometry Grounded Transformer
peisuke
1
2k
AI for Kids:小学生に画像認識を教えてみた話
peisuke
1
110
LangGraphで始めるマルチエージェントシステム
peisuke
14
5.1k
Self-RAG: Learning to Retrieve, Generate and Critique through Self-Reflections
peisuke
9
1.7k
Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields
peisuke
0
14k
LangChain Toolsの運用と改善
peisuke
5
3k
GNeRF: GAN-based Neural Radiance Field without Posed Camera
peisuke
1
860
TTS Skins: Speaker Conversion via ASR
peisuke
0
460
Featured
See All Featured
Paper Plane (Part 1)
katiecoart
PRO
1
10k
A designer walks into a library…
pauljervisheath
211
24k
The MySQL Ecosystem @ GitHub 2015
samlambert
251
13k
How to optimise 3,500 product descriptions for ecommerce in one day using ChatGPT
katarinadahlin
PRO
2
3.8k
Between Models and Reality
mayunak
4
420
Leadership Guide Workshop - DevTernity 2021
reverentgeek
1
360
Facilitating Awesome Meetings
lara
57
7.1k
The innovator’s Mindset - Leading Through an Era of Exponential Change - McGill University 2025
jdejongh
PRO
1
310
Avoiding the “Bad Training, Faster” Trap in the Age of AI
tmiket
0
220
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
16k
Highjacked: Video Game Concept Design
rkendrick25
PRO
1
450
Transcript
第67回 コンピュータビジョン勉強会@関東 CVPR2026 読み会 EgoX: Egocentric Video Generation from a
Single Exocentric Video Author: T. Kang, K. Kim, D. Kim, M. Park, J. Hyung, J. Choo Presenter: @peisuke
自己紹介 藤本 敬介 ABEJA CEO室/Labs ラボ⻑ ▷ 経歴 2010-2016:⽇⽴製作所 2016-:ABEJA
▷ SNS X:@peisuke github:@peisuke Qiita:peisuke ▷ 著書 ディープラーニングG検定公式テキスト AI⽩書2023, 2025
論文 概要 • 第3者視点 動画から自己視点 動画を生成する手法 https://keh0t0.github.io/EgoX/
Physical AIにおける自己視点動画 重要性 • 自己視点動画による動作生成においてスケール則が成り立ちそうなこ とが示された https://www.dyna.co/dyna-2
これまで 手法 EgoExo-Gen 悩み • 研究自体 あるも 色々な制約があった 、 ego
Exo2Ego-V 同時刻 1フレーム目を入力する必要がある 4Diff exo 4視点が必要 静止画を対象としている
本研究 特徴 • 既存手法 ような制約無しに、第3者視点 動画を生成 動画から直接自己視点 見えない部分も生成 見える場所 角度を
変えて生成
手法 工夫点 • 工夫点1 ◦ 精度良く別視点に移すため、 第3者視点動画から点群データを作成して別視点 画像を作成 し、Video Diffuion
Modelを利用して高精細な動画に変換 • 工夫点2 ◦ 動画生成 精度を良くするため、 第3者視点画像と自己視点画像 幾何的な関 係性をAttentionに入れ込む
手法 大まかな流れ 点群データを作成
手法 大まかな流れ 点群データから 欠損画像を作成
手法 大まかな流れ VAEでエンコード
手法 大まかな流れ 特徴量を連結 Ztを生成対象とする
手法 大まかな流れ 幾何的な対応を利用した アテンション 改善
手法 大まかな流れ デコードして動画を生成
第3者視点 動画から 一貫性 • 2種類 Depth Mapデータ 作成 Dm:単眼深度( MoGe-2)
スケール 精度 高いが、 前後フレーム 一貫性が無い ある点群データ 作成 Dv:動画深度( Video Depth Anything) 時間方向に アフィン不 変、全体でスケール・バ イアスを持つ
第3者視点 動画から 一貫性 ある点群データ 作成 • DmとDvを合わせ込んで、時間方向性とスケール・バイアスに関する矛 盾を解消 • 前後フレーム
スケール・バイアスをスムージング 1. フレーム単位で スケー ル・バイアスを求める 2. 時間方向で求めた 値をスムージング
欠損つき 自己視点画像へ 変換 • 第3者画像データからDepthを利用して3D点群に変換 • 3D点群から視点位置に基づいて自己視点画像に変換 ◦ 論文において 視点位置
人手で与える(future work)
VDMによる自己視点画像へ 変換 • 第3者視点画像と、先ほど 点群をレンダリングした画像から、VDM (Video Diffusion Model)で自己視点画像を生成
VDMによる自己視点画像へ 変換 ここを 生成 • 入力データ 以下をconcat ◦ 第3者視点画像:x0 ◦
点群レンダリング:p0 ◦ ノイズ:zt ◦ マスク:m0, m1 ◦※実際 xとz VAE 出力した x0 zt x0 p0 m1 m0 latent • 以下 ようにデータ生成 チャネル 方向 画像w方向
Geometry-Guided Self-Attention • 通常 Attentionを使うとExo-Ego間で任意に参照を取れてしまう • 生成が目的であれ 、同じ箇所同士を参照する で十分である input
query key
Geometry-Guided Self-Attention • Exo-Ego トークン間が同じ位置かどうかをAttentionにバイアスとして 与えることで、Ego画像 生成 精度を上げる Ego画像 視点からそれぞれトークン
位置を見た時 視線方向 バイアスとして加えて attentionを計算 cos類似度を同じ位置か どうか 基準として利用
Geometry-Guided Self-Attention • Exo-Ego 構 関係をAttentionにバイアスとして与える
Attention 重み 可視化 • GGAを使わないとき 、対象 物に対して広範囲が反応 • GGAを使うと3D的に同じ位 置が反応し、Ego画素を埋め
る情報が精度よく集まる
実験環境について 学習データ Ego-Exo4Dから4000クリップ(Train:3,600, Test:400) 汎化性能評価 未学習シーン100クリップを別途収集 計算資源 H200(140B)x8、約1日 比較手法 Exo2Ego-v
/ TrajectoryCrafter / WanFunControl / Wan VACE 評価方針 画像 質・物体 再現度・動画 3 系統で評価
モデル 詳細 ベースモデル Ego-Exo4Dから4000クリップ(Train:3,600, Test:400) 学習対象 LoRA(rank256)、VDM/VAE 入力解像度 第3者視点:448x784、自己視点:448x448 フレーム数
49 推論 度 10.5分 凍結
定性評価
定性評価
評価指標 系統 指標 何を見るか 画像系 PSNR / SSIM / LPIPS
/ CLIP-I 各フレームが正解にどれだけ近いか 物体系 位置誤差 / IoU / 輪郭精度 物体が正しい場所に正しい形であるか 動画系 FVD / Temporal Flickering / Motion Smoothness / Dynamic Degree 分布として 近さと動き 質
定量評価 負けている指標であっても、 0.9台後半と十分良い SOTAで あるも IoUが弱い 、
考察 • 未観測領域が画面 ◦ 視点が違う 大半を占める で、原理的に どうしても発生してしまう • 動体がマスクされ、ego
prior に入っていない ◦ “Dynamic objects are masked out so that only static background regions are used during both alignment and rendering”→点群作る時に動いているも マ スクしちゃっているが、作業動画 動いているも が重要 • 深度 ◦ 限界 Dv(深度動画推定)、Dm(深度画像推定)を合わせ込んでいるが、スケールとバイ アスを修正することしかできない
失敗例と今後 課題 • 見えないなどで曖昧性が残る場合に 上手くいかない • 視点位置 手動で入れる必要がある ◦ 視線方向
認識などが必要
まとめ • 第3者視点 動画から自己視点画像を生成する手法を提案 • 制約が少ないにも関わらず高精度な動画 ◦ 時系列 Depth Map
高精度化やアテンション 生成が可能 工夫 • 自己視点位置を人手で入力したり曖昧な環境で る 成功しないこともあ