Upgrade to Pro — share decks privately, control downloads, hide ads and more …

EgoX: Egocentric Video Generation from a Single...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for peisuke peisuke
August 28, 2026
150

EgoX: Egocentric Video Generation from a Single Exocentric Video

第67回 コンピュータビジョン勉強会@関東「CVPR2026読み会(前編)」

Avatar for peisuke

peisuke

August 28, 2026

More Decks by peisuke

Transcript

  1. 第67回 コンピュータビジョン勉強会@関東 CVPR2026 読み会 EgoX: Egocentric Video Generation from a

    Single Exocentric Video Author: T. Kang, K. Kim, D. Kim, M. Park, J. Hyung, J. Choo Presenter: @peisuke
  2. 自己紹介 藤本 敬介 ABEJA CEO室/Labs ラボ⻑ ▷ 経歴 2010-2016:⽇⽴製作所 2016-:ABEJA

    ▷ SNS X:@peisuke github:@peisuke Qiita:peisuke ▷ 著書 ディープラーニングG検定公式テキスト AI⽩書2023, 2025
  3. これまで 手法 EgoExo-Gen 悩み • 研究自体 あるも 色々な制約があった 、 ego

    Exo2Ego-V 同時刻 1フレーム目を入力する必要がある 4Diff exo 4視点が必要 静止画を対象としている
  4. 手法 工夫点 • 工夫点1 ◦ 精度良く別視点に移すため、 第3者視点動画から点群データを作成して別視点 画像を作成 し、Video Diffuion

    Modelを利用して高精細な動画に変換 • 工夫点2 ◦ 動画生成 精度を良くするため、 第3者視点画像と自己視点画像 幾何的な関 係性をAttentionに入れ込む
  5. 第3者視点 動画から 一貫性 • 2種類 Depth Mapデータ 作成 Dm:単眼深度( MoGe-2)

    スケール 精度 高いが、 前後フレーム 一貫性が無い ある点群データ 作成 Dv:動画深度( Video Depth Anything) 時間方向に アフィン不 変、全体でスケール・バ イアスを持つ
  6. 第3者視点 動画から 一貫性 ある点群データ 作成 • DmとDvを合わせ込んで、時間方向性とスケール・バイアスに関する矛 盾を解消 • 前後フレーム

    スケール・バイアスをスムージング 1. フレーム単位で スケー ル・バイアスを求める 2. 時間方向で求めた 値をスムージング
  7. VDMによる自己視点画像へ 変換 ここを 生成 • 入力データ 以下をconcat ◦ 第3者視点画像:x0 ◦

    点群レンダリング:p0 ◦ ノイズ:zt ◦ マスク:m0, m1 ◦※実際 xとz VAE 出力した x0 zt x0 p0 m1 m0 latent • 以下 ようにデータ生成 チャネル 方向 画像w方向
  8. 評価指標 系統 指標 何を見るか 画像系 PSNR / SSIM / LPIPS

    / CLIP-I 各フレームが正解にどれだけ近いか 物体系 位置誤差 / IoU / 輪郭精度 物体が正しい場所に正しい形であるか 動画系 FVD / Temporal Flickering / Motion Smoothness / Dynamic Degree 分布として 近さと動き 質
  9. 考察 • 未観測領域が画面 ◦ 視点が違う 大半を占める で、原理的に どうしても発生してしまう • 動体がマスクされ、ego

    prior に入っていない ◦ “Dynamic objects are masked out so that only static background regions are used during both alignment and rendering”→点群作る時に動いているも マ スクしちゃっているが、作業動画 動いているも が重要 • 深度 ◦ 限界 Dv(深度動画推定)、Dm(深度画像推定)を合わせ込んでいるが、スケールとバイ アスを修正することしかできない
  10. まとめ • 第3者視点 動画から自己視点画像を生成する手法を提案 • 制約が少ないにも関わらず高精度な動画 ◦ 時系列 Depth Map

    高精度化やアテンション 生成が可能 工夫 • 自己視点位置を人手で入力したり曖昧な環境で る 成功しないこともあ