Upgrade to Pro — share decks privately, control downloads, hide ads and more …

EO-VGGT: Orbital Ray-Conditioned 3D Foundation ...

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

本資料はSatAI.challengeのサーベイメンバーと共に作成したものです。
SatAI.challengeは、リモートセンシング技術にAIを適用した論文の調査や、より俯瞰した技術トレンドの調査や国際学会のメタサーベイを行う研究グループです。speakerdeckではSatAI.challenge内での勉強会で使用した資料をWeb上で共有しています。
https://x.com/sataichallenge

本研究では,複数時期・複数方向から撮影された衛星画像からDSMを高速に,高精度に構築する手法を提案する.事前学習済み3次元基盤モデルであるVGGTをベースとし,その重みを凍結したまま,入力画像の選別処理(GCCS)および衛星画像特有の撮影幾何を考慮するAdapterのみを学習することで複数枚の衛星画像から高精度なDSMの構築を実現した.

Avatar for SatAI.challenge

SatAI.challenge

August 10, 2026

More Decks by SatAI.challenge

Other Decks in Research

Transcript

  1. 自己紹介 藤野 倫太郎 東京理科大学大学院 創域理工学専攻 社会基盤工学研究科 修士2年 - 東京理科大学 水理研究室所属

    - AcademiX(AIを学びたい学生が集まるコミュニティ)の運営メンバー - 未踏アドバンス(2023) 野球の動作解析アプリの開発 研究テーマ :河川橋梁の橋脚局所洗掘(実験・混相流の数値計算) 興味のある分野:数値計算 人工知能全般(距離学習、GNN、サロゲートモデル) リモートセンシング(衛星から流量観測,氾濫状況) 2
  2. EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

    arXiv preprint arXiv:2607.00417, 2026. (査読中) 事前学習済み3次元基盤モデルVGGTを衛星マルチビュー画像によるDSM再構築への適用 • • 複数時期・複数方向から撮影 された衛星画像からDSMを高 速に,高精度に構築する 手法 を提案 事前学習済みの3次元基盤モ デルVGGT をベースとし,その 重みを凍結した まま,入力画像 の選別処理(GCCS) や衛星画 像特有のカメラモデル を考慮 したAdapterのみを学習するこ とで高精度なDSMの構築を実 現 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用 3
  3. Introduction:背景・VGGTを衛星画像に適用する際の課題 • • • Digital Surface Modelは都市計画,災害解析,デジタルツインなどで重要 衛星画像から広範囲で低コストのDSMを構築する意義は大きい 近年,着目されているFeed-Forward neural

    networkのVGGTを用いた検討が行われている 課題1 カメラモデルの相違 通常の画像:ピンホールカメラ 衛星画像:プッシュブルーム 衛星の移動方向 ➢ ➢ 画像全体が1つのカメラか ら撮影されたとみなすモデ ル ➢ 撮影範囲 撮影範囲 画像の行ごとに投影中心 ・撮影時間が異なる 画像全体をピンホールカメ ラで表現できない VGGTが学習してきた画像との相違が存在し,精度が劣化する 課題2 撮影時期が異なる衛星画像の相違 季節変化,気象条件等が異なり,撮影される画像に相違が生じる 課題1 → VGGTに衛星の視線方向情報を追加 課題2 → VGGTに入力する画像を選別 出典:高知大学 地球環境情報学研究室(https://www.is.kochi-u.ac.jp/kyoko/edu/image/8.html) 4
  4. 重要知識:VGGT(Visual Geometry Ground transformer) • • 画像から3Dモデル を出力する 複数の3Dタスク(複数の画像から,カメラパラメータや深度推定,高密度ポイント推定,3Dトラッキング等)で最先 端の結果を達成

    • Feed-Forward neural network(順方向) ◦ 高速に出力 少量の画像(オーバーラップ率が低い)でも 3Dモデルを構築可能 • Wang et al., 2025, “VGGT: Visual Geometry Grounded Transformer ”より引用 5
  5. 研究目的・概要 EO-VGGT (Earth Observation - Visual Geometry Grounded Transformer) 一般的な画像で事前学習されたVGGTのパラメータをほぼ凍結させたまま,衛星マルチビュー画像から

    高精度な DSMを構築する ➢ 幾何的・放射的に不適切 な画像を除外する ➢ 各画像の光線の始点 ➢ と方向を計算する 光線情報をVGGTの画像 パッチトークンへ加える Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用 6
  6. EO-VGGT Stage 1 : GCCS(Geometry-Correlation Constrained Selection)① 異なる時期に取得された衛星画像は観測条件が大きく異なる →品質の悪い画像を除外する Step1:

    幾何的可視性による前処理 AOI(対象範囲)の地表範囲を各候補が像へRPC(Rational Polynomial coefficient) を用いて逆投影し,幾何学的に利用可能な画像集合を 構築 RPCによる画像座標へ の投影 画像領域 ➢ 対象領域が画像内 に入っている ➢ 被覆率 衛星の入射角 被覆率の閾値 入射角の閾値 対象タイルの被 覆率が十分か ➢ 衛星の入射角が 極端でないか 7 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  7. EO-VGGT Stage 1 : GCCS(Geometry-Correlation Constrained Selection)② Step2: 放射輝度品質による前処理(Radiometric Quality

    Refinement) 大気条件や季節変化によって画像が劣化した画像を除去 正規化相互相関(Normalized Cross-Correlation:NCC) 基準画像のパッチ 各パッチの平均輝度 候補画像のパッチ NCC値が高い順に画像を選択 *M=18 Step3: 撮影角度の分散の最大化(Angular Dispersion Maximization) 撮影方向の多様性を確保した画像を選択 視線ベクトルの角度 各画像の視線ベクトル 基準画像の視線ベクトル *RPCより算出 以下の条件を満たす画像だけを採用する 8 画像を固定枚数K枚サンプリング (角度が均等になるように調整) *K=9 *10-60° or 0-75° Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  8. EO-VGGT Stage 2 : SRE(Sensor-Ray Encoder) ①衛星からの視線生成・表現 衛星の軌道に沿って投影中心が変化する →高次の幾何トークンへ変換する DSMの最大値?

    画素 Origin(視線の始点) DSMの最小値? Anchor(視線の基準点) RPCによる逆投影 ENU(East-North Up)への座標変換 センサ視線の単位ベクトル 各画素に対して,6次元の高次元ベクトル ② 幾何トークンをチャンネルごとに平均処理 ENU座標系で各チャンネルを正規化 SREを14×14画素のパッチになるように,Average poolingを実施 VisionTransformerのトークン分解に一致する形へ Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用 9
  9. EO-VGGT Stage 3 : RPAA(Ray-Pointing-Aware Adapter) RPAAの構造 Geometry conditioning Path

    • 2層のMLP 学習可能パラメータ 初期0 最初は元のVGGTと完全に同じ挙動を し、学習とともに少しずつ衛星幾何の 影響を増やす • 残差構造 vision tokensと足し合わせて, 凍結したVGGTに入力 10 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  10. 研究目的・概要(再掲) 一般的な画像で事前学習されたVGGTのパラメータをほぼ凍結させたまま,衛星マルチビュー画像から 高精度な DSMを構築する EO-VGGT ➢ 幾何的・放射的に不適切 な画像を除外する ➢ 各画像の光線の始点

    ➢ と方向を計算する 光線情報をVGGTの画像 パッチトークンへ加える Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用 11
  11. 学習対象と損失関数 学習対象 各画素に対応する3D座標(相対座標) • • • 予測された座標空間と真値の地形座標の間で空間位置合わせ を行う ランダムなN個の画素について,それぞれの真値標高を真のRPCモデルを用い て3次元の実座標へ逆投影

    スケール係数s,回転行列R,並進ベクトルtをアライメントにより推定し,予測座標 を真値の座標系へ変換する 損失関数 • • smooth-L1損失関数 を採用 を用いて,標高成分を重視 標高成分 水平成分 12 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  12. データセットと検証方法 データセット US3D dataset(DFC2019 Track 3) (Bosch et al., 2019)

    異なる都市域を対象として撮影されたWorldview-3衛星の多時期の画像群 前処理は実施せず 512 × 512 にcrop • • • 検証方法 • Cross-city evaluation 学習と検証で異なる都市を対象とする 比較モデル • • 一般的なMulti-view fundation models(zero shot) VGGT(wang et al.,2025a), π (wang et al., 2026), MapAnything(Keetha et al., 2026) EOに特化した3Dモデル(zero shot) EOGS(aira et al., 2025), SatMVS(Gao et al., 2021), SatNGP(Billouard et al., 2024) • VGGT+Pinhole ray(adapter 学習) pinholeだと仮定して, ray情報を入力 3 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  13. 結果 定量評価 95パーセンタイルの誤差 予測領域/対象領域 66地点(検証+テスト)を対象とした検証結果 • • • EO-VGGTはすべてのモデルの中で最も高い性能を達成 Vanilla

    VGGTと比較すると,2.448→1.751(MAE) Pinhole raysでは改善されない ◦ 衛星固有のプッシュブルーム撮影幾何を明示的にモデルに与える重要性を示唆 14 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  14. 結果 ablation study 66地点(検証+テスト)を対象としたablation studyの結果 • • Adapterによる性能向上の寄与が大きい(randomの場合であっても) View Selection

    Strategyでの寄与は軽微 画像選択だけでは,基盤モデルと衛星センサの本質的なギャップを解消できない 16 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  15. 結果 abulation study 異なる衛星画像群から得られた,last-layerでのpatchの潜在特徴を可視化(PCA) • • Vanilla VGGTでは,撮影時期や照明の条件の違いに よって,特徴の色が変化し,構造表現にもばらつきが生 じる

    EO-VGGTの場合,異なる視点間でも特徴が一致して いる →SRE+RPAAを用いて,物理的な視線方向を高次の幾何 特徴に変換することで,影や大気条件の違いや撮影時期の 変化の影響を受けにくくなる 17 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用
  16. 結論・今後の課題 結論 • EO-VGGTを提案し,RPCのray情報(SRE+RPAA)をVGGTへ導入 • GCCSによる画像選択と組み合わせることで,多時期の衛星画像から高精度なDSM再構 成を実現 • Vanilla VGGTより大幅改善

    し,既存の衛星画像向け手法と比較しても高い再構成精度を達 成 • 内部特徴の一貫性 (Cross-view Feature Consistency)が向上し,衛星画像への幾何学的 適応が有効であることを確認 ディスカッション・今後の課題 • • 相対座標の位置推定にとどまっており,絶対位置推定まで含めた統合的な3D構成 に至っ ていない 水域・植生・影等の低テクスチャ領域では,誤差が残る マルチスペクトル情報等の活用や 平滑化事前知識の導入を検討 18 Qiyan Luo et al. (2026), “EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction ”,より引用