Upgrade to Pro — share decks privately, control downloads, hide ads and more …

自律型AI時代のソフトウェア開発

 自律型AI時代のソフトウェア開発

Avatar for Masahiro Muto

Masahiro Muto

September 26, 2026

More Decks by Masahiro Muto

Other Decks in Technology

Transcript

  1. 自己紹介 自己紹介 1.これまでの経験 ソフトウェアエンジニア/インフラエンジニアとして、 設計・開発・運用を長年経験。 某企業では、オンプレミス環境にKubernetesベースのクラウド基盤を スクラッチで構築。IP-ClosアーキテクチャのBGPネットワーク設計・構築をリード。 その後、AIスタートアップ企業にて、生成AIと量子技術でプロジェクトをリード。 2.社会人大学院生 北陸先端科学技術大学院大学の修士1年です。

    ロボット基盤モデル、フィジカルAIを研究しています。 3.ウェブサイト https://huggingface.co/spaces/mutomas a/engineering-research-portfolio クライアントワーク・プロジェクト管理・ ソフトウェア・インフラ・AIの実装までを通して行えるのが強みです。 4.趣味 登山/ハイキング/温泉巡り/自然観察/サーバ・プログラミング 02
  2. 資料構成 目次 01 前提の変化 決定論的なソフトウェアから、確率的・自律的なシステムへ 02 開発方法の変化 AI実行環境、認知負荷、評価駆動開発、能力探索 5–8頁 03

    品質と統制 期待値管理、人による監督、多層評価、基盤、本人性 9–13頁 04 企業規模への展開 自律型AI連携基盤、エコシステム、技術リーダーの責任 14–16頁 05 運用と意思決定 継続的評価、統治コスト、投資対効果、最終提言 17–19頁 4頁 中心テーマ:AIを作ることではなく、AIが安全に判断・行動・改善できる環境を設計する 自律型AI時代のソフトウェア開発 03
  3. パラダイム転換 自律型AIは「LLMを追加すること」ではない 従来:決定論的な実行 AI:文脈で変化する実行 入力 入力+文脈 ↓ ↓ → プログラム/規則

    ↓ 出力 LLM/計画 ↓ ツール/エージェント → 出力 ソフトウェア開発 から 確率的システム工学 へ 結果はモデル・指示文・文脈・データ・ツール・エージェント状態によって変わ る 04
  4. 実行環境設計 開発対象は「コード」から「AI実行環境」へ 従来 AI開発エージェント 開発者 要求 ↓ コード テスト →

    配備 文脈 規則 ツール 隔離環境 テスト 評価 安全制御 実行追跡 ↓ AI開発エージェント ↓ AIを囲む実行環境 ↓ ソフトウェア 中心課題は コーディング → AI実行環境設計 05
  5. 人間の認知負荷 AIエージェント時代、レビューは「コード確認」から「判断の監督」へ 生成量が増えるほど、人間のボトルネックは実装ではなく、意図・根拠・実行経路・副作用を見極める認知負荷になる。 従来のレビュー 仕様を理解 ↓ 認知負荷の新要因 意図 コード/出力 量

    要求と生成物の目的は一致 しているか 結果は正しく、保守可能か 生成速度が確認速度を上回る 非決定性 差分を確認 ↓ 実行経路 根拠 入力が同じでも経路と結果が変わる 判断・ツール・再試行をど う経たか テスト・評価・根拠は十分 か 不可視性 内部判断を差分だけでは説明できない 承認 / 修正 全件精査から レビュー設計へ AIエージェント時代に同時確認するも の 副作用 不確実性 権限・データ・外部操作の 影響 未知の失敗と説明不能領域 責任 承認者が副作用まで引き受ける リスク階層化 根拠を先に確認 例外へ集中 標本監査 影響度でレビュー深度を変える 追跡・評価・テストを承認材料に する 正常系を自動化し、逸脱に集中す る 全件ではなく継続監査で品質を見 る 人による監督は、自律度に合わせて強化する 06
  6. 評価駆動開発 ウォーターフォールから「評価しながら仕様を発見 する」開発へ 従来:完成してからテスト 要件 → 設計 → 実装 →

    テスト → 試作 仮説 → 評価 ↓ ← 指示文/検索拡張 再評価 ← 失敗分析 モデル/ツール ↺ 仮説 → 実装 → 評価 → 学習 → 要件修正を、継続的に回す 07
  7. 能力探索 要件定義も「固定」から「探索」へ 最初に固定する 評価で更新する 守るべき境界 探索する能力 • ビジネス要件 • セキュリティ要件

    • 法的・規制上の制約 • 操作権限と禁止事項 • AIに任せられるタスク • 達成可能な精度・再現性 • 人による確認が必要な地点 • 既知の失敗と能力境界 + 要件定義に加えて、能力探索が必要になる 08
  8. 期待値管理 顧客との「期待値調整」が開発そのものになる 能力を変化させる要素 いつ どの条件なら どれくらいの確率で どこまでできるか モデル 指示文 検索拡張生成

    ツール エージェント 作業手順 顧客と継続共有するもの 能力 限界 リスク 評価結果 既知の失敗 改善 「できる/できない」ではなく、能力の条件と限界を説明する 09
  9. 人による監督 人間参加型の設計は例外処理ではない 段階 0 AIが提案 → 人が実行 人が実行 段階 1

    AIが計画 → 人が承認 → AIが実行 事前承認 段階 2 AIが実行 → 人が事後確認 段階 3 AIが自律実行 → 人が例外時に介入 事後レビュー 例外介入 設計するのは「何をさせるか」だけでなく「どこまで権限を与えるか」 10
  10. 品質保証体系 テストから評価へ 事業成果の評価 タスク達成/成果 評価軸は品質・安全・運用へ広がる 正確性 根拠整合性 ツール選択 実行経路 安全性

    応答時間 コスト タスク達成 実行経路の評価 計画/引き継ぎ/再試行/経路 ツール利用の評価 選択/引数/副作用 出力の評価 正確性/根拠整合性 期待値と実測値の一致だけでは、AIエージェントの品質は定義できない 11
  11. エージェント基盤 AIエージェントでは非機能要件が一段難しくなる AIエージェント/実行基盤 モデルと文脈 行動 制御 モデル ツール/MCP 本人性/方針 検索拡張/記憶

    引き継ぎ 安全制御 状態 隔離環境 人による承認 実行追跡 監査 可観測性 コスト管理 ライフサ イクル 障害対応 12
  12. 本人性と信頼 「誰が」だけでなく「どのエージェントが、誰の代理で、何をし たか」 利用者 本人性 → エージェント 本人性 役割/属性ベース権限制御 最小権限

    → 委任された 権限 → ツール 本人性 → 対象資源 必要になる統制 短期認証情報 監査証跡 本人性・記憶・ツール・人による監督・複数エージェント連携が新たな攻撃面になる 13
  13. 自律型AI連携基盤 エージェントが増えると、開発対象は共通基盤になる エージェント市場 人事エージェン 財務エージェント ト 開発エージェン ト 営業エージェント 調査エージェント

    エージェント台帳/発見/ライフサイクル モデル ツール/MCP データ/記憶 本人性/方針 安全制御/承認 評価 可観測性 監査/コスト ライフサイクル エージェント制御基盤 14
  14. エコシステム工学 アプリケーション開発からエージェント・エコシステム工学へ 従来 自律型AI 自律型AI連携基盤 コード エージェント エージェント・エコシステム API ツール/MCP

    エージェント発見 単体テスト 評価 継続的評価 ログ 実行追跡 エージェント横断追跡 サービス用アカウント エージェント本人性 信頼基盤 配備 エージェント公開 エージェント・ライフサイクル アクセス制御 安全制御 方針のコード化 監視 エージェント可観測性 制御基盤 エージェント乱立・権限・依存関係・変更・コストを横断管理する 15
  15. 技術リーダーシップ 技術リーダーは「AIが安全に自律できる範囲」を設計する 従来の責任 • アーキテクチャ • コード品質 • 性能 •

    信頼性 • セキュリティ これから加わる責任 AIの能力 評価 文脈 エージェント実行環境 人による監督 安全制御 エージェント本人性 可観測性 コスト 統治 新しい問い:どこまで自律させ、失敗時に検知・停止・復旧・説明できるか? 16
  16. 自律型AI開発工程 開発ライフサイクルそのものを変える 従来の開発工程 計画 事業目標 → 能力 → 試作 →

    評価 仮説 ↓ ↓ 構築 ↓ ← 再評価 改善 テスト ← 配備/ 観測 ← リスク 評価 ↓ ↺ 配備 ↓ 統治 | セキュリティ | 人による監督 | コスト | 法令順守 運用 継続的統合・継続的配備だけでは足りない。継続的評価が必要になる 17
  17. コストと投資対効果 AIエージェントの自律性を高めるほど、統治コストも増える 利用形態 チャットボット ガバナンス負荷 自律度 自律度とともに増える統制 低 本人性 権限管理

    支援型AI 中低 隔離環境 人による承認 エージェント+ツー ル 中高 監査 評価 監視 障害対応 法務 法令順守 自律型エージェント 高 「エージェント化できるか」ではなく、投資対効果があるかを判断する 18
  18. 最終メッセージ AIエージェント時代の開発とは、AIを作ることではない。 AIが安全に判断・行動・改善できる環境を作ることである。 ソフトウェア 工学 → → AI 工学 エージェント

    工学 → エージェント基盤 工学 1. 開発方法 2. アーキテクチャ 3. リーダーシップ コード駆動 → 評価駆動 アプリケーション → 自律型AI連携基盤 ソフトウェア管理 → 自律性の統治 19