Upgrade to Pro — share decks privately, control downloads, hide ads and more …

ADKで始める業務改善 - AIエージェント開発時の考えと設計

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for Kazuki Hara Kazuki Hara
September 18, 2026

ADKで始める業務改善 - AIエージェント開発時の考えと設計

Avatar for Kazuki Hara

Kazuki Hara

September 18, 2026

More Decks by Kazuki Hara

Other Decks in Technology

Transcript

  1. 自己紹介 原 和希 株式会社サイバーエージェント MIU AI戦略本部・ AI/MLエンジニア • Google Developer

    Experts (Google Cloud: AI) • CyberAgent Next Experts (Google Cloud/ ML) • X: @harappa80
  2. 自己紹介 先月、書籍を出版しました 🎉! 『Google CloudではじめるAI/ML入門』 ・出版: O'Reilly Japan ・著者: 藤森

    立、岡安 優、原 和希、徳山 健斗 ・担当:Agent Platform/MLOps 周辺 「データ基盤の構築〜AIエージェント開発」 までの幅広い領域を、ハンズオンを通して、 実践的に学べる一冊になっています!
  3. 02 エージェントアーキテクチャ 技術構成 エージェントフレームワーク: 「ADK 2.0」 実行基盤: 「Agent Runtime, Cloud

    Run Jobs」 アクセス方法: WebアプリとMCPの両方に対応 Web App API Job Worker Agents Gemini 3.8 Flash Cloud Run Service Cloud Run Service Cloud Run Jobs Agent Platform Runtime MCP 外部 MCP ©CyberAgent, Inc. All Rights Reserved 外部 API
  4. エージェントアーキテクチャ 02 Workflow か Agentic か やみくもにLLMにルーティングをさせない Workflow (ADK 2.0

    Workflow) Agentic (LlmAgent) • 固定グラフ • LLMがルーティングとTool選択を判断 • 決定論的 • 柔軟だが揺らぐ • 定型の業務プロセス向き • カバー範囲が広域、 • デバッグが比較的容易 探索的・非定型なタスク向き • デバッグが比較的困難 ©CyberAgent, Inc. All Rights Reserved
  5. 02 エージェントアーキテクチャ 目的に合わせたUI 「AI Agent ≠ チャットアプリ」 チャット: 想定する入力の柔軟性・機能のカバー範囲が広いケースで有効 フォーム形式のUIを採用

    • • 柔軟な応答を必要としない機能なため ユーザー応答は逐次、選択形式(ボタン/ チェックボックス)で取得 → 利用者が直感的に利用できるようにする ©CyberAgent, Inc. All Rights Reserved
  6. エージェントアーキテクチャ 02 ADK 2.0 Workflow での実装 • Workflow と Agentic

    のハイブリッド(SubAgent で柔軟性を活かす) • 分岐・合流・再試行・フォールバック • Agent Runtime へのデプロイ (セッション管理 / スケーリング) Parallel tasks 再試行 SubAgent 1 Input Preprocess 処理を分岐 品質を判定 Join ••• Fan-out GUARD SubAgent n 全タスクの 完了を待つ GUARD 品質を判定 ©CyberAgent, Inc. All Rights Reserved Postprocess 結果を統合 Output
  7. 02 エージェントアーキテクチャ 「人間が待つ」をなくす Cloud Run Jobs から Agent Runtime へリクエスト

    一括投入: コーディングエージェント・スプシ(Webアプリ)から並列処理 並列実行: 1 件 = 1 タスクの並列 index で一斉処理 バックグラウンド処理: 画面を閉じて、人間は他の仕事へ ©CyberAgent, Inc. All Rights Reserved
  8. 03 ADK Evalと開発ワークフロー ADK の組み込み評価機能 AI エージェントの出力品質を自動で評価する仕組みが標準搭載 『評価ケース × 評価基準』を定義して評価実行

    LLM as a Judge, Tool Trajectory, Reference ベースの評価が可能 評価ケース 入力・初期状態 下記の方法で利用 評価基準 Tool・rubric adk web(開発者が実行・確認) Agentを実行 adk eval CLI(コーディングエージェント) pytest(CI) LLM-as-judge ©CyberAgent, Inc. All Rights Reserved 結果+理由 Reference を元に評価
  9. 03 ADK Evalと開発ワークフロー 機能追加で広がる評価の空白 実装が進んでも、評価ケースとルーブリックの更新が放置されがち 評価側 実装側 既存評価の範囲 1 2

    3 既存機能 新機能・指示 新しいTool 以前のケースとルーブリック 新しい要件 未評価のまま ©CyberAgent, Inc. All Rights Reserved
  10. 03 ADK Evalと開発ワークフロー 開発ハーネス -「コーディングエージェント」 × 「ADK Eval」 実装・評価の差分を産まない: 実装と評価資産を同じ変更単位にする仕組み化

    開発品質の向上: 『実装 → EVAL → 失敗した観点を読んで修正』を収束まで自走 STEP 1 STEP 2 STEP 3 専用 Skill Coding Agent 専門家と開発者 変わった出力・Tool・安全境界を確認 追加すべきケースとルーブリックを提案 評価資産を実装し、ADK Evalを実行 結果と変更理由を整理 最終判断を持つ 基準の妥当性と境界をレビュー ©CyberAgent, Inc. All Rights Reserved
  11. 03 ADK Evalと開発ワークフロー 評価基準・背景を一元管理 - Evalset / ケース ルーブリック どの入力で確かめるか

    どの基準で評価するか EVAL.md PR 追加背景と対応関係 人間によるレビュー Repository ©CyberAgent, Inc. All Rights Reserved
  12. 03 ADK Evalと開発ワークフロー 評価基準・背景を一元管理 利用者 FB・専門家レビュー・本番失敗を再現ケースも加える - Evalset / ケース

    ルーブリック どの入力で確かめるか どの基準で評価するか EVAL.md PR 追加背景と対応関係 人間によるレビュー Repository ©CyberAgent, Inc. All Rights Reserved
  13. 03 ADK Evalと開発ワークフロー 専門家とつくる評価基準 「理想の出力」とはどのようなものか? 01 理想の出力を言語化する ドメイン専門家に、こだわりや優位性をヒアリングする。 02 良し悪しを分解する

    定性評価からはじめ、判断の観点を整理する。 03 ルーブリックを継続的に改善する 人手評価と LLM-as-a-Judge の結果を突き合わせる。 ©CyberAgent, Inc. All Rights Reserved
  14. 03 ADK Evalと開発ワークフロー 基礎セットで捉える品質劣化 モデル変更・プロンプト改善で、 Aが良くなってもBが劣化することがある。 変更前 変更後 両方の観点を守れている Aは向上、Bは劣化

    Metrics A 期待する品質を満たす Metrics A 狙った品質が改善 Metrics B 期待する品質を満たす Metrics B 以前できていたことが劣化 同じ基礎セットを変更前後で実行し、 狙った改善と既存品質の劣化を同時に確認する。 ©CyberAgent, Inc. All Rights Reserved
  15. 03 ADK Evalと開発ワークフロー 評価を始める最初の一歩 01 専門家の知見を言語化する 重要な出力を一つ選び、「良い」「絶対に避けたい」を一つずつ書く。 02 実装と同じPRで追加する ケースかルーブリックを一つ、実装と同じPRで追加する。

    03 次も実行できるケースを残す レビュー指摘や本番の失敗を、再実行できるケースとして残す。 一観点・一ケースを確実に動かすところから始める。 ©CyberAgent, Inc. All Rights Reserved
  16. 04 まとめ まとめ エージェント設計 実行基盤 業務を分解し、性質に合わせて WorkflowとAgenticを使い分ける・ 組み合わせる。 Agent Runtimeに実行を任せ、

    安定性とスケールを確保する。 業務への組み込み 品質と運用 一括・並列・バックグラウンド 人を待たせない。選択式UIで、迷わせない。 ADK EvalとCoding Agentで評価・修正を回し、 品質を保つ。判断は人が持つ。 ©CyberAgent, Inc. All Rights Reserved