Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
【CA.ai #4】Vertex AI Gen AI Evaluation Service の...
Search
Kazuki Hara
September 03, 2026
Programming
6
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
【CA.ai #4】Vertex AI Gen AI Evaluation Service の活用事例紹介
https://cyberagent.connpass.com/event/383129/
Kazuki Hara
September 03, 2026
More Decks by Kazuki Hara
See All by Kazuki Hara
Build with AI:ADKとGemini CLIで自分だけのAIアシスタントを作ろう!
harappa80
0
6
【CA.ai #3】Google ADKを活用したAI Agent開発と運用知見
harappa80
1
500
Other Decks in Programming
See All in Programming
20260828_品質と開発生産性を両立させる、AI時代のE2Eテストの考え方
magicpod
0
210
【高い買い物LT会】初任給で話題の国産フィジカルAIを買った話
akagami
PRO
0
160
技術的負債の返済は、AI時代の複利で効く投資 — 経営としての意思決定とその遂行
curekoshimizu
0
1.3k
AWS DevOps Agentで インシデント対応をAIに任せたい
honmarkhunt
7
2.9k
Go × SIMDで高速化するベクトル検索 ~ルーフラインモデルでSIMDが効く境界を探れ! ~
po3rin
1
920
選挙速報を多くのユーザーへ 届ける Live Activities 設計
hamayokokuririn
0
140
スマートフォンでモールス信号を送受信する 〜スマートフォンのLEDとカメラで作る光通信の設計と実装〜
atsuki_seo
0
110
フロントエンドUIフレームワークのこれまでとこれから
ssssota
5
2.7k
LL言語やWebフレームワークのPostgreSQL対応 〜DBの機能がユーザーに届くまで〜
kentaroutakeda
1
150
The Good Stuff, Not the Slop: Engineering High-Quality Android Apps with Modern AI Tooling
danybony
1
250
Jetpack Compose メカニズム
skydoves
0
420
kubernetes コンポーネント開発入門 / 新卒N年目の勉強会&交流会!〜〇〇への誘い〜 #n_study
mazrean
0
240
Featured
See All Featured
Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum
chikuwait
0
800
Templates, Plugins, & Blocks: Oh My! Creating the theme that thinks of everything
marktimemedia
31
2.9k
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.3k
A Soul's Torment
seathinner
8
3.6k
Designing Powerful Visuals for Engaging Learning
tmiket
1
550
Refactoring Trust on Your Teams (GOTO; Chicago 2020)
rmw
35
3.8k
The B2B funnel & how to create a winning content strategy
katarinadahlin
PRO
1
520
Performance Is Good for Brains [We Love Speed 2024]
tammyeverts
12
1.8k
Leading Effective Engineering Teams in the AI Era
addyosmani
9
2.6k
Distributed Sagas: A Protocol for Coordinating Microservices
caitiem20
333
23k
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
490
Practical Orchestrator
shlominoach
192
12k
Transcript
Vertex AI Gen AI Evaluation Service の活用事例紹介 2026/03/05 「CA.ai#4 〜AIOpsの最前線〜」
株式会社サイバーエージェント MIU AI戦略本部 原 和希
1.自己紹介 2.今日皆さんに持ち帰って欲しいこと 3.事例①〜占いチャットアプリ〜 4.事例②〜記事校正支援用エージェント〜 5.まとめ
原 和希 株式会社サイバーエージェント / MIU AI戦略本部 AIエンジニア • Google Developer
Experts (Google Cloud: AI) • CyberAgent Developer Experts (Google Cloud/ ML) • X: @harappa80
LLMを使った機能・アプリケーションを 開発している方 ✋
出力評価 (LLM-as-a-Judgeとか) をしている方 ✋
今日皆さんに 持ち帰って欲しいこと
今日話すこと • 事例紹介 ◦ 出力評価の重要性 ◦ Vertex AI Gen AI
Evaluation Serviceの強み
LLMをサービスインする時に決めること • LLM • システムプロンプト • パラメータ etc. エージェントの場合は加えて、 •
ツール(とディスクリプション) これらは何度も出力・確認して調整していくもの
出力評価の必要性 前述の変数の決定に加えて... • あらゆるユーザー入力に対応できている? • 意図せぬ出力(意味不明な記号とか文字とか)は出ない? • プロンプトインジェクションなどの攻撃には堅牢? LLMは非決定論的振る舞いをするため、完璧な対応は難しいが、 サービス品質に関わる問題。可能な範囲での対策はしておくべき。
None
事例① 〜占いチャットアプリ〜
サービス •
直面していた課題
アーキテクチャ • LangChainをVertex AI SDKでラップ • 結果はGCSへ格納 ◦ → エンジニア:
専用アプリ(Streamlit), Notebook ◦ → ビジネスメンバー: スプレッドシート
アプローチ Rubric(評価基準 ) User prompt Response Vertex AI Gen AI
Evaluation Service LLM as a Judge スコア & 評価理由
Vertex AI Gen AI Evaluation Serviceの良いところ①
重要なポイント ① 専門家の暗黙知をルーブリックに落とし込む • 「理想の出力」とはどのようなものか? ◦ ドメイン専門家にヒアリング(こだわりや優位性) ◦ 定性評価からはじめて良し悪しを分解していく •
ルーブリックを継続的に改善していく ◦ 人手評価と LLM-as-a-Judge の結果を突き合わせて信頼性を検証
重要なポイント ② ユースケースを網羅したデータセットを作成 • 想定される入力に対して理想の出力を用意する ◦ 既存のデータが使用・参考にする • 10 件程度の高品質なデータセットからはじめて、徐々に増やす
• 品質担保のためのデータと改善領域にフォーカスした、チャレンジングな データを使う
None
事例② 〜記事校正支援用エージェント〜
現在開発しているアプリケーション とあるメディアサイトの記事校正支援用 AIエージェント 📝 • 業務効率化が目的 • 社内用のWebアプリケーションとして提供 • ADKで開発,
VertexAI AgentEngineへデプロイ
事例①の時からのアップデート • エージェントのための評価機能 ◦ Trajectory(軌跡) 評価 • 適応型ルーブリックが追加 ◦ 自動的にルーブリックリストを生成
◦ guidelinesパラメータでカスタマイズも可能 • SDKがGenAI Client(from vertexai import Client)に移行 ◦ 旧(from vertexai.evaluation import EvalTask)
課題 🤔 instructionやツール定義(説明文)が曖昧だと、 ツールを使わずに出力をしてしまうことがある 🤔 複数のサブエージェントがあり、 ルートエージェントが適切に呼び出しているかを評価したい
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Sub AgentをAgent-as-a-Toolとして使用 Root Agent(LLMAgent) Agent-as-a-Tool①
Agent-as-a-Tool② Tools Agent-as-a-Tool③ オーケストレートに対しての Trajectory評価 Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools Agent as a ToolはToolとして扱われるので eventが含まれない サブエージェント に対しての Trajectory評価
評価観点 1. ツールの実行内容・順序を評価 LLM as a Judge カスタム &適応型ルーブリック 2.
最終出力を評価 出力 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools Agent-as-a-Tool③ Tools
Vertex AI Gen AI Evaluation Serviceの良いところ② • ADK×AgentEngineとの親和性の高さ ◦ AgentEngineへのリクエスト〜評価をサポート
◦ 評価に必要なAgentのメタデータを簡単に渡せる ▪ メタデータ: instruction,ツール定義(関数名・引数・説明文)など ◦ 上記を考慮して、適応型ルーブリックが動的に基準を作成
まとめ
まとめ • AI機能をサービスインする際に出力評価は大切。 • Vertex AI Gen AI Evaluation Service
を使えばマネージドで実現可能 • 最も重要なのは「良い出力」を「言語化」 すること
None
None