Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
【CA.ai #4】Vertex AI Gen AI Evaluation Service の...
Search
Kazuki Hara
September 03, 2026
Programming
19
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
【CA.ai #4】Vertex AI Gen AI Evaluation Service の活用事例紹介
https://cyberagent.connpass.com/event/383129/
Kazuki Hara
September 03, 2026
More Decks by Kazuki Hara
See All by Kazuki Hara
ADKで始める業務改善 - AIエージェント開発時の考えと設計
harappa80
2
310
Build with AI:ADKとGemini CLIで自分だけのAIアシスタントを作ろう!
harappa80
0
15
【CA.ai #3】Google ADKを活用したAI Agent開発と運用知見
harappa80
1
560
Other Decks in Programming
See All in Programming
Augmenting AI with the Power of Jakarta EE
ivargrimstad
0
440
GemmaをJevのように使ってみる / Use Gemma like Jev
kishida
5
670
Heart of Swift Concurrency
koher
0
1.2k
【加筆修正版】Laravel のアプリケーションをどこにデプロイするか #phpcon_ehime
akase244
0
150
C#の現在地 進化の歴史と、AI時代の.NET Everywhere
neuecc
5
4.9k
Java 27新機能 / Java 27 new features
kishida
2
200
ハーネス設計入門 〜 基礎知識の整理から実務へのステップアップ 〜
kinopeee
20
21k
Atomic Design, Enforced: Scaling Mobile Design Systems (next.app devCon / droidCon Berlin 2026)
steliosf
PRO
0
120
AI時代のコードレビューは人に向けるな、仕組みに向けろ
texmeijin
5
3.5k
AI Agent時代のリアーキテクチャ戦略と実践
hokaccha
9
5.4k
そのリトライ、死んだコネクションを使い回していませんか ── GoのHTTPクライアントとHTTP/2を実プロダクト障害から学び直す
myus4a
0
390
Vue Fes Japan 2026 タイムテーブル徹底解説
448jp
1
620
Featured
See All Featured
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
300
Become a Pro
speakerdeck
PRO
31
6.3k
Jamie Indigo - Trashchat’s Guide to Black Boxes: Technical SEO Tactics for LLMs
techseoconnect
PRO
0
690
Evolution of real-time – Irina Nazarova, EuRuKo, 2024
irinanazarova
9
1.6k
Primal Persuasion: How to Engage the Brain for Learning That Lasts
tmiket
0
490
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
510
How to audit for AI Accessibility on your Front & Back End
davetheseo
0
570
AI: The stuff that nobody shows you
jnunemaker
PRO
10
1.1k
Side Projects
sachag
456
43k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.6k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
760
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
260
Transcript
Vertex AI Gen AI Evaluation Service の活用事例紹介 2026/03/05 「CA.ai#4 〜AIOpsの最前線〜」
株式会社サイバーエージェント MIU AI戦略本部 原 和希
1.自己紹介 2.今日皆さんに持ち帰って欲しいこと 3.事例①〜占いチャットアプリ〜 4.事例②〜記事校正支援用エージェント〜 5.まとめ
原 和希 株式会社サイバーエージェント / MIU AI戦略本部 AIエンジニア • Google Developer
Experts (Google Cloud: AI) • CyberAgent Developer Experts (Google Cloud/ ML) • X: @harappa80
LLMを使った機能・アプリケーションを 開発している方 ✋
出力評価 (LLM-as-a-Judgeとか) をしている方 ✋
今日皆さんに 持ち帰って欲しいこと
今日話すこと • 事例紹介 ◦ 出力評価の重要性 ◦ Vertex AI Gen AI
Evaluation Serviceの強み
LLMをサービスインする時に決めること • LLM • システムプロンプト • パラメータ etc. エージェントの場合は加えて、 •
ツール(とディスクリプション) これらは何度も出力・確認して調整していくもの
出力評価の必要性 前述の変数の決定に加えて... • あらゆるユーザー入力に対応できている? • 意図せぬ出力(意味不明な記号とか文字とか)は出ない? • プロンプトインジェクションなどの攻撃には堅牢? LLMは非決定論的振る舞いをするため、完璧な対応は難しいが、 サービス品質に関わる問題。可能な範囲での対策はしておくべき。
None
事例① 〜占いチャットアプリ〜
サービス •
直面していた課題
アーキテクチャ • LangChainをVertex AI SDKでラップ • 結果はGCSへ格納 ◦ → エンジニア:
専用アプリ(Streamlit), Notebook ◦ → ビジネスメンバー: スプレッドシート
アプローチ Rubric(評価基準 ) User prompt Response Vertex AI Gen AI
Evaluation Service LLM as a Judge スコア & 評価理由
Vertex AI Gen AI Evaluation Serviceの良いところ①
重要なポイント ① 専門家の暗黙知をルーブリックに落とし込む • 「理想の出力」とはどのようなものか? ◦ ドメイン専門家にヒアリング(こだわりや優位性) ◦ 定性評価からはじめて良し悪しを分解していく •
ルーブリックを継続的に改善していく ◦ 人手評価と LLM-as-a-Judge の結果を突き合わせて信頼性を検証
重要なポイント ② ユースケースを網羅したデータセットを作成 • 想定される入力に対して理想の出力を用意する ◦ 既存のデータが使用・参考にする • 10 件程度の高品質なデータセットからはじめて、徐々に増やす
• 品質担保のためのデータと改善領域にフォーカスした、チャレンジングな データを使う
None
事例② 〜記事校正支援用エージェント〜
現在開発しているアプリケーション とあるメディアサイトの記事校正支援用 AIエージェント 📝 • 業務効率化が目的 • 社内用のWebアプリケーションとして提供 • ADKで開発,
VertexAI AgentEngineへデプロイ
事例①の時からのアップデート • エージェントのための評価機能 ◦ Trajectory(軌跡) 評価 • 適応型ルーブリックが追加 ◦ 自動的にルーブリックリストを生成
◦ guidelinesパラメータでカスタマイズも可能 • SDKがGenAI Client(from vertexai import Client)に移行 ◦ 旧(from vertexai.evaluation import EvalTask)
課題 🤔 instructionやツール定義(説明文)が曖昧だと、 ツールを使わずに出力をしてしまうことがある 🤔 複数のサブエージェントがあり、 ルートエージェントが適切に呼び出しているかを評価したい
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Sub AgentをAgent-as-a-Toolとして使用 Root Agent(LLMAgent) Agent-as-a-Tool①
Agent-as-a-Tool② Tools Agent-as-a-Tool③ オーケストレートに対しての Trajectory評価 Tools
評価観点 1. ツールの実行内容・順序を評価 2. 最終出力を評価 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools
Agent-as-a-Tool③ Tools Agent as a ToolはToolとして扱われるので eventが含まれない サブエージェント に対しての Trajectory評価
評価観点 1. ツールの実行内容・順序を評価 LLM as a Judge カスタム &適応型ルーブリック 2.
最終出力を評価 出力 Root Agent(LLMAgent) Agent-as-a-Tool① Agent-as-a-Tool② Tools Agent-as-a-Tool③ Tools
Vertex AI Gen AI Evaluation Serviceの良いところ② • ADK×AgentEngineとの親和性の高さ ◦ AgentEngineへのリクエスト〜評価をサポート
◦ 評価に必要なAgentのメタデータを簡単に渡せる ▪ メタデータ: instruction,ツール定義(関数名・引数・説明文)など ◦ 上記を考慮して、適応型ルーブリックが動的に基準を作成
まとめ
まとめ • AI機能をサービスインする際に出力評価は大切。 • Vertex AI Gen AI Evaluation Service
を使えばマネージドで実現可能 • 最も重要なのは「良い出力」を「言語化」 すること
None
None