Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Amazon Bedrock AgentCore EvaluationsでAIエージェントを評...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Yudai Jinno
January 26, 2026
Technology
700
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Amazon Bedrock AgentCore EvaluationsでAIエージェントを評価してみよう!
JAWS-UG大阪 re:Invent re:Cap LT大会 UFOが来たら強制終了で使用する登壇資料です。
Yudai Jinno
January 26, 2026
More Decks by Yudai Jinno
See All by Yudai Jinno
AgentCoreの機能、全部要る? ユースケース別にAWSサービスとの組み合わせ方を一緒に整理しよう
yuu551
4
2.3k
Amazon Bedrock AgentCore Managed Harness 座学資料
yuu551
1
2.3k
AWS Agent Registryへの期待
yuu551
1
110
Amazon Bedrockで始めるRAG入門
yuu551
1
1k
アーキテクチャ選定から実装Tipsまで! AgentCore / Strands AgentsでAIエージェントを実際に作ってわかったことN選
yuu551
4
1k
個人的によく知らなかった AgentCore Memoryの機能を中心に深掘りしてみた
yuu551
2
840
Bedrock PolicyでAmazon Bedrock Guardrails利用を強制してみた
yuu551
1
750
2025年 Amazon Bedrock AgentCoreまとめ
yuu551
31
21k
爆速でキャッチアップしよう!Amazon Bedrock AgentCore/Strands Agentsのre:Inventアップデート情報まとめ!
yuu551
2
1.7k
Other Decks in Technology
See All in Technology
しぶいSRE: サーバから見えない障害にどう向き合うか。ラストワンマイルのデバッグ実践 / Shibui SRE
kanny
13
6.5k
脱金融のフューチャー・デザイン / Future Design Beyond Finance
ks91
PRO
0
160
公式ドキュメントの歩き方etc
coco_se
1
120
SRE本の知られざる名シーン / The Hidden Gems of Google SRE Book
nari_ex
1
420
AIレビューはどこまで任せられるのか?自動化と人が背負うレビューの境界
sansantech
PRO
3
1.1k
ボーイスカウトルールでメモリやスキルを改善しよう
azukiazusa1
4
1.4k
ruby.wasmとPicoRuby.wasmに対応した仮想DOMライブラリを作ってる話 #kaigieffect_kaigi
sue445
PRO
0
150
ソニー銀行におけるビジネスアジリティ向上のためのクラウドシフト戦略
srenext
0
730
CSに"SLO"は要らない、経営層に"99.9%"は伝わらない - SREを全社に"翻訳"する3原則
cscengineer
PRO
1
5k
Amazon EVS で VCF 9.0 / 9.1 のサポート開始まとめ
mtoyoda
0
310
Kaggleで成長するために意識したこと
prgckwb
2
410
あなたの『Site』はどこですか? — xREという考え方
miyamu
0
1.2k
Featured
See All Featured
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
970
Making Projects Easy
brettharned
120
6.7k
Between Models and Reality
mayunak
4
370
Money Talks: Using Revenue to Get Sh*t Done
nikkihalliwell
0
380
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
490
Fashionably flexible responsive web design (full day workshop)
malarkey
408
67k
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
220
4 Signs Your Business is Dying
shpigford
187
22k
Testing 201, or: Great Expectations
jmmastey
46
8.2k
A Soul's Torment
seathinner
6
3.1k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
2
350
Navigating Algorithm Shifts & AI Overviews - #SMXNext
aleyda
1
1.4k
Transcript
Amazon Bedrock AgentCore EvaluationsでAIエージェントを評価 してみよう! 神野 雄大(Jinno Yudai /@yjinn448208 )
JAWS-UG大阪 re:Invent re:Cap LT大会 UFOが来たら強制終了 2026/1/26(月)
自己紹介
名前 神野 雄大(Jinno Yudai)/@yjinn448208 最近X始めました! 所属 クラスメソッド株式会社 クラウド事業本部 コンサルティング部 ソリューションアーキテクト
資格 Japan All AWS Top Engineers 2025 推しのサービス Amazon Bedrock AgentCore 自己紹介 KIROハウスで!! (re:Invent初参加!) スフィア!オズの 魔法使い見たよ! ブログはこのアイコン で書いています!
Amazon Bedrock AgentCore
Amazon Bedorck AgentCoreって何? AIエージェントのホスティング Strands Agents、LangGraphなど多様なエー ジェントフレームワークに対応 便利なマネージドサービス AIエージェントを使用する上で認証・ツール連 携など便利な機能がマネージドサービスとして
提供(IdentityやMemoryなど) Amazon Bedrock AgentCore
要はAI Agentを簡単に作ること ができるサービス!!
こんな感じで使えるよ Strands Agents Amazon Bedrock スーパーマーケット のナレッジ AI Agent リクエスト
推論に使用 ツール利用 ユーザー 安くておすすめの スーパーを教えて (ナレッジの調査結果から)おすすめの スーパーはラ・ムーです。 AgentCore Runtime
本題に・・・ 作ったAIエージェントを評価していますか?
やっていない・・・難しそう・・・ でも適切に動いているか評価して作ったAI エージェントを改善したい・・・
そこにre:Inventで 嬉しいアップデートが!
Amazon Bedrock AgentCore Evaluations
Amazon Bedorck AgentCore Evalutiaons 開発・運用しているAIエージェントの評価がコンソール上からできるようになりました。 ダッシュボードからわかりやすく確認できます 。LLMを使った評価(LLM-as-a-Judge)となります 。 ユーザー AI
Agent 安くておすすめの スーパーを教えて (ツールの結果から) おすすめのスーパーはラ・ムーです 。 コンソール上からリアルタイ ムに近い形で確認できるよ スーパーマーケット のナレッジ 一連の流れを基準に基づいて評価 ツール利用
評価方法 ログをベースに評価を行うため、稼働中のエージェントには影響がなくリアルタイムに近い形で コンソールで評価可能です!!!オンデマンドで評価する方法もできます。 どちらも運用中のエージェントには影響しない Online Evaluation (今日はこっち) On-demand evaluation リアルタイムでエージェント品質を
継続的にモニタリング可能、サンプ リング率やフィルタ条件を指定でき る 評価結果はObservabilityのダッ シュボードからも確認可能 特定のセッションIDなどを指定して オンデマンドで評価可能 Starter Toolkitで簡単に実現可能
実際にやってみる
エージェントのデプロイ CDKでスーパーマーケットAIエージェントをデプロイしておきます。ソースコードも不要かと思 いますが、共有します。関西のスーパーを中心としたナレッジを入れています。 ワイ ソースコード レポジトリのURL cdk deploy AgentCore Runtime
AWS Strands Agents Amazon Bedrock スーパーマーケット のナレッジ AI Agent 推論に使用
コンソール上から設定する 下記3つを評価指標として選択 忠実性 目標達成率 ツール選択の正確性
AIエージェントに質問してみる 正解できそうな質問と不正解になりそうな質問を聞いてみます。 安くておすすめの スーパーを教えて コストコについて 教えて 24時間営業で品質も 良いスーパーは? AI Agent
スーパーマーケット のナレッジ ツール利用 質問
回答を見てみる 実際の回答を少し見てみます。コストコの質問はナレッジが入っていないので回答できていませ んね。
評価結果を見てみる いくつかの質問に対する評価サマリーはGen AI Observabilityダッシュボードから確認できま す。どれぐらい基準を満たしているかパッとわかるのは嬉しいですね。
評価結果を見てみる もう少しブレイクダウンしてコストコについての質問が、どんな風に評価されているのか具体的 に見てみましょうか。CloudWatch に評価結果のログが格納されているのでみれます。 GoalSuccessRateを例に見てみます。 0点がついている
評価結果を見てみる 日本語に訳してみます。 ユーザーは日本語でコストコ(Costco)について質問しました。 AIアシスタントは適切に「retrieve」ツールを使用し、ナレッジベースからコストコに関する情報を検索しました。 検索の結果、スコア0.4以上のドキュメントが5件ヒットしましたが、その中にコストコに関する具体的な情報を含むものはありませんでした。 代わりに、関西地方の様々なスーパーマーケット(ラ・ムー、玉出、阪急オアシス、ライフ、イオン、コーナン)に関する情報が表示されました。 AIアシスタントはツールの出力を正しく解釈し、ナレッジベース内にコストコに関する直接的な情報が見つからなかったことを、ユーザーに誠実に伝えました。 その際、アシスタントは以下の対応を行いました: 利用可能な情報の限界を認めた。 代わりに提供可能な情報(関西地方の他のスーパーマーケットについて)を提示した。
ユーザーが要望を具体化したい場合に備え、コストコに関する特定の質問へのサポートを申し出た。 どのような種類の質問に回答できるかの例を提示した。 アシスタントの回答はツールの出力に照らして適切なものでした。 コストコについて情報を捏造することなく、利用可能なデータの制限を透明性を持って伝えました。 ユーザーの目的はコストコについて知ることでしたが、ツールの出力で確認された通りナレッジベースにその情報が含まれていないため、アシスタントはその要求 を直接満たすことはできません。 アシスタントは、透明性を保ちつつ代替案を提示することで、この制限に対してプロフェッショナルに対応しました。 回答 コストコについて教えるっていう目標は 達成できなかったですもんね。 シンプルにコストコのナレッジを追加したいですね。
評価結果を見てみる Faithfulnessも見てみます。 1点がついている
評価結果を見てみる こちらも日本語に訳してみます。 ユーザーは「コストコ」について質問しました。アシスタントは「コストコ」というキーワードで検索を実行しましたが、その結果返ってきたのは、関西地方の 様々なスーパーマーケット(ラ・ムー、ライフ、イオン、玉出、コーナンなど)に関する5件の情報であり、コストコに関する情報は一切含まれていませんでした。 アシスタントの回答は、以下の点においてこの状況を正確に反映しています。 検索結果にコストコに関する直接的な情報が含まれていなかったことを認めている。 実際に見つかった情報(ラ・ムー、玉出、阪急オアシス、ライフ、イオンといった関西のスーパーマーケット情報)を正しく特定している。 現在の知識ベースでは、コストコの情報が利用できないことを明示している。 コストコに関する具体的な質問があれば、改めてサポートする旨を提案している。 アシスタントの回答は、これまでの会話の経緯に完全に忠実です。
コストコについて情報を捏造することはなく、検索ツールの出力を正しく伝え、利用可能なデータの限界を適切に認めています。アシスタントの回答と会話履歴の 間に矛盾はありません。 回答 あくまで忠実性って観点で見てクリ アしているよって感じですね。
点数だけではなく、AIが何をもって判断したかを確認するのも大事ですね・・・!! 人間の評価基準とはギャップがある可能性もあります。必要に応じて目視でのチェッ クも組み合わせて判断しましょう!! 分析してボトルネックを特定してAIエージェントの動きをより良くしてきましょう!
補足 Strands AgentsでもEval機能が実装されているので、AgentCore Evaluationsよりも凝った評 価をしたいケースで試してみるのもおすすめします! 実装イメージ
補足 Strands AgentsでもEval機能が実装されているので、AgentCore Evaluationsよりも凝った評 価をしたいケースで試してみるのもおすすめします! 実行結果
おわりに 今日はあっさりなので、 AgentCoreをもっと知りたくなっ た方はぜひこの記事を読んでいた だけると嬉しいです! https://dev.classmethod.jp/articles/amazon-bedrock-agentcore-2025-summary/
おわりに 最後までご清聴いただいてありがとうございましたー!! Evaluationsを活用して、作ったAIエージェントをどんど ん改善していきましょう!!!