Upgrade to Pro — share decks privately, control downloads, hide ads and more …

LLMアプリケーションやAIエージェントの評価の基本

 LLMアプリケーションやAIエージェントの評価の基本

## 講座概要

AIエージェントの活用・開発が広まる中、次のような疑問をよく耳にします。

- Claude CodeやCodexの`AGENTS.md`(`CLAUDE.md`)やスキルはどう書くべきなのか知りたい
- 開発しているAIエージェントの出力を改善するにはどうすればいいのか分からない
- etc...

このような疑問に対する答えとして、最も重要なのが「評価」です。

AIエージェントを使うと、簡単にある程度それらしい出力が得られます。
簡単にそれらしい出力を得られるからこそ、それが本当に使い物になるのかを「評価」することこそが重要なのです。

本セミナーでは、書籍『LLMアプリケーション評価駆動開発』の発売にあたり、著者らがAIエージェントの活用・開発における「評価」について話します。

### 書籍『LLMアプリケーション評価駆動開発 継続的に改善し運用していくための実践知』


Amazonで予約可能です。ぜひご予約ください。

https://www.amazon.co.jp/dp/4798190721

## 主な対象者

AIエージェントの活用・開発で、次のような悩みに遭遇している方

- Claude CodeやCodexに設定したスキルがうまく動いているのか分からない
- 開発しているAIエージェントの出力を改善するにはどうすればいいのか分からない

## 前提とする知識

- Claude CodeやCodexなどのAIエージェントの基本的な使い方
- (できれば)LLMアプリケーションやAIエージェント開発の基礎

## タイムテーブル

| 時刻 | 内容 | 登壇者 |
| --- | --- | --- |
| 19:30 | はじめに | |
| 19:35 | LLMアプリケーションやAIエージェントの評価の基本 | 上野彰大 |
| 19:55 | 評価に取り組む第一歩のためのヒント | 大嶋勇樹 |
| 20:15 | 書籍『LLMアプリケーション評価駆動開発』の紹介 | |
| 20:20 | 質疑応答 ||
| 20:30 | 終了 | |

※質疑の内容や数などにより、終了時刻が前後する可能性があります。

More Decks by PharmaX(旧YOJO Technologies)開発チーム

Transcript

  1. 評価対象の 3レイヤー構造 L1→L2→L3の各層の改善が連鎖的に波及するよう、評価指標を設計し、定期的に検証するのが理想 レイヤー 1 レイヤー 2 レイヤー 3 プロダクト品質

    ユーザーの体験品質・価値 ビジネスインパクト アプリケーションそのものが持つ内在的な品質 やポテンシャル 例:出力品質、機能要件、非機能要件、 設計品質 etc プロダクトがユーザーの元に届けられ、実際に使 われる中で生まれる価値 例:効果性、効率性、満足度、サポート品質、ブ ランド体験 etc プロダクトとユーザーの活動が最終的にビジネス 全体にもたらす成果 例:売上向上、コスト削減、市場シェア、 ROI、顧 客獲得数 エンジニアチーム プロダクト開発組織 事業部全体 (C)PharmaX Inc. 2025 All Rights Reserve 7
  2. 評価駆動開発とは何か 届けたい価値と評価を定め、結果を使って開発・改善を進める ① 提供価値 ② 評価設計 ③ 実装 誰の、どんな課題を 解決したいか

    良い状態を定め 測り方を考える 評価を確かめながら プロンプトやコードを作る アプリケーションと 評価の仕組みを一緒に育てる ⑤ 改善 ④ 実利用 結果から次に変える 箇所と優先順位を決める 使われた結果と 現場の声を集める 評価結果を、次の開発・リリース・改善の判断に使う (C)PharmaX Inc. 2025 All Rights Reserve 9
  3. 評価設計の全体像 5W1Hで評価を具体化し、合格基準を意思決定につなげる Why What 評価の目的 実現したい価値 評価対象・観点 評価指標 評価基準 目的と評価の設計

    Who / How / When / Where 評価者・方法・データ 評価の時期と環境 実行する仕組み 合格基準 評価結果を踏まえ 公開や改善を判断 最終判断 初回から完成を目指さず、実利用から評価の仕組みを育てる (C)PharmaX Inc. 2025 All Rights Reserve 10
  4. 評価観点・評価指標・評価基準・合格基準 設計例:問い合わせ回答の有用性を、採点と公開判断に落とし込む 評価観点 評価指標 何を見るか 何を測るか 有用性 最終判断 回答の有用性スコア (1〜5点)

    評価基準 1点:解決につながらない 3点:参考になるが情報不足 5点:次の行動が分かり解決できる 合格基準 評価したケースで 平均4点以上 かつ 重大な失敗0件 評価基準は点数の意味、合格基準は結果を使った判断の条件 (C)PharmaX Inc. 2025 All Rights Reserve 11
  5. LLMベースのアプリケーション特有の評価の難しさ 識別(分類)問題や回帰問題と比較して自由度の高い出力の評価は難しい • 評価が必要なのは、 AIをまったく使わないアプリケーションや、従来の機械学習を用いたアプリケーション でも同様 • 一方で自由度の高い LLMの出力の評価は、分類問題などとは異なり、正解が 1つに定まるわけでないの

    で評価が難しい 以下の英文を読み、その内容を70~80字の日本 語で要約せよ。句読点も字数に含める。 識別 AIモデル 回帰 4 Table manners are as old as human society itself, the reason being that no human society can exist without them. The active sharing of food — not consuming all the food we find on the spot, but carrying some back home and then giving it out systematically — is believed, even nowadays, to lie at the root of what makes us different from animals. Birds, dogs, and hyenas carry home food for their young until they are ready to find for themselves, and chimpanzees may even demand and receive pieces of meat from other adults in their group. (Chimpanzees apparently exhibit this behaviour only on the occasions when they consume meat; their main, vegetable diet they almost invariably eat where they find it, without sharing.) Only people actively, regularly, and continuously work on the distribution of their food. This activity is based on and probably helped give rise to many basic human characteristics, such as family and community (who belongs with whom; which people eat together), language (for discussing food past, present, and future, for planning the acquisition of food, and deciding how to divide it while preventing fights), technology (how to kill, cut, keep, and carry), and morality (what is a fair portion?). The basic need of our stomachs for food continues to supply a good deal of the driving force behind all of human enterprise: we have to hunt for food, fight for it, find it, or sow it and wait for it to be ready; we then have to transport it, and distribute it before it goes rotten. It is in addition easier for us to consume food chopped, ground, cooked, or left to soften. Civilization itself cannot begin until a food supply is assured. And where food is concerned we can never stop; appetite keeps us at it. The active sharing out of what we are going to eat is only the beginning. We cannot help being choosy about our food: preference enters into every mouthful we consume. We play with food, show off with it, honour and despise it. The main rules about eating are simple: if you do not eat you die; and no matter how large your dinner, you will soon be hungry again. Precisely because we must both eat and keep on eating, human beings have poured enormous effort into making food more than itself, so that it bears multiple meanings beyond its primary purpose of physical nutrition. LLMモデル 食べ物を分け合う行為が人間を 動物と区別し、家族、言語、技術、 道徳などの基本的人間特性を生 み出した。人間は食べ物に栄養以 上の多重の意味を持たせてきた。 ―東京大学入学二次試験2022年英語 評価が比較的容易 評価が難しい (C)PharmaX Inc. 2025 All Rights Reserve 12
  6. LLMベースのアプリケーションの危険性 識別(分類)問題や回帰問題と比較して自由度の高い出力の評価は難しい プロンプトエンジニアリングでどれだけ工夫をしても、 LLMの出力を完全には制御できず、予想もできない 大谷翔平に決まってんでしょ! あんたバカァ? 二刀流で活躍している 日本人メジャーリーガーは? LLMモデル 不適切な表現

    大谷翔平選手です。大谷翔平は、愛知 誤情報 県西春日井郡豊山町出身の 愛知県西春日井郡豊山町は イチロー選手の出身地 プロ野球選手です。 企業ブランドの著しい毀損や 法的なトラブルに繋がる危険性 大谷翔平選手です。大谷翔平は、現在 個人情報流出 Los Angels 1000 Vin Scully Aveに※1000 Vin Scully Aveは ドジャースタジアムの所在地 住んでいます。 開発したアプリケーションが信頼性や安全性を損なうような出力をしていないか、最低限守るべき品質基準を満 たしているかを、開発プロセスを通じて繰り返し評価・検証することが不可欠 (C)PharmaX Inc. 2025 All Rights Reserve 13
  7. LLM as a Judgeの評価用のプロンプトのイメージ LLMからのメッセージ提案を評価させるためのプロンプトを定義し、 LLMにLLMの評価をさせる 評価用プロンプト System User あなた(assistant)には、別のassistant(chat-assistant)のメッ

    セージを評価していただきます。 chat-assistantの最後の返答がどの程度下記の文章作成マニュ アルに従っているかで0〜100点のスコアを付けて下さい ## chat-assistantの前提 chat-assistantの役割は、PharmaX株式会社のYOJOという サービスのかかりつけ薬剤師です。健康や漢方の専門家とし て、常にユーザーの感情に寄り添いアドバイスをします。 ...(略) ## 文章のライティング方針 ・丁寧に対応する ・謝罪では絵文字を使わずに、文章だけで表現する ・難しい漢字はひらがなで書く ・細かい説明は箇条書きで書く ...(略) (C)PharmaX Inc. 2025 All Rights Reserve 15
  8. LLM-as-a-Judgeの評価精度を確かめる 同じ回答を人手と Judgeで評価し、不一致の理由から改善する 人手評価 同じ回答 評価者間で 基準と解釈を揃える 入力・回答・文脈 Judgeの評価 固定した評価者プロンプト

    で採点と理由を出す 評価を照合 不一致の理由を調べる 人手の基準も見直す 評価者プロンプト を改善 評価の仕組みも評価し、導入後も人手との照合を続ける (C)PharmaX Inc. 2025 All Rights Reserve 16
  9. 評価結果をリリースと改善の判断に使う 設計例:同じ評価条件で比較し、複数の合格基準を確認する 公開 評価項目 合格条件 現行版 変更案 必要な条件を満たす 有用性 目標以上

    未達 達成 再改善 重大な失敗 発生なし なし なし 条件未達を修正する 応答時間 目標以内 達成 未達 保留 評価したケースで比較 根拠を追加確認する この例は応答時間が未達のため、変更案を再改善して再評価する (C)PharmaX Inc. 2025 All Rights Reserve 19
  10. AIエージェントの継続的改善サイクル 運用から得た知見を次の計画に戻し、改善を繰り返す ① 計画立案・設計 ② 実装 ③ リリース前評価 ④ 本番リリース

    価値と評価を定義 観測の仕組みも実装 テストで合格を確認 必要に応じ段階的に ⑧は次のサイクルの① ⑧ 改善計画の立案 ⑦ シグナル分析 ⑥ シグナル収集 ⑤ 運用 次の①として開始 原因と改善点を特定 ログ・指標 トレース 利用者や障害に対応 アプリケーションの改善と、評価の仕組みの改善を一緒に進める (C)PharmaX Inc. 2025 All Rights Reserve 21
  11. 評価駆動開発と LLMOpsの関係 評価駆動開発という考え方を、 LLMOpsで実践し続ける 評価駆動開発 思想・パラダイム 評価を設計 変更を試す 結果で判断 良い状態を定義する

    評価を見ながら作る 次の改善を決める LLMOps 実践する方法論 観測 変更の管理 分析と改善 入出力・ログ・トレース 何を変えたかを残す 結果と原因を結び付ける 評価で見つかった問題を、原因分析と具体的な改善につなげる (C)PharmaX Inc. 2025 All Rights Reserve 22
  12. リリース前後で評価の役割を分ける リリース前の確認と、運用中の出力制御・分析を組み合わせる リリース後 リリース前 変更の確認 回答を生成 In-the-loop評価 出力を制御 評価データセット テスターによる検証

    アプリケーション 返す前に品質を判定 返答・修正 人への引き継ぎ ログを保存 Out-of-the-loop評価 入出力と処理の記録 応答経路の外で、継続的に分析 In-the-loopは応答経路内、 Human-in-the-loopは人が介入する構成 (C)PharmaX Inc. 2025 All Rights Reserve 23
  13. LLMOpsと従来の MLOpsの違い 必ずしもモデルのアップデートを伴わないため、改善サイクルを短くできるのが LLMOpsの特徴 MLOps LLMOps モデルアップデート ・モデルがアップデートされることが前提 ・新データ →再学習

    →デプロイが中心 ・必ずしもモデルの再学習を伴わない ・プロンプト・パラメータ調整がメイン 主要な改善手法 ・データ収集・前処理 →モデル学習・評価 →再学習によるパフォーマンスの向上 ・プロンプトエンジニアリング ・パラメータ調整 ・RAG ・ファインチューニング等 評価の特徴 ・定量的指標中心(精度、 F1スコアなど) ・比較的客観的な評価が可能 ・出力が確率的で自由度が高い ・LLM-as-a-Judge等の新手法が必要 ・多面的評価(品質・安全性・コスト) 監視・観測の重点 ・モデルの変更履歴管理 ・本番でのモデル精度の評価 ・モデル精度の劣化の検知 ・プロンプト・パラメータ変更履歴管理 ・本番でのアウトプットの評価 ・予期せぬ挙動の検知 (C)PharmaX Inc. 2025 All Rights Reserve 24
  14. 評価駆動開発の始め方 小さく比較を始め、実利用から必要な評価を増やしていく ① 目的を絞る ② 例を集める ③ 判断を揃える ④ 変更を比べる

    ⑤ 反復を自動化 誰の課題を どう解決するか 代表的な入力と 重要な失敗例 人手で確認し 基準を具体化 同条件で 変更前後を比較 反復部分に 自動評価を導入 利用の入出力を記録し、失敗を次のケース・観点・基準に残す 重大な失敗を押さえながら、評価と改善の小さな循環を回し始める (C)PharmaX Inc. 2025 All Rights Reserve 26