$30 off During Our Annual Pro Sale. View Details »
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
最近の Citadel AI の取り組みのご紹介 (Nov, 2024)
Search
Asei Sugiyama
October 08, 2024
Technology
2
250
最近の Citadel AI の取り組みのご紹介 (Nov, 2024)
MLSE LLM ドメイン適用 WG向けに最近の取り組みをご紹介した資料です
Asei Sugiyama
October 08, 2024
Tweet
Share
More Decks by Asei Sugiyama
See All by Asei Sugiyama
AI との良い付き合い方を僕らは誰も知らない
asei
0
110
最近の生成 AI の活用事例紹介
asei
1
29
AI エージェント活用のベストプラクティスと今後の課題
asei
2
530
エージェントの継続的改善のためのメトリクス再考
asei
3
730
生成AI活用のベストプラクティス集を作ってる件
asei
1
850
GenAIOps: 生成AI時代の DevOps
asei
0
63
生成AI活用の実践解説 (速報版)
asei
1
1.6k
実践AIガバナンス
asei
3
1k
Eval-Centric AI: Agent 開発におけるベストプラクティスの探求
asei
1
360
Other Decks in Technology
See All in Technology
MySQLとPostgreSQLのコレーション / Collation of MySQL and PostgreSQL
tmtms
1
1k
Sansanが実践する Platform EngineeringとSREの協創
sansantech
PRO
2
950
30分であなたをOmniのファンにしてみせます~分析画面のクリック操作をそのままコード化できるAI-ReadyなBIツール~
sagara
0
180
シニアソフトウェアエンジニアになるためには
kworkdev
PRO
3
190
マイクロサービスへの5年間 ぶっちゃけ何をしてどうなったか
joker1007
17
6.7k
AI-DLCを現場にインストールしてみた:プロトタイプ開発で分かったこと・やめたこと
recruitengineers
PRO
2
170
ウェルネス SaaS × AI、1,000万ユーザーを支える 業界特化 AI プロダクト開発への道のり
hacomono
PRO
0
170
年間40件以上の登壇を続けて見えた「本当の発信力」/ 20251213 Masaki Okuda
shift_evolve
PRO
1
140
2025年 開発生産「可能」性向上報告 サイロ解消からチームが能動性を獲得するまで/ 20251216 Naoki Takahashi
shift_evolve
PRO
2
200
AI時代のワークフロー設計〜Durable Functions / Step Functions / Strands Agents を添えて〜
yakumo
3
990
Strands AgentsとNova 2 SonicでS2Sを実践してみた
yama3133
0
620
OCI Oracle Database Services新機能アップデート(2025/09-2025/11)
oracle4engineer
PRO
1
210
Featured
See All Featured
The State of eCommerce SEO: How to Win in Today's Products SERPs - #SEOweek
aleyda
2
9.1k
Six Lessons from altMBA
skipperchong
29
4.1k
Utilizing Notion as your number one productivity tool
mfonobong
2
180
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
61
47k
The AI Search Optimization Roadmap by Aleyda Solis
aleyda
1
5k
Raft: Consensus for Rubyists
vanstee
141
7.2k
Faster Mobile Websites
deanohume
310
31k
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
Neural Spatial Audio Processing for Sound Field Analysis and Control
skoyamalab
0
120
CSS Pre-Processors: Stylus, Less & Sass
bermonpainter
359
30k
Reality Check: Gamification 10 Years Later
codingconduct
0
1.9k
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
60
37k
Transcript
©2021-2024 Citadel AI Inc. LLM ドメイン適⽤ WG 向け Citadel AI
の取り 組みのご紹介 株式会社 Citadel AI
CONFIDENTIAL ©2021-2024 Citadel AI Inc. TOC - Citadel AI のご紹介
- 対話ログの分析ワークフローのご紹介 - 今後の展望 - ご相談 2
Citadel AI のご紹介 #1 3
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 4 Trusted by Global Companies
Contributing to Trustworthy AI US AISIC (US) The AI Alliance (Meta/IBM) 安全安⼼な「信頼できるAI」を実現
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 5 ミスが許されない AI システムの品質検証 銀行・保険
など 医療・ヘルスケア 自動車・製造業
CONFIDENTIAL ©2021-2024 AI ライフサイクル全体の信頼性‧品質を向上 6 開発中の モデル データセット 1. モデル開発時の自動検証
自動 テスト モデル評価 レポート 2. モデル運用時の自動監視 運用中の モデル 自動 モニタリング 再学習
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 7 ⼤規模⾔語モデルの評価ツール Lens for
LLMs Human Eval Automated Eval Lens Fast ❌ ✅ ✅ Accurate ✅ ❌ ✅ ✅ ⼤量の網羅的な⾃動評価に ✅ 少量の⼈⼿評価を組み合わせ ✅ 両者の強みをインテグレート
対話ログの分析ワークフローの ご紹介 #2 8
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 対話の品質評価の 3 つの⽅法 - ベンチマークを⽤いた事前評価
: QA4AI ガイドライン - 仮想シナリオを⽤いた事前評価 : デジタル庁のレポート - 対話ログを⽤いた事後評価: 弊社での取り組み 9 評価手法 ベンチマーク 仮想シナリオ 対話ログ 事前評価可能 ✓ ✓ カスタマイズ性 ✓ 特定業務の品質評価 ✓
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 対話ログの分析ワークフロー概要 10 全対話ログ サンプル (1000ユーザー)
RAGあり RAGなし 一般質問 100件 (目標) 要約 100件 (目標) 要約 100件 (目標) 翻訳 100件 (目標) 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 人手による 精度検証 自動化された指標 との比較 Step1. データの確認 Step2. 用途の確認 Step3. 人手での検証 Step4. 自動化の検討 … …
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 分析⽅法のデモ - Lens for LLMs
と Azure OpenAI の画⾯を⽤いてご紹介 1. 対話ログのカテゴリ抽出 2. 対話ログのカテゴリ分類‧評価 11
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 評価 - ⼈⼿で分類したアノテーション結果と、⽣成したプロンプトを⽤いた評価結 果を⽐較 -
カテゴリ抽出では⼈⼿で作成したカテゴリと類似するカテゴリを作成するこ とに成功した - カテゴリ分類では⼈⼿とほぼ変わらない精度で分類可能 - 「⼀般的な知識で回答できない質問かどうか」「健康問題に関する相談を含 んでいるか」「攻撃的なプロンプトを含んでいないか」もプロンプトにより 判定可能 12
今後の展望 #3 13
CONFIDENTIAL ©2021-2024 Citadel AI Inc. モデルの性能改善の3類型 14 モデル データ テスト
モデル データ テスト モデル データ テスト Kaggle型 モデルを改善 Data-Centric型 データを改善 API型 テストを改善 既存のノウハウが乏しい
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 問題意識 - 網羅的な評価観点を最初から取り揃 えることは無理 -
さまざまな⽤途に利⽤できるため、 ユースケースを列挙できない - 世論が変化することで新たな評価基 準があとから出現する 15 モデル データ テスト API型 テストを改善
CONFIDENTIAL ©2021-2024 Citadel AI Inc. 継続的な評価 - 評価 → 指標の設計
→ 評価を反復 - すべての評価観点を最初から網羅す るのではなく、利⽤を通じて徐々に 評価観点を育てていく - 評価を⾏うことで、既存の評価観点 では抜け落ちるケースに気が付き、 新たな評価観点に気がつく 16 モデル データ テスト API型 テストを改善
19