Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
ユーザーシュミレーション AIプロダクトのバグを事前検知
Search
ttnyt8701
August 23, 2026
Programming
13
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ユーザーシュミレーション AIプロダクトのバグを事前検知
ttnyt8701
August 23, 2026
More Decks by ttnyt8701
See All by ttnyt8701
Gemini CLI のはじめ方
ttnyt8701
1
340
ObsidianをMCP連携させてみる
ttnyt8701
4
8.1k
Claude Codeの使い方
ttnyt8701
3
490
FastMCPでMCPサーバー/クライアントを構築してみる
ttnyt8701
3
780
LangChain Open Deep Researchとは?
ttnyt8701
2
510
Vertex AI Agent Builderとは?
ttnyt8701
4
470
A2A(Agent2Agent )とは?
ttnyt8701
2
570
Amazon Bedrock LLM as a Judgeを試す
ttnyt8701
3
280
Amazon Sagemaker Jump Startを用いて爆速でモデルを作成してみる
ttnyt8701
3
140
Other Decks in Programming
See All in Programming
Omarchy Tokyo やると聞いて UMPC 買ってセットアップしてきた
mtsmfm
0
200
Findy - エンジニア向け会社紹介/Findy Company Deck
findyinc
6
400k
モデルのリファクタリングが難しいと思ったら、そもそも複雑だったのはビジネス仕様だった ? / is-the-business-domain-the-real-complexity
hatsu38
0
430
ゲームコントローラやキーボードのファームウェアをSwiftで書く
kishikawakatsumi
1
270
AHC070解法紹介
eijirou
0
150
Are APIs Still Relevant in the AI Era?
soyuka
0
390
[ハンズオン]AIへの指示だけで「五目並べ」を作ってみよう
satoshi256kbyte
1
310
カツオ、ご期待ください
suneo3476
0
130
AI が書く Go コードの品質を劇的に向上させる Linter: “declscope”
mpyw
0
460
Heart of Swift Concurrency
koher
0
1.1k
海上で動くGoサーバー: goroutineとchannelでさばく航行データストリーム
atsuki_seo
0
1k
TiDB Cloudのカスタムコントローラーによるオートスケール対応
takaidohigasi
0
140
Featured
See All Featured
The Spectacular Lies of Maps
axbom
PRO
1
1.1k
Done Done
chrislema
187
17k
Fight the Zombie Pattern Library - RWD Summit 2016
marcelosomers
234
18k
The Language of Interfaces
destraynor
162
27k
Large-scale JavaScript Application Architecture
addyosmani
515
110k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
56
3.5k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2.1k
We Analyzed 250 Million AI Search Results: Here's What I Found
joshbly
1
2k
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
440
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
480
The agentic SEO stack - context over prompts
schlessera
0
950
Distributed Sagas: A Protocol for Coordinating Microservices
caitiem20
333
23k
Transcript
ユーザーシュミレーション AIプロダクトのバグを事前検知 立野 祐太
品質に関する現状の課題 顧客のバグ報告を受けてから対応する運用が常態化 顧客がデバッカーになってしまっている 顧客満足・解約リスクに直結する 2
現状の品質担保 テスト、 UATをしっかり行っているのになぜバグ報告が頻発する? 2
原因 現状のテストは理想的な使われ方が前提で、実運用の想定外な使われ方に対する品質を担保できていない これらをカバーできるテストの種類が足りていない
解決案 エージェントが様々な使われ方をシュミレーション。想定外の挙動を検証し、早期にバグを発見する
イメージ(世界観) ※夜間はコストを抑えられる 「顧客からの報告」を「事前の発見」に置き換えることが可能になる 5
どう実現するか
必要なデータ シナリオの定義 評価の定義 ゴール+ペルソナ (何をどんな人が検証するのか) 合否の採点表 (ゴール達成 + 性質) シミュレーター層(演者)
評価層(審査員) 顧客を演じて会話を作る─ 採点表は知らない 会話を後から採点する 1
検証精度 検証 精度 = シナリオの質 × 評価の質 シナリオが雑 → 何回まわしても見つからない
/ 評価が弱い → 起きた失敗を見逃す 1
シナリオの質をどうやって高めるか 機能一覧 機能一覧から体系的に生成 新機能もリリース前に作れる 例:「ファイル要約」機能→ 「営業資料を添付して要約を頼む」 抽出してシナリオ生成 シナリオ集 本番ログ 実セッションを匿名化・蒸留
実顧客の壊し方と頻出の重みを供給 例:「あの件まとめといて。やっぱ英語で」 → 曖昧指示+方針変更シナリオ 4
評価の質をどうやって高めるか • • 汎用の基準 専用の基準 エラーかどうか 決めたゴールを達成できているか ハルシネーションが発生しているか 過去の不具合を項目化 定めたルールを項目化
(書式・トーンなど) 最初から張ってある ─ 未知の失敗もかかる 失敗のたびに 1 枚ずつ増える ─ 既知を狙い撃ち 最初は汎用の基準だけで検証 運用してバグ発見いくうちに専用の基準が勝手に増えてくる
評価の難易度 簡単 普通 エラー ハルシネーション 難しい 品質の良し悪しなどの主観 例外・タイムアウト・ツール失敗 機械判定はできないが、正解がある 決定的に判定できる
主観的で正解が多様で曖昧 過去の評価データの蓄積で精度をあげていく 2
全体の流れ 人間 AI AI AI ① シナリオ作成 ② シナリオ承認 ③
パターン量産 ④ 実行 シナリオと成功条件を AI が下書き 人間がレビューして シナリオ集へ登録 変化形を AI が毎回生成 夜間の探索 + PR ごとの回帰 人間 AI ⑧ 回帰テストへ昇格 シナリオ集へ戻り 以後は再発を自動監視 AI ⑦ 修正 AI ⑥ Issue起票 ⑤バグ検知 開発チームが対応 ↩ ⑧ で昇格したシナリオは ④ の回帰実行に自動で組み込まれ、ループが回り続ける 6
注意点 誤検知の量産は、レポートを読まれなくする 対策:精度の高い検出を目指していく。機械チェック優先の二段構え + Issue 化の前に人間のトリアージ 「通った = 本番で安全」ではない 位置づけ:保証ではなく、顧客が先にバグを踏む回数を減らす施策
まとめ 足りないのは、テストの量ではなく種類 AI が顧客を演じる「デバッカー」になり、未知のバグを探す 見つけた失敗は回帰テストへ昇格し、テスト資産を育て続ける