Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ユーザーシュミレーション AIプロダクトのバグを事前検知
Search
ttnyt8701
August 23, 2026
Programming
1
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
ユーザーシュミレーション AIプロダクトのバグを事前検知
ttnyt8701
August 23, 2026
More Decks by ttnyt8701
See All by ttnyt8701
Gemini CLI のはじめ方
ttnyt8701
1
320
ObsidianをMCP連携させてみる
ttnyt8701
3
7.7k
Claude Codeの使い方
ttnyt8701
3
470
FastMCPでMCPサーバー/クライアントを構築してみる
ttnyt8701
3
770
LangChain Open Deep Researchとは?
ttnyt8701
2
500
Vertex AI Agent Builderとは?
ttnyt8701
4
460
A2A(Agent2Agent )とは?
ttnyt8701
2
540
Amazon Bedrock LLM as a Judgeを試す
ttnyt8701
3
240
Amazon Sagemaker Jump Startを用いて爆速でモデルを作成してみる
ttnyt8701
3
140
Other Decks in Programming
See All in Programming
AIに既存システムを理解させる技術 ~レガシーを見捨てないハーネスエンジニアリング入門~
ochtum
0
140
[PyCon KR 2026] More Variants, More Diversity for AI Accelerators
achimnol
0
100
関東Kaggler会_NVIDIA_Nemotron_コンペ_振り返り
rick_ds
0
710
生成AIで帳票OCRが「簡単に」作れる時代になった?
kon_shou
0
1.1k
【デモ】Kiroで体験する仕様駆動開発|設計からコーディングまでAIと進める開発フロー
cmkudo
0
350
メールのエイリアス機能を履き違えない
isshinfunada
0
250
FastAPI の並行処理モデルを完全に理解する
hoto17296
8
2.8k
属人化した知識を、 AIが辿れる地図にする
pkshadeck
PRO
1
200
React本体のコードリーディング
high_g_engineer
1
150
人間の目はかわらない、だからJPEGは30年もつ
yuzneri
12
19k
My Marp Sample
sinoue0108
0
110
進化を続けるGo toolsの現在地 / The Current State of Ever-Evolving Go Tools
hond0413
0
250
Featured
See All Featured
Helping Users Find Their Own Way: Creating Modern Search Experiences
danielanewman
31
3.3k
Discover your Explorer Soul
emna__ayadi
2
1.3k
Building an army of robots
kneath
306
46k
Pawsitive SEO: Lessons from My Dog (and Many Mistakes) on Thriving as a Consultant in the Age of AI
davidcarrasco
0
220
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
550
JAMstack: Web Apps at Ludicrous Speed - All Things Open 2022
reverentgeek
1
570
Cheating the UX When There Is Nothing More to Optimize - PixelPioneers
stephaniewalter
287
14k
The AI Search Optimization Roadmap by Aleyda Solis
aleyda
1
6.1k
Docker and Python
trallard
47
4.1k
Let's Do A Bunch of Simple Stuff to Make Websites Faster
chriscoyier
508
140k
Agile Leadership in an Agile Organization
kimpetersen
PRO
0
210
B2B Lead Gen: Tactics, Traps & Triumph
marketingsoph
0
220
Transcript
ユーザーシュミレーション AIプロダクトのバグを事前検知 立野 祐太
品質に関する現状の課題 顧客のバグ報告を受けてから対応する運用が常態化 顧客がデバッカーになってしまっている 顧客満足・解約リスクに直結する 2
現状の品質担保 テスト、 UATをしっかり行っているのになぜバグ報告が頻発する? 2
原因 現状のテストは理想的な使われ方が前提で、実運用の想定外な使われ方に対する品質を担保できていない これらをカバーできるテストの種類が足りていない
解決案 エージェントが様々な使われ方をシュミレーション。想定外の挙動を検証し、早期にバグを発見する
イメージ(世界観) ※夜間はコストを抑えられる 「顧客からの報告」を「事前の発見」に置き換えることが可能になる 5
どう実現するか
必要なデータ シナリオの定義 評価の定義 ゴール+ペルソナ (何をどんな人が検証するのか) 合否の採点表 (ゴール達成 + 性質) シミュレーター層(演者)
評価層(審査員) 顧客を演じて会話を作る─ 採点表は知らない 会話を後から採点する 1
検証精度 検証 精度 = シナリオの質 × 評価の質 シナリオが雑 → 何回まわしても見つからない
/ 評価が弱い → 起きた失敗を見逃す 1
シナリオの質をどうやって高めるか 機能一覧 機能一覧から体系的に生成 新機能もリリース前に作れる 例:「ファイル要約」機能→ 「営業資料を添付して要約を頼む」 抽出してシナリオ生成 シナリオ集 本番ログ 実セッションを匿名化・蒸留
実顧客の壊し方と頻出の重みを供給 例:「あの件まとめといて。やっぱ英語で」 → 曖昧指示+方針変更シナリオ 4
評価の質をどうやって高めるか • • 汎用の基準 専用の基準 エラーかどうか 決めたゴールを達成できているか ハルシネーションが発生しているか 過去の不具合を項目化 定めたルールを項目化
(書式・トーンなど) 最初から張ってある ─ 未知の失敗もかかる 失敗のたびに 1 枚ずつ増える ─ 既知を狙い撃ち 最初は汎用の基準だけで検証 運用してバグ発見いくうちに専用の基準が勝手に増えてくる
評価の難易度 簡単 普通 エラー ハルシネーション 難しい 品質の良し悪しなどの主観 例外・タイムアウト・ツール失敗 機械判定はできないが、正解がある 決定的に判定できる
主観的で正解が多様で曖昧 過去の評価データの蓄積で精度をあげていく 2
全体の流れ 人間 AI AI AI ① シナリオ作成 ② シナリオ承認 ③
パターン量産 ④ 実行 シナリオと成功条件を AI が下書き 人間がレビューして シナリオ集へ登録 変化形を AI が毎回生成 夜間の探索 + PR ごとの回帰 人間 AI ⑧ 回帰テストへ昇格 シナリオ集へ戻り 以後は再発を自動監視 AI ⑦ 修正 AI ⑥ Issue起票 ⑤バグ検知 開発チームが対応 ↩ ⑧ で昇格したシナリオは ④ の回帰実行に自動で組み込まれ、ループが回り続ける 6
注意点 誤検知の量産は、レポートを読まれなくする 対策:精度の高い検出を目指していく。機械チェック優先の二段構え + Issue 化の前に人間のトリアージ 「通った = 本番で安全」ではない 位置づけ:保証ではなく、顧客が先にバグを踏む回数を減らす施策
まとめ 足りないのは、テストの量ではなく種類 AI が顧客を演じる「デバッカー」になり、未知のバグを探す 見つけた失敗は回帰テストへ昇格し、テスト資産を育て続ける