自動化が難しいとされてきた新機能のシステムテストを、生成AI(Claude Code)とPlaywrightの組み合わせで「設計→実行→エビデンス→資産化」まで一気通貫で自動化した実践の記録です。
・何を・なぜ自動化したかったのか — 回帰の自動化は回っていて、最も人手を食っていた新機能テストが対象
・実行エンジンの選定 — 金額の精密検証/ロール別認証/CI安定性/資産化/失敗時調査という業務要件からの逆算
・"LLM向け"を謳う新興ツールVibiumとの同一テストケース実測比較(ツールコール116 vs 251)と、役割で組み合わせる使い分けの実運用
・運用の結果 — 実行コード資産約300件・健全率約98%。画面改修で34件が一斉に壊れた際、失敗モードの機械分類で31件をAI追加課金なしで復旧
詳細はZennのTOKIUMテックブログ(実践編・理論編・実測編)で公開しています。