Upgrade to Pro — share decks privately, control downloads, hide ads and more …

週末にAI-DLCを本気で回したら$1,600溶けた

 週末にAI-DLCを本気で回したら$1,600溶けた

Avatar for Atsushi Shimizu

Atsushi Shimizu

August 27, 2026

Other Decks in Programming

Transcript

  1. A I - D LC v 1 P R A

    C T I C E R E P O R T 週末にAI-DLCを 本気で回したら $1,600溶けた 速さだけでは測れない、AIチームの生産性 2026/8/27 株式会社HBA 清水厚志 @shimizuxa
  2. 国内事例で語られるのは「速さ」 日立産業制御ソリューションズ様 東京海上日動システムズ様 約530人時 → 約70人時 2〜3か月 → 1.5日 7名・2日間でプロトタイプを構築

    10名で周辺Webシステムの初期版を構築 ※対象・参加人数・完成条件は事例ごとに異なる 出典1: https://aws.amazon.com/jp/blogs/news/ai-dlc-unicorn-gym-hitachi-ics-202601/ 出典2: https://aws.amazon.com/jp/blogs/news/tokio-marine-ai-dlc/ 2
  3. 週末の結果 約66 時間 4 Unit $1,607 相当 開始から中断まで 実装+品質証跡 160,734

    AI Credits換算 workspace全体で1,000件超のテストケースがPASS 注意: 利用量のドル換算であり、実際の追加請求額とは限らない 5
  4. 止まらなければ、課金も止まらない 従量計測 超過利用 → Copilot CLIも → 組織・Enterpriseは AI Credits対象

    既定で利用可能 予算上限 → 機能あり/今回は未設定 今回の要因: 予算上限を設定せず、超過利用可能な構成で継続した 7
  5. 費用の山は、実装後半の品質ループ 80.9 % 61.4 % 74.7 % 最初の週末 背景Agent 最初の週末

    入力200K token超 継続セッション review中心区間 AI Credits構成比。※最初の週末の2指標は分類軸が異なり、重複を含む 高かった処理: 品質を「作る・確かめる・説明する」ための再読と反復 8
  6. ある真面目すぎるAIプロジェクトチーム Manager AI M AI語 R 「closureは0件に」 Planner AI P

    AI語 「進行Gateにも」 人間語 「最後は指摘ゼロに」 人間語 「開始前の必須条件にも」 Reviewer AI 修正担当AI AI語 「固定roundはstale」 人間語 「前回の合格はもう古い」 F AI語 「Minorも全部修正」 人間語 「小さな指摘も全部直す」 当時の私: この会話で「止まる条件」が厳しくなったと気づけなかった 9
  7. 品質目標が「ローカル規程」になった日 AI語は読める でも、これがルール変更? 進⾏ルール M 「closureは0件に」 closure = 0 /

    0 / 0 Blocking / Major / Minor の指摘件数 ? Manager AI 実⾏前 Gate にも適⽤ P Planner AI 「進⾏Gateにも」 開始前の必須条件へ⼀般化 最新 review = 0 / 0 / 0 変更のたびに合格を取り直す R Reviewer AI 「固定roundはstale」 監督役:⼈間 AI-DLC指⽰でもユーザー指⽰でもなく、AI⽣成のローカルpolicyとして整備されてしまった 10
  8. 全員が正しく働くほど、仕事が増える Reviewer AI 指摘を⾒つける RELEASE / ROLLBACK PLAN 独⽴監査AI 最初から読む

    修正担当AI 1.3K → 6.8K lines review × 15 まだ 全部直す 「品質向上中」 だと思っていた… Planner AI 計画を更新する 11
  9. そして、ファイルを1枚移動した 1 質問ファイルを移動 Q&A 2 鮮度確認が反応 3 巨⼤計画を再レビュー inventory 55

    → 56 PLAN PASS 6.8K⾏ 1 file 正しい⽂書領域 変更は、たった1ファイル 0/0/0 直前の合格が失効 Re-review 14:1 / 2 / 0 ⼈間がようやく STOP 12
  10. AI語を覚えるより「境界」を先に決める 1 Review boundary 差分+関連契約へ絞る 2 Test boundary 変更影響で回帰testを選ぶ 4

    Model / Cost boundary 難易度・usage・budgetで分業 5 Plan / Stop boundary 複雑度とreview回数に上限 3 Context boundary 有効な意思決定だけを配る 仕組みで監督: 全会話を追わず、境界を超えたら人間判断へ戻す 14
  11. 5つの境界を実装し、使い始めた R Review 有望 差分review+安全fallback T Test 変更影響+targeted test 方式見直し

    routing規約+usage/budget計測 P Plan / Stop 有望 C Context M Model / Cost 有望 complexity check+review回数上限 採用見直し decision manifest+context packet 初期観測: 3施策は有望 / Contextは採用見直し / Model-Costは方式見直し 15
  12. QCDで測るAI-DLCの生産性 Q Quality:品質 何を守れたか 今回の焦点 C Cost:AI利用料 いくら使ったか D Delivery:開発期間

    何人月 → 何日 最初に目が行くのはD。 今回はCから「止め方」を学んだ 17
  13. T H R E E-W E E K P OST

    M O RT E M 週末に 3週間、 AI-DLCを本気で回したら $1,600 $X,XXX 溶けた 予算と停止線は、人間が決め、仕組みで守る Thank you @shimizuxa