Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
AIコーディング道場成果発表【予告】
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
吉田真吾
June 07, 2025
Technology
74
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AIコーディング道場成果発表【予告】
吉田真吾
June 07, 2025
More Decks by 吉田真吾
See All by 吉田真吾
AIに代替されるフリーランス、AIを操りチームを導くリーダー。運命を分ける『AI-DLC』とインテントマネジメント/Intent is All We Need
yoshidashingo
0
62
AI-DLCを活用した高品質・安全なAI駆動開発実践 / AI Driven Development with AI-DLC
yoshidashingo
0
280
早く行きたいならClaude Codeと行け、遠くに行きたいならチームで行け 〜AI駆動開発の講師が教えるAIがリードするチーム開発の実践ノウハウ/Fast w/ Claude Code, Far Together
yoshidashingo
0
43
AI-DLCを活用した高品質・安全なAI駆動開発実践 / AI Driven Development
yoshidashingo
1
700
はじめてのAI-DLC
yoshidashingo
3
1.3k
初手AIで実現する 「AIと一緒に働く」ということ - AIファーストを実現する汎用タスクエージェントのつくりかた / JAWS DAYS 2026
yoshidashingo
0
82
Claude Codeで実践するスペック駆動開発入門 / sdd-with-claude_code
yoshidashingo
4
18k
エンジニアはコミュニティで伸びる!テックコミュニティ代表者トークリレー / TCP2026
yoshidashingo
0
45
達人に学ぶAIコーディング / ai-coding-learned-from-master
yoshidashingo
0
62
Other Decks in Technology
See All in Technology
ブラウザ研修 2026
recruitengineers
PRO
6
900
『三匹の子ぶた』から学ぶネットワークセキュリティの昔と今 / Network Security: Then and Now Through the Lens of The Three Little Pigs
nttcom
1
1.8k
OSPN.JPバージョンアップ作業進捗のご報告 / 20260801-osc26kyoto
akkiesoft
0
460
第3回しろおびセキュリティスポンサーセッション
log0417
0
170
ガバメントクラウドでのランサムウェア対策
techniczna
2
1.1k
Digitization部 紹介資料
sansan33
PRO
2
7.7k
【CEDEC2026】『Relink』を拡張せよ - 『GRANBLUE FANTASY: Relink - Endless Ragnarok』の開発速度と品質を守るCI運用
cygames
PRO
0
150
Agent 時代の Kaggle 展望 / kaggle-in-the-agentic-era
upura
1
700
研究開発部の紹介 / Sansan R&D Profile
sansan33
PRO
4
24k
Contract One Engineering Unit 紹介資料
sansan33
PRO
0
19k
今こそ聞きたいソフトウェア設計 ドメイン駆動設計再入門
masuda220
PRO
17
7.1k
ボトムアップ文化が強い組織で セキュリティをどう根付かせていくかの現在進行形の話 / Making Security Stick in a Bottom-Up Organization
yamaguchitk333
0
210
Featured
See All Featured
How to Align SEO within the Product Triangle To Get Buy-In & Support - #RIMC
aleyda
2
1.8k
Stewardship and Sustainability of Urban and Community Forests
pwiseman
0
450
RailsConf 2023
tenderlove
30
1.5k
Information Architects: The Missing Link in Design Systems
soysaucechin
0
1.1k
Why Our Code Smells
bkeepers
PRO
340
58k
Believing is Seeing
oripsolob
1
180
StorybookのUI Testing Handbookを読んだ
zakiyama
31
6.9k
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
659
62k
Building the Perfect Custom Keyboard
takai
2
840
Evolving SEO for Evolving Search Engines
ryanjones
0
250
Max Prin - Stacking Signals: How International SEO Comes Together (And Falls Apart)
techseoconnect
PRO
0
360
No one is an island. Learnings from fostering a developers community.
thoeni
21
3.8k
Transcript
吉⽥真吾 +"846(ԣࢧ෦ 4FSWFSMFTT$PNNVOJUZ +1 -BOH$IBJO $PNNVOJUZ +1 FUDʜ コミュニティ 2011〜
DMPVEQBDL ג ηΫγϣϯφΠϯ ג αΠμε ג δΣωϥςΟϒΤʔδΣϯπ p"844FSWFSMFTT)FSP p-BOH$IBJO ެࣜ &YQFSU"NCBTTBEPS コミュニティ型転職・独⽴
None
ίʔυิ *%&౷߹νϟοτܕ "*ιϑτΣΞΤϯδχΞ ฒྻඇಉظશͳҕ (FNJOJ$PEF"TTJTU +VMFT 74$PEF $MJOF3PP$PEF $VSTPS 8JOETVSG
%FWJO (JU)VC$PQJMPU (JU)VC$PQJMPU "HFOU.PEF $PEFY $MBVEF$PEF $-* $-*νϟοτܕ +FU#SBJOT*%&
ʲ࣮ʳ"*ίʔσΟϯάͰθϩ͔Β ༻αʔϏεΛϦϦʔεͯ͠Ք͙ه )&30;CZ4FDUJPO#:/".&CZ(FOFSBUJWF"HFOUTڞ࠵ ٢ాਅޗ 4FDUJPO (FOFSBUJWF"HFOUT "*ίʔσΟϯάಓ ެ։ษڧձ δϣϯυώϣϯʢṄಓᭈʣ
3PCPDP γχΞίϯαϧλϯτ ୈظ Ռൃදձ 5IV
None
Task Master https://github.com/eyaltoledano/claude-task-master PRDをタスクに分解して管理できるMCP経由で利⽤するサービス(ローカル起動可能)
None
None
Claude Code + Github Actions
Claude Code / CLAUDE.md によるリポジトリの仕様書の明記
ͳʹΛֶͿ͖͔ • ιϑτΣΞΤϯδχΞϦϯάͷ֤ఔʹ"*ΛͲ͏׆༻͢Δ͔ • ͡Ίখ͍͞نͷͷ13%͔Β"*Ͱ։ൃ͍ͯ͘͠αΠΫ ϧΛճ͠ɺঃʑʹେ͖ͳنʹ͍ͯ͘͜͠ͱ • ཁٻ։ൃɺλεΫܭըɺ֤λεΫͷ࣮ߦ͕جຊΞϓϩʔνͰ͋ ΓɺαϒλεΫϨϕϧͰ࣮ߦˠϨϏϡʔˠద༻ˠ࣍ •
$MBVEF$PEF$MBVEFͷຽେҠಈɿ͜ΕΛ͖͔͚ͬʹ • ΈΜͳͰू·ͬͯͭͶʹΑΓྑ͍࣮ફతͳࣝͷަɾϋϯζ Φϯ
ʲ࣮ʳ"*ίʔσΟϯάͰθϩ͔Β ༻αʔϏεΛϦϦʔεͯ͠Ք͙ه )&30;CZ4FDUJPO#:/".&CZ(FOFSBUJWF"HFOUTڞ࠵ ٢ాਅޗ 4FDUJPO (FOFSBUJWF"HFOUT "*ίʔσΟϯάಓ ެ։ษڧձ δϣϯυώϣϯʢṄಓᭈʣ
3PCPDP γχΞίϯαϧλϯτ ୈظ Ռൃදձ 5IV
খ͘͞ධՁͯ͠ େ͖͘ҭͯΔ "*ίʔσΟϯάಓ ୈճ Ռൃදձ ٢ా ਅޗ
ධՁۦಈ։ൃ &WBMVBUJPO%SJWFO%FWFMPQNFOUʹΑΔ࣭ཧ
アプローチ 1. コードによる評価: 完全⼀致、正規表現、JSON形式の 妥当性チェックなど、プログラムコードによる評価。 ・決定的で安価かつ⾼速 ・⾃然⾔語の応答内容のニュアンスを捉えるには限界あ り。 2. LLM
as a Judge: ⼤規模⾔語モデル(LLM)⾃⾝を評 価者として利⽤する⼿法。 ・複雑な評価基準に対応できる可能性がある ・評価⽤LLMのプロンプトエンジニアリングが必要に なるなど、導⼊の難しさも伴う。 3. ⼈間によるアノテーション: ユーザーからのフィード バック(サムズアップ/ダウンなど)を収集したり、専 ⾨のアノテーターがLangSmithのアノテーションキュー を通じて評価を⾏う。
ジャーニー 1. オフライン評価 (Offline Evals) 本番環境に移⾏する前に、 事前に準備したデータセットに対してアプリケーションを実 ⾏し、パフォーマンスを測定・スコアリング。モデルやプロ ンプトの変更がパフォーマンスに与える影響を追跡。 2.
オンライン評価 (Online Evals) 本番環境で稼働中のアプリ ケーションに対し、実際に⼊⼒されるデータの⼀部をサンプ リングしてスコアリング。実際のユーザーインタラクション に基づいたリアルタイムなパフォーマンス監視が可能。 3. インザループ評価 (In-the-loop Evals) エージェントが実⾏ 中に発⽣するEvals。エージェントの応答前に評価を⾏い、誤 りを検知した場合には⾃⼰修正を促し、応答品質の向上や、 不適切な応答のブロックが可能。⽋点は時間とコストの増加。 ミスへの許容度が低い場合や、レイテンシが問題にならない ような⻑時間実⾏されるエージェントに適している。⻑時間 実⾏エージェントの増加に伴い、このタイプのEvalsの重要性 が増すと予測。
openevals https://github.com/langchain-ai/openevals