b. Cacheをうまく活用する i. TTLの設計も慎重に: OpenAIの場合TTLが30分間 / Claudeの場合TTLが5分間と1時間がある ii. 会話の途中で変更がないようにする(effortを気軽に変えない) 精度・レイテンシーへの影響を評価しながら、 Costと性能のTrade offを探る a. 調査 i. Weaveを使い、コストがかかっているケースを特定する(コストや Latency, tool callで並び替え / wandb skillsでCoding Agentに分析 をさせる) b. 影響中 i. 無駄なプロンプトを省く(Quickに解決できるなら実行 e.g. /claude-api prompt-audit) ii. tool取得結果の不要部分除去・1行に置換(次ページ例あり)/ Programmatic Tool Callingでは複数のtool callを処理し、必要な結 果だけcontextに入れる iii. 必要なtool定義だけ遅延ロード iv. 画像リサイズ c. 影響大 i. Workflowをできるだけ利用する ii. Compactionの利用(詳細な情報が必要な際はConversation Stateを導入する必要あり) iii. Tool callingのMax回数を修正。何度もloopしているtoolを変更 iv. Model Rooting (Multi-model architectures)を検討 v. Set budget 33