b. Cacheをうまく活用する i. TTLの設計も慎重に: OpenAIの場合TTLが30分間 / Claudeの場合TTLが5分間と1時間がある ii. 会話の途中で変更がないようにする(effortを気軽に変えない) 精度・レイテンシーへの影響を評価しながら、 Costと性能のTrade offを探る a. 調査 i. Weaveを使い、コストがかかっているケースを特定する(コストや Latency, tool callで並び替え / wandb skillsでCoding Agentに分析 をさせる) b. 影響中 i. 無駄なプロンプトを省く(Quickに解決できるなら実行 e.g. /claude-api prompt-audit) ii. tool取得結果の不要部分除去・1行に置換(次ページ例あり)/ Programmatic Tool Callingでは複数のtool callを処理し、必要な結 果だけcontextに入れる iii. 必要なtool定義だけ遅延ロード iv. 画像リサイズ c. 影響大 i. Workflowをできるだけ利用する ii. Compactionの利用(詳細な情報が必要な際はConversation Stateを導入する必要あり) iii. Tool callingのMax回数を修正。何度もloopしているtoolを変更 iv. Model Rooting (Multi-model architectures)を検討 v. Set budget 33
マルチエージェントシステム全体の挙動を簡単に 追跡 KEY VALUE 生ログでは埋もれてしまう障害障害の根本原因をすばやく 発見 Blog: New in W&B Weave: Observability and continuous improvement for production agents
取りを自動で記録・分類 アラート で重要な情報をSlack通知やWebhook自動化で即 時に届ける 失敗モードを高精度で検出し、数百万件規模の エージェント挙動から重大な問題を見逃さない Rating templates User satisfaction User Good Intent Safe-for-Work Response Quality Jailbreaking NSFW Low Quality Response Tag templates User Frustration
final boss battle. It's a lot more complex at scale of course - you don't just have a single train.py file to tune. But doing it is "just engineering" and it's going to work. - Andrej Karpathy’’’ X, github 「すべてのフロンティアLLMラボは、これ(自動研究)をや るようになる。これはラスボス戦だ。もちろん、大規模に やるとなるとはるかに複雑になる。単に1つの train.py ファイルをチューニングすればいい、という話ではない。 だが、それを実現することは“ただのエンジニアリング”で あり、うまくいくことになる。」 75