Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
LLM + 強化学習
Search
NearMeの技術発表資料です
PRO
July 30, 2026
7
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
LLM + 強化学習
NearMeの技術発表資料です
PRO
July 30, 2026
More Decks by NearMeの技術発表資料です
See All by NearMeの技術発表資料です
PosthogのA/Bテスト機能の紹介
nearme_tech
PRO
1
23
AIフレンドリーなプロダクトに向けて
nearme_tech
PRO
1
52
初めてのLean言語
nearme_tech
PRO
0
80
Apache Airflow Workflow orchestration without turning cron into spaghetti
nearme_tech
PRO
1
23
実務で役立つ幾何学 ボロノイ図の基礎から グラフ・ネットワーク応用まで
nearme_tech
PRO
1
61
SQL/ID抽出タスクから考える 実践的なハルシネーション対策
nearme_tech
PRO
1
69
OpenCode & Local LLM
nearme_tech
PRO
0
200
OpenCode Introduction
nearme_tech
PRO
0
61
【Browser Automation × AI】 Stagehandを試してみよう
nearme_tech
PRO
0
170
Featured
See All Featured
The Curse of the Amulet
leimatthew05
2
13k
Cheating the UX When There Is Nothing More to Optimize - PixelPioneers
stephaniewalter
287
14k
Imperfection Machines: The Place of Print at Facebook
scottboms
270
14k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
65
57k
Building Applications with DynamoDB
mza
96
7.1k
Information Architects: The Missing Link in Design Systems
soysaucechin
0
1k
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
52
6k
Effective software design: The role of men in debugging patriarchy in IT @ Voxxed Days AMS
baasie
0
450
WENDY [Excerpt]
tessaabrams
11
39k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
55
3.4k
Optimising Largest Contentful Paint
csswizardry
37
3.8k
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
390
Transcript
LLM + 強化学習 2025-07-30 第151回NearMe技術勉強会 Takuma KAKINOUE 0
はじめに • LLMを強化学習でチューニングする的な内容ではないので注意 今回は強化学習エージェントを訓練する上位AIとしてLLMを⽤いる 1
今のLLMに⾜りないもの • LLMは「頭脳」は持っている ◦ しかし、リアルタイム性のあるゲームやロボットの制御はできない ◦ なぜならLLMはダイナミックな「運動」の制御に適していないからである • 動物の脳に例えるなら、LLMが⾔語系だとすると、 運動野や⼩脳に当たる部分を作りたい
2
運動野としてのRLポリシー • ⼈間は、不慣れな間は動作を1つ1つ頭で考えながら実⾏するが、 熟練してくると無意識に体を動かせるようになることのアナロジーを考えた • LLMが上位AIになって、下位AIとして強化学習の⽅策ネットワークを訓練する のはどうだろうか ◦ ⽅策の訓練が完了すれば(技能を習得してしまえば)、 ⽅策ネットワークのみで⾼速に動くことができる
3
先⾏研究 • というわけで、同じようなことを試みている事例がないか調査してみた ◦ Eureka: Human-Level Reward Design via Coding
Large Language Models ▪ https://arxiv.org/abs/2310.12931 ▪ LLMを「RLポリシーを訓練するための報酬関数の設計者」として使う ◦ Voyager: An Open-Ended Embodied Agent with Large Language Models ▪ https://arxiv.org/abs/2305.16291 ▪ LLMでコード(ルールベース)を⽣成しながら、マインクラフトを攻略 4
以下のようなアーキテクチャを考えてみた • LLMに「環境コード」と「タスク記述」のみを渡し、訓練コードを出⼒させる • 強化学習のフレームワークはRustで実装したDLLを使う (https://github.com/kakky-hacker/reinforcex) ◦ FFIもAIに書かせれば様々な⾔語に対応可能 ◦ 並列訓練もサポート
• LLMが出⼒した訓練コードをシェルで実⾏し、 実際にLLMがプロセスのログを読みながら訓練コードを修正することを繰り返す。 5
トークン削減のために⼯夫したポイント • 強化学習フレームワークのヘッダファイルを⽤意することで⼊⼒トークンを削減 ◦ https://github.com/kakky-hacker/reinforcex/blob/master/ffi/include/reinforc ex.h • その他、強化学習で使いそうな機能は関数として事前に⽤意(エントロピー計算、 報酬に有意差があるかの検定など) •
強化学習のサンプルコードをいくつか⽤意しておいて、コピペ後に調整させる 6
環境 • Windows11 • Codex + ChatGPT 5.6 Sol •
Python 3.12 + gymnasium 7
実験1:まずは⼈間が書いたコードを元にハイパラ調整 • CartPole with DQN ◦ beforeは⼈⼿で適当にコード書いて訓練した結果 ◦ AIは何回か訓練プロセスを実⾏しながらハイパラを調整して改善に成功した 8
実験2:AIが0から強化学習 • Hopper with SAC ◦ 強化学習フレームワークのヘッダファイルと 「Hopperを訓練して」というチャットのみを⼊⼒ 9
おまけ • デスクトップとスマホをSSH接続し、 スマホから訓練を実⾏させてみる ◦ 実演 10
今後の展望 • gymnasium(https://gymnasium.farama.org/index.html)の環境を 全て上位LLM+下位RLポリシーに訓練させてみる ◦ 強化学習レシピ集みたいなものを作成して、 未知の環境に対しても知⾒を活かせないか 11
Thank you 12