Upgrade to Pro — share decks privately, control downloads, hide ads and more …

LLM + 強化学習

LLM + 強化学習

More Decks by NearMeの技術発表資料です

Transcript

  1. 先⾏研究 • というわけで、同じようなことを試みている事例がないか調査してみた ◦ Eureka: Human-Level Reward Design via Coding

    Large Language Models ▪ https://arxiv.org/abs/2310.12931 ▪ LLMを「RLポリシーを訓練するための報酬関数の設計者」として使う ◦ Voyager: An Open-Ended Embodied Agent with Large Language Models ▪ https://arxiv.org/abs/2305.16291 ▪ LLMでコード(ルールベース)を⽣成しながら、マインクラフトを攻略 4