Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
PLaMo 3.0 Primeの事後学習
Search
Preferred Networks
PRO
July 30, 2026
Technology
65
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
PLaMo 3.0 Primeの事後学習
2026年7月30日に開催された「PFN LLMオープンハウス」での講演資料です。
Preferred Networks
PRO
July 30, 2026
More Decks by Preferred Networks
See All by Preferred Networks
PLaMo 3.0 Primeの構造化出力サポート
pfn
PRO
0
52
plamo-3-translateの開発
pfn
PRO
0
110
PLaMoを毎日の開発で使い育てていく
pfn
PRO
0
60
The Making of AI Chips
pfn
PRO
1
1k
国産生成AI PLaMoを支える事後学習と推論最適化
pfn
PRO
13
5.4k
Japanese SimpleQA: 日本語における事実に基づいた回答能力の評価ベンチマーク
pfn
PRO
1
420
Headlampと独自プラグインを活用したKubernetesダッシュボードの機能拡張
pfn
PRO
2
430
AI/MLのマルチテナント基盤を支えるコンテナ技術
pfn
PRO
6
1.9k
単一Kubernetesクラスタで実現する AI/ML 向けクラウドサービス
pfn
PRO
1
1k
Other Decks in Technology
See All in Technology
ここは地獄!つらい朝会を体験することで、チームとしてのより良い振る舞いに気づくワークショップ / The stand-up meeting from hell in the game industry
scrummasudar
0
430
「休む」重要さ
smt7174
7
1.8k
データ活用研修 問いの発見と仮説構築【MIXI 26新卒技術研修】
mixi_engineers
PRO
1
650
AI工学特論: MLOps・継続的評価
asei
11
3k
13年運用タイトルのサーバーサイドが辿り着いた現在地 ― モンスターストライクにおける技術・組織・AI活用から得た知見
mixi_engineers
PRO
1
310
AIがAPIを書く時代に、私たちは何を設計すべきか
nagix
0
140
コンポーネント名には何を含めるべきなのか? / what-should-be-included-in-component-names
airrnot1106
0
180
AI研修(Day1)【MIXI 26新卒技術研修】
mixi_engineers
PRO
2
2.6k
事業成長とAI活用を止めないデータ基盤アーキテクチャの設計思想
hiracky16
0
770
変更し続けられるシステムをどう保つか — AI時代のSSoTという設計原則
kawauso
1
1.5k
最高のシステムプロンプトを作るためにフィードバック機能を導入した話
alchemy1115
0
220
論語・武士道・産業革命から見る かわるもの、かわらないもの
ichimichi
8
1.5k
Featured
See All Featured
Paper Plane
katiecoart
PRO
2
52k
Large-scale JavaScript Application Architecture
addyosmani
515
110k
Effective software design: The role of men in debugging patriarchy in IT @ Voxxed Days AMS
baasie
0
450
Keith and Marios Guide to Fast Websites
keithpitt
413
23k
XXLCSS - How to scale CSS and keep your sanity
sugarenia
249
1.3M
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
67
56k
Agile that works and the tools we love
rasmusluckow
331
22k
A designer walks into a library…
pauljervisheath
211
24k
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
The Limits of Empathy - UXLibs8
cassininazir
1
560
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
640
Transcript
PLaMo 3.0 Primeの事後学習 LLM開発事業部 PLaMo Post-training team 野沢 健人
PLaMo 3.0 Prime のパイプライン概略 2 Pretraining & Continual pretraining SFT
Stage 1 SFT Stage 2 RL DPO • 事前学習:(Continual) Pretraining ◦ ◦ 次のトークンを予測するように学習させ、後段のための良い初期値を得る Continual pretraining:コンテキスト長の延長 • 事後学習:SFT, RL, and DPO ◦ ◦ 利用時に期待する挙動を学習 Reasoningありの学習を紹介
SFT (Supervised fine-tuning) 3 - プロンプトと期待される応答のペアを用意し、期待する形式の応答がで きるように学習 - プロンプト:自己紹介よろ -
応答:株式会社PFNで開発されたAI PLaMoです!😀 - 応答のトークンの予測誤差を使って学習 - PLaMo 3.0 Prime では2段から構成
SFT Stage 1 4 - 大規模にReasoningを伴う応答ができるように学習 - プロンプト:1+1 - Reasoning:ユーザーが1+1…田ではなく2と回答しよう。
- 最終的な応答:2です! - データのドメインは、STEMやCodingが支配的
SFT Stage 2 5 - Stage 1で身につけたReasoning能力を、PLaMoで注力するドメインや 汎用的な対話利用でも同じように学習 - 指示追従
- 長コンテキスト - エージェント - 安全性など - Stage 1に比べて多様、小規模
RL (Reinforcement learning) 6 - SFTで身につけた能力をさらに汎化させるために、報酬関数を最大化す るように学習 - データ例: -
プロンプト:約30文字で面白いこと言って - 報酬関数:その応答の良し悪しを定量化する関数f - f(プロンプト + つまらない256文字): 0.0 - f(プロンプト + 爆笑の30文字): 1.0 - 報酬設計が重要 Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, arXiv, 2024.
DPO (Direct preference optimisation) 7 - 最後の微調整で、chosen (望ましい応答) の応答確率が rejected
(望ま しくない応答) より高くなるように学習 - データ形式: - プロンプト:約30文字で面白いこと言って - chosen: 爆笑の30文字 - rejected: スベりたくないので拒否します - 事後学習の中でもっとも小規模 Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, In NeurIPS, 2023.
まとめ 8 Pretraining & Continual pretraining SFT Stage 1 SFT
Stage 2 RL - 紹介できなかったPLaMo 3.0 Primeに関わる開発 - 学習・評価基盤改善 - Non-reasoning modelの開発 DPO
SFT vs RL 9 「RLで汎化するなら最初からRLしたら?」 - オンラインRLは応答生成が伴うため、GPUの利用効率がSFTより悪い - “SFT memorizes,
RL Generalizes” [Chu et al., 2025] Chu et al., SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training, In ICML, 2025.