Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[SNLP2026] Scaling up Test-Time Compute with La...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
池田航
August 20, 2026
Research
180
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
池田航
August 20, 2026
Other Decks in Research
See All in Research
kintone リサーチ副部/UXリサーチャー 業務紹介
cybozuinsideout
PRO
0
150
Scalable dynamic origin-destination demand estimation enhanced by high-resolution satellite imagery data
satai
3
420
SOTAのさらに先へ:厳しい推論制約下での高性能モデルのPost-Training
analokmaus
0
1.5k
IA for theory
gpeyre
1
370
[CV勉強会@関東 CVPR2026] PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow / kantocv 67th CVPR 2026
shunk031
0
260
【Zozo Research 技術共有会】三次元領域の現在と展望
mickey_0226
3
580
Sleuthcon Keynote - How Cybercriminals (ab)use AI
fr0gger
0
300
2026年版中小企業白書・小規模企業白書の概要
ozekinote
0
190
人間中心の意思決定支援AI
yukinobaba
PRO
7
3.9k
[最先端NLP勉強会2026] Agentic Rubrics as Contextual Verifiers for SWE Agents
rfujii
1
280
AIエージェント時代のLLM-jpモデルのあるべき姿
k141303
0
590
2026年 オープンキャンパス 研究室紹介
junkurihara
0
140
Featured
See All Featured
Documentation Writing (for coders)
carmenintech
77
5.5k
Making Projects Easy
brettharned
120
6.7k
SEOcharity - Dark patterns in SEO and UX: How to avoid them and build a more ethical web
sarafernandez
0
250
個人開発の失敗を避けるイケてる考え方 / tips for indie hackers
panda_program
123
22k
Design in an AI World
tapps
1
290
Joys of Absence: A Defence of Solitary Play
codingconduct
1
450
KATA
mclloyd
PRO
35
15k
Mozcon NYC 2025: Stop Losing SEO Traffic
samtorres
1
500
Accessibility Awareness
sabderemane
1
180
A Guide to Academic Writing Using Generative AI - A Workshop
ks91
PRO
1
390
Max Prin - Stacking Signals: How International SEO Comes Together (And Falls Apart)
techseoconnect
PRO
0
430
Efficient Content Optimization with Google Search Console & Apps Script
katarinadahlin
PRO
1
820
Transcript
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth
Approach Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian R. Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, Tom Goldstein NeurIPS 2025 https://arxiv.org/abs/2502.05171 発表者: 池田 航 東北大学 M2 鈴木・赤間研究室 2026/08/30 第18回最先端NLP勉強会 2026/8/30 第18回最先端NLP勉強会 1
昨今のTest time Scaling ⚫ テスト時(推論時)に計算を追加投入して性能を 伸ばすアプローチ, Test time Scalingが注目される. ⚫
テスト時に計算量を増やす方法として推論過程を 「言語化=外在化」させるものが主流. - OpenAI o1, Deepseek-r1, etc… cf. 人間: 脳内で非言語的な思考の後に発話. - 空間的思考, 物理的直感, (運動)計画, 抽象化, etc... 2026/8/30 第18回最先端NLP勉強会 2
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 2026/8/30 第18回最先端NLP勉強会 3
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 本研究では深さ再帰(Recurrent Depth)をアーキテクチャを導入. 深さ再帰(層数)のスケールによる潜在的な推論(Latent Reasoning) はTest time scalingの新しい軸となりうるか…? 2026/8/30 第18回最先端NLP勉強会 4
検証する深さ再帰型Transformer ⚫ モデルを構成するTransformer層を3ブロックに分割. ×r プレリュード 再帰ブロック コーダ 入力されたデータを 再帰的にブロックを適用し, 潜在空間から
潜在空間に埋め込む. 潜在空間での推論を行う. 語彙空間に戻す. ⚫ 再帰ブロックの再帰ステップ数𝒓を設定することで テスト時に任意の層数/計算量にスケール可能. 2026/8/30 第18回最先端NLP勉強会 5
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 6
再帰ブロックの計算の工夫 ×r プレリュードPが コーダCが 入力トークンを 再帰ブロックの出力SR 潜在表現eに埋め込み 再帰ブロックRを を語彙空間に戻す 繰り返し適用し,
潜在表現si を更新 2026/8/30 第18回最先端NLP勉強会 7
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 8
再帰ブロックの計算の工夫 再帰ブロックでは潜在表現を プレリュードの出力eを ランダムに初期化 毎再帰ステップでinput injection Why…?: 再帰による不動点への収束を安定化させるため. 2026/8/30 第18回最先端NLP勉強会
9
任意の深さに汎化するための工夫 ⚫ テスト時に任意の再帰ステップ数rで機能するように 事前学習時に再帰ステップ数𝒓をランダムサンプリング. Log-normal Poisson分布に従う. 裾が長く,より長い再帰ステップに 汎化することが期待される. ⚫ 再帰ブロックには最後の定数ステップ分のみ勾配を流す.
Backprop時の計算量とメモリがサンプリングされた 再帰ステップ数に関わらず定数に収まる. 2026/8/30 第18回最先端NLP勉強会 10
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 再帰ステップrを揺らして評価. r = 32の場合, 実効層数は132(=2+32*4+2) 2026/8/30 第18回最先端NLP勉強会 11
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 より難易度が高い・推論を要する 単純な事実の想起を測る タスクで特に再帰モデルが優位 タスクではあまり変わらない ! 深さ再帰は推論を要するタスクにおいて優位 2026/8/30 第18回最先端NLP勉強会 12
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag GSM8K CoT (Flexible) GSM8K CoT
(Strict) Humaneval 2026/8/30 第18回最先端NLP勉強会 13
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag 再帰ステップ数を増やすと 下流タスクで性能が向上. GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval ! 深さ再帰は新しいTest Time Scalingとして有望 2026/8/30 第18回最先端NLP勉強会 14
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwagでは再帰ステップ数の HellaSwag 早い段階で性能が収束 GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval Math・Code系タスクでは性能収束 にはより多くの再帰ステップが必要 ! 必要な再帰ステップ数はタスクの難易度に依存 2026/8/30 第18回最先端NLP勉強会 15
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 “Open-book”形式 =正解を含むを記述を与えた状態で回答 (※ Closed-bookはその逆) Shot数を変化させる 2026/8/30 第18回最先端NLP勉強会 16
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 他の深さ固定モデルと比較して Closed➔Openのときの性能向上がより顕著. Shot数が増えるほど性能の収束に より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 17
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. 各再帰ステップでの学習時の性能の推移 OpenbookQAのスコア比較 “Closed-book”形式
vs “Open-book”形式 ARC-Challengeのスコア推移 再帰ステップ数が shot数の再帰ステップ数への影響の比較 大きい条件 ➔安定して性能向上 再帰ステップ数 が小さい条件 ➔ほとんど変化無し 静的なブロックに知識を埋め込むよりも 他の深さ固定モデルと比較して Shot数が増えるほど性能の収束に Closed➔Openのときの上がり幅が顕著. 再帰に適応するように学習が進行 より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 18
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 2026/8/30 第18回最先端NLP勉強会 19
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 軌道を描くパターン 算術問題など難易度の高い 入力などに対して現れる
固定点に収束するパターン 最も多くのトークンで観測 他にもスライダーなど, 様々な幾何的構造が創発. ! 高次元の潜在空間を活用した推論形式の獲得を示唆 2026/8/30 第18回最先端NLP勉強会 20
まとめ ⚫ テスト時に計算量を増やす新しい方向性として, 深さ方向の再帰を提案 ⚫ 深さ方向の再帰の特性として 1. 深さ固定に対して特に推論を要するタスクで優位 2. 再帰ステップを増やすことで性能の引き上げが可能
3. 再帰は暗記能力より推論能力に寄与 ! 総じて, Test time scalingの新しい軸として有望 ⚫ CoTが行っているような, いわゆる “推論” が潜在空間で 行われているかは今後の課題. 2026/8/30 第18回最先端NLP勉強会 21
所感 ⚫ Test Time Scaling手法として深さ固定モデルwith CoT との比較で真に効率が良いのは…?が気になる. - 深さ固定との比較で, 深さ再帰は学習時におよそ10倍,
推論時は14倍 のFLOPsを消費. - 真に公平な比較は深さ固定モデル with CoTと, FLOPsやメモリなどの 条件を固定した上での性能比較…? ⚫ “暗記能力<推論能力” の性質はRAGなどの知識を外在 化する手法と相性良し…? ⚫ 潜在で考える= 何を考えているかわからない人 - 実用上, 安全性を担保するためにも潜在空間でどのような言語的な 情報処理が行われているかを明らかにしていくことが必要. 2026/8/30 第18回最先端NLP勉強会 22