Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
20260427-EhimeDSCSeminar-MBR-CBDT-Decoding
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Hiroyuki Deguchi
September 02, 2026
Research
12
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
20260427-EhimeDSCSeminar-MBR-CBDT-Decoding
Hiroyuki Deguchi
September 02, 2026
More Decks by Hiroyuki Deguchi
See All by Hiroyuki Deguchi
260624_NLP-colloquium: Hubness
de9uch1
2
210
20250226 NLP colloquium: "SoftMatcha: 10億単語規模コーパス検索のための柔らかくも高速なパターンマッチャー"
de9uch1
1
830
20240820: Minimum Bayes Risk Decoding for High-Quality Text Generation Beyond High-Probability Text
de9uch1
0
370
サブセット探索を用いた高速なkNNニューラル機械翻訳
de9uch1
0
180
20240226_AAMT-Japio
de9uch1
0
210
Searching for Needles in a Haystack: On the Role of Incidental Bilingualism in PaLM’s Translation Capability
de9uch1
0
180
Paper Reading: Sampling-Based Approximations to Minimum Bayes Risk Decoding for Neural Machine Translation
de9uch1
0
240
My Research Environmental Setup
de9uch1
0
350
Nearest Neighbor Machine Translation
de9uch1
0
300
Other Decks in Research
See All in Research
Source Code Diff Revolution
tsantalis
0
120
Cross-Media Human-Information Interaction
signer
PRO
0
210
【中間報告】国会議員の立法・政策実務を支える環境を巡る現状と課題
polipoli
0
520
LINEヤフー データサイエンス Meetup「三井物産コモディティ予測チャレンジ」の舞台裏-AlpacaTechパート
gamella
1
650
AY 2026 Guide to Academic Writing Using Generative AI - Workshop
ks91
PRO
0
160
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
760
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
21
23k
typst の使い方:言語学を研究する学生のために
gitomochang
0
570
2025年度秋葉原ウォーカブルプロジェクト調査報告 「アキバらしいウォーカブル」とは何か
izumiyama_lab
1
200
RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent
satai
3
510
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
530
SoftMatcha 2: 1兆語規模コーパスの超高速かつ柔らかい検索
e869120_sub
7
3.8k
Featured
See All Featured
The Organizational Zoo: Understanding Human Behavior Agility Through Metaphoric Constructive Conversations (based on the works of Arthur Shelley, Ph.D)
kimpetersen
PRO
0
430
Unsuck your backbone
ammeep
672
58k
brightonSEO & MeasureFest 2025 - Christian Goodrich - Winning strategies for Black Friday CRO & PPC
cargoodrich
3
800
技術選定の審美眼(2025年版) / Understanding the Spiral of Technologies 2025 edition
twada
PRO
120
120k
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
410
Understanding Cognitive Biases in Performance Measurement
bluesmoon
32
3k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
2.1k
The AI Revolution Will Not Be Monopolized: How open-source beats economies of scale, even for LLMs
inesmontani
PRO
3
3.7k
Writing Fast Ruby
sferik
630
63k
Rails Girls Zürich Keynote
gr2m
96
14k
Efficient Content Optimization with Google Search Console & Apps Script
katarinadahlin
PRO
1
830
[SF Ruby Conf 2025] Rails X
palkan
2
1.3k
Transcript
高品質なテキスト生成: 最小Bayesリスク復号から 事例ベース意思決定理論に基づく復号まで 出口 祥之 NTTコミュニケーション科学基礎研究所 E-mail:
[email protected]
2026/04/27: 第43回愛媛大学DS研究セミナー
© NTT, Inc. 2026
2 自己紹介 ◼ 経歴 • 2024/10—現在 ポスドク@NTTコミュニケーション科学基礎研究所(CS研) • 2021/11—2024/09 研究技術員@情報通信研究機構(NICT)
• 2021/04—2024/09 博士(工学)@奈良先端科学技術大学院大学(NAIST) • 2019/04—2021/03 修士(工学)@愛媛大学 • 2015/04—2019/03 学士(工学)@愛媛大学 ◼ 研究分野 • 復号(テキスト生成アルゴリズム):用例ベース復号、最小Bayesリスク復号 • 検索:大規模ベクトル検索(最近傍探索・直積量子化)、 高速・柔軟パターン検索「SoftMatcha」 • ニューラルネットワークの脆弱性特定:埋め込みモデルの脆弱性特定 © NTT, Inc. 2026
3 本日の講演内容 1. チュートリアル チュートリアルの目標 ◼ 「復号」とはどういう問題かを知る 本講演に「学習」 は登場しない ◼
高品質なテキスト生成法として注目を集めている 「最小Bayesリスク(minimum Bayes’ risk; MBR)復号」の • 気持ち:「高確率より高品質」 • 数式:ポイントは「期待効用最大化」と「モンテカルロ推定」 • 実装:たったの10行で書ける! を理解する 2. 最小Bayesリスク復号:課題と研究動向をダイジェスト的に解説 3. 事例ベース意思決定理論に基づく復号:新たな復号の方向性を紹介 © NTT, Inc. 2026
4 1. チュートリアル: 復号、最小Bayesリスク復号 © NTT, Inc. 2026
5 テキスト生成 ◼ テキスト生成 • 自然言語処理(natural language processing; NLP)の中心技術の1つ •
翻訳や要約といった基本的なNLPタスクからコーディングや数学など多岐にわたり応用 ◼ テキスト生成モデルによるテキスト生成 大規模言語モデル (large language model; LLM) など 入力テキスト 𝐱∈𝒳 テキスト生成モデル 𝜃 復号(デコーディング) 𝐱, 𝜃 ↦ 𝐲 © NTT, Inc. 2026 出力テキスト 𝐲∈𝒴 • 𝒳, 𝒴 ⊆ 𝒱 ∗ : 入力・出力空間 (語彙𝒱のKleene閉包) • 𝜃 : モデルパラメータ
6 テキスト生成 = 系列探索問題 ◼ テキスト生成の問題設定:最良の出力テキスト 𝐲 ⋆ ∈ 𝒴
を探索 • テキストはトークン(単語や文字など)の系列として表現 • 一般には、入力テキストが与えられ、それに対する最良の出力を探索 ◼ 復号(デコーディング):最良の出力テキストを探索する手続き・過程 © NTT, Inc. 2026 • 𝒴 ⊆ 𝒱 ∗ : 出力空間 (語彙𝒱のKleene閉包)
【余談】なぜ「復号(デコーディング)」? ◼ 機械翻訳(・自然言語処理)のはじまり • Warren Weaver から Norbert Wiener への一通の手紙
(1947年) When I look at an article in Russian, I say "This is really written in English, but it has been coded in some strange symbols. I will now proceed to decode. https://upload.wikimedia.org/wikipedia/ commons/9/94/Warren_Weaver.jpg (Public Domain) © NTT, Inc. 2026 7
8 テキスト生成 = 系列探索問題 ◼ テキスト生成の問題設定:最良の出力テキスト 𝐲 ⋆ ∈ 𝒴
を探索 • テキストはトークン(単語や文字など)の系列として表現 • 一般には、入力テキストが与えられ、それに対する最良の出力を探索 ◼ 復号(デコーディング):最良の出力テキストを探索する手続き・過程 復号における問題 • 探索空間:無限集合 𝒴 から探索 › あらゆるテキストについて最良か否か判定することは不能 • 決定規則:「最良」の判断基準 © NTT, Inc. 2026 • 𝒴 ⊆ 𝒱 ∗ : 入力・出力空間 (語彙𝒱のKleene閉包)
9 言語モデル ◼ 言語モデル:テキストに対する生成確率を計算するモデル 大規模化→LLM • 種類例:n-gramモデル、最大エントロピーモデル、ニューラルネットワーク • 条件付き言語モデル:入力 𝐱
∈ 𝒳 に基づいて条件付けられる言語モデル ◼ 言語モデルにおける確率計算:トークンごとの生成確率の積に分解 • 系列の確率を直接計算するのは困難 • 連鎖律によって系列の確率をトークン単位に分解 |𝐲| 𝑝 𝐲|𝐱; 𝜃 = 𝑝 𝑦1 |𝐱; 𝜃 𝑝 𝑦2 |𝐱, 𝑦1 ; 𝜃 … 𝑝 𝑦 𝐲 ∣ 𝐱, 𝐲< 𝐲 ; 𝜃 = ς𝑡=1 𝑝 𝑦𝑡 |𝐱, 𝐲<𝑡 ; 𝜃 例 𝐱 =“吾輩は猫である”:𝑝 I am a cat ∣ 𝐱; 𝜃 = 𝑝 I ∣ 𝐱; 𝜃 𝑝 am ∣ 𝐱, I; 𝜃 … 𝑝 cat ∣ 𝐱, I am a; 𝜃 › 入力 𝐱 とそれまでに出力した部分列 𝐲<𝑡 から、次のトークン 𝑦𝑡 ∈ 𝒱 の生成確率を計算 © NTT, Inc. 2026
10 テキスト生成 = 系列探索問題 ◼ テキスト生成の問題設定:最良の出力テキスト 𝐲 ⋆ ∈ 𝒴
を探索 • テキストはトークン(単語や文字など)の系列として表現 • 一般には、入力テキストが与えられ、それに対する最良の出力を探索 ◼ 復号(デコーディング):最良の出力テキストを探索する手続き・過程 復号における問題 • 探索空間:無限集合 𝒴 から探索 › あらゆるテキストについて最良か否か判定することは不能 言語モデル等により、確率の高いテキスト ℋ ⊂ 𝒴 に候補を 絞る(仮説生成) 手法例:ビーム探索、サンプリング • 決定規則:「最良」の判断基準 © NTT, Inc. 2026 • 𝒴 ⊆ 𝒱 ∗ : 出力空間 (語彙𝒱のKleene閉包)
11 テキスト生成 = 系列探索問題 ◼ テキスト生成の問題設定:最良の出力テキスト 𝐲 ⋆ ∈ 𝒴
を探索 • テキストはトークン(単語や文字など)の系列として表現 • 一般には、入力テキストが与えられ、それに対する最良の出力を探索 ◼ 復号(デコーディング):最良の出力テキストを探索する手続き・過程 復号における問題 • 探索空間:無限集合 𝒴 から探索 › あらゆるテキストについて最良か否か判定することは不能 言語モデル等により、確率の高いテキスト ℋ ⊂ 𝒴 に候補を 絞る(仮説生成) 手法例:ビーム探索、サンプリング • 決定規則:「最良」の判断基準 © NTT, Inc. 2026 ←本講演のメイントピック • 𝒴 ⊆ 𝒱 ∗ : 出力空間 (語彙𝒱のKleene閉包)
12 復号の流れ 1. 仮説生成:モデルによって計算される生成確率を利用し、仮説集合ℋ ⊂ 𝒴を生成 2. 仮説選択:決定規則に従って、仮説集合ℋから最良の仮説を選択(出力) 例:英日翻訳 入力テキスト
𝐱∈𝒳 I am a cat 仮説集合 𝐡∈ℋ • 𝐡1 : 私は猫である テキスト生成モデル 仮説生成 𝜃 • 𝐡2 : 吾輩は猫である • 𝐡3 : 吾輩は猫だ • 𝐡4 : 吾輩は猫です • 𝐡5 : 猫である © NTT, Inc. 2026 復号(デコーディング) 𝐱, 𝜃 ↦ 𝐲 仮説選択 決定規則 出力テキスト 𝐲∈𝒴 吾輩は猫である
最大事後確率(maximum a posteriori; MAP)復号 ◼ 決定規則:生成確率を最大化するテキストを出力 • 最も広く使われている決定規則 • 仮定「モデルが計算する出力テキスト
𝐲 の確率 𝑝 𝐲|𝐱; 𝜃 が高ければ、𝐲 は良いテキスト」 argmax 𝐡∈ℋ 𝑝 𝐡 ∣ 𝐱; 𝜃 𝐡 ς𝑡=1 𝑝 ℎ𝑡 ∣𝐱,𝐡<𝑡 ;𝜃 仮説 𝐡 ∈ ℋ の生成段階ですでに確率 𝑝 𝐡|𝐱; 𝜃 を計算しているため、追加計算不要 仮説集合𝐡 ∈ ℋ • 𝐡1 : 私は猫である • 𝐡2 : 吾輩は猫である • 𝐡3 : 吾輩は猫だ • 𝐡4 : 吾輩は猫です • 𝐡5 : 猫である © NTT, Inc. 2026 仮説選択 argmax 𝑝 𝐡 ∣ 𝐱; 𝜃 𝐡∈ℋ 出力テキスト 𝐲∈𝒴 私は猫である 13
14 最大事後確率(maximum a posteriori; MAP)復号 ◼ 決定規則:生成確率を最大化するテキストを出力 • 最も広く使われている決定規則 •
仮定「モデルが計算する出力テキスト 𝐲 の確率 𝑝 𝐲|𝐱; 𝜃 が高ければ、𝐲 は良いテキスト」 argmax 𝐡∈ℋ 本当? 𝑝 𝐡 ∣ 𝐱; 𝜃 𝐡 ς𝑡=1 𝑝 ℎ𝑡 ∣𝐱,𝐡<𝑡 ;𝜃 仮説 𝐡 ∈ ℋ の生成段階ですでに確率 𝑝 𝐡|𝐱; 𝜃 を計算しているため、追加計算不要 仮説集合𝐡 ∈ ℋ • 𝐡1 : 私は猫である • 𝐡2 : 吾輩は猫である • 𝐡3 : 吾輩は猫だ • 𝐡4 : 吾輩は猫です • 𝐡5 : 猫である © NTT, Inc. 2026 仮説選択 argmax 𝑝 𝐡 ∣ 𝐱; 𝜃 𝐡∈ℋ 出力テキスト 𝐲∈𝒴 私は猫である
高確率 ≠ 高品質 15 ◼ 過信問題 • モデルの予測確率と実際の正解確率はしばしば乖離 › 高確率であるからといって高品質(望ましい)とは限らない
• 「ビームの呪い」:ビーム幅を上げてより高確率な系列を探索するとしばしば出力が崩壊 (Ott+, ICML2018; Stahlberg & Byrne, EMNLP2019) › 幻覚(hallucination)や無意味な回答(対話において “I don’t know” と返す等) › 空文字列 › 同じトークンの繰り返し › ランダムに見える崩壊したトークン列 実際の各𝐲は離散系列 のため厳密な図ではない 𝐲5 が出力される ; ◼ MAP復号の課題 • モデルの過信問題の影響を受けやすい • 復号時に出力テキストの品質自体を考慮していない © NTT, Inc. 2026 Ott+, ICML2018, “Analyzing Uncertainty in Neural Machine Translation”. Stahlberg & Byrne, EMNLP2019, “On NMT Search Errors and Model Errors: Cat Got Your Tongue?”
最小Bayesリスク(minimum Bayes’ risk; MBR)復号 16 期待効用最大化 ◼ 目的:高確率ではなく高品質なテキストの生成を目指す =Bayesリスク最小化 ◼
決定規則:期待効用を最大化するテキストを出力 • 期待効用理論(expected utility theory; EUT) (von Neumann & Morgenstern, 1944) からのアナロジー ◼ (真の)期待効用 𝑈 MBR 𝑈 MBR 𝐡; 𝐱 ≔ 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲 • 𝑢: 𝒴 × 𝒴 → ℝ 効用関数 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率 例:参照テキスト 𝐲1 , 𝐲2 ∈ 𝒴 の真の生成確率がそれぞれ 40%・60%のとき、仮説 𝐡 の期待効用は 0. × 𝑢 𝐡, 𝐲1 + 0.6 × 𝑢 𝐡, 𝐲2 © NTT, Inc. 2026 von Neumann & Morgenstern, 1944, “Theory of Games and Economic Behavior”.
17 期待効用の計算における問題点 ◼ (真の)MBR復号 • 𝑢: 𝒴 × 𝒴 →
ℝ 効用関数 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲 𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
18 期待効用の計算における問題点 ◼ (真の)MBR復号 • 𝑢: 𝒴 × 𝒴 →
ℝ 効用関数 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲 𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
19 期待効用の計算における問題点 ◼ (真の)MBR復号 • 𝑢: 𝒴 × 𝒴 →
ℝ 効用関数 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲 𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
20 期待効用の計算における問題点 ◼ (真の)MBR復号 • 𝑢: 𝒴 × 𝒴 →
ℝ 効用関数 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲 𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
21 期待効用推定 ◼ (真の)MBR復号 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲
𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 参照テキストとの類似度に基づく自動評価指標などを利用 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 • 𝑢: 𝒴 × 𝒴 → ℝ 効用関数 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
22 期待効用推定 ◼ (真の)MBR復号 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲
𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 参照テキストとの類似度に基づく自動評価指標などを利用 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 代理的にテキスト生成モデルの生成確率を利用 argmax𝐡∈ℋ 𝔼𝐲∼𝑝 ⋅|𝐱;𝜃 𝑢 𝐡, 𝐲 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 • 𝑢: 𝒴 × 𝒴 → ℝ 効用関数 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
23 期待効用推定 ◼ (真の)MBR復号 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲
𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 参照テキストとの類似度に基づく自動評価指標などを利用 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 代理的にテキスト生成モデルの生成確率を利用 argmax𝐡∈ℋ 𝔼𝐲∼𝑝 ⋅|𝐱;𝜃 𝑢 𝐡, 𝐲 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 生成確率にしたがってサンプリングしたテキスト 「擬似参照」を用いて期待値を推定(次頁) © NTT, Inc. 2026 • 𝑢: 𝒴 × 𝒴 → ℝ 効用関数 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
Monte Carlo (MC) 推定によるMBR復号 (MCMBR) (Kumar & Byrne, NAACL2004; Eikema
& Aziz, COLING2020) ◼ MCMBR復号:MC法により推定される期待効用 𝑈 MCMBR を最大化 argmax 𝑈 MCMBR 𝐡; 𝐱 𝐡∈ℋ • テキスト生成モデルからサンプリングした出力テキスト (擬似参照)の多重集合 𝒴 を用いてMC推定 𝑈 MCMBR 𝐡; 𝐱 ≔ 𝒴 𝑢 𝐡, 𝐲 𝐲∈𝒴 i.i.d. where 𝒴 ∼ 𝑝 ⋅∣ 𝐱; 𝜃 ※ 典型的には仮説と擬似参照には同じ集合を用いる (ℋ = Supp 𝒴 ) 複数(擬似)参照に対する品質スコアの平均を最大化 Kumar & Byrne, NAACL2004, “Minimum Bayes-Risk Decoding for Statistical Machine Translation”. Eikema & Aziz, COLING2020, “Is MAP Decoding All You Need? The Inadequacy of the Mode in Neural Machine Translation”. © NTT, Inc. 2026 24
MCMBR復号の実装例 1 ◼ MCMBR復号:argmax σ𝐲∈𝒴 𝑢 𝐡, 𝐲 𝒴
𝐡∈ℋ ◼ Python実装 def decode_mcmbr(input: str, model: Model, utility_fn: Callable[[str, str], float], H: int, Y: int) -> str: hypotheses = [model.sample_hyp(input) for _ in range(H)] references = [model.sample_ref(input) for _ in range(Y)] pairwise_scores = np.zeros((H, R), dtype=np.float32) for (i, h) in enumerate(hypotheses): for (j, y) in enumerate(references): pairwise_scores[i, j] = utility_fn(h, y) expected_scores = pairwise_scores.mean(axis=1) best_idx = expected_scores.argmax(axis=0) return hypotheses[best_idx] © NTT, Inc. 2026 25
翻訳実験:設定 ◼ データセット:WMT’22英独翻訳タスク ◼ テキスト生成モデル(翻訳モデル):M2M100 (418Mパラメータ) (Fan+, 2021) ◼ 仮説生成
• 仮説数:各入力文につき1,024個の仮説文を生成 • サンプリング法:epsilonサンプリング (𝜀 = 0.0 ) (Freitag+, EMNLP Findings 2023) ◼ 擬似参照生成:仮説集合と同じサンプルを利用 © NTT, Inc. 2026 Fan+, 2021, “Beyond english-centric multilingual machine translation”. Freitag+, Findings of EMNLP2023, “Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation”. 26
翻訳実験:比較する復号法 27 ◼ MAP: 生成確率を最大化 ◼ MBR: MC法によって推定される期待効用を最大化 ◼ QE:
参照テキストなしで仮説の品質を直接推定する指標を最大化 • 品質推定モデル:CometKiwi-22 ◼ Oracle: 参照テキストに対して計算される評価値を最大化(仮説選択の性能上限) © NTT, Inc. 2026
評価指標と効用関数 ◼ 評価指標・効用関数 • BLEU • chrF • COMET 参照テキストとの単語・文字列一致に基づく評価指標
参照テキストとの意味的類似度に基づくニューラル評価指標 • BLEURT ◼ 仮説選択に用いる計算資源 • CPU: Intel (R) Xeon (R) Platinum 8160 × 32コア • GPU: NVIDIA RTX 6000 Ada × 1基 (100 GPU時間) © NTT, Inc. 2026 28
29 WMT’22独英翻訳実験の結果 復号 効用関数 BLEU chrF COMET BLEURT Comet Kiwi
MAP -- 23.8 50.1 75.6 54.9 74.2 QE CometKiwi 22.5 51.8 82.1 58.4 83.6 MBR BLEU 25.6 52.9 75.2 54.8 73.7 chrF 24.4 54.2 76.3 56.4 75.1 COMET 24.1 52.8 83.9 58.7 79.5 BLEURT OOT OOT OOT OOT OOT Oracle BLEU 44.4 62.8 76.1 59.5 71.6 chrF 39.5 66.6 77.7 62.0 72.9 COMET 30.2 58.0 87.0 64.1 80.4 BLEURT 31.0 58.2 79.7 71.0 75.0 100 GPU時間 の制限超過 ◼ MBR復号は各効用関数を最大化、指標ごとにMAP復号より高い評価値を獲得 © NTT, Inc. 2026
30 2. 最小Bayesリスク復号:課題、研究動向 © NTT, Inc. 2026
31 WMT’22独英翻訳実験の結果 復号 効用関数 BLEU chrF COMET BLEURT Comet Kiwi
MAP -- 23.8 50.1 75.6 54.9 74.2 QE CometKiwi 22.5 51.8 82.1 58.4 83.6 MBR BLEU 25.6 52.9 75.2 54.8 73.7 chrF 24.4 54.2 76.3 56.4 75.1 COMET 24.1 52.8 83.9 58.7 79.5 BLEURT OOT OOT OOT OOT OOT Oracle BLEU 44.4 62.8 76.1 59.5 71.6 chrF 39.5 66.6 77.7 62.0 72.9 COMET 30.2 58.0 87.0 64.1 80.4 BLEURT 31.0 58.2 79.7 71.0 75.0 100 GPU時間 の制限超過 ◼ MBR復号は各効用関数を最大化、指標ごとにMAP復号より高い評価値を獲得 © NTT, Inc. 2026
32 MBR復号の課題 ◼ 計算コスト • 仮説・擬似参照生成:仮説や擬似参照を複数生成する必要があり、生成コストが線形に増加 • 仮説選択:仮説と擬似参照の全対から期待効用を推定するため、時間計算量 𝒪 ℋ
𝒴 › 典型的な設定として仮説と擬似参照に同じサンプル集合を用いたとき、二乗時間 › 効用関数にニューラルネットワークのような計算コストの重い関数を用いると非常に低速 ◼ 効用関数への過剰適合 ◼ MCMBR復号におけるいくつかの近似による影響 • 擬似参照への依存性:擬似参照の分布に強い影響を受ける © NTT, Inc. 2026
33 MBR復号の課題 ◼ 計算コスト • 仮説・擬似参照生成:仮説や擬似参照を複数生成する必要があり、生成コストが線形に増加 • 仮説選択:仮説と擬似参照の全対から期待効用を推定するため、時間計算量 𝒪 ℋ
𝒴 › 典型的な設定として仮説と擬似参照に同じサンプル集合を用いたとき、二乗時間 › 効用関数にニューラルネットワークのような計算コストの重い関数を用いると非常に低速 ◼ 効用関数への過剰適合 ◼ MCMBR復号におけるいくつかの近似による影響 • 擬似参照への依存性:擬似参照の分布に強い影響を受ける © NTT, Inc. 2026
仮説選択の高速化 34 ◼ 擬似参照の特徴量を集約 • 単一の平均特徴量を利用 (DeNero+, ACL2009; Vamvas&Sennrich, ACL2024)
• 複数の重心特徴量を利用 (Deguchi+, ACLFindigns2024) ◼ 仮説の枝刈り • 信頼度に基づく枝刈り (Cheng&Vlachos, EMNLP2023) • MBR復号をMedoid特定問題とみなしCorrelated Sequential Halvingにより探索 (Jinnai&Ariu, ACLFindings2024) • Bayes最適化(Gauss過程に基づく最適化法)による効率的な仮説評価 (Cheng+, NAACL2025) ◼ 未観測の効用値を推定 • 部分的に観測された効用から低ランク近似で行列補完 (Trabelsi+, NeurIPS2024) › 軽量な代替効用関数で効用評価を補助し、目的の効用と合意をとり行列補完 (Natsumi+, AACL2025) © NTT, Inc. 2026 DeNero+, ACL2009, “Fast Consensus Decoding over Translation Forests”. Vamvas&Sennrich, ACL2024, “Linear-time Minimum Bayes Risk Decoding with Reference Aggregation”. Deguchi+, Findings of ACL2024, “Centroid-Based Efficient Minimum Bayes Risk Decoding”. Cheng&Vlachos, EMNLP2023, “Faster Minimum Bayes Risk Decoding with Confidence-based Pruning”. Jinnai&Ariu, Findings of ACL2024, “Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding”. Cheng+, NAACL2025, “A Bayesian Optimization Approach to Machine Translation Reranking”. Trabelsi+, NeurIPS2024, “Efficient Minimum Bayes Risk Decoding using Low-Rank Matrix Completion Algorithms”. Natsumi+, AACL2025, “Agreement-Constrained Probabilistic Minimum Bayes Risk Decoding”.
擬似参照集約 35 (Denero+, ACL2009; Vamvas&Sennrich, ACL2024) ◼ いくつかの効用関数はテキストの特徴量 𝜙 𝐲
から評価値を計算 • BLEU: 単語n-gramと参照テキスト長 • chrF: 文字n-gram • COMET: テキスト埋め込み ◼ 擬似参照の平均特徴量を計算し、擬似参照を集約 𝜙ത 𝒴 = 𝒴 𝜙 𝐲 • 𝜙: 𝒴 → ℱ : 特徴量抽出関数 • 𝑢𝜙 : ℱ × ℱ → ℝ : 特徴量から 計算する効用関数 𝐲∈𝒴 ◼ 効用平均の近似として、平均特徴量 𝜙ത 𝒴 から効用を計算 argmax 𝑢𝜙 𝜙 𝐡 , 𝜙ത 𝒴 𝐡∈ℋ • 時間計算量:𝒪 ℋ 𝒴 © NTT, Inc. 2026 → 𝒪 ℋ + 𝒴 DeNero+, ACL2009, “Fast Consensus Decoding over Translation Forests”. Vamvas&Sennrich, ACL2024, “Linear-time Minimum Bayes Risk Decoding with Reference Aggregation”.
複数重心に基づく擬似参照集約 (Deguchi+, Findings of ACL2024) ◼ 研究目的:テキスト埋め込みに基づく効用関数を用いたMBR復号 の速度・品質トレードオフの改善 • 翻訳品質指標COMET等はテキスト特徴量を𝐷次元埋め込みベクトルで表現
𝜙: 𝒴 → ℝ𝐷 ◼ 提案法:Centroid-Based MBR (CBMBR) 復号 • 擬似参照集約において平均特徴量ではなく、𝑘個のクラスタ重心を利用 › クラスタリングには 𝑘-means++ を利用 • 時間計算量: 𝒪 ℋ 𝑘 + 𝒴 𝑘 ◼ 貢献:CBMBR復号は素朴なMBR復号よりも高速、かつ、平均特徴 量を用いた手法よりも高品質 © NTT, Inc. 2026 Deguchi+, Findings of ACL2024, “Centroid-Based Efficient Minimum Bayes Risk Decoding”. 36
低ランク近似を用いた効用値の行列補完 (Trabelsi+, NeurIPS2024) ◼ 目的:効用の評価回数を削減 計算量 𝒪 𝐻 𝒴 →𝒪
37 ℋ 𝒴 𝑟 ◼ アイデア:推薦システム • 好みの似ているユーザは近い映画を好むはず→よく似た仮説は近い効用値を得るはず ◼ 手法 1. いくつか無作為に仮説・擬似参照対を選び、効用値を計算 2. 交互最小二乗法(alternating least square; ALS)によって、仮説—擬似参照の効用値行列 ∈ ℝ𝑑× 𝒴 を2つの低ランク行列に分解 𝐇 ∈ ℝ𝑑× ℋ , 𝐘 3. 低ランク近似行列をかけあわせることで、欠損値を補完 𝐇 ⊤ 𝐘 行列 © NTT, Inc. 2026 Trabelsi+, NeurIPS 2024, “Efficient Minimum Bayes Risk Decoding using Low-Rank Matrix Completion Algorithms”.
38 軽量な代替効用関数によって行列補完を補助 (Natsumi+, AACL2025) ◼ 目的:低ランク近似行列補完の精度を改善 ◼ 手法:追加的に軽量な効用関数を用い、行列補完時に合意をとる制約を付与 1. 目的の効用関数に加え、軽量な
効用関数で追加的に効用値を計算 2. 行列分解時に、軽量な効用関数で 計算した効用値との合意をとる制 約を付与しながら最適化 3. 低ランク近似行列をかけあわせる ことで、欠損値を補完 𝐇⊤ 𝐘 目的の効用関数 行列 分解 ( 意 約 を最小化) 分解 軽量な代替効用関数 (知 モデル等) © NTT, Inc. 2026 Natsumi+, AACL2025, “Agreement-Constrained Probabilistic Minimum Bayes Risk Decoding”.
mbrs: MBR復号のライブラリ pip install mbrs ◼ リンク • GitHub: https://github.com/naist-nlp/mbrs
• 論文: https://aclanthology.org/2024.emnlp-demo.37 • ドキュメント: https://mbrs.readthedocs.io/en/latest ◼ 機能 • さまざまなアルゴリズムと効用関数を実装 • Pythonのdataclass・YAMLベースの設定 • プラグイン機構による拡張可能な設計 • 復号速度を自動計測するためのプロファイラ © NTT, Inc. 2026 Deguchi+, EMNLP2024 demo, “mbrs: A Library for Minimum Bayes Risk Decoding”. 39
40 3. 事例ベース意思決定理論に基づく復号 Case-Based Decision-Theoretic (CBDT) Decoding 国内会議 NLP2025 若手奨励賞受賞
国際会議 EMNLP2025 (main) 採択 論文誌 自然言語処理 Vol.33 No.3 採録予定 © NTT, Inc. 2026
41 MBR復号の課題 ◼ 計算コスト • 仮説・擬似参照生成:仮説や擬似参照を複数生成する必要があり、生成コストが線形に増加 • 仮説選択:仮説と擬似参照の全対から期待効用を推定するため、時間計算量 𝒪 ℋ
𝒴 › 典型的な設定として仮説と擬似参照に同じサンプル集合を用いたとき、二乗時間 › 効用関数にニューラルネットワークのような計算コストの重い関数を用いると非常に低速 ◼ 効用関数への過剰適合 ◼ MCMBR復号におけるいくつかの近似による影響 • 擬似参照への依存性:擬似参照の分布に強い影響を受ける © NTT, Inc. 2026
42 期待効用推定 ◼ (真の)MBR復号 argmax 𝔼𝐲∼Pr ⋅|𝐱 𝑢 𝐡, 𝐲
𝐡∈ℋ 期待効用 ◼ 期待効用の計算における問題点 ① 効用関数 𝑢 の選択 参照テキストとの類似度に基づく自動評価指標などを利用 ② 参照テキストの真の生成確率 Pr 𝐲|𝐱 は不明 代理的にテキスト生成モデルの生成確率を利用 argmax𝐡∈ℋ 𝔼𝐲∼𝑝 ⋅|𝐱;𝜃 𝑢 𝐡, 𝐲 ③ すべての 𝐲 ∈ 𝒴 に対する期待値計算は実行不能 © NTT, Inc. 2026 • 𝑢: 𝒴 × 𝒴 → ℝ 効用関数 › 参照テキスト𝐲 ∈ 𝒴のもとで 𝐡 ≽𝐲 𝐡′ ⇔ 𝑢 𝐡, 𝐲 ≥ 𝑢 𝐡′ , 𝐲 ※ ≽𝐲 は 𝐲 のもとでの選好関係 • Pr ⋅∣ 𝐱 :真の生成確率
Monte Carlo (MC) 推定によるMBR復号 (MCMBR) (Kumar & Byrne, NAACL2004; Eikema
& Aziz, COLING2020) ◼ MCMBR復号:MC法により推定される期待効用 𝑈 MCMBR を最大化 argmax 𝑈 MCMBR 𝐡; 𝐱 𝐡∈ℋ • テキスト生成モデルからサンプリングした出力テキスト (擬似参照)の多重集合 𝒴 を用いてMC推定 𝑈 MCMBR 𝐡; 𝐱 ≔ 𝒴 𝑢 𝐡, 𝐲 𝐲∈𝒴 i.i.d. where 𝒴 ∼ 𝑝 ⋅∣ 𝐱; 𝜃 ※ 典型的には仮説と擬似参照には同じ集合を用いる (ℋ = Supp 𝒴 ) テキスト生成モデルからサンプリングされたテキストを 参照テキストとみなしてよいのだろうか・・・ Kumar & Byrne, NAACL2004, “Minimum Bayes-Risk Decoding for Statistical Machine Translation”. Eikema & Aziz, COLING2020, “Is MAP Decoding All You Need? The Inadequacy of the Mode in Neural Machine Translation”. © NTT, Inc. 2026 43
課題:MCMBR復号とドメインシフト ◼ MCMBR復号の出力品質は疑似参照の分布に依存 (Ohashi+, NAACL2024; Kamigaito+, ACL2025) ◼ 疑似参照の分布と真の分布の間の乖離が大きく なりやすいドメインにおいて、ドメインの知
や情報を反映した仮説選択が困難 Ohashi+, NAACL2024, “On the True Distribution Approximation of Minimum Bayes-Risk Decoding”. Kamigaito+, ACL2025, “Diversity Explains Inference Scaling Laws: Through a Case Study of Minimum Bayes Risk Decoding”. © NTT, Inc. 2026 44
事例ベース意思決定理論 (CBDT) (Gilboa & Schmeidler, 1995) ◼ CBDT:過去に経験した事例に基づく意思決定の理論的枠組み • 事例空間
𝒞 ≔ 問題集合 𝒬 × 行動集合 𝒜 × 報酬空間 ℛ ◼ CBDTに従う意思決定主体:現在直面する問題 𝑞 ∈ 𝒬 に対し、記憶 ℳ ⊆ 𝒞 に基づき、最良の行動 𝑎⋆ ∈ 𝒜 を選択 𝑠: 𝒬 × 𝒬 → 0, 問題の近さを表す類似度関数 𝑎⋆ ≔ argmax𝑎∈𝒜 𝑠 𝑞, 𝑞 𝟙𝑎=𝑎 𝑟ǁ 𝑎, 𝑟ǁ ∈ℳ 𝑞, • 過去に同じ行動を選択した際に得た報酬に対し、現在の問題との類似度を重み付けし、 その荷重和を最大化する行動を選択 例:記憶「過去に食べたラーメン屋A, Bの中で店Aが美味しかった」 現在「ラーメンを食べたい」→ 店Aを選択しやすい ◼ ドメインシフトや非定常な環境などにおいて、期待効用理論より頑健に推論可能 • 医療診断やマーケティングなどにおいて有効性が示されている © NTT, Inc. 2026 Gilboa & Schmeidler, 1995, “Case-based decision theory”. 45
46 目的・提案法の概要 ◼ 目的:ドメインデータを活用した復号によるテキスト生成の品質改善 ◼ 提案法 ① 事例ベース意思決定理論に基づく復号(CBDT復号) › 記憶構築:事前に、事例集合である「記憶」に事例を記憶
› 復号:構築した「記憶」を参照しながら出力仮説を選択 ② MBR-CBDT復号:MBR復号とCBDT復号を線形補間 以降、テキスト生成を扱うため、 = , © NTT, Inc. 2026 , • 問題集合𝒬を入力空間𝒳 • 行動集合𝒜を出力空間𝒴 • 報酬空間ℛを出力テキストの 品質スコア空間 (⊆ ℝ) にそれぞれ読み替える
47 CBDT復号:記憶 ◼ パラレルデータ(入力・参照テキスト対)𝒟 ≔ 𝐱𝑖 , 𝐲𝑖 𝒟 𝑖=1
から記憶ℳ ⊆ 𝒞を構築 ◼ 構築手順 1. データ𝒟内の各入力テキスト 𝐱 について、それぞれ 𝐻 ∈ ℕ 個の仮説をサンプリングし、 重複除去した集合 ℋ𝐱 ⊂ 𝒴 を作成 2. 生成した各仮説 𝐡 ∈ ℋ𝐱 に対して、参照テキスト 𝐲 を用いて品質評価 参照テキストを使えるため、仮説の品質を正確に評価可能(「擬似」参照が登場しない!) 3. 三つ組 𝐱, 𝐡, 𝑢 𝐡, 𝐲 ∈ 𝒳 × 𝒴 × ℝ を記憶に格納 × × , , , , , © NTT, Inc. 2026 , , ,
48 CBDT復号:素朴なCBDT復号 ◼ 素朴なCBDT復号: CBDTの目的関数をそのまま利用 𝑈 CBDTnaïve 𝐡; 𝐱, ℳ
= 𝑠 𝐱, 𝐱 𝟙𝐡=𝐡ሚ 𝑟ǁ ሚ 𝑟ǁ ∈ℳ 𝐱 ,𝐡, ◼ 問題点:指示関数 𝟙𝐡=𝐡ሚ により、仮説 𝐡 と完全一致するテキストが記憶に含ま れない限り、スコアを計算できない • 表記揺れ・言い換えの存在:同じ回答内容でも複数の出力をとりうる • 疎性:句や文、文書などの単位は疎であるため、仮説と同一のテキストを記憶構築時に出力 している可能性は低い テキスト生成にCBDTを用いるには工夫が必要 © NTT, Inc. 2026
49 CBDT復号:復号時 ◼ 𝑈 CBDT スコアを最大化する仮説を選択 • 指示関数の代わりに仮説間の類似度を利用 • 正規化類似度を導入
; , , , , , 𝑈 CBDTnaïve 𝐡; 𝐱, ℳ ≔ 𝑠 𝐱, 𝐱 𝟙𝐡=𝐡ሚ 𝑟ǁ ሚ 𝑟ǁ ∈ℳ 𝐱 ,𝐡, , , , , , , 𝑈 CBDT 𝐡; 𝐱, ℳ ≔ ሚ ℋ𝐱 𝑟ǁ 𝑠𝒳 ҧ 𝐱, 𝐱 ; ℳ 𝑠𝒴 ҧ 𝐡, 𝐡; ሚ 𝑟ǁ ∈ℳ 𝐱 ,𝐡, • 𝑠𝒳 ҧ :𝒳 × 𝒳 × 𝒞 → [0, • 𝑠𝒴 ҧ :𝒴 × 𝒴 × 𝒳 → 0, ] : ℳ 内の全入力事例を用いた温度付きsoftmax正規化類似度 : ℋ𝐱 内の全仮説を用いた温度付きsoftmax正規化類似度 ※ ℳ全体を用いると空間計算量が大きいため、入力テキスト𝐱との類似度が高い𝑘件に絞り込み計算 © NTT, Inc. 2026
50 MBR-CBDT復号 ◼ MBR復号とCBDT復号(EUTとCBDT) • 目的:どちらも効用を最大化する仮説の選択が目的 • 手法:MBR復号は未来の可能性・CBDT復号は過去の経験と、互いに異なる情報に基づく › 原理上は、EUTとCBDTは同等の説明力
› EUTは演繹的 CBDTは帰納的 ◼ MBR-CBDT復号:両者のスコアの荷重和を最大化する仮説を選択 argmax ഥ MBR 𝐡; 𝒴 + 𝜆𝑈 ഥ CBDT 𝐡; 𝐱, ℳ −𝜆 𝑈 𝐡∈ℋ • 𝜆 ∈ 0, :両者のスコアの重みを調節するハイパーパラメータ ഥ MBR , 𝑈 ഥ CBDT :値域を揃えるため、仮説集合ℋ内の最大・最小スコアによりmin-max正規化 • 𝑈 © NTT, Inc. 2026
独英翻訳実験 実験設定:データセット、計算機環境 ◼ データセット 独英翻訳 (Aharoni & Goldberg, ACL 2020)
• ドメイン:IT、コーラン、法、医療、字幕 › ◼ 計算機環境 • Intel Xeon Gold 6426Y: 32コア使用 • NVIDIA RTX 6000Ada: 1基使用 Aharoni & Goldbert, ACL2020, “Unsupervised Domain Clusters in Pretrained Language Models”. © NTT, Inc. 2026 51
独英翻訳実験 独英翻訳実験:仮説生成 ◼ 仮説・疑似参照生成(疑似参照には仮説と同じ候補集合を利用) • 生成モデル:M2M100 (418Mパラメータ) (Fan+, 2021) •
サンプリング法:epsilonサンプリング (𝜀 = 0.0 ) (Freitag+, EMNLP Findings 2023) • 仮説・疑似参照数:1入力につき、1024個の仮説・疑似参照を生成 › 疑似参照には仮説と同じ候補集合を利用 Fan+, 2021, “Beyond english-centric multilingual machine translation”. Freitag+, Findings of EMNLP2023, “Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation”. © NTT, Inc. 2026 52
独英翻訳実験 実験設定:比較する復号法 ◼ MAP: 生成確率を最大化 ◼ QE: 参照なし品質推定(QE)スコアを最大化 • 品質推定モデル:Unbabel/wmt22-cometkiwi-da
◼ kNN-MT: 事例ベース翻訳モデルkNN-MT (Khandelwal+, ICLR2021) の生成確率を最大化 • 近傍事例数6 、温度 00.0、線形補間の重み𝜆 = 0. ◼ MBR: MC推定された期待効用を最大化 ◼ CBDT: CBDTスコアを最大化 ◼ MBR-CBDT: MBRスコアとCBDTスコアを線形補間したスコアを最大化 ◼ Oracle: 参照テキストを用いて評価スコアを最大化(仮説選択の性能上限) © NTT, Inc. 2026 Khandelwal+, ICLR2021, “Nearest Neighbor Machine Translation”. 53
独英翻訳実験 54 実験設定:MBR復号、CBDT復号の設定 ◼ 効用関数:chrF (Popović+, WMT2015) 、COMET (Unbabel/wmt22-comet-da) (Rei+,
WMT2022) ◼ 記憶構築 • 記憶構築用データ:各ドメインのチューニングセット(対訳データ) • 仮説数:1入力につき256仮説を生成 ◼ 復号 • 類似度関数:intfloat/multilingual-e5-large-instruct (Wang+, 2024) のcosine類似度 › • スコア計算に用いた近傍事例数:入力との類似度が高い上位256件 › • STSタスク用のinstructionを使用:”Instruct: Retrieve semantically similar text.¥nQuery: ” それぞれにつき256個の仮説があるため、 6× 6=6 , 6 個の3つ組事例 正規化類似度関数の温度パラメータ:入力側、出力側ともに0.01 © NTT, Inc. 2026 Popović+, WMT2015, “chrF: character n-gram F-score for automatic MT evaluation”. Rei+, WMT2022, “COMET-22: Unbabel-IST 2022 Submission for the Metrics Shared Task”. Wang+, arXiv:2402.05672, 2024, “Multilingual E5 Text Embeddings: A Technical Report”.
独英翻訳実験 55 実験結果:翻訳品質 (chrF) ◼ 評価指標、効用関数:chrF 復号法 MAP QE kNN-MT
MBR CBDT MBR-CBDT Oracle IT コーラン 45.5 23.7 51.0 50.2 52.7 36.2 28.0 37.3 51.7 54.6 63.9 34.0 37.5 48.0 法 医療 字幕 48.5 58.3 58.6 60.1 58.9 61.6 69.5 50.7 55.0 57.3 56.7 56.2 58.4 67.0 39.8 40.6 42.1 42.4 39.3 43.3 57.1 ◼ CBDTはMAPと比べて最大+10.4% chrFスコアを改善 ◼ MBR-CBDTはMBRと比べて最大+1.9% • 他の復号法と比較して、全ドメインで最高性能 © NTT, Inc. 2026
独英翻訳実験 56 実験結果:翻訳品質 (COMET) ◼ 評価指標、効用関数:COMET 復号法 MAP QE kNN-MT
MBR CBDT MBR-CBDT Oracle IT コーラン 76.1 57.9 79.1 79.8 81.1 71.9 63.7 73.5 79.7 82.2 86.5 68.1 73.3 77.8 法 医療 字幕 74.6 84.0 81.7 84.6 82.7 85.0 87.2 78.0 81.6 82.5 82.9 81.1 83.3 86.0 73.5 77.1 74.7 77.9 74.9 78.2 83.1 ◼ CBDTはMAPと比べて最大+10.2% COMETスコアを改善 ◼ MBR-CBDTはMBRと比べて最大+1.1% • 他の復号法と比較して、5ドメイン中4ドメインで最高性能 © NTT, Inc. 2026
独英翻訳実験 実験結果:独英翻訳の品質 © NTT, Inc. 2026 57
独英翻訳実験 仮説選択時間 復号法 平均 標準偏 最小 最大 QE 363.5 0.4
362.9 364.0 kNN-MT 2972.9 5.8 3059.6 2981.3 MBR 6400.3 104.7 6192.1 6463.8 CBDT 120.2 0.8 119.0 121.1 MBR-CBDT 6521.6 105.3 6312.2 6585.2 MBR 899.8 1.2 898.8 902.0 CBDT 158.6 3.8 155.6 165.9 MBR-CBDT 1087.1 3.8 1084.2 1094.5 58 効用:chrF 効用:COMET ◼ 計測:ITドメインの評価セット全体を5回復号したときの、1文あたりの平均復号時間(ミリ秒) ◼ 結果:CBDTは効用関数によらず最速(MAPを除く) • CBDT: 復号時に効用を計算しないため、効用関数のコストに非依存 • MBR: 効用関数のコストに依存、時間計算量 𝒪 ℋ 𝒴 © NTT, Inc. 2026
独英翻訳実験 翻訳例:医療ドメイン 入力文 Insulin Human Winthrop Comb 50 ist eine
Flüssigkeit (Suspension) zum Spritzen unter die Haut. 参照訳 Insulin Human Winthrop Comb 50 is a fluid (suspension) for injection under the skin. MBR Insulin Human Winthrop Comb 50 is a liquid (suspension) to be sprayed under the skin. MBR-CBDT Insulin Human Winthrop Comb 50 is a liquid (suspension) for injection under the skin. ◼ MBR-CBDTは、“zum Spritzen unter die Haut”(皮膚の下への注射)を正しく訳出 ◼ 記憶構築用データの中で、原文 “zum Spritzen unter die Haut” に対し、 • 参照訳に“for injection under the skin”が含まれる事例は11件→訳出されやすくなる • 参照訳に“to be sprayed under the skin”が含まれる事例は0件→訳出されにくくなる © NTT, Inc. 2026 59
関連研究:Pointwise Hilbert—Schmidt独立性基準 (PHSIC) (Yokoi+, EMNLP2018) ◼ データスパース性に頑健な共起尺度 • CBDT復号と同様、入力側・出力側でカーネル関数を用いた類似度で指示関数を緩和 ◼
機械翻訳の訓練事例のデータ選択などに有効 • CBDT復号は、PHSICで得られる類似度を効用の重み付けに利用している、と考えられる Yokoi+, EMNLP2018, “Pointwise HSIC: A Linear-Time Kernelized Co-occurrence Norm for Sparse Linguistic Expressions”. © NTT, Inc. 2026 60
本章のまとめと今後の課題 ◼ 提案:事例ベース意思決定理論に基づく復号 ◼ 貢献:ドメイン情報を活用することにより、テキスト生成の出力品質を改善 ◼ 結果:翻訳実験、画像キャプション生成実験より以下を確認 ① CBDT復号: ›
MAP復号よりも高品質なテキストを生成 › 他の品質重視な復号法に比べて高速に復号可能 ② MBR-CBDT復号:MBR復号よりも高品質なテキストを生成 ◼ 今後の課題 • 過剰適合への対策 • テキスト以外の生成タスクへの応用 © NTT, Inc. 2026 61
おわりに ◼ よりよい復号法を考えることでモデルの性能を引き出せるようになる • 目的は何か? › 高速に生成したい › 高品質なテキストを生成したい→品質をどう測るか、過剰適合問題 ›
ドメイン知 を活用したい ◼ 意思決定理論などのような数理モデルにヒントが転がっている…かもしれない • 人間はどのようにテキストを生成しているのか? • 人間はどのようにテキストを選択しているのか? • 人間らしいテキスト・AIらしいテキストとは? 研究の質問・議論・共同研究などなど、お気軽にご連絡ください! © NTT, Inc. 2026 E-mail:
[email protected]
62
63 補足資料 © NTT, Inc. 2026
日英・英日翻訳実験 実験設定:データセット・ハイパーパラメータ ◼ タスク:日英・英日翻訳 • ASPEC:科学技術論文ドメイン (Nakazawa+, LREC2016) • KFTT:Wikipediaの京都に関する記事
(Neubig, 2011) ◼ CBDT復号・MBR-CBDT復号のメモリ構築 • 記憶対象データ:各データの訓練コーパス • 仮説数:1入力につき64仮説を生成 • 類似度関数:intfloat/multilingual-e5-large-instruct (Wang+, 2024) のcosine類似度 › STSタスク用のinstructionを使用:”Instruct: Retrieve semantically similar text.¥nQuery: ” • スコア計算に用いた近傍事例数:入力との類似度が高い上位256件 • 正規化類似度関数の温度パラメータ:入力側0.1、出力側0.01 © NTT, Inc. 2026 Nakazawa+, LREC2016, “ASPEC: Asian Scientific Paper Excerpt Corpus”. Neubig, 2011, “The Kyoto free translation task”. Wang+, arXiv:2402.05672, 2024, “Multilingual E5 Text Embeddings: A Technical Report”. 64
独英翻訳実験 実験結果:日英・英日翻訳の品質 ◼ 結果:MBR-CBDT復号がMBR復号よりも効用関数の評価スコアを改善 © NTT, Inc. 2026 65
画像キャプション生成実験 実験設定:データセット、仮説生成 ◼ データセット • MSCOCO (Lin+, ECCV2014; Karpathy &
Fei-Fei, IEEE TPAMI, 2015) • nocaps (Agrawal+, 2019) ◼ 仮説生成 • 生成モデル:BLIP-2 (Salesforce/blip2-flan-t5-xl) (Li+, ICML2023) • サンプリング法:イプシロンサンプリング (𝜀 = 0.0 ) • 仮説数:1入力につき、256個の仮説を生成 • 疑似参照には仮説と同じ候補集合を利用 Lin+, ECCV2014, “Microsoft COCO: Common Objects in Context”. Karpathy & Fei-Fei, IEEE TPAMI, 2015, “Deep Visual-Semantic Alignments for Generating Image Descriptions”. Li+, ICML2023, “BLIP-2: Bootstrapping Language-Image Pre-trainingwith Frozen Image Encoders and Large Language Models”. © NTT, Inc. 2026 66
画像キャプション生成実験 実験設定:MBR復号、CBDT復号 ◼ 効用関数:BERTScore (microsoft/deberta-v3-large) (Zhang+, ICLR2020; He+, ICLR2023) ◼
メモリ構築 • 画像間類似度:DINOv2 (facebook/dinov2-large) (Fan+, 2021) • キャプション間類似度:multilingual-e5-large-instruct • 画像側温度:0.1、キャプション側温度:1.0 Zhang+, ICLR2020, “BERTScore: Evaluating Text Generation with BERT”. He+, ICLR2023, “DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing”. Oquab+, TMLR, 2024, “DINOv2: Learning Robust Visual Features without Supervision”. © NTT, Inc. 2026 67
画像キャプション生成実験 実験結果 ◼ MBR-CBDT復号は画像キャプション生成にも有効 • テキスト以外のモダリティに対しても有効 • BLEU、chrF、BERTScoreの精度をすべて改善 © NTT,
Inc. 2026 68
69 考察:MBR-CBDT復号の補間重み ITドメイン独英翻訳(開発データ) ◼ 結果:𝜆 = 0.5~0.6 で最高品質 5 .0
53.5 • 実験では 𝜆 = 0. を採用 c r 53.0 52.5 52.0 51.5 51.0 0.0 0.1 0.2 0.3 0. © NTT, Inc. 2026 0.5 0.6 0.7 0.8 0.9 1.0
70 考察:類似度関数 類似度関数 mE5 large-instruct LaBSE (Feng+, ACL2022) BM25 (Jones+,
IPRM, 2000) chrF 54.6 54.0 51.2 COMET 78.7 78.5 76.5 BLEURT 59.8 59.1 57.4 ITドメイン独英翻訳 (効用:chrF) ◼ 類似度関数が最終的な品質に直結 • 類似度を正確に推定できるモデルが必要 • 入力側・出力側でそれぞれ独立して類似度を計算 › それぞれの空間で最適なモデルを選択可能→今後の課題 › 画像キャプション生成においてクロスモーダルなモデルは不要 Feng+, ACL2022, “Language-agnostic BERT Sentence Embedding”. Jones+, IPRM, 2000, “A probabilistic model of information retrieval: development and comparative experiments Part 2”. © NTT, Inc. 2026
画像キャプション生成実験 71 考察:事例のドメインと出力品質との関係 ◼ 実験:記憶用データのドメインが出力品質に与える影響を調査 • 記憶用データに › 目標ドメインのデータ ›
目標ドメインと異なるドメイン(遠ドメイン)のデータ を用いたときの出力品質を評価 nocaps画像キャプション生成 ◼ 結果:遠ドメインデータで記憶を構築 するとBLEUとBERTScoreが低下 • 記憶用データのドメインが目標ドメインに 近いほど高品質なテキストを生成可能 © NTT, Inc. 2026 記憶用データ 目標 BLEU ドメイン Localized Narratives MSCOCO ✘ chrF BERT Score 26.8 41.6 66.3 25.7 41.7 66.0
72 考察:記憶から取得する事例数 ITドメイン独英翻訳 (開発データ) ◼ 近傍事例𝑘 ≥ • 個以上の取得では、精度が頭打ち 提案法は記憶の全事例を使わず、近傍事例のみを利用していることに注意
› 全事例を使用→空間計算量:𝒪 ℋ ℳ › 例:仮説数 ℋ = ,0 、データサイズ 𝒟 = 00,000、記憶中の仮説数𝐻 = ,0 × 00,000 × 6 × bit ≃ 97.7Gi © NTT, Inc. 2026 =𝒪 ℋ 𝒟𝐻 6とすると、
考察:記憶時の仮説数 𝑯 と記憶内仮説の多様性 ITドメイン独英翻訳(開発データ) ◼ 左:𝐻を増やすと精度が改善、𝐻 > ◼ 右:記憶内の仮説の多様性をpairwise-BLEU(低いほど多様)で評価したところ、𝐻 >
で多様性が飽和 ◼ 結果:記憶内の各事例に対する仮説集合の多様性と最終的な品質との関係性を示唆 • © NTT, Inc. 2026 で改善幅が減少 記憶内仮説が多様であれば、「この仮説を選択すればこれくらい効用が得られる」と いう事例情報をたくさん得られる 73