Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
NTCIR-17 Transfer タスク
Search
Hideo Joho
September 28, 2022
Research
0
340
NTCIR-17 Transfer タスク
NTCIR-17にパイロットタスクとして採択されたTransferタスクの紹介
Hideo Joho
September 28, 2022
Tweet
Share
More Decks by Hideo Joho
See All by Hideo Joho
NTCIR-17 Transfer Task
hideojoho
0
160
HCIR輪読会2021 フェアネス 第8章 // HCIR Group Reading 2021 on Fairness: Chapter 8
hideojoho
0
150
HCIR輪読会2021 フェアネス 書籍紹介 // HCIR Group Reading 2021 on Fairness: Book Introduction
hideojoho
1
190
HCIR輪読会2021 フェアネス 第1章 // HCIR Group Reading 2021 on Fairness: Chapter 1
hideojoho
0
91
Other Decks in Research
See All in Research
Towards a More Efficient Reasoning LLM: AIMO2 Solution Summary and Introduction to Fast-Math Models
analokmaus
2
740
SSII2025 [SS2] 横浜DeNAベイスターズの躍進を支えたAIプロダクト
ssii
PRO
7
3.9k
心理言語学の視点から再考する言語モデルの学習過程
chemical_tree
2
550
ストレス計測方法の確立に向けたマルチモーダルデータの活用
yurikomium
0
1.2k
多言語カスタマーインタビューの“壁”を越える~PMと生成AIの共創~ 株式会社ジグザグ 松野 亘
watarumatsuno
0
110
Delta Airlines® Customer Care in the U.S.: How to Reach Them Now
bookingcomcustomersupportusa
0
110
GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization
satai
3
300
数理最適化と機械学習の融合
mickey_kubo
16
9.2k
Adaptive fusion of multi-modal remote sensing data for optimal sub-field crop yield prediction
satai
3
250
Mechanistic Interpretability:解釈可能性研究の新たな潮流
koshiro_aoki
1
400
「どう育てるか」より「どう働きたいか」〜スクラムマスターの最初の一歩〜
hirakawa51
0
820
Computational OT #4 - Gradient flow and diffusion models
gpeyre
0
370
Featured
See All Featured
Product Roadmaps are Hard
iamctodd
PRO
54
11k
What's in a price? How to price your products and services
michaelherold
246
12k
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
48
9.6k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
15
1.6k
GraphQLの誤解/rethinking-graphql
sonatard
71
11k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
139
34k
Keith and Marios Guide to Fast Websites
keithpitt
411
22k
Producing Creativity
orderedlist
PRO
347
40k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
229
22k
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
50
5.5k
[RailsConf 2023] Rails as a piece of cake
palkan
56
5.8k
BBQ
matthewcrist
89
9.8k
Transcript
NTCIR-17 Transfer タスク 資源リサイクル型密検索技術 上保 秀夫 筑波大学 欅 惇志 一橋大学
大場 勇貴 筑波大学 English Version with audio 日本語版(音声付き)
概要 2
資源転移の例 • タスク横断 ◦ 案内型クエリ (Navigational queries) から情報型クエリ (Informational queries)
への再学習 ◦ 言語モデルからランキングモデルへの再学習 • ドメイン横断 ◦ Web 文書から学術記事へのドメイン適合 • 言語横断 ◦ 英語モデルから日本語モデル • などなど… 3
利用可能データ • 既存データ ◦ 英語版 MS MARCO (ver 1) (eMARCO)
◦ NTCIR-1 Ad-Hoc test collection (日本語) ◦ NTCIR-2 Ad-Hoc test collection (日本語) ◦ BERT モデル (英語/日本語) • オーナイザーから提供予定のデータ ◦ 日本語翻訳版 MS MARCO (ver 1) (jMARCO) ▪ 文書コレクションと Dev トピック (暫定版の翻訳済み) ▪ JParaCrawl version 2 + DeepL API ◦ jMARCO による学習済みの ColBERT モデル ◦ Dev / jMARCO による学習済みの BERT リランカー 4
サブタスク1: Dense First Stage Retrieval • 入力/出力 ◦ 入力: Ad-Hoc
task の トピック記述 ◦ 出力: 順位付けされた検索結果の上位 10,00件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価尺度 ◦ nDCG 5
サブタスク2: Dense Reranking Subtask • 入力/出力 ◦ 入力: 第1段階検索結果の上位 1,000
件 (文書ID、ベクトルデータ、等 ) ▪ オーガナイザーらによって提供 ◦ 出力: 再順位付けされた検索結果の上位 100 件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価指標 ◦ nDCG / MRR 6
暫定版スケジュール • 9/28, 2022: Kick-off event • 1/30, 2023: 最終タスクガイドライン公開,全資源データの公開
• 2/1, 2023: Formal Run: Dev/Test topics 公開 • 5/1, 2023: Formal Run: タスク参加登録期限 • 6/1, 2023: Formal Run: ラン提出期限 • 8/1, 2023: Formal Run: 評価結果返却 • 8/1, 2023: Task overview paper 公開 (ドラフト版) • 9/1, 2023: 参加者の論文投稿期限 (ドラフト版) • 11/1, 2023: Camera-ready 版論文投稿期限 • 12月, 2023: NTCIR-17 Conference 7
タスク設計の検討事項 1. 疎検索モデル (例:BM25のみ) のランは対象外、単純な再学習済みランは OK 2. サブタスク2の入力文書(固定 vs. サブタスク1のランを活用)
3. 現時点ではターゲットタスク言語が日本語のみ 4. 現時点では利用可能なデータやモデルに制約なし 5. Dry Run 時期を設けていない 6. Formal run の提出数は1チーム3-5 を検討中 7. Test sets の正解データを参加者が閲覧しないことを前提( ←重要) 8. 追加の適合性判定作業を実施する可能性あり 9. リーダーボードの導入の可能性あり 10. 資源ガイドや成功事例の構築を予定 8
アドバイザリー・ボード • Noriko Kando (NII, Japan) • Doug Oard (University
of Maryland, US) • 随時追加 9
最新情報・問い合わせ • Webサイト https://hcir.slis.tsukuba.ac.jp/project/ntcir-transfer/ • 連絡先
[email protected]
• Twitter #ntcir_transfer
• Slack (タスク参加登録者限定) 10