Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
JAPAN AI CUP Prediction Tutorial
Search
Shotaro Ishihara
January 13, 2026
Education
1.3k
2
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
JAPAN AI CUP Prediction Tutorial
https://www.ai-gakkai.or.jp/aicup/
Shotaro Ishihara
January 13, 2026
More Decks by Shotaro Ishihara
See All by Shotaro Ishihara
Agent 時代の Kaggle 展望 / kaggle-in-the-agentic-era
upura
1
670
大規模言語モデルは誰を覚えているか / Who Do Large Language Models Memorize?
upura
0
110
[ACL 2026 Demo] Fast-MIA: Efficient and Scalable Membership Inference for LLMs
upura
0
93
Fast-MIA: Efficient and Scalable Membership Inference for LLMs
upura
0
60
情報技術の社会実装に向けた応用と課題:ニュースメディアの事例から / appmech-jsce 2025
upura
0
420
日本語新聞記事を用いた大規模言語モデルの暗記定量化 / LLMC2025
upura
0
770
Quantifying Memorization in Continual Pre-training with Japanese General or Industry-Specific Corpora
upura
1
130
JOAI2025講評 / joai2025-review
upura
0
1.7k
AI エージェントを活用した研究再現性の自動定量評価 / scisci2025
upura
1
280
Other Decks in Education
See All in Education
解決策を教えても次期リーダーは育たない ─ 器の発達に伴走するために / Partnering with leaders in their vertical development
matsu0228
1
610
Visionary Initiative: Materials-Positive Society — Evolving “Things,” empowering a positive society | Science Tokyo
sciencetokyo
PRO
0
170
第2部-高校生とAI活用/high-school2026-2
okana2ki
0
110
BITCOIN : Les fondamentaux !
rlifchitz
0
220
[2026前期火5] 論理学(京都大学文学部 前期 第14回)「計算は、証明ではない——ハルシネーションを三層ハーモニーで診る」
yatabe
0
170
Case Studies - Lecture 12 - Information Visualisation (4019538FNR)
signer
PRO
0
210
Beyond the Prompt: Programming as a Pathway to Statistical Thinking
minecr
0
310
【セーフィー】テクニカルライティング&コミュニケーション実践講座(26新卒エンジニア向け研修資料)
ymzaki_m4
0
290
Laura Wilson - The Quarterly PR Pivot
laurawilsonbseo1
1
390
Visionary Initiative: Future Intelligence 「未来の知性と社会の礎を築く」|Science Tokyo(東京科学大学)
sciencetokyo
PRO
0
1.2k
0506
cbtlibrary
0
240
自己紹介 / who-am-i
yasulab
6
7.1k
Featured
See All Featured
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
1
840
The Cost Of JavaScript in 2023
addyosmani
55
10k
How to train your dragon (web standard)
notwaldorf
97
6.7k
Art, The Web, and Tiny UX
lynnandtonic
304
22k
Discover your Explorer Soul
emna__ayadi
2
1.2k
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
2.9k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
200
[Rails World 2023 - Day 1 Closing Keynote] - The Magic of Rails
eileencodes
38
2.9k
Into the Great Unknown - MozCon
thekraken
41
2.7k
First, design no harm
axbom
PRO
2
1.2k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
660
How to Get Subject Matter Experts Bought In and Actively Contributing to SEO & PR Initiatives.
livdayseo
0
170
Transcript
JAPAN AI CUP 予測部門 チュートリアル 人工知能学会企画委員コンペティション担当 石原祥太郎、原田慧、高野海斗
• JAPAN AI CUP の概要 • ベースラインモデルの構築 • 今後の改善の指針 チュートリアルの目次
• JAPAN AI CUP の概要 ◦ 中高生 AI・DS 探究部門 /
中高生予測部門 / 一般予測部門 ◦ 予測部門で取り組む課題 ◦ 評価指標 ◦ 生成 AI 利用などのルール • ベースラインモデルの構築 • 今後の改善の指針 チュートリアルの目次
中高生 AI・DS 探究部門と、中高生/一般予測部門を開催 • AI・DS 探究部門 [募集要項] ◦ 人工知能 (AI)
やデータサイエンスに関する幅広い探究活動 の成果を募集 • 予測部門 [中高生][一般] ◦ 所定の項目に対する予測精度を競う。今回の課題は、商品 購買データを用いた需要予測。 JAPAN AI CUP の概要 https://www.ai-gakkai.or.jp/aicup/
2024 年 2 月 3 日〜2025 年 2 月 2
日の商品購買データを用いて 顧客が 2025 年 2 月 3〜28 日に 100 円以上購入するか予測 • データ提供:生活協同組合コープさっぽろ • 商品購買データ: コンペの課題:顧客の再訪を予測せよ!
詳細は Data タブ参照 • 商品名 • 商品カテゴリ • 価格 •
購入量 • 会員 ID • 会員ステータス • 性別 など 商品購買データに含まれる情報
課題設定 (データの分割) 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public
test (提供せず) Private test (提供せず) 29965 人 3300 人 6700 人 ユーザ x 日付のデータを提供
コンペ終了後に、上位チームはコードと解法説明資料を提出。 中高生/一般予測部門それぞれで、以下を表彰。 • 最優秀スコア賞/優秀スコア賞:Private test に対する性能を AUC で評価。 • 人工知能学会特別賞/コープさっぽろ特別賞:独創的な発想や
工夫が認められたチームに授与。 表彰の対象
• JAPAN AI CUP の概要 • ベースラインモデルの構築 ◦ Kaggle アカウントの準備やコンペ参加
◦ データの確認 ◦ 基本的な特徴量を使ったモデルの作成 ◦ モデルの検証 ◦ 予測結果の提出 • 今後の改善の指針 チュートリアルの目次
1. アカウント作成 • 日本人工知能オリンピック「Kaggle アカウントの作成手順」の 解説動画 • ※ Kaggle アカウントは、13
歳以上から作成できます(13〜16 歳は保護者の同意が必要) 2. コンペ参加 • コンペの URL にアクセスし「Join Competition」 Kaggle アカウントの準備やコンペ参加
提供ファイル
データの読み込み
商品購買データ
正解ラベル(1; 再訪、0; 再訪なし)
提出ファイル ← 各 ID の予測値を 0-1 で提出
教師あり学習によるコンペの概要 1. 主催者がデータセットと 課題を提供 2. 参加者は評価用データ セットの正解ラベルを予 測 3. 開催期間中に順位を競い
合う 4. 終了時の最終結果で順位 が確定
基本的な特徴量を使ったモデルの作成 素朴な特徴量として、会員 ID に紐づく以下を計算 • 購入回数:”date” の総数 • 購入単価の多寡:”average_unit_price” の合計
機械学習モデル:LightGBM を利用 • 高速かつ高性能なモデルとして有名 • lgb.train() => model.predict()
検証スコアの算出 モデルの提出前に、性能を見積もる • train_flag.csv のデータ数 (29965) の方が、暫定の順位表に 使われているデータ (Public test)
の数 (3300) よりも多く、 信頼しやすいため • 順位表には提出制限があるため
予測結果の提出
提出の例:[0.7, 0.8, 0.9, 0.2, 0.3, 0.1, …] • 正解ラベルが 1
(再訪する) のユーザに 1 寄りの値、0 (しない) のユーザに 0 寄りの値を付けていると、良いスコアが出るよう な評価指標 評価指標:AUC (0〜1 の予測値を提出) 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 29965 人 3300 人 6700 人
提出の例:[0.7, 0.8, 0.9, 0.2, 0.3, 0.1, …] • 約 33
% のユーザでスコアを算出 => 暫定の順位表 (Public) • 残りのユーザでスコアを算出 => 最終結果に利用 (Private) 評価指標:AUC (0〜1 の予測値を提出) 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 最終の順位表の スコアに 29965 人 3300 人 6700 人
1. 提供されたデータと正解ラベルを用い、機械学習モデルを構築 2. 構築したモデルで、評価用のデータに対する正解ラベルを予測 3. 予測結果を提出し、暫定の順位表のスコアを確認 4. スコアを参考に、モデルの改善を模索 (1 に戻る)
参加者は何をするか 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 最終の順位表の スコアに 29965 人 3300 人 6700 人
1. 提供されたデータと正解ラベルを用い、機械学習モデルを構築 2. 構築したモデルで、評価用のデータに対する正解ラベルを予測 3. 予測結果を提出し、暫定の順位表のスコアを確認 4. スコアを参考に、モデルの改善を模索 (1 に戻る)
参加者は何をするか 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 最終の順位表の スコアに 29965 人 3300 人 6700 人
1. 提供されたデータと正解ラベルを用い、機械学習モデルを構築 2. 構築したモデルで、評価用のデータに対する正解ラベルを予測 3. 予測結果を提出し、暫定の順位表のスコアを確認 4. スコアを参考に、モデルの改善を模索 (1 に戻る)
参加者は何をするか 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 最終の順位表の スコアに 29965 人 3300 人 6700 人
1. 提供されたデータと正解ラベルを用い、機械学習モデルを構築 2. 構築したモデルで、評価用のデータに対する正解ラベルを予測 3. 予測結果を提出し、暫定の順位表のスコアを確認 4. スコアを参考に、モデルの改善を模索 (1 に戻る)
参加者は何をするか 商品購買データ (data.csv) 2024/02/03 2025/02/02 学習用の正解データ (train_flag.csv) 02/28 Public test (提供せず) Private test (提供せず) 開催中の暫定の 順位表でスコア を確認可能 最終の順位表の スコアに 29965 人 3300 人 6700 人
• JAPAN AI CUP の概要 • ベースラインモデルの構築 • 今後の改善の指針 チュートリアルの目次
仮説を立てる → 手元と順位表で検証しながら試行錯誤 • 仮説を立てる ◦ 特徴量の追加や削除 (何が予測に役立ちそう?) ◦ 機械学習モデルの差し替え
(XGBoost やニューラルネット ワークなど) ◦ 複数の予測結果の活用 (アンサンブル) • 手元と順位表で検証 ◦ 最終結果は、暫定の順位表 (Public) で使われているデータ とは、異なるデータに対する性能で評価 (Private) ◦ 手元の検証スコアも見て、汎用性が高いモデルを目指す まとめと今後の改善の指針