Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
第182回 雲勉 【Gemini 3.0 Pro】AI ベンチマーク徹底比較!他モデルに比べ優...
Search
iret.kumoben
January 16, 2026
Technology
73
0
Share
第182回 雲勉 【Gemini 3.0 Pro】AI ベンチマーク徹底比較!他モデルに比べ優れている点まとめ
下記、勉強会での資料です。
https://youtu.be/t5JX3In2Fnk
iret.kumoben
January 16, 2026
More Decks by iret.kumoben
See All by iret.kumoben
第181回 雲勉 WEB制作者のちょっとした面倒をAWSで解決!Amazon S3とAWS Lambda活用術
iret
0
63
第180回 雲勉 Abuse report の調査・確認方法について
iret
0
92
第179回 雲勉 AI を活用したサポートデスク業務の改善
iret
0
120
第178回 雲勉 Amazon EKSをオンプレで! Amazon EKS Anywhere 実践構築ガイド
iret
1
91
第177回 雲勉 IdP 移行を楽に!Amazon Cognito でアプリへの影響をゼロにするアイデア
iret
0
99
第176回 雲勉 VPC 間サービス接続を考える!Private Service Connect 入門
iret
0
79
第175回 雲勉 Amazon ECS入門:コンテナ実行の基本を学ぶ
iret
0
120
第174回 雲勉 Google Agentspace × ADK Vertex AI Agent Engineにデプロイしたエージェントを呼び出す
iret
0
150
第173回 雲勉 ノーコードで生成 AI アプリを構築!Google Cloud AI Applications(旧 Vertex AI Agent Builder)入門
iret
0
130
Other Decks in Technology
See All in Technology
CloudSec JP #005 後締め ~ソフトウェアサプライチェーン攻撃から開発者のシークレットを守る~
lhazy
0
190
All About Sansan – for New Global Engineers
sansan33
PRO
1
1.4k
Claude Teamプランの選定と、できること/できないこと
rfdnxbro
1
2.4k
OBI+APMでお手軽にアプリケーションのオブザーバビリティを手に入れよう
kenshimuto
0
300
BigQuery × dbtでコスト削減した話
rightcode
0
140
昔はシンプルだった_AmazonS3
kawaji_scratch
0
260
新規サービス開発におけるReact Nativeのリアル〜技術選定の裏側と実践的OSS活用〜
grandbig
2
190
Eight Engineering Unit 紹介資料
sansan33
PRO
3
7.2k
申請待ちゼロへ!AWS × Entra IDで実現した「権限付与」のセルフサービス化
mhrtech
2
310
Zero-Downtime Migration: Moving a Massive, Historic iOS App from CocoaPods to SPM and Tuist without Stopping Feature Delivery
kagemiku
0
240
Bluesky Meetup in Tokyo vol.4 - 2023to2026
shinoharata
0
190
Introduction to Sansan Meishi Maker Development Engineer
sansan33
PRO
0
390
Featured
See All Featured
Prompt Engineering for Job Search
mfonobong
0
260
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
220
Bioeconomy Workshop: Dr. Julius Ecuru, Opportunities for a Bioeconomy in West Africa
akademiya2063
PRO
1
93
The Curse of the Amulet
leimatthew05
1
11k
What's in a price? How to price your products and services
michaelherold
247
13k
SEO Brein meetup: CTRL+C is not how to scale international SEO
lindahogenes
1
2.5k
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
120
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
AI in Enterprises - Java and Open Source to the Rescue
ivargrimstad
0
1.2k
Docker and Python
trallard
47
3.8k
Darren the Foodie - Storyboard
khoart
PRO
3
3.2k
Deep Space Network (abreviated)
tonyrice
0
110
Transcript
青木 駿弥 アイレット株式会社 【Gemini 3.0 Pro】AIベンチマーク徹底比較! 他モデルに比べ優れている点まとめ 第
182 回 雲勉
01 アジェンダ 自己紹介 02 そもそもベンチマークとは 03 Gemini 3.0 Proの優れている点 04
まとめ
青木 駿弥 • DX開発事業部 フルスタックセクション エン タープライズシステムグループ • 2025年新卒入社、アイレット歴:9ヶ月 •
緊張しますが精一杯頑張ります! アイレット株式会社 あ お き しゅ ん や Profile お写真 ★ご質問は YouTubeのコメント欄で 受け付けております。後日回答させていただきます! ★チャンネル登録よろしくお願いします!
そもそもベンチマークとは
私たちが学校で「国語」「数学」「英語」 の試験を受けて学力を測るのと同じように、 AIも「論理的思考」「画像認識」「プログラミング」 といった観点で、様々なテストを受けることで、 総合力や得意・不得意を判定します。 AIの実力テストのようなもの そもそもベンチマークとは 5 参考:https://blog.google/products/gemini/gemini-3/#gemini-3-deep-think
そもそもベンチマークとは 6 参考:https://blog.google/products/gemini/gemini-3/#gemini-3-deep-think ベンチマークの数値の差と個人的な見解で、 以下7つをピックアップ 1. ARC-AGI-2 2. GPQA Diamond
3. MathArena Apex 4. ScreenSpot-Pro 5. SWE-Bench Verified 6. Vending-Bench 2 7. SimpleQA Verified
Gemini 3.0 Proの凄さ
Gemini 3.0 Pro の凄さ 8 ARC-AGI-2 未知の法則性を見つけ出す力を測るテスト Gemini 3.0 Pro
の凄さ 31.1% の正答率 学習データにない新しい状況に直面しても、 「自ら考え、柔軟に適応して問題を解決」 する能力が高い! 参考:https://arcprize.org/arc-agi/2/ LLMに数字の2次元配列データが与えられ、 そこにある抽象的なルールを推論。 その推論に基づき正解の配列orそれを生成するコードを出力
Gemini 3.0 Pro の凄さ 9 GPQA Diamond 物理学、化学、生物学の分野で、博士号を持つ 専門家が作成した高難易度の問題集 Gemini
3.0 Pro の凄さ 博士号保持者でも7割しか解けない問題を91.9% 参考:https://epoch.ai/benchmarks/gpqa-diamond AIの知能が人類のトップ層を追い越した 専門的な科学分野のテキストによる質問と、 4つの選択肢が与えられ、正解の選択肢(A)を返す
Gemini 3.0 Pro の凄さ 10 MathArena Apex 超高難易度の数学ベンチマーク AIが正解できなかった問題だけを集めた超高難易度の問題集 Gemini
3.0 Pro の凄さ 参考:https://matharena.ai/apex/ 他AIモデルの正答率:1.0%〜1.6% Gemini 3.0 Proの正答率:23.4% 論理を組み立て、自力で正解を導き出す推論能力が非常に高い 数学オリンピックなどの問題文が与えられ、LLMは思考プロセスと回答をアウ トプット
Gemini 3.0 Pro の凄さ 11 ScreenSpot-Pro AIがプロ向けソフト(VS CodeやAutoCADなど )の画面をどれだけ正しく認識 し、操作できるかを評価するためのテスト
Gemini 3.0 Pro の凄さ 72.7% の正答率 人間のように画面を見て、マウス操作までもAIが完全 に代行できるようになる未来の可能性 参考:https://github.com/likaixin2000/ScreenSpot-Pro-GUI-Grounding 参考:https://arxiv.org/abs/2504.07981 画面のスクリーンショットと自然言語による指示(設定アイコンを開いて) が与えられ、LLMは該当箇所の座標を数値で返します
Gemini 3.0 Pro の凄さ 12 SWE-Bench Verified AIが実務レベルのソフトウェアエンジニアとして機能するかを測るテスト Gemini 3.0
Pro の凄さ 単なるコーディングだけでなく、システムの整合性を保ったまま修正でき る高度な文脈理解力 参考:https://www.swebench.com/ コーディング特化AIではないのにも関わらず、スコア76.2%を記録 まさに、高水準汎用AI Django, Flaskなど、有名なPythonライブラリの実際のバグ修正を行わせ、最 終的に実際にコードを書き換えるためのパッチファイルを返す
Gemini 3.0 Pro の凄さ 13 Vending-Bench 2 AIの「長期記憶」と「一貫性」を測る指標となるテスト Gemini 3.0
Pro の凄さ 約5,478ドル の儲け ロングコンテキストを活かした「高い信頼性と安定感」 参考:https://arcprize.org/arc-agi/2/ 自動販売機のオーナーとして、仕入れ・価格設定・在庫管理・顧客対応を行う 毎日変化するビジネスの状況が与えられる 最終的にいくら儲けたか
Gemini 3.0 Pro の凄さ 14 SimpleQA Verified 質問に対して、どれだけ正直に答えることができるか つまり、ハルシネーションがどれほど少ないかを測るテスト Gemini
3.0 Pro の凄さ 72.1% という高いスコア ビジネスや学術用途で使用する際に 「信頼感」は非常に重要なポイント 参考:https://arcprize.org/arc-agi/2/ Correct: 正しい答え Incorrect: 間違った答え(知ったかぶり) ※これが最悪の評価 Not Attempted:「分かりません」と答える (間違えるよりはマシと評価される)
まとめ
まとめ 16 1 2 Gemini 3.0 Proは高水準の汎用AIモデル AIの進化の早さは想像以上 https://deepmind.google/models/gemini/ 3
特定のAIモデルやツールに固執することなく、 様々なAIを小さく試すことが重要