Upgrade to Pro — share decks privately, control downloads, hide ads and more …

人工知能時代の到来/IntroAI01

 人工知能時代の到来/IntroAI01

Avatar for Kazuhisa Fujita

Kazuhisa Fujita

September 30, 2026

More Decks by Kazuhisa Fujita

Other Decks in Education

Transcript

  1. これまでも人工知能はあった • これまでのあった人工知能的なもの • 画像認識 AIは影からみんなの生 活を支えています。 • 画像に映っている物体が何か分かる。 •

    何が何処にあるか分かる。 • 文字が分かる。 • 予測 • 天気予報などの情報から仕入れ数を予測する。 • 状況から販売値段を決める。 • これまでの人工知能は何らかの機能に特化している。 • 特化しているため人工知能を使っている感覚がなく、単に便利なソフト・機能と 感じる。 • 日常で使っており高性能であることに気づかない。 • 高性能が当たり前になっている。
  2. なぜ今、人工知能が話題になるのか • 汎用的 • 自然な会話ができる。 • 動くプログラムコードも生成される。 • データ解析もできる。 •

    文章要約もできる。 • 文章校正もできる。 • 翻訳も出来る。 • 表現の世界にも進出 • 絵も書ける。 • 曲も作れる。 • 以上の機能をもった人工知能を誰でも使える。 作文や絵を描くのが得意 です。 小論文の添削で使った人 も多いかもね。
  3. なぜ今、人工知能が話題になるのか 人のかわりに何でも できます。 • 性能が高い • 前述の用途で実用に足る性能がある。 • 人工知能に任せられる業務が増える。人工知能に雇用を奪われるの心配を真面目にし なければならなくなった。

    • 人工知能技術が人類を滅ぼす可能性を真面目に議論する人工知能研究者が現れる。 • 性能が文字通り日進月歩で向上している。 • 創造性を持ち始める。 • 絵や音楽など芸術の世界でも人工知能の作品が存在感を持つ。 • 創造するという人の特権と思っていた行為が人工知能にも出来、人の尊厳を傷つけ る。 • 人は習得するために多大な時間をかけているのに、人工知能がいとも簡単に高品質の絵を出力する (本当は人工知能(研究者)もこのレベルまで来るのに大変な苦労をしているが)。
  4. 人工知能はすでに人を超えている https://aiindex.Stanford.edu/report/ 人レベル 英語言語理解 複数モードの 理解 画像認識 複数モードの 理解 博士レベルの

    科学の質問 画像理解と自然言語理解 の統合能力 マルチタスク言語理解 エージェント 複数モード 数学
  5. あらゆる端末に人工知能が搭載される • 2023年12月,GoogleはGoogle Pixel 8 ProにAIモデルGemini Nanoを搭載した . AI(モデル)そのものがスマホに入っており,スマホでAIが実行される. •

    2024年1月,MicrosoftはWindows 11 PCのキーボードに人工知能ボタン (Copilotキー)を導入することを発表した. • Copilotキーを押すことで,Windowsに搭載されている人工知能Copilotが起動さ れる. • 2024年6月,AppleはApple Intelligenceを発表した. • 将来iPhone,iPad,Macに人工知能が搭載される. • 2024年10月アメリカで英語のベータサービス開始予定 • 2025年中に日本語のサービス開始予定 (https://www.microsoft.com/ja-jp/surface/devices/surface-pro-11th-edition) Copilotキー
  6. 人工知能の実力 • 人と会話ができます。 • 文章作成は得意です。 • 英語・日本語だけではなく様々 な言語ができます。 • プログラミングもできます。

    • 自動でソフトを作れます。 • 絵も得意です。 • 曲も作れます。 • ゲームは人より得意です。 もう、人を雇う必要はないのでは?
  7. 人工知能は画像処理が得意 • 物体認識 • 画像に写っているものが何であるか分かる。 • 領域分割 • 画像の該当する場所がどこか分かる。 •

    物体の位置推定 • 物体がどこに写っているか分かる。 • 異常検知 • 画像がいつも通りであるかどうか検知する。 • 画像生成 • 指示された画像を生成する。 何が映っているか分かります。 絵を描けます。
  8. 物体認識 Classification Results (CLS) 物体認識大会で優勝した人工知能のスコア Deep learning 0.3 Classification Error

    誤答率 0.25 0.28 0.26 (Krizhevsky 2012) 0.2 AlexNet 0.15 0.16 0.12 0.1 GoogLeNet ResNet 16.7% ↓ 23.3% ↓ 0.051 0.07 0.05 0 2010 2011 2012 2013 2014 Karpathy 0.036 0.03 0.023 2015 2016 2017 (http://image-net。org/challenges/talks_2017/ILSVRC2017_overview。pdf) 2012年の物体認識大会で優勝した人工知能 AlexNetの認識例。間違っているものもあるが、 間違いも筋の良い間違え方(画像から連想され る答え)をしている。 人間と同じような間違え 方をしている点が面白い。 画像識別大会の課題にKarpathy博士が取り組んだが、人工知能より悪 いスコアだった。 物体認識において、人工知能は人間より性能は上かもしれない。
  9. 領域分割 • 人工知能による画像の領域分割 • 各ピクセルが何の物体に属しているかを推定する FCN -8s SDS [14] Ground

    Truth Image TABLE 8 The role of foreground, background, and shape cues. All scores are the mean intersection over union metric excluding background. The architecture and optimization are fixed to those of FCN-32s (Reference) and only input masking differs. train Reference Reference-FG Reference-BG FG-only BG-only Shape Fig. 6. Fully convolutional networks improve performance on PASCAL. Shelhamer et al。 2016 The left column shows the output of our most accurate net, FCN-8s. The 9 test FG BG FG BG mean IU keep keep keep keep mask mask keep keep keep mask keep mask keep keep mask keep mask mask keep mask keep mask keep mask 84.8 81.0 19.8 76.1 37.8 29.1 M asking the foreground at inference time is catastrophic. H ow ever, masking the foreground during learning yields a netw ork capable of recognizing object segments w ithout observing a single pixel of the labeled class. M asking the background has little effect overall but does lead to class confusion in certain cases. When the background is masked during both learning and inference, the netw ork unsurprisingly achieves nearly perfect background accuracy; how ever certain classes are more confused. A ll-in-all this suggests that FCN s do incorporate context even though decisions are driven by foreground pixels. To separate the contribution of shape, w e learn a net restricted to the simple input of foreground/ background masks. The accuracy in this shape-only condition is low er Ronneberger et al., 2015 Novikov et al., 2018
  10. 音声 • 音声認識 • 何の音か分かる。 • 何を言っているか分かる。 いらない音を消せます。 曲を作れます。 •

    信号分離 • 混ざった音を音源ごとに分ける。 • 混ざった音の中から特定の音源の音を取り出す。 • 音声生成 • 新たな曲や声を作りだす。 • 既存の声に似た声を作れる。
  11. 人よりゲームは上手い • ロボットの制御やゲーム人工知能に使われる人工 知能はDQNは、ゲームで人間より良いスコアを出 す。 • Atariの49のゲームのうち29タイトルで人間より良 い成績を収める (Mnih et

    al。 2015)。 • AlphaStarはコンピュータゲーム「スタークラフト 2」で人間のプレーヤの上位0。2%にランクインし た(2019)。 (Mnih et al., 2015) (https://deepmind.google/discover/blog/alphastar-mastering-the-real-time-strategy-game-starcraft-ii/)
  12. AlphaGo、 AlphaGo Zero、 AlphaZero • AlphaGo • 2016年イ・セドル氏に勝利、2017年柯潔(コ・ジェ)氏に勝利 • 2015年まではアマ有段者レベルだった囲碁AIが、AlphaGoの登場によりにより囲

    碁AIが世界トップ棋士より強くなった。 • AlphaGo Zero (Silver et al., 2017) • 自己学習のみでAlphaGoに勝つ。 • AlphaZero (Silver et al., 2018) • 様々なボードゲームにも対応できる。 • 自己学習のみで強くなる。人間はデータを用意する必要がない。 • 碁ではAlpha Goにも勝てる。 • チェス (Stockfish)、将棋(elmo)にも勝てる。
  13. NPCのLLM化 • RPGにおけるNPC(Non Player Charactor)は決められた会話しか出来なかっ た。 • 何度話しても、会話パターンは同じ。 • NPCの会話をLLMで生成することで、より自然で広い世界観を持った会話が

    でき、会話自体も楽しめると考えられる。 • 会話するたびに変化する。 • LLMの会話を制御できない場合、ゲームの世界やキャラクタの設定とは異なる会 話が発生する可能性がある。 • 例:RyzaChat:AI • キャラクタもののゲームであるにも関わらずLLMで会話生成を実現し、それをプ ロダクトとして売り出した点が革新的である。
  14. 主なサービス • ChatGPT(OpenAI) 高い汎用性能を持つ総合型対話AI。検索、画像生成、音声対話などを幅広く統合している。高い知能 を持つAIとして知られている。 • Claude(Anthropic) 推論、長文理解、文章作成、コーディングなどを重視した対話AI。高い知能を持つAIとして知られて いる。 •

    Gemini(Google) ロングコンテキストとGoogleサービスとの連携が強みの対話AI。検索、画像・音声・動画の理解、画 像生成まで幅広く対応する。 • Microsoft Copilot 背後でGPTやClaudeなど複数の高性能モデルを利用する対話AI。Word、Excel、PowerPoint、 TeamsなどにAIを組み込む業務統合型サービスとなっている。 • Grok(xAI) XやWeb上のリアルタイム情報との連携が特徴。近年は推論、画像・動画生成、エージェント機能に も拡張している。 • DeepSeek 推論・コーディング性能と低コスト性で注目されたAI。モデルの効率性やオープン性の高さでも存在 感が大きい。
  15. マルチモーダル化 • 対話型人工知能(その裏で動く文章生成人工知能)はテキストだけではなく画像 や音声も処理できるようになった。 • テキストという一つのモードだけではなく,画像などの複数のモードに対応=マルチ モーダル対応 • GPT-4V (画像対応,2023年9月),Gemini

    (画像,動画,音声対応,2023年12月),Claude3 (画像 対応,2024年3月),GPT-4o( 画像,動画,音声対応,2024年5月 ) テキスト 画像 動画 音声 テキスト マルチモーダル非対応 マルチモーダル対応
  16. プログラミングは人工知能任せ 社内でCodexをどのように自社製品として活用 していますか?CodexはCodexの構築に貢献して いますか? 40 eason-OAI •14日前 非常に活用しています!チームメンバーによっ てパターンは異なりますが、私はCodexへの変 更の99%をCodexを使って記述しています。来年

    は手動でコードを1行も書かないことを目標に しています :) 人工知能コーディングシステムOpenAI Codexの開発において、ある技術者は 人工知能コーディングシステムを使って99%のコードを書いている。
  17. Vibe coding • バイブコーディング(Vibe coding)とは • 人間がプログラムコードを書く作業を最小限に抑え、プログラマーはAIが生成し たコードを活用しながら、成果物の評価やテスト、ファイン・チューニングに重 点を置くコーディング手法のことである。 •

    https://www.ibm.com/jp-ja/think/topics/vibe-coding • ChatGPT、Claude、などの生成AIを利用しコードを生成する。 • 人間は細かなコードを書くより、目的・仕様・修正内容をAIに伝えることに集中す る。 • 「コードを書く」から「AIにコードを書かせて評価・修正する」開発へ変化して いる。
  18. Vibe codingからAIエージェント • AIエージェント • ユーザーから与えられた指示に基づき、自律的に問題解決やタスク実行を行うソフ トウェア(https://www.ipa.go.jp/digital/kaihatsu/sds-column/ai-agent.html) • 例:Codex、Claude Code、GitHub

    Copilotなど • 目的を与えると、エージェントが自分で手順を考えて自律的に作業を進める。 • エージェントが必要に応じてWeb検索、ファイル操作、プログラム実行、外部ツー ル利用などを組み合わせる。 • エージェントは、計画 → 実行 → 確認 → 修正を繰り返し、タスク達成を目指す。 • 開発スタイルの変化 • 人間がコードを書く→ AIにコードを書かせる(Vibe coding)→ AIに開発そのもの を任せる(AIエージェント) • 人間の役割は、実装から目的設定・設計・評価へ移りつつある。
  19. 2026年はフィジカルAIの技術的転換期 • Figure AIは2026年、自社のヒューマノイド型ロボットFigure 03を、物流現場とみられる場所 で、段ボールやビニール袋で梱包された大きさの異なる荷物を次々と荷物に貼られたバーコー ドの面を下に向け、ベルトコンベヤーに流す実演を行った。 • ライブ中継で200時間動き続ける様子を見せた。 •

    1台が動き続けたわけではなく交代していた。 • 人とほぼ変わらない作業スピードだった。 • これは、現在のヒューマノイド型ロボットが単なる見世物ではなく、長時間動き続け、それを 人に見せても問題ない程に事故が起こらない証明となっている。 https://gdep-sol.co.jp/newtech-report/no262/ https://www.youtube.com/watch?v=4AJepQHNHL0
  20. クローズLLM • 対話型人工知能など言語を扱う人工知能の性能はLLMに大きく依存している ため,開発したLLMを公開し他社が使ってしまうと自社の優位性がなくなっ てしまう. • OpenAIやAnthropicは自社のLLMを公開していない. • 公開していないLLMのことをクローズLLMという. LLM=脳

    ChatGPTくんの LLMを取り出す 取り出したLLMを自分の システムに入れる 自分 の シス テム ChatGPTく んのLLM 自分 のシ ステム ChatGPTくん 自分のシステムがChatGPTく んと同じ能力になる こんな事が起こると,OpenAIの優位性がなくなり,LLM開発にかけた多額の資金を回収できない.当然LLMは公開されない.
  21. オープンLLM • 一方で,LLMを公開する動きも活発に行われており,商用可能なモデルも公 開されている. • 公開されたモデルをオープンLLMと呼ぶ. • オープンLLMは公開されているため,誰でも使える. • 使用出来る範囲や制限はそれぞれのオープンLLMにより異なる.

    自分の システム 高性能なLLMを公開する 公開されたLLM 公開されたLLMを自分 のシステムに組み込む オープンLLMのお陰で誰でも最新の人工知能を使った システムが作れる!! 自分のシステムがMetaのLLM と同じ能力になる
  22. オープンソースAIの定義 • 許可を求めることなく,あらゆる目的でシステムを自由に使用できる. • 自由にシステムの仕組みを研究し,その結果がどのように作成されたかを自由 に理解できる. • 出力の変更など,あらゆる目的でシステムを自由に変更出来る. • 変更の有無にかかわらず,あらゆる目的で他のユーザーが使用できるようにシ

    ステムを自由に共有できる. 原文 •Use the system for any purpose and without having to ask for permission. •Study how the system works and understand how its results were created. •Modify the system for any purpose, including to change its output. •Share the system for others to use with or without modifications, for any purpose. (https://opensource.org/what-is-open-source-ai) オープンだからといってオープンソースとは言えない.
  23. クローズ、オープンの細かな違い • クローズLLM • LLMを動かす根幹となるコードやデータ(LLM自体(ウェイト)、その仕組み、 学習データなど)が公開されていない。 • オープンソースLLM • 自由にシステムの仕組みを研究し、その結果がどのように作成されたかを理解で

    きる。 • つまり、LLMを理解し研究できるだけの、コード、LLM自体、LLMの仕組み、学 習データに関する情報が公開されている。 • オープンウェイトLLM • LLM自体が公開されている。 • ただし、その仕組みや学習方法、学習データに関する情報まで公開されていると は限らない。
  24. オープンLLMが社会を変えるかも • 2023年頃 • オープンLLMはChatGPTなどのクローズLLMに比べて性能面で差があり、利用で きる用途も限られていた。 • また、自分のPCで動かすための環境構築も容易ではなかった。 • 2024年

    • オープンLLMは急速に性能を向上させ、GPT-4に匹敵するモデルも登場した。 • さらに、Ollamaなどのソフトウェアによって導入も簡単になり、ゲーミングPCが あれば個人でも高性能なLLMを動かせるようになった。 • 2026年 • 用途によってはGPT-5.6など最新のクローズLLMに迫る性能を持つオープンLLM も登場している。 • また、小型化・量子化された高性能モデルであれば、一般的なゲーミングPCでも 動かすことができる。
  25. OpenAI • 非営利法人OpenAI Incとその子会社である営利法人OpenAI Limited Partnershipからなる。 • 2015年サム・アルトマン、イリヤ・サツケヴァー、イーロン・マスクらが設立 • GPT3、GPT4、DALL-E2など開発

    イリヤ・サツケヴァー:現在の深層ニューラルネットワーク、人工知能ブームの火付 け役となった人物。AlexNetの共著者で研究を主導した人物であると言われる。 • OpenAIの精神 • AI should be an extension of individual human wills and、 in the spirit of liberty、 as broadly and evenly distributed as possible。 (AIは個人の意思の延長であるべきで、自由の精神の下、できる限り広く均等に分配さ れるべき)(https://openai.com/blog/introducing-openai) • 「人間レベルのAIが、いつ実現可能なレベルに達するかを予測するのは困難だ。そのレベルに達したときに、良 い成果を自己利益よりも優先できる強力な研究機関が存在することが重要となる」 (https://japan.zdnet.com/article/35074857/、 2015年12月14日) • 「自身の好奇心に集中して良い結果を優先できる一流の研究機関が存在することが重要です」と声明で述べている。 「研究者は、論文やブログ投稿、コードなどの形態を問わず、自らの成果を公開することを強く推奨され、(もし 存在するならば)特許は世界と共有されます」。(https://www.technologyreview.jp/s/188883/the-messysecretive-reality-behind-openais-bid-to-save-the-world/、 2020年5月27日) • 様々な人工知能開発支援ツールを提供 • OpenAI Gym • OpenAI Universe OpenAIからCloseAIへ • 2019年マイクロソフトから出資 • 皮肉なことに、現在は開発した人工知能技術はクローズドなものになっている。
  26. DeepMind • 2010年デミス・ハサビス(世界トップクラスのゲームプレーヤー、ゲーム開発者 、神経科学者、人工知能研究者)が設立 • 2014年Googleが買収 • 様々な革新的な人工知能技術を開発 • Deep

    Q Network • Alphaシリーズ • AlphGo:囲碁で人のトッププレーヤーに勝つ • AlphaZero:自らの対戦データだけで世界最強 • AlphaStar:コンピュータゲームでも人のトッププレーヤーに勝つ • MuZero:ルールを教えなくても強くなる。 • AlphaFold:タンパク質の構造予測 • AlphaTensor、 AlphaDev:効率的なアルゴリズムを発見 • 2023年4月Google Brain Teamと統合しGoogle DeepMindになった。 • 2024年ノーベル化学賞受賞
  27. Google Brain Team • Googleの人工知能研究部門 • 様々な革新的な技術を開発 • 機械学習のプラットフォームTensorflowを開発 •

    言語モデル(Transformer、 BERT) • 画像識別モデル(EfficientNet、 Vision Transformer) • AutoML • TPU (https://gigazine.net/news/20180112-google-brain-work-2017/) • 2023年4月Deep Mindと統合しGoogle Deep Mindとなった。
  28. NVIDIA • GPU設計およびGPU向け開発ソフトの開発 • GPUとはコンピュータの画像処理に特化した演算装置 • ジェンスン・フアンが1993年に設立 • 開発環境CUDAの提供 •

    GPUを汎用計算に使う(GPGPU)ソフトを開発する環境 (https://nvidianews.nvidia.com/news/nvidiaannounces-gtc-2020-keynote-with-ceojensen-huang-set-for-may-14) • GPUが科学技術計算で使えるようになったためワークステーションやスーパーコ ンピュータに普及した。 • GPUはニューラルネットワークの計算も高速化出来るため、人工知能の必須部品と なる。 • GPUで量子計算も出来るようになる。 • 量子コンピューティングでも覇権を狙っている? • GPUを汎用計算に用いる技術を実用的なレベルで一般に提供できるのはNVIDIAの みである。
  29. AI関連各企業の特徴 • OpenAI • 大規模言語モデル(ChatGPT) • 技術公開に消極的 • 最高性能へのチャレンジには積極的 •

    Google • 人工知能開発のプラットフォーム(Tensorflow) • 深層強化学習(DQN、 Alpha*) • 研究成果の公開は比較的積極的 • 最高性能へのチャレンジには消極的 • NVIDIA • 人工知能用のプロセッサの独占 Microsoft • OpenAI とパートナーシップ • Antholopicとパートナーシップ • Metaと提携 • クラウドコンピューティングに注力 • オープンソースに積極的 Meta • 人工知能開発プラットフォーム(Pytorch) • 大規模言語モデル(LLAMA) • オープンソースに積極的 Amazon • クラウドコンピューティングに注力 「オープンソースは脅威」「勝者はMeta」「OpenAIは重要ではな い」などと記されたGoogleのAI関連内部文書が流出 (https://gigazine.net/news/20230508-google-document-llm-armsrace/、2023年5月8日) Googleの負け惜しみと言う意見もあったが、2024年の段階では正確 に将来を見越していたと考えられる。確かにMetaは技術発展への寄 与としては勝者かもしれないが、それがビジネスに繋がっていると 言えるかといえば怪しい。 2025年には、MetaのLLMは競争力を失い、OpenAIとGoogleのクロ ーズLLMと中国製のオープンLLMが存在感を示す。
  30. AI関連各企業の特徴 • Meta • 人工知能を活かすサービスがない。 • 人工知能を動かすためのインフラを活用するサービスがない。 • プロセッサを開発する。 •

    Google • 人工知能を活かすサービスがある。 • 人工知能を動かすためのインフラをクラウド事業に活用できる。 • 自社のプロセッサ(TPU)を有している。 • Amazon • 人工知能を動かすためのインフラをクラウド事業に活用できる。 • プロセッサはNVIDIAから購入する。 • プロセッサを開発する 。 • Microsoft • 人工知能を活かすサービスがある。 • 人工知能を動かすためのインフラをクラウド事業に活用できる。 • プロセッサを開発する 。
  31. その他のキープレイヤー • Anthropic •X • Deepseek • Alibaba • Huawei

    • メモリー関連 • SSD • 半導体製造装置 • ALSM • 東京エレクトロン • ディスコ