Upgrade to Pro — share decks privately, control downloads, hide ads and more …

書籍『生成AIの安全性入門』の入門

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.

 書籍『生成AIの安全性入門』の入門

書籍『生成AIの安全性入門』の入門
2026年9月8日 出版記念イベント @ BLUE FRONT SHIBAURA
https://news.fixstars.com/6874/

第1章 AI安全性の基礎
第2章 AIリスクの分類
第3章 AIの理想的な振る舞い
第4章 安全性評価技術:ベンチマーク
第5章 安全性評価技術:レッドチーミング
第6章 安全性向上技術:モデルレベル
第7章 安全性向上技術:システムレベル
第8章 AI安全性の未来

綿岡晃輝
https://wataoka.github.io/

Avatar for Koki Wataoka

Koki Wataoka

August 30, 2026

Other Decks in Technology

Transcript

  1. 書籍はこちら 『生成AIの安全性入門』を出版しました 定価 3,300円(税込) | A5判・256ページ | 2026年6月24日 発売 章構成

    ― 全8章+付録A 第1章 AI安全性の基礎 第6章 安全性向上技術:モデルレベル 第2章 AIリスクの分類 第7章 安全性向上技術:システムレベル 第3章 AIの理想的な振る舞い 第8章 AI安全性の未来 第4章 安全性評価技術:ベンチマーク 第5章 安全性評価技術:レッドチーミング こだわりポイント AIの安全性技術を扱った初の書籍。 この分野を代表する一冊となるよう目指し、 網羅性と一貫性を保つため全8章を単著で書き下ろした。 技術評論社 刊
  2. 書籍はこちら 今日は『生成AIの安全性入門』の入門 第1章 基礎 AI Safetyとは何か? 第4・5章 評価 AIの安全性レベルをどう測るか 第2章

    リスク AIの何が危険なのか? 第3章 AIの理想的な振る舞いとは何か? 向上 第8章 AIの安全性レベルをどう上げるか 次に来る課題 第6・7章 理想 未来
  3. 第1章 基礎 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 AI安全性とは何か 定義:AIが人類に利益をもたらすべく、潜在的な危害や悪影響を制御・管理することを目指す横断的な分野 AIセーフティにおける重要要素 - AISI 評価観点ガイド 書籍はこちら 第1章 基礎
  4. 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上 第8章 未来

    リスク AIリスクの分類 第2章 01 02 03 不快表現の生成 情報漏洩 誤情報 ヘイトスピーチ・差別・アダルト表現 個人情報・組織/国家機密 実被害と拡散被害 04 05 06 悪用 精神的依存 その他の外部に潜むリスク 違法・非倫理的行為への加担 過度な相談・擬人化 開発企業・環境への影響 開発企業にとってのリスク例: 訓練データ抽出攻撃、モデル反転攻撃 環境にとってのリスク例: 膨大なエネルギー消費 書籍はこちら 第1章 基礎
  5. 第3章 理想 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 AIの理想的な振る舞い 書籍はこちら 第1章 基礎 https://projects.laion.ai/Open-Assistant/docs/guides/guidelines https://model-spec.openai.com/ https://ai.google/principles/
  6. 第3章 理想 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    AIの理想的な振る舞い “Do not facilitate or encourage illicit behavior” - OpenAI Model Spec 第8章 未来 書籍はこちら 第1章 基礎
  7. 第3章 理想 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 AIの理想的な振る舞い 悪意があるかわからない場合 “Do not facilitate or encourage illicit behavior” - OpenAI Model Spec 書籍はこちら 第1章 基礎
  8. 第3章 理想 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    AIの理想的な振る舞い “Gently pushing back, when the user goes along” - OpenAI Model Spec 第8章 未来 書籍はこちら 第1章 基礎
  9. 第4・5章 評価 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 安全性評価技術 第4章 書籍はこちら 第1章 基礎 第5章 ベンチマーク レッドチーミング 評価データセットで定量測定 敵対的ユーザーを想定して穴を突く。ロールプレイ・ 対話応答型・分類型・補完型などタスク形式は様々 出力形式操作・自動/勾配攻撃。 → 静的かつ網羅的な評価 → 動的かつ攻撃的な評価
  10. 第6・7章 向上 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 安全性向上技術 ―― どう『近づける』か 第6章 モデルレベル 書籍はこちら 第1章 基礎 第7章 システムレベル ガードレールモデル: AIモデル自体を訓練するのではなく、その外側から入出 力データを監視し、ブロック処理等を行う。
  11. 第8章 未来 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 AI安全性の未来 書籍はこちら 第1章 基礎 対話 → 実行 デジタル → 物理 人間 → 超知能 エージェントAI ロボティクスAI AGI / ASI 権限委譲が進むほどAIリスクも深 VLAモデルによりAIは物理世界へ AIリスクは知能 × 自律性で決まる 安全制約付き強化学習で事故なき GoogleやAnthoropicなどはAGIリ 探索などが望まれる。 スクを先んじて議論。 刻になっていく。 自己複製ワーム「Morris II」など エージェントAI特化の攻撃も成長 最高レベルのリスクとして、「人 し続けている。 類至上主義の衰退」や「現段階で は議論不可能なリスク」など
  12. 第8章 未来 第2章 リスク 第3章 理想 第4・5章 評価 第6・7章 向上

    第8章 未来 AI安全性の未来 リスクのないAI チェスAI 非AIで起きる範囲 のリスクを持つAI 非AIでは起きなかっ たリスクを持つAI 現代では議論不可能 なリスクを持つAI Haiku Sonnet 3.7 Mythos 5? Opus 4 我々が今生きている時代はここ Responsible Scaling Policy - Anthropic 書籍はこちら 第1章 基礎