書籍
生成AIの安全性入門
綿岡晃輝
概要
生成AIが引き起こす有害コンテンツ生成や情報漏洩、誤情報拡散といったリスクを分類した上で、 OpenAIのモデルスペックなど他組織のルールを参照しながら「AIの理想的な振る舞い」を検討する。 安全性を測るベンチマークやレッドチーミングによる評価手法、事前学習・SFT・RLHFなど モデルレベルでの安全性向上技術、ガードレールによるシステムレベルの対策までを扱い、 エージェントAIやロボティクスAI、AGIといった将来のリスクにも触れる。
対象読者
- 生成AIモデルの安全性評価・レッドチーミングに携わるエンジニア・研究者
- 生成AIプロダクトのリスク管理・ガードレール設計を担当する実務者
タグ
奥付
- 出版社
- 技術評論社
- ISBN
- 978-4-297-15702-9
- 出版日
- 2026年6月
- 参考定価
- ¥3,300税込Amazonの実売価格と異なる場合があります
この本を手に入れる
※ 上記は Amazon アソシエイトによる広告リンクです。関連書籍
前提となる書籍
- 参考
Webセキュリティ担当者のための脆弱性診断スタートガイド 第2版
上野宣が教える新しい情報漏えいを防ぐ技術
上野宣
理由: OWASP ZAPやBurp Suiteで自らの手を動かし、理論と実践の溝を埋める診断経験を積んだら、同じ「対策を実地で確かめる」姿勢を新しい対象へ向ける。生成AIのリスクはベンチマークやレッドチーミングという異なる形で評価されるが、机上の想定を検証で裏づけるという発想は共通する。
次に読む書籍
- 推奨前提
LLMOps
本番環境における大規模言語モデル運用ガイド
Abi Aryan
理由: 生成AIのリスク分類やレッドチーミングによる安全性評価、ガードレールによるシステムレベルの対策までを学んだら、それらを実際に本番環境で回し続ける仕組みへ落とし込む段階に進む。LLMOpsは終章でガバナンス・プライバシー・プロンプトインジェクションといったセキュリティリスクへの対応や可観測性パイプラインの構築を扱っており、生成AIの安全性入門で得た評価・対策の知識を本番運用の具体的な仕組みへ接続する。
- 参考
生成AIアプリケーション評価入門
松木晋祐
理由: ベンチマークやレッドチーミングによる安全性評価の技法を学んだら、その「評価する」という営みを自社の生成AIプロダクトへ具体的にどう組み込むかという実務へ視野を広げる。生成AIアプリケーション評価入門は評価観点モデルの構築から混同行列・RAG向けメトリクス、セキュリティ評価、AIエージェントの評価までを開発ライフサイクルに沿って扱っており、抽象的な安全性評価の考え方を自プロダクトの品質保証プロセスへ接続する。