書籍
生成AIアプリケーション評価入門
松木晋祐
概要
生成AIを組み込んだアプリケーションは出力が確率的で挙動が複雑なため、従来の ソフトウェアテストの手法だけでは品質を測りにくい。本書は生成AIアプリ特有の 評価観点モデルの構築から、混同行列やRAG向けメトリクスなどの具体的な指標、 LLMを評価者として使うLLM-as-a-Judge、pytestとの統合運用、セキュリティ評価、 AIエージェントの評価まで、開発ライフサイクルに沿って解説する。
対象読者
- 生成AIプロダクトの品質保証を担当するQAエンジニア
- LLMアプリケーションの評価・テスト手法を学びたいソフトウェアエンジニア
- AIエージェントのセキュリティ・品質評価に関わる開発者
タグ
奥付
- 出版社
- 技術評論社
- ISBN
- 978-4-297-15614-5
- 出版日
- 2026年5月
- 参考定価
- ¥2,640税込Amazonの実売価格と異なる場合があります
この本を手に入れる
※ 上記は Amazon アソシエイトによる広告リンクです。関連書籍
前提となる書籍
- 推奨前提
Effective Software Testing
A developer's guide
Maurício Aniche
理由: 境界値分析や同値分割といったテスト設計の技法を身につけたら、出力が確率的で挙動が複雑な生成AIアプリという対象にその考え方を適用する段階に進む。本書は評価観点モデルの構築から混同行列やRAG向けメトリクスまで、生成AI特有の評価手法を扱う。
- 推奨前提
生成AI時代のソフトウェア開発
ツールを賢く選択、評価、活用し、より速く効率的な開発を進めるために
Sergio Pereira
理由: 生成AIを開発の道具として使いこなす段階を経たら、次は生成AIそのものを組み込んだアプリケーションの品質をどう測るかという問いに向き合う。本書はLLM-as-a-Judgeやセキュリティ評価、AIエージェントの評価まで、開発ライフサイクルに沿った評価手法を扱う。
- 参考
生成AIの安全性入門
綿岡晃輝
理由: ベンチマークやレッドチーミングによる安全性評価の技法を学んだら、その「評価する」という営みを自社の生成AIプロダクトへ具体的にどう組み込むかという実務へ視野を広げる。生成AIアプリケーション評価入門は評価観点モデルの構築から混同行列・RAG向けメトリクス、セキュリティ評価、AIエージェントの評価までを開発ライフサイクルに沿って扱っており、抽象的な安全性評価の考え方を自プロダクトの品質保証プロセスへ接続する。