AWS認定資格 WEB問題集&徹底解説
生成AIデベロッパー-プロフェッショナル
分野5:テスト、検証、トラブルシューティング
- No.50 要約の幻覚と関連性欠如を検出するLLM-as-a-judge評価
- No.55 ゲームローカライズにおけるナラティブトーン評価手法の選定
- No.57 複数の基盤モデル候補を本番昇格させる前の自動評価基盤
- No.70 RAG の検索品質と回答品質を切り分けて測る評価手段の選定
- No.72 プロンプト更新の回帰を防ぐ自動品質ゲートの実装
- No.102 請求要約ドラフト生成における候補モデルのA/Bテストとアンサンブルルーティング設計
- No.104 技術仕様書生成プロンプトの自動回帰テスト
- No.107 プロンプト変更の自動リグレッションテストとデプロイゲート
- No.133 Amazon Bedrock 上の複数基盤モデル比較のための A/Bテスト
- No.161 RAG のハルシネーション検知に使う Bedrock RAG 評価の指標選定
- No.177 プロンプトテンプレートの回帰比較評価の仕組み
- No.181 RAGベースの判例要約生成における自動品質評価
- No.221 メディア企業における複数FMの横並び評価
- No.234 旅行予約アプリ向け複数基盤モデルの評価戦略
- No.246 ナレッジベース更新に対する自動品質ゲート
- No.252 プロンプトテンプレート更新に対する回帰テスト基盤の設計
- No.263 生成AIによる要約アシスタントの人間評価ジョブ設計
- No.282 製造業カスタマーサポートRAGにおける検索ノイズの定量評価
- No.286 プロンプト改善の効果測定に使う模範解答データセットの呼称
- No.287 融資審査アシスタントの本番デプロイ前バイアスゲート
- No.337 ECカスタマーサポートAgentのツール選択エラーを定量評価する仕組み
- No.338 求人票生成における複数基盤モデルの体系的評価
- No.371 ECサイト商品説明文の複数モデル比較と自動ロールアウト
- No.410 本番移行の可否を判断するための PoC 成功基準の設計
- No.423 推薦文の偏りが学習データ由来かプロンプト由来かの切り分け
- No.429 多言語アシスタントの言語別品質基準と提供可否の運用
- No.434 本番トラフィックのサンプリングによるハルシネーション率の継続測定
- No.440 ユーザーフィードバックの収集と評価データセットへの還流
- No.441 マルチステップエージェントのタスク完了品質の評価
- No.442 コストと性能を1つの指標に落とす基盤モデル選定
- No.443 ゴールデンデータセットの更新サイクルとリーク防止
広告