AI Evaluation Planner
AIプロンプト評価セット生成
AIチャット、RAG、Agentの用途から、正常系、拒否、権限境界、根拠確認、回帰テストの評価ケースを作成します。
評価セットを生成する
できること
- AI用途、RAG、Agent、禁止事項、合格基準から評価ケースを生成
- 正常系、曖昧入力、禁止情報、プロンプトインジェクション、根拠不足、回帰テストを整理
- RAGの文書ACL、引用、更新日、Agent tool承認、データ最小化の追加ケースを生成
- 期待結果、必要証跡、評価運用チェックリスト、顧客向け報告メモをコピー可能な形で出力
使う場面
- AIチャット、RAG、Agentのリリース前テスト設計
- プロンプト変更、モデル変更、RAG文書更新、tool権限変更時の回帰テスト
- AI利用統制、監査、顧客説明用の評価証跡づくり
無料範囲
単一AI用途メモからの評価ケース生成、期待結果、証跡、運用チェックリスト、顧客向け報告メモまでを無料で確認できます。複数プロンプト横断評価、CI連携、継続評価ダッシュボードは将来のPro候補として分けます。
よくある質問
- どのようなAIシステムに使えますか?
- AIチャット、RAG、社内ナレッジ検索、AI Agent、tool/function callingを使う業務アシスタントのリリース前評価や回帰テスト設計に使えます。
- 実データを入力してよいですか?
- 入力しないでください。秘密情報、個人情報、APIキー、顧客固有情報は含めず、用途、禁止事項、合格基準、権限境界だけを抜粋して使ってください。
評価ケースには疑似データを使い、実際の秘密情報、個人情報、APIキー、顧客固有情報を含めないでください。