AI Evaluation Planner

AIプロンプト評価セット生成

AIチャット、RAG、Agentの用途から、正常系、拒否、権限境界、根拠確認、回帰テストの評価ケースを作成します。

評価セットを生成する

できること

  • AI用途、RAG、Agent、禁止事項、合格基準から評価ケースを生成
  • 正常系、曖昧入力、禁止情報、プロンプトインジェクション、根拠不足、回帰テストを整理
  • RAGの文書ACL、引用、更新日、Agent tool承認、データ最小化の追加ケースを生成
  • 期待結果、必要証跡、評価運用チェックリスト、顧客向け報告メモをコピー可能な形で出力

使う場面

  • AIチャット、RAG、Agentのリリース前テスト設計
  • プロンプト変更、モデル変更、RAG文書更新、tool権限変更時の回帰テスト
  • AI利用統制、監査、顧客説明用の評価証跡づくり

無料範囲

単一AI用途メモからの評価ケース生成、期待結果、証跡、運用チェックリスト、顧客向け報告メモまでを無料で確認できます。複数プロンプト横断評価、CI連携、継続評価ダッシュボードは将来のPro候補として分けます。

よくある質問

どのようなAIシステムに使えますか?
AIチャット、RAG、社内ナレッジ検索、AI Agent、tool/function callingを使う業務アシスタントのリリース前評価や回帰テスト設計に使えます。
実データを入力してよいですか?
入力しないでください。秘密情報、個人情報、APIキー、顧客固有情報は含めず、用途、禁止事項、合格基準、権限境界だけを抜粋して使ってください。
評価ケースには疑似データを使い、実際の秘密情報、個人情報、APIキー、顧客固有情報を含めないでください。