プロンプトインジェクション&ハルシネーション防御デモ
攻撃パターン一覧表(全サンプルの検知結果サマリ)
このアプリでできること
- 入力した文章が「AIへの指示を乗っ取ろうとする文章(プロンプトインジェクション)」かどうかを、その場で判定します。
- AIが事実と異なる内容を答えてしまう「ハルシネーション」を検出する仕組みも、あわせて確認できます。
- あらかじめ用意した攻撃文章サンプル一式に対して、判定結果が想定通りかどうかを一覧表で確認できます。
使い方
- 「攻撃パターン選択」から試したいサンプルを選ぶか、「自由入力」欄に好きな文章を入力します。
- 「実行」ボタンを押します。
- 「処理経過タイムライン」に、①入力検知 → ②AI応答生成 → ③ハルシネーション検証、の3段階の判定結果が順番に表示されます。
- 「一覧表を読み込む」ボタンを押すと、用意されている攻撃文章サンプル全件について、期待した判定と実際の判定が一致しているかを一覧で確認できます。
注意点・既知の制限
- AI連携用のキーが設定されていない環境では、①の入力検知(ルールに基づく判定)のみ動作し、②AI応答生成・③ハルシネーション検証はスキップまたはエラーになります。
- これはデモ・見本用の仕組みです。判定に使う攻撃文章サンプルやハルシネーション照合用のデータは、実データではなくサンプルデータです。実際の業務に組み込む際は、判定基準の見直しと実データでの検証が必要です。
- 現状、判定結果の通知・アラート送信の仕組みは実装されておらず、記録はログ出力までにとどまります。