プロンプトインジェクション
定義
プロンプトインジェクションとは、ユーザー入力や外部コンテンツに悪意ある指示を隠し込み、AI システムに本来の指示を無視させたり、意図しない動作をさせたりするセキュリティ攻撃です。
仕組み
LLM は指示とデータを同じテキストの流れとして処理します。そのため攻撃者は、チャットのメッセージ、サポートチケット、エージェントが読み込むウェブページなどに「これまでの指示を無視せよ」といった命令を埋め込めます。信頼できる指示と信頼できないコンテンツをシステムが区別できなければ、埋め込まれた命令に従ってしまう可能性があります。
外部のコンテンツを取得したりツールを呼び出したりする AI エージェントでは、間接的プロンプトインジェクションがとくに危険です。悪意ある指示が、ユーザーから直接ではなく、取得したデータに紛れて届くからです。
サポートにとっての意味
実システムに接続された AI サポートエージェントは、だまされればデータを漏らし、ポリシーを迂回し、有害な操作を実行しかねません。防御策には、ガードレール、入力のフィルタリング、最小権限にしぼったツール権限、そしてシステムプロンプトをユーザーのコンテンツから分離し、そちらを優位に保つことが含まれます。
よくある質問
プロンプトインジェクションとジェイルブレイクの違いは何ですか?
ジェイルブレイクは、モデルに安全ルールを迂回させる手口です。プロンプトインジェクションはより広く、信頼できない入力や外部コンテンツを通じて、システムが意図した指示そのものを上書きします。重なる部分はありますが、インジェクションには取得データ経由の間接攻撃も含まれます。
プロンプトインジェクションはどう防ぎますか?
信頼できる指示と信頼できない入力を分離し、ガードレールと入力フィルタリングを適用し、ツール権限を最小限にとどめ、機微な操作には確認を必須にしてください。
関連用語
AI ガードレール
AI ガードレールとは、AI システムの挙動を安全に、話題の範囲内に、ポリシーの枠内に保つために設けるルール、チェック、制約のことです。何を言えるか、何ができるか、何にアクセスできるかを制御します。.
システムプロンプト
システムプロンプトとは、会話における AI モデルの役割、振る舞い、トーン、制約を定義する基盤の指示文です。エンドユーザーではなく開発側が設定し、すべてのやり取りに適用されます。.
大規模言語モデル(LLM)
大規模言語モデル(LLM)とは、膨大なテキストで学習し、言語を予測・生成するニューラルネットワークです。質問の理解、要約、分類、人間らしい文章の作成といった処理を可能にします。.
AI エージェント
AI エージェントとは、言語モデルを使ってリクエストを理解し、何をすべきかを判断し、行動するソフトウェアシステムです。ツールを呼び出し、データを取得し、タスクを完了します。台本どおりの回答を 1 つ返すだけではありません。.
ツール利用(Tool Use)
ツール利用とは、AI モデルが外部の関数・API・システムを呼び出せる能力のことです。注文の照会や返金の処理などを、テキストを生成するだけでなく実際のデータに対して実行できるようになります。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始