AI ガードレール
定義
AI ガードレールとは、AI システムの挙動を安全に、話題の範囲内に、ポリシーの枠内に保つために設けるルール、チェック、制約のことです。何を言えるか、何ができるか、何にアクセスできるかを制御します。
仕組み
ガードレールは複数の層で働きます。境界を定めるシステムプロンプト内の指示、プロンプトインジェクションや話題外のリクエストを止める入力フィルタ、安全でない応答やポリシー違反の応答を捉える出力チェック、そしてエージェントが触れられるツールとデータを絞る権限の制限です。
サポートでよく使われるガードレールには、ポリシー外の約束をエージェントに禁じること、解約や法務のような機微な話題では人への引き継ぎを必須にすること、エージェントが自律的に実行してよいアクションと承認が必要なアクションを分けることがあります。
サポートで重要な理由
自動化を、規模が大きくなっても信頼できるものにするのがガードレールです。AI エージェントがポリシーを勝手に作り出したり、データを漏らしたり、取り返しのつかない操作を実行したりするのを防ぎ、予測しづらいモデルを、顧客の前に出せる制御されたシステムに変えます。
- ポリシー外の回答と、権限外のアクションを防ぐ
- 機微なケースや確信度が低いケースでエスカレーションを強制する
- ツールとデータへのアクセスを適切な範囲に限定する
よくある質問
サポートにおける AI ガードレールの例を教えてください。
一定額を超える解約や返金については、エージェントが自律的に実行するのではなく、必ず人に引き継ぐ、というルールです。
ガードレールでハルシネーションは止まりますか?
範囲を絞り、根拠づけを求めることで助けにはなりますが、RAG(検索拡張生成)のような手法と併用するものです。ガードレールは AI が言ってよいこと、してよいことを制限し、根拠づけは言った内容が正確かどうかを高めます。
関連用語
AI ハルシネーション
AI ハルシネーションとは、言語モデルが流暢で自信ありげでありながら、事実として誤っている、あるいは作り話である応答を生成してしまう現象です。存在しない詳細、ポリシー、出典を作り出します。.
プロンプトインジェクション
プロンプトインジェクションとは、ユーザー入力や外部コンテンツに悪意ある指示を隠し込み、AI システムに本来の指示を無視させたり、意図しない動作をさせたりするセキュリティ攻撃です。.
システムプロンプト
システムプロンプトとは、会話における AI モデルの役割、振る舞い、トーン、制約を定義する基盤の指示文です。エンドユーザーではなく開発側が設定し、すべてのやり取りに適用されます。.
人への引き継ぎ
人への引き継ぎとは、お客様に関わることには必ず人を介在させるという Macha の原則です。最も具体的な形は、対話型チャットで書き込み操作の直前にエージェントを一時停止させる確認ゲートと、難しい案件をチームに回すエスカレーションの型です。.
グラウンディング(根拠づけ)
グラウンディングとは、AI モデルの回答を、自社のドキュメント、ライブデータ、ナレッジベースといった検証済みの情報源に結びつけ、モデルの推測ではなく実際の事実を反映させる取り組みです。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始