Agent Evaluation(エージェント評価)
定義
Agent Evaluation は、エージェントが実際にどれだけうまく仕事をしたかを採点する Macha の標準機能です。AI のジャッジがエージェントの過去の会話にチェックリストを適用し、会話ごとに、指示に従えていたかどうかと、その理由を返します。
仕組み
チェックリストを一度設定するか、エージェント自身の指示から Macha に作らせると、AI のジャッジが対象範囲内のすべての過去の会話にそれを適用します。対象はチャットセッション、自律トリガーの実行、サブエージェントへの引き継ぎ、埋め込みチャットボットの会話などです。項目は常に 2 つ含まれます。指示の順守(はい / 一部 / いいえ)と、短い理由です。「正しいツールを呼んだか」「ポリシーが認める場合にのみ返金したか」といった独自のチェックも追加できます。
総合スコアは部分点方式です。「はい」の件数に「一部」の件数の半分を足し、総件数で割ります。結果は一覧表、グラフ付きのレポート、そして会話ごとの理由として返るため、スレッド全体を読み直さなくても判定を検証できます。
Auto-Eval と手動評価の違い
すべてのワークスペースで Auto-Eval をどのプランでも無料で使えます。エージェントを作成した時点から、Macha は固定のジャッジを使い、稼働中の指示に照らしてすべての自律実行を採点します。会話数の上限はなく、費用もかかりません。手動評価も全プランに含まれる設定可能なフローです。対象範囲を選び、独自のルーブリックを定義し、ジャッジのモデルを選び、特定バージョンの指示に照らして評価できます。
プロンプトの変更を測るのはこのやり方です。変更前と変更後に実行してスコアを比べれば、その編集が効いたかどうかを推測せずに済みます。評価の対象は過去の会話であって、進行中の会話ではありません。リアルタイムの制御には、エージェントの指示と確認ゲートを使ってください。
よくある質問
ジャッジは実際に何をチェックするのですか?
過去の各会話で、エージェントが自身の指示に従えていたかどうかです。正しいツール、正しいルーティング、設定したトーンや境界線に加え、追加した独自のチェックも対象になります。会話ごとに「はい / 一部 / いいえ」の判定と、短い理由を返します。
エージェントの評価は有料ですか?
いいえ。Auto-Eval はどのプランでも無料で、すべての自律実行を会話数の上限なしで採点します。設定可能な手動評価もすべてのプランに含まれています。
関連用語
プレーンな日本語によるエージェント設定
Macha では、エージェントの設定を指示フィールドにプレーンな日本語で書きます。どうトリアージするか、どんなトーンで話すか、何をエスカレーションするか、何をしてはいけないか。ロジックをコードで書く必要はありません。モデルはすべての会話でその指示に従います。.
AI アクションクレジット
クレジットは、月間チケット枠の裏側で Macha のダッシュボードが利用量を計測するための単位です。購入と請求はチケット単位で行われ、エージェントがどのモデルで動いても、何通のメッセージや何回のツール呼び出しが必要でも、1 チケットは 1 回の課金です。.
品質保証(QA)スコア
品質保証(QA)スコアとは、サポートのやり取りがチームの品質基準をどれだけ満たしたかを測る指標です。正確さ、トーン、ポリシーの遵守、解決状況などを採点するスコアカードに基づいて算出します。.
AI ガードレール
AI ガードレールとは、AI システムの挙動を安全に、話題の範囲内に、ポリシーの枠内に保つために設けるルール、チェック、制約のことです。何を言えるか、何ができるか、何にアクセスできるかを制御します。.
アイデアを実装に
Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。
トライアルを開始