Macha
Macha の基本概念

Agent Evaluation(エージェント評価)

定義

Agent Evaluation は、エージェントが実際にどれだけうまく仕事をしたかを採点する Macha の標準機能です。AI のジャッジがエージェントの過去の会話にチェックリストを適用し、会話ごとに、指示に従えていたかどうかと、その理由を返します。

別名: AI 評価LLM-as-judge指示順守の評価

仕組み

チェックリストを一度設定するか、エージェント自身の指示から Macha に作らせると、AI のジャッジが対象範囲内のすべての過去の会話にそれを適用します。対象はチャットセッション、自律トリガーの実行、サブエージェントへの引き継ぎ、埋め込みチャットボットの会話などです。項目は常に 2 つ含まれます。指示の順守(はい / 一部 / いいえ)と、短い理由です。「正しいツールを呼んだか」「ポリシーが認める場合にのみ返金したか」といった独自のチェックも追加できます。

総合スコアは部分点方式です。「はい」の件数に「一部」の件数の半分を足し、総件数で割ります。結果は一覧表、グラフ付きのレポート、そして会話ごとの理由として返るため、スレッド全体を読み直さなくても判定を検証できます。

Auto-Eval と手動評価の違い

すべてのワークスペースで Auto-Eval をどのプランでも無料で使えます。エージェントを作成した時点から、Macha は固定のジャッジを使い、稼働中の指示に照らしてすべての自律実行を採点します。会話数の上限はなく、費用もかかりません。手動評価も全プランに含まれる設定可能なフローです。対象範囲を選び、独自のルーブリックを定義し、ジャッジのモデルを選び、特定バージョンの指示に照らして評価できます。

プロンプトの変更を測るのはこのやり方です。変更前と変更後に実行してスコアを比べれば、その編集が効いたかどうかを推測せずに済みます。評価の対象は過去の会話であって、進行中の会話ではありません。リアルタイムの制御には、エージェントの指示と確認ゲートを使ってください。

よくある質問

ジャッジは実際に何をチェックするのですか?

過去の各会話で、エージェントが自身の指示に従えていたかどうかです。正しいツール、正しいルーティング、設定したトーンや境界線に加え、追加した独自のチェックも対象になります。会話ごとに「はい / 一部 / いいえ」の判定と、短い理由を返します。

エージェントの評価は有料ですか?

いいえ。Auto-Eval はどのプランでも無料で、すべての自律実行を会話数の上限なしで採点します。設定可能な手動評価もすべてのプランに含まれています。

アイデアを実装に

Macha は既に運用中のヘルプデスク (Zendesk、Freshdesk、Front、Intercom、Gorgias) の上に載る AI エージェント層です。

トライアルを開始