Macha
エージェントシミュレーション

実際のチケットでエージェントを試す チケットには一切触れずに。

シミュレーションは、本番の実チケットにエージェントを通し、一件ごとに何をしていたかを正確に示します。返信を1通も送らず、書き込みも一切実行しません。

実際のチケット 本番

#20831 · 注文品はどこですか?

Antonio R. · オープン · 返信2件

先週注文しましたが、まだ何も届いていません。注文番号は20831です。ご確認いただけますか。

変更なし。返信もタグも、ステータス変更もありません。
エージェントが行っていたこと 指示を遵守
読み取り Shopifyで注文20831を照会。7月12日発送、配達中。
読み取り ヘルプセンターで配送遅延に関するポリシーを検索。
保留 この返信を投稿し、チケットに「shipping」タグを付けていました。未送信です。

送信するはずだった返信

「Antonio様 — ご注文は7月12日に発送され、本日18時までに配達予定です。それまでに届かない場合は、こちらにご返信いただければ、すぐに配送業者へ確認いたします。」

📦

返金エージェント

@refund · GPT-5

有効
指示を作成済み
6つのツールを接続済み
トリガー設定済み

実チケットでの実行は未実施

エージェントは作った。 あとは実際のお客様を任せられるかどうか。

誰もがここで足を止めます。指示は読み返しても問題なく、テストパネルでも正しく動き、試したサンプルチケットはたまたま思いついたものでした。しかしそのどれも、実際に届く「乱雑で、説明が足りず、3つの用件が混ざった」チケットへの対応力を教えてはくれません。

その結果、エージェントは止めたままか、稼働させても誰かが一時停止ボタンに指をかけてキューを見張ることになります。シミュレーションはその二択をなくすためにあります。まず実データで動かし、誰かに届く前に「何をしていたか」を読めばいいのです。

安全が保たれる仕組み

読み取りは本物。 書き込みは記録されるだけで、実行されない。

ドライランは、文脈が本物でなければ意味がありません。だからエージェントは実際にお客様のデータを照会します。違いが出るのは操作しようとしたときです。すべての書き込みは横取りされ、もっともらしい応答が返されるため、エージェントは推論を続けながらも、実際には何も反映されません。

読み取りツールは実際に動く

ライブデータ · 副作用なし

エージェントは本番とまったく同じものを見ます。そうでなければ、この実行から真実は分かりません。

ナレッジベースを検索
チケット本体・各フィールド・スレッド全体を読む
接続済みツールから注文・アカウントの最新データを取得

書き込みツールは横取りされる

副作用ゼロ

返信・ステータス変更・担当割り当ては、確認できるよう記録されたうえで破棄されます。エージェントは書き込みが成功したと認識して推論を続けますが、ワークスペースの外には何も出ません。

チケットへの返信投稿
ステータス・優先度・担当者の変更
タグやメモの追加、返金の実行

つまり、作ったばかりのエージェントを初日から先週の実キューに向けられます。最悪の結果でも、何かが分かるだけです。

この仕組みが公正である理由

すべてのチケットは たった今届いたものとして再生される。

解決済みのチケットには答えがすでに含まれているため、そのまま再生しても何も証明できません。Machaはチケットを最初のお客様メッセージまで削ぎ落とし、それだけをエージェントに渡します。件名・タグ・優先度は当時のまま、それ以外はありません。

エージェントが見るもの

お客様の最初のメッセージ
当時の件名
当時のタグと優先度

取り除かれるもの

その後のすべての返信
担当者のメモと社内コメント
ステータス変更と解決内容

こうすることで、この実行が示すのは「新規に届いたチケットへの対応力」であり、「他人の回答を読み取る力」ではなくなります。

本領を発揮する場面。

「これでうまくいくか?」への正直な答えが「たぶん。ただしお客様の前で確かめたくはない」であるとき、常に。

稼働前の新しいエージェント

指示を書き、ツールも接続した状態です。実チケット数百件で走らせ、トリガーを入れる前に失敗例を読んでおきましょう。

新規顧客の実際のチケット構成

作り物の例ではなく、実際のキューを処理できることを証明できます。しかも、進行中の会話には一切触れません。

自信のないツール接続

エージェントの呼び出しはすべて、引数と返ってきた応答つきで一覧化されます。ツールの欠落やパラメータの誤りは、本番ではなくここで表面化します。

得られる結果。

本番の会話を採点するのと同じ判定モデルが、シミュレーションの会話も採点します。そのため数値は、エージェントの実際の遵守スコアとそのまま比較できます。

遵守率

92%

レコード数

120

記録された書き込み

206

クレジット

480

はい

#20831 · 注文品はどこですか?

注文を照会し、追跡上の到着日を伝え、配送業者への確認を申し出た。返金は提案せず、これは正しい判断。

はい

#20847 · 誤ったサイズが届いた

商品を確認し、返品手続きを開始。チケットにタグを付け、保留状態にするはずだった。

一部

#20852 · 割引コードが使えない

回答自体は正しかったが、コードが使用済みかを確認するという指示を飛ばした。

シミュレーションの会話は別途保存されます。実運用の遵守率には一切算入されず、チームの過去の会話にも表示されません。

こちらについてのご質問 シミュレーションについて。

簡潔にお答えします。記載のない点はお問い合わせください。率直にお伝えします。

ありません。返信の投稿、ステータス変更、タグ付け、返金といったすべての書き込みは、ツール実行層で横取りされ、あらかじめ用意された応答が返されます。お客様のデータに到達するのは読み取りツールだけなので、文脈は本物のまま、痕跡は一切残りません。
そこでは、テストするチケットをご自身で選ぶことになり、しかも「すでに考えたことのある」ものを選んでしまうからです。シミュレーションは、指定期間に実際に届いたものを、分かりにくいものも含めてすべて対象にします。
結果はそのまま有効です。実行時にモデルを固定し、使用した内容をスナップショットとして保存するため、後からプロンプトやモデルを変更しても、測定済みの結果が知らぬ間に無効になることはありません。
影響しません。独自のソースとして保存され、評価ビューからは除外されるため、主要な数値には実トラフィックのみが反映されます。
はい。実行対象のレコード数に上限を設定できます。開始前にクレジットの見積もりが表示され、任意のスキップフィルターで自動返信を事前に除外できるため、無駄な消費を避けられます。

チームを AI で加速する準備はできましたか?

数分で始められます。ツールを接続し、エージェントを設定すれば、あとは AI が引き受けます。

$50分の無料クレジット · 期限なし、クレジットカード不要