Macha
Simulations d'agents

Testez un agent sur de vrais tickets sans y toucher.

Une simulation fait passer votre agent sur vos vrais tickets de production et vous montre exactement ce qu'il aurait fait sur chacun — sans envoyer une seule réponse ni déclencher une seule écriture.

Le vrai ticket production

#20831 · Où est ma commande ?

Antonio R. · ouvert · 2 réponses

J'ai commandé la semaine dernière et je n'ai toujours rien reçu. Numéro de commande 20831. Pouvez-vous m'aider ?

Inchangé. Aucune réponse, aucune étiquette, aucun changement de statut.
Ce que l'agent aurait fait Instructions respectées
lecture A recherché la commande 20831 dans Shopify — expédiée le 12 juillet, en cours de livraison.
lecture A cherché dans le centre d'aide la politique de retard de livraison.
retenue Aurait publié cette réponse et étiqueté le ticket « shipping ». Non envoyée.

La réponse qu'il aurait envoyée

« Bonjour Antonio — votre commande a été expédiée le 12 juillet et est en cours de livraison aujourd'hui, avant 18 h. Si elle n'arrive pas d'ici là, répondez ici et je relance le transporteur immédiatement. »

📦

Agent Remboursements

@refund · GPT-5

Actif
Instructions rédigées
6 outils connectés
Déclencheur configuré

Jamais exécuté sur un vrai ticket

Vous avez construit l'agent. Reste à lui confier un vrai client.

C'est là que tout le monde bloque. Les instructions se lisent bien, il s'est bien comporté dans le panneau de test, et les tickets d'exemple étaient ceux qui vous sont venus à l'esprit. Rien de tout cela ne dit comment il gère les tickets brouillons, à moitié expliqués, avec trois sujets à la fois — ceux qui arrivent vraiment.

Résultat : l'agent reste éteint, ou il passe en production et quelqu'un surveille la file, le doigt sur le bouton pause. Les simulations existent pour supprimer ce choix : faites-le tourner d'abord sur le réel et lisez ce qu'il aurait fait avant que quoi que ce soit n'atteigne quelqu'un.

Comment cela reste sans risque

Les lectures sont réelles. Les écritures sont capturées, jamais envoyées.

Un essai à blanc n'a d'intérêt que si le contexte est authentique : l'agent interroge donc réellement vos données. La différence apparaît quand il tente d'agir : chaque écriture est interceptée et reçoit une réponse plausible, si bien que l'agent continue de raisonner sans que rien n'aboutisse.

Les outils de lecture s'exécutent réellement

Données en direct · sans effet de bord

L'agent voit exactement ce qu'il verrait en production : c'est la seule façon que l'exécution dise quelque chose de vrai.

Interroge votre base de connaissances
Lit le ticket, ses champs et tout le fil
Récupère les données de commande et de compte en direct depuis les outils connectés

Les outils d'écriture sont interceptés

Zéro effet de bord

Réponses, changements de statut et affectations sont capturés pour que vous puissiez les lire, puis jetés. L'agent croit que l'écriture a réussi et poursuit son raisonnement ; rien ne quitte votre espace de travail.

Publier une réponse sur le ticket
Modifier statut, priorité ou responsable
Ajouter des étiquettes ou des notes, ou déclencher un remboursement

Autrement dit, vous pouvez lancer un agent tout neuf sur la vraie file de la semaine dernière dès le premier jour, et le pire qui puisse arriver, c'est que vous appreniez quelque chose.

Ce qui le rend honnête

Chaque ticket est rejoué comme s'il venait d'arriver.

Un ticket résolu contient déjà la réponse : le rejouer en entier ne prouverait rien. Macha le ramène à son premier message client et donne cela à l'agent — avec l'objet, les étiquettes et la priorité d'origine, rien de plus.

Ce que voit l'agent

Le premier message du client
L'objet d'origine
Étiquettes et priorité telles quelles

Ce qui est retiré

Toutes les réponses ultérieures du fil
Notes d'agents et commentaires internes
Changements de statut et la résolution

L'exécution vous dit donc comment votre agent traite un ticket qui vient d'arriver — pas s'il sait bien lire la réponse de quelqu'un d'autre.

Quand cela vaut vraiment le coup.

Chaque fois que la réponse honnête à « est-ce que ça va marcher ? » est « sans doute, mais je préfère ne pas le découvrir devant un client ».

Un nouvel agent, avant sa mise en production

Les instructions sont écrites, les outils connectés. Faites-le tourner sur quelques centaines de vrais tickets et lisez les échecs avant même d'activer le déclencheur.

Le mix réel de tickets d'un nouveau client

Prouvez que l'agent gère leur file réelle, pas des exemples synthétiques, sans toucher à une seule de leurs conversations en cours.

Un câblage d'outils dont vous n'êtes pas sûr

Chaque appel de l'agent est listé avec ses arguments et la réponse obtenue. Outils manquants et mauvais paramètres apparaissent ici plutôt qu'en production.

Ce que vous obtenez.

Le même juge qui note vos conversations en production note chaque conversation simulée : les chiffres sont donc directement comparables au score de conformité réel de l'agent.

Conformité

92 %

Enregistrements

120

Écritures capturées

206

Crédits

480

Oui

#20831 · Où est ma commande ?

A recherché la commande, donné la date de suivi, proposé de relancer le transporteur. N'a pas proposé de remboursement, à juste titre.

Oui

#20847 · Mauvaise taille expédiée

A confirmé l'article, lancé un retour, aurait étiqueté le ticket et l'aurait passé en attente.

Partiellement

#20852 · Échec du code promo

A répondu correctement mais a ignoré l'instruction de vérifier si le code avait déjà été utilisé.

Les conversations simulées sont stockées à part — elles ne comptent jamais dans votre conformité réelle et n'apparaissent jamais dans l'historique de votre équipe.

Questions sur les simulations.

Des réponses courtes. S'il manque quelque chose, demandez-nous : nous vous répondrons franchement.

Non. Chaque écriture — publier une réponse, changer le statut, étiqueter, rembourser — est interceptée par l'exécuteur d'outils et reçoit une réponse préparée. Seuls les outils de lecture atteignent vos données : l'exécution a un contexte réel et ne laisse aucune trace.
Parce que vous y choisissez les tickets de test, et vous choisissez ceux auxquels vous avez déjà pensé. Une simulation prend tout ce qui est réellement arrivé sur une période, y compris les cas déroutants, et y fait tourner l'agent.
Les résultats restent valables. L'exécution fige le modèle au lancement et enregistre ce qu'elle a utilisé : un changement ultérieur de prompt ou de modèle n'invalide pas en silence ce que vous avez déjà mesuré.
Non. Elles sont stockées avec leur propre source et filtrées hors de la vue d'évaluation : votre chiffre principal ne reflète que le trafic réel.
Oui — limitez l'exécution à un petit nombre d'enregistrements. Vous voyez l'estimation de crédits avant le lancement, et des filtres optionnels écartent les réponses automatiques avant toute dépense.

Prêt à booster votre équipe avec l'IA ?

Démarrez en quelques minutes. Connectez vos outils, configurez vos agents et laissez l'IA s'occuper du reste.

50 $ de crédits offerts · sans limite de temps, sans carte de crédit