Macha
Agenten-Simulationen

Einen Agenten an echten Tickets testen, ohne sie anzufassen.

Eine Simulation schickt Ihren Agenten durch Ihre echten Produktionstickets und zeigt Ihnen genau, was er bei jedem einzelnen getan hätte — ohne eine einzige Antwort zu senden oder einen einzigen Schreibvorgang auszulösen.

Das echte Ticket Produktion

#20831 · Wo ist meine Bestellung?

Antonio R. · offen · 2 Antworten

Ich habe letzte Woche bestellt und bis heute nichts erhalten. Bestellnummer 20831. Können Sie helfen?

Unverändert. Keine Antwort, kein Tag, keine Statusänderung.
Was der Agent getan hätte Anweisungen befolgt
gelesen Bestellung 20831 in Shopify nachgeschlagen — am 12. Juli versandt, in Zustellung.
gelesen Im Help Center nach der Richtlinie für verspätete Lieferungen gesucht.
zurückgehalten Hätte diese Antwort gepostet und das Ticket mit „shipping“ getaggt. Nicht gesendet.

Die Antwort, die er gesendet hätte

„Hallo Antonio — Ihre Bestellung wurde am 12. Juli versandt und ist heute in Zustellung, Ankunft bis 18 Uhr. Sollte sie bis dahin nicht da sein, antworten Sie einfach hier, dann hake ich sofort beim Zusteller nach.“

📦

Erstattungs-Agent

@refund · GPT-5

Aktiv
Anweisungen geschrieben
6 Tools verbunden
Trigger konfiguriert

Nie an einem echten Ticket gelaufen

Sie haben den Agenten gebaut. Jetzt müssen Sie ihm einen echten Kunden anvertrauen.

Genau hier zögern alle. Die Anweisungen lesen sich gut, im Testpanel hat er sich benommen, und die Beispieltickets waren die, die Ihnen gerade einfielen. Nichts davon sagt Ihnen, wie er mit den unordentlichen, halb erklärten Tickets umgeht, in denen drei Themen gleichzeitig stecken — und die tatsächlich eintreffen.

Also bleibt der Agent ausgeschaltet, oder er geht live und jemand beobachtet die Queue mit dem Finger über der Pause-Taste. Simulationen gibt es, um diese Wahl abzuschaffen: Lassen Sie ihn zuerst auf dem echten Material laufen und lesen Sie, was er getan hätte, bevor irgendetwas jemanden erreicht.

Warum das sicher bleibt

Lesevorgänge sind echt. Schreibvorgänge werden erfasst, nie gesendet.

Ein Trockenlauf nützt nur, wenn der Kontext echt ist — der Agent fragt Ihre Daten also wirklich ab. Der Unterschied zeigt sich, wenn er handeln will: Jeder Schreibvorgang wird abgefangen und mit einer plausiblen Antwort quittiert, sodass der Agent weiterdenkt, während nichts ankommt.

Lese-Tools laufen echt

Live-Daten · ohne Nebenwirkungen

Der Agent sieht genau das, was er in der Produktion sehen würde — nur so sagt der Lauf überhaupt etwas Wahres aus.

Durchsucht Ihre Wissensdatenbank
Liest das Ticket, seine Felder und den gesamten Verlauf
Ruft Live-Bestell- und Kontodaten aus verbundenen Tools ab

Schreib-Tools werden abgefangen

Null Nebenwirkungen

Antworten, Statusänderungen und Zuweisungen werden erfasst, damit Sie sie lesen können, und danach verworfen. Der Agent glaubt, der Schreibvorgang sei geglückt, und denkt weiter; nichts verlässt Ihren Workspace.

Eine Antwort im Ticket posten
Status, Priorität oder Zuständigen ändern
Tags oder Notizen hinzufügen oder eine Erstattung auslösen

Sie können also einen brandneuen Agenten am ersten Tag auf die echte Queue der letzten Woche loslassen — und das Schlimmste, was passiert, ist, dass Sie etwas lernen.

Der Teil, der es ehrlich macht

Jedes Ticket wird abgespielt, als wäre es gerade eingegangen.

Ein gelöstes Ticket enthält die Antwort bereits, ein vollständiges Abspielen würde also nichts beweisen. Macha reduziert das Ticket auf die erste Kundennachricht und übergibt dem Agenten genau das — mit dem ursprünglichen Betreff, den Tags und der Priorität, sonst nichts.

Was der Agent sieht

Die erste Nachricht des Kunden
Der ursprüngliche Betreff
Tags und Priorität wie damals

Was entfernt wird

Jede spätere Antwort im Verlauf
Agentennotizen und interne Kommentare
Statusänderungen und die Lösung

So sagt Ihnen der Lauf, wie Ihr Agent ein frisch eingehendes Ticket bewältigt — nicht, wie gut er die Antwort eines anderen lesen kann.

Wann es sich wirklich lohnt.

Immer dann, wenn die ehrliche Antwort auf „wird das funktionieren?“ lautet: „wahrscheinlich, aber ich möchte es lieber nicht vor einem Kunden herausfinden“.

Ein neuer Agent, bevor er live geht

Die Anweisungen stehen, die Tools sind verbunden. Lassen Sie ihn über ein paar hundert echte Tickets laufen und lesen Sie die Fehlschläge, bevor der Trigger überhaupt eingeschaltet wird.

Der echte Ticket-Mix eines neuen Kunden

Belegen Sie, dass der Agent deren Queue bewältigt und nicht synthetische Beispiele — ohne eine einzige ihrer echten Konversationen anzufassen.

Eine Tool-Verdrahtung, bei der Sie unsicher sind

Jeder Aufruf des Agenten wird mit seinen Argumenten und der erhaltenen Antwort aufgelistet. Fehlende Tools und falsche Parameter zeigen sich hier statt in der Produktion.

Was Sie zurückbekommen.

Derselbe Judge, der Ihre Live-Konversationen bewertet, bewertet auch jede simulierte — die Zahlen sind also direkt mit dem echten Adherence-Wert des Agenten vergleichbar.

Regeltreue

92 %

Datensätze

120

Erfasste Schreibvorgänge

206

Credits

480

Ja

#20831 · Wo ist meine Bestellung?

Bestellung nachgeschlagen, Zustelldatum genannt, angeboten, beim Zusteller nachzuhaken. Hat richtigerweise keine Erstattung angeboten.

Ja

#20847 · Falsche Größe geliefert

Artikel bestätigt, Rücksendung angestoßen, hätte das Ticket getaggt und auf „wartend“ gesetzt.

Teilweise

#20852 · Rabattcode fehlgeschlagen

Richtig geantwortet, aber die Anweisung übersprungen, zu prüfen, ob der Code bereits eingelöst war.

Simulierte Konversationen werden getrennt gespeichert — sie zählen nie in Ihre Live-Regeltreue und tauchen nie in den vergangenen Konversationen Ihres Teams auf.

Fragen zu Simulationen.

Kurze Antworten. Fehlt etwas, fragen Sie uns — wir sagen es Ihnen geradeheraus.

Nein. Jeder Schreibvorgang — eine Antwort posten, den Status ändern, taggen, erstatten — wird vom Tool-Executor abgefangen und mit einer vorgefertigten Antwort quittiert. Nur Lese-Tools erreichen Ihre Daten, der Lauf hat also echten Kontext und hinterlässt keine Spur.
Weil Sie dort die Testtickets auswählen — und zwar die, über die Sie schon nachgedacht haben. Eine Simulation nimmt, was in einem Zeitraum tatsächlich eingegangen ist, auch die verwirrenden Fälle, und lässt den Agenten auf allen laufen.
Die Ergebnisse bleiben gültig. Der Lauf friert das Modell beim Start ein und speichert, was er verwendet hat — eine spätere Prompt- oder Modelländerung entwertet also nicht stillschweigend, was Sie bereits gemessen haben.
Nein. Sie werden mit eigener Quelle gespeichert und aus der Bewertungsansicht herausgefiltert, sodass Ihre Kennzahl ausschließlich echten Traffic abbildet.
Ja — begrenzen Sie den Lauf auf eine kleine Zahl von Datensätzen. Sie sehen die Credit-Schätzung vor dem Start, und optionale Skip-Filter entfernen Auto-Antworten, bevor Sie etwas für sie ausgeben.

Bereit, dein Team mit KI zu turbo-boosten?

Starte in Minuten. Verbinde deine Tools, konfiguriere deine Agenten und lass die KI den Rest erledigen.

$50 Gratis-Guthaben · ohne Zeitlimit, ohne Kreditkarte