Einen Agenten an echten Tickets testen,
ohne sie anzufassen.
Eine Simulation schickt Ihren Agenten durch Ihre echten Produktionstickets und zeigt Ihnen genau, was er bei jedem einzelnen getan hätte — ohne eine einzige Antwort zu senden oder einen einzigen Schreibvorgang auszulösen.
#20831 · Wo ist meine Bestellung?
Antonio R. · offen · 2 Antworten
Ich habe letzte Woche bestellt und bis heute nichts erhalten. Bestellnummer 20831. Können Sie helfen?
Die Antwort, die er gesendet hätte
„Hallo Antonio — Ihre Bestellung wurde am 12. Juli versandt und ist heute in Zustellung, Ankunft bis 18 Uhr. Sollte sie bis dahin nicht da sein, antworten Sie einfach hier, dann hake ich sofort beim Zusteller nach.“
Erstattungs-Agent
@refund · GPT-5
Nie an einem echten Ticket gelaufen
Sie haben den Agenten gebaut. Jetzt müssen Sie ihm einen echten Kunden anvertrauen.
Genau hier zögern alle. Die Anweisungen lesen sich gut, im Testpanel hat er sich benommen, und die Beispieltickets waren die, die Ihnen gerade einfielen. Nichts davon sagt Ihnen, wie er mit den unordentlichen, halb erklärten Tickets umgeht, in denen drei Themen gleichzeitig stecken — und die tatsächlich eintreffen.
Also bleibt der Agent ausgeschaltet, oder er geht live und jemand beobachtet die Queue mit dem Finger über der Pause-Taste. Simulationen gibt es, um diese Wahl abzuschaffen: Lassen Sie ihn zuerst auf dem echten Material laufen und lesen Sie, was er getan hätte, bevor irgendetwas jemanden erreicht.
Warum das sicher bleibt
Lesevorgänge sind echt. Schreibvorgänge werden erfasst, nie gesendet.
Ein Trockenlauf nützt nur, wenn der Kontext echt ist — der Agent fragt Ihre Daten also wirklich ab. Der Unterschied zeigt sich, wenn er handeln will: Jeder Schreibvorgang wird abgefangen und mit einer plausiblen Antwort quittiert, sodass der Agent weiterdenkt, während nichts ankommt.
Lese-Tools laufen echt
Live-Daten · ohne Nebenwirkungen
Der Agent sieht genau das, was er in der Produktion sehen würde — nur so sagt der Lauf überhaupt etwas Wahres aus.
Schreib-Tools werden abgefangen
Null Nebenwirkungen
Antworten, Statusänderungen und Zuweisungen werden erfasst, damit Sie sie lesen können, und danach verworfen. Der Agent glaubt, der Schreibvorgang sei geglückt, und denkt weiter; nichts verlässt Ihren Workspace.
Sie können also einen brandneuen Agenten am ersten Tag auf die echte Queue der letzten Woche loslassen — und das Schlimmste, was passiert, ist, dass Sie etwas lernen.
Der Teil, der es ehrlich macht
Jedes Ticket wird abgespielt, als wäre es gerade eingegangen.
Ein gelöstes Ticket enthält die Antwort bereits, ein vollständiges Abspielen würde also nichts beweisen. Macha reduziert das Ticket auf die erste Kundennachricht und übergibt dem Agenten genau das — mit dem ursprünglichen Betreff, den Tags und der Priorität, sonst nichts.
Was der Agent sieht
Was entfernt wird
So sagt Ihnen der Lauf, wie Ihr Agent ein frisch eingehendes Ticket bewältigt — nicht, wie gut er die Antwort eines anderen lesen kann.
Wann es sich wirklich lohnt.
Immer dann, wenn die ehrliche Antwort auf „wird das funktionieren?“ lautet: „wahrscheinlich, aber ich möchte es lieber nicht vor einem Kunden herausfinden“.
Ein neuer Agent, bevor er live geht
Die Anweisungen stehen, die Tools sind verbunden. Lassen Sie ihn über ein paar hundert echte Tickets laufen und lesen Sie die Fehlschläge, bevor der Trigger überhaupt eingeschaltet wird.
Der echte Ticket-Mix eines neuen Kunden
Belegen Sie, dass der Agent deren Queue bewältigt und nicht synthetische Beispiele — ohne eine einzige ihrer echten Konversationen anzufassen.
Eine Tool-Verdrahtung, bei der Sie unsicher sind
Jeder Aufruf des Agenten wird mit seinen Argumenten und der erhaltenen Antwort aufgelistet. Fehlende Tools und falsche Parameter zeigen sich hier statt in der Produktion.
Was Sie zurückbekommen.
Derselbe Judge, der Ihre Live-Konversationen bewertet, bewertet auch jede simulierte — die Zahlen sind also direkt mit dem echten Adherence-Wert des Agenten vergleichbar.
Regeltreue
92 %
Datensätze
120
Erfasste Schreibvorgänge
206
Credits
480
#20831 · Wo ist meine Bestellung?
Bestellung nachgeschlagen, Zustelldatum genannt, angeboten, beim Zusteller nachzuhaken. Hat richtigerweise keine Erstattung angeboten.
#20847 · Falsche Größe geliefert
Artikel bestätigt, Rücksendung angestoßen, hätte das Ticket getaggt und auf „wartend“ gesetzt.
#20852 · Rabattcode fehlgeschlagen
Richtig geantwortet, aber die Anweisung übersprungen, zu prüfen, ob der Code bereits eingelöst war.
Vier Funktionen, die ähnlich klingen. Sind sie nicht.
Eine Simulation lässt Ihren Agenten auf echten Datensätzen laufen und zeigt, was er getan hätte. Nichts erreicht den Kunden.
Studies — KI-Analyse
Eine Analyse über Tausende Datensätze laufen lassen und ein strukturiertes Raster zurückbekommen.
Agenten-Bewertung
Bereits geführte Konversationen an den eigenen Anweisungen des Agenten bewerten.
AI Knowledge Builder
Gelöste Tickets in eine Wissensdatenbank verwandeln, die Ihre Agenten durchsuchen können.
Fragen zu Simulationen.
Kurze Antworten. Fehlt etwas, fragen Sie uns — wir sagen es Ihnen geradeheraus.
Bereit, dein Team mit KI zu turbo-boosten?
Starte in Minuten. Verbinde deine Tools, konfiguriere deine Agenten und lass die KI den Rest erledigen.
$50 Gratis-Guthaben · ohne Zeitlimit, ohne Kreditkarte
Intercom
Shopify
Stripe
Slack
Notion
Google Workspace
Confluence