Agenten-Auswertung
Definition
Die Agenten-Auswertung (Agent Evaluation) ist Machas eingebauter Weg, um zu bewerten, wie gut ein Agent seine Aufgabe tatsächlich erledigt hat. Ein KI-Judge prüft die vergangenen Konversationen des Agenten anhand einer Checkliste und gibt pro Konversation zurück, ob er seinen Anweisungen gefolgt ist — und warum.
So funktioniert sie
Sie legen die Checkliste einmal an — oder lassen Macha sie aus den Anweisungen des Agenten erzeugen — und ein KI-Judge wendet sie auf jede vergangene Konversation im gewählten Bereich an: Chat-Sitzungen, autonome Trigger-Läufe, Übergaben an Sub-Agents, Konversationen im eingebetteten Chatbot. Zwei Felder sind immer dabei: Anweisungen befolgt (Ja / Teilweise / Nein) und ein kurzes Warum. Eigene Prüfungen ergänzen Sie selbst, etwa „richtiges Tool aufgerufen“ oder „Rückerstattung nur gewährt, wenn die Richtlinie es erlaubt“.
Der Gesamtwert vergibt Teilpunkte — Anzahl Ja plus die Hälfte der Teilweise, geteilt durch die Gesamtzahl — und die Ergebnisse kommen als Tabelle, als Report mit Diagrammen und mit einer Begründung je Konversation zurück, sodass Sie ein Urteil prüfen können, ohne den ganzen Thread erneut zu lesen.
Auto-Eval und manuelle Auswertungen
Jeder Workspace bekommt Auto-Eval in jedem Tarif kostenlos: Ab dem Moment, in dem Sie einen Agenten anlegen, bewertet Macha jeden autonomen Lauf gegen die aktuellen Anweisungen mit einem fest verdrahteten Judge, ohne Begrenzung der Konversationen und ohne Kosten. Manuelle Auswertungen, ebenfalls in jedem Tarif enthalten, sind der konfigurierbare Ablauf — Bereich wählen, eigene Bewertungskriterien festlegen, Judge-Modell bestimmen und gegen eine bestimmte Version der Anweisungen auswerten.
So messen Sie eine Änderung am Prompt: einmal vorher und einmal nachher laufen lassen und die Werte vergleichen, statt zu raten, ob die Anpassung geholfen hat. Ausgewertet werden vergangene Konversationen, keine laufenden — für Kontrolle in Echtzeit dienen die Anweisungen des Agenten und die Bestätigungsschritte.
Häufig gefragt
Was prüft der Judge genau?
Ob der Agent in jeder vergangenen Konversation seinen eigenen Anweisungen gefolgt ist — die richtigen Tools, das richtige Routing, der von Ihnen gesetzte Ton und die gesetzten Grenzen — plus alle eigenen Prüfungen, die Sie ergänzen. Zurück kommen ein Urteil Ja/Teilweise/Nein und eine kurze Begründung je Konversation.
Muss ich für die Auswertung meiner Agenten bezahlen?
Nein. Auto-Eval ist in jedem Tarif kostenlos und bewertet jeden autonomen Lauf, ohne Begrenzung der Konversationen. Manuelle, konfigurierbare Auswertungen sind ebenfalls in jedem Tarif enthalten.
Verwandte Begriffe
Agentenkonfiguration in natürlicher Sprache
In Macha konfigurieren Sie einen Agenten, indem Sie seine Regeln in natürlicher Sprache in sein Anweisungsfeld schreiben – wie er triagiert, welchen Ton er trifft, was er eskaliert, was tabu ist – statt Logik zu programmieren.
Credits für KI-Aktionen
Credits sind die Einheit, mit der Machas Dashboard den Verbrauch hinter Ihrem monatlichen Ticket-Kontingent misst.
Qualitätssicherungs-Score (QA-Score)
Ein Qualitätssicherungs-Score (QA-Score) misst, wie gut eine Support-Interaktion die Qualitätsstandards eines Teams erfüllt hat – bewertet über eine Scorecard, die Dinge wie Richtigkeit, Ton, Richtlinientreue und Lösung benotet..
KI-Guardrails
KI-Guardrails sind die Regeln, Prüfungen und Beschränkungen rund um ein KI-System, die sein Verhalten sicher, beim Thema und innerhalb der Richtlinien halten — sie steuern, was es sagen und tun darf und worauf es zugreifen kann..
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten