Macha
Macha-Konzepte

Agenten-Auswertung

Definition

Die Agenten-Auswertung (Agent Evaluation) ist Machas eingebauter Weg, um zu bewerten, wie gut ein Agent seine Aufgabe tatsächlich erledigt hat. Ein KI-Judge prüft die vergangenen Konversationen des Agenten anhand einer Checkliste und gibt pro Konversation zurück, ob er seinen Anweisungen gefolgt ist — und warum.

Auch bekannt als: KI-AuswertungLLM-as-JudgeAuswertung der Anweisungstreue

So funktioniert sie

Sie legen die Checkliste einmal an — oder lassen Macha sie aus den Anweisungen des Agenten erzeugen — und ein KI-Judge wendet sie auf jede vergangene Konversation im gewählten Bereich an: Chat-Sitzungen, autonome Trigger-Läufe, Übergaben an Sub-Agents, Konversationen im eingebetteten Chatbot. Zwei Felder sind immer dabei: Anweisungen befolgt (Ja / Teilweise / Nein) und ein kurzes Warum. Eigene Prüfungen ergänzen Sie selbst, etwa „richtiges Tool aufgerufen“ oder „Rückerstattung nur gewährt, wenn die Richtlinie es erlaubt“.

Der Gesamtwert vergibt Teilpunkte — Anzahl Ja plus die Hälfte der Teilweise, geteilt durch die Gesamtzahl — und die Ergebnisse kommen als Tabelle, als Report mit Diagrammen und mit einer Begründung je Konversation zurück, sodass Sie ein Urteil prüfen können, ohne den ganzen Thread erneut zu lesen.

Auto-Eval und manuelle Auswertungen

Jeder Workspace bekommt Auto-Eval in jedem Tarif kostenlos: Ab dem Moment, in dem Sie einen Agenten anlegen, bewertet Macha jeden autonomen Lauf gegen die aktuellen Anweisungen mit einem fest verdrahteten Judge, ohne Begrenzung der Konversationen und ohne Kosten. Manuelle Auswertungen, ebenfalls in jedem Tarif enthalten, sind der konfigurierbare Ablauf — Bereich wählen, eigene Bewertungskriterien festlegen, Judge-Modell bestimmen und gegen eine bestimmte Version der Anweisungen auswerten.

So messen Sie eine Änderung am Prompt: einmal vorher und einmal nachher laufen lassen und die Werte vergleichen, statt zu raten, ob die Anpassung geholfen hat. Ausgewertet werden vergangene Konversationen, keine laufenden — für Kontrolle in Echtzeit dienen die Anweisungen des Agenten und die Bestätigungsschritte.

Häufig gefragt

Was prüft der Judge genau?

Ob der Agent in jeder vergangenen Konversation seinen eigenen Anweisungen gefolgt ist — die richtigen Tools, das richtige Routing, der von Ihnen gesetzte Ton und die gesetzten Grenzen — plus alle eigenen Prüfungen, die Sie ergänzen. Zurück kommen ein Urteil Ja/Teilweise/Nein und eine kurze Begründung je Konversation.

Muss ich für die Auswertung meiner Agenten bezahlen?

Nein. Auto-Eval ist in jedem Tarif kostenlos und bewertet jeden autonomen Lauf, ohne Begrenzung der Konversationen. Manuelle, konfigurierbare Auswertungen sind ebenfalls in jedem Tarif enthalten.

Setzen Sie diese Ideen ein

Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.

Trial starten