Macha
KI und Agenten im Support

Prompt Injection

Definition

Prompt Injection ist ein Sicherheitsangriff, bei dem schädliche Anweisungen in Nutzereingaben oder externen Inhalten versteckt werden, um ein KI-System dazu zu bringen, seine ursprünglichen Anweisungen zu ignorieren oder unbeabsichtigte Aktionen auszuführen.

Auch bekannt als: Prompt HackingJailbreakInjection-Angriff

So funktioniert es

Weil LLMs Anweisungen und Daten im selben Textstrom verarbeiten, kann ein Angreifer Befehle wie „Ignoriere deine vorherigen Anweisungen“ in eine Chat-Nachricht, ein Support-Ticket oder eine Webseite einbetten, die der Agent liest. Kann das System vertrauenswürdige Anweisungen nicht von nicht vertrauenswürdigen Inhalten unterscheiden, befolgt es womöglich den eingeschleusten Befehl.

Besonders gefährlich ist die indirekte Prompt Injection bei KI-Agenten, die externe Inhalte abrufen oder Tools aufrufen, denn die schädliche Anweisung kann über abgerufene Daten kommen statt direkt vom Nutzer.

Warum es für den Support wichtig ist

Ein KI-Support-Agent mit Zugriff auf echte Systeme könnte dazu gebracht werden, Daten preiszugeben, Richtlinien zu umgehen oder schädliche Aktionen auszuführen. Zu den Abwehrmaßnahmen zählen Guardrails, Eingabefilterung, Tool-Rechte nach dem Least-Privilege-Prinzip und ein System-Prompt, der von Nutzerinhalten getrennt bleibt und ihnen übergeordnet ist.

Häufig gefragt

Was ist der Unterschied zwischen Prompt Injection und einem Jailbreak?

Ein Jailbreak bringt ein Modell dazu, seine Sicherheitsregeln zu umgehen; Prompt Injection überschreibt allgemeiner die beabsichtigten Anweisungen des Systems, oft über nicht vertrauenswürdige Eingaben oder externe Inhalte. Beides überschneidet sich, aber Injection umfasst auch indirekte Angriffe über abgerufene Daten.

Wie verhindert man Prompt Injection?

Trennen Sie vertrauenswürdige Anweisungen von nicht vertrauenswürdigen Eingaben, setzen Sie Guardrails und Eingabefilter ein, beschränken Sie Tool-Rechte auf das Nötigste und verlangen Sie eine Bestätigung für sensible Aktionen.

Setzen Sie diese Ideen ein

Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.

Trial starten