Prompt Injection
Definition
Prompt Injection ist ein Sicherheitsangriff, bei dem schädliche Anweisungen in Nutzereingaben oder externen Inhalten versteckt werden, um ein KI-System dazu zu bringen, seine ursprünglichen Anweisungen zu ignorieren oder unbeabsichtigte Aktionen auszuführen.
So funktioniert es
Weil LLMs Anweisungen und Daten im selben Textstrom verarbeiten, kann ein Angreifer Befehle wie „Ignoriere deine vorherigen Anweisungen“ in eine Chat-Nachricht, ein Support-Ticket oder eine Webseite einbetten, die der Agent liest. Kann das System vertrauenswürdige Anweisungen nicht von nicht vertrauenswürdigen Inhalten unterscheiden, befolgt es womöglich den eingeschleusten Befehl.
Besonders gefährlich ist die indirekte Prompt Injection bei KI-Agenten, die externe Inhalte abrufen oder Tools aufrufen, denn die schädliche Anweisung kann über abgerufene Daten kommen statt direkt vom Nutzer.
Warum es für den Support wichtig ist
Ein KI-Support-Agent mit Zugriff auf echte Systeme könnte dazu gebracht werden, Daten preiszugeben, Richtlinien zu umgehen oder schädliche Aktionen auszuführen. Zu den Abwehrmaßnahmen zählen Guardrails, Eingabefilterung, Tool-Rechte nach dem Least-Privilege-Prinzip und ein System-Prompt, der von Nutzerinhalten getrennt bleibt und ihnen übergeordnet ist.
Häufig gefragt
Was ist der Unterschied zwischen Prompt Injection und einem Jailbreak?
Ein Jailbreak bringt ein Modell dazu, seine Sicherheitsregeln zu umgehen; Prompt Injection überschreibt allgemeiner die beabsichtigten Anweisungen des Systems, oft über nicht vertrauenswürdige Eingaben oder externe Inhalte. Beides überschneidet sich, aber Injection umfasst auch indirekte Angriffe über abgerufene Daten.
Wie verhindert man Prompt Injection?
Trennen Sie vertrauenswürdige Anweisungen von nicht vertrauenswürdigen Eingaben, setzen Sie Guardrails und Eingabefilter ein, beschränken Sie Tool-Rechte auf das Nötigste und verlangen Sie eine Bestätigung für sensible Aktionen.
Verwandte Begriffe
KI-Guardrails
KI-Guardrails sind die Regeln, Prüfungen und Beschränkungen rund um ein KI-System, die sein Verhalten sicher, beim Thema und innerhalb der Richtlinien halten — sie steuern, was es sagen und tun darf und worauf es zugreifen kann..
System-Prompt
Ein System-Prompt ist der zugrunde liegende Satz von Anweisungen, der Rolle, Verhalten, Tonfall und Grenzen eines KI-Modells für eine Konversation festlegt – gesetzt von der Entwicklerseite, nicht von den Nutzern, und gültig für jede Interaktion..
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen – dadurch kann es Fragen verstehen, zusammenfassen, klassifizieren und menschenähnliche Antworten schreiben..
KI-Agent
Ein KI-Agent ist ein Softwaresystem, das mit einem Sprachmodell eine Anfrage versteht, entscheidet, was zu tun ist, und handelt — Tools aufrufen, Daten abrufen, Aufgaben abschließen — statt nur eine einzelne vorgeschriebene Antwort zurückzugeben..
Tool-Nutzung
Tool-Nutzung ist die Fähigkeit eines KI-Modells, externe Funktionen, APIs oder Systeme aufzurufen – etwa eine Bestellung nachzuschlagen oder eine Rückerstattung auszulösen –, statt nur Text zu erzeugen.
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten