Transformer-Modell
Definition
Ein Transformer-Modell ist eine Architektur neuronaler Netze, die eine ganze Textsequenz auf einmal verarbeitet und über einen Attention-Mechanismus gewichtet, wie stark sich die Wörter aufeinander beziehen. Sie ist die Grundlage nahezu jedes modernen großen Sprachmodells.
So funktioniert es
Transformer wurden 2017 im Aufsatz „Attention Is All You Need“ vorgestellt. Ihre entscheidende Neuerung ist die Self-Attention: Für jedes Token berechnet das Modell, wie relevant jedes andere Token der Eingabe ist. So erfasst es Bezüge über weite Strecken (etwa, auf welches Substantiv sich ein Pronomen bezieht), ohne die Wörter strikt nacheinander abarbeiten zu müssen.
Text wird zuerst in Tokens zerlegt und in numerische Vektoren überführt (Embeddings). Gestapelte Attention-Schichten transformieren diese Vektoren, und das Modell sagt das nächste Token voraus. Weil Attention parallel läuft, trainieren Transformer effizient auf riesigen Datenmengen – und genau das hat die heutigen großen Sprachmodelle möglich gemacht.
Warum das für den Support wichtig ist
Praktisch jeder KI-Support-Agent, dem Sie begegnen, hat unter der Haube einen Transformer. Wer die Architektur versteht, versteht zugleich ihre Stärken und ihre Grenzen.
- Sie liest eine ganze Konversation im Zusammenhang, nicht Wort für Wort
- Ihr festes Kontextfenster begrenzt, wie viel Historie sie auf einmal berücksichtigen kann
- Sie sagt wahrscheinlichen Text voraus – deshalb ist die Verankerung in Ihren eigenen Daten (RAG) für die Genauigkeit entscheidend
Häufig gefragt
Was ist der Transformer in einem großen Sprachmodell?
Der Transformer ist die zugrunde liegende Architektur des neuronalen Netzes. Ein großes Sprachmodell ist ein sehr großer Transformer, der auf riesigen Textkorpora trainiert wurde, um Sprache vorherzusagen und zu erzeugen.
Was macht der Attention-Mechanismus?
Attention lässt das Modell gewichten, wie relevant jedes Wort der Eingabe für jedes andere ist. So erfasst es Zusammenhänge und Bezüge über eine lange Passage hinweg, statt isoliert zu lesen.
Verwandte Begriffe
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen – dadurch kann es Fragen verstehen, zusammenfassen, klassifizieren und menschenähnliche Antworten schreiben..
Embeddings
Embeddings sind numerische Vektordarstellungen von Text (oder Bildern, Code usw.), die Bedeutung erfassen — Inhalte mit ähnlicher Bedeutung liegen dadurch in einem hochdimensionalen Raum dicht beieinander..
Kontextfenster
Das Kontextfenster ist die maximale Textmenge — gemessen in Tokens —, die ein Sprachmodell auf einmal berücksichtigen kann, einschließlich der Eingabe, die Sie ihm geben, und der Ausgabe, die es erzeugt..
Tokens (LLM)
Tokens sind die kleinen Textbausteine – Wörter, Wortteile oder Zeichen –, die ein Sprachmodell liest und erzeugt.
Foundation Model
Ein Foundation Model ist ein großes KI-Modell, das in großem Maßstab auf breiten, allgemeinen Daten trainiert wurde und sich für viele nachgelagerte Aufgaben anpassen lässt — über Prompting, Retrieval oder Fine-Tuning —, statt für eine einzige enge Aufgabe gebaut zu sein..
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten