Grundlagen

Was ist ein Large Language Model (LLM)?

Ein Large Language Model (LLM) ist ein großes neuronales Sprachmodell, das aus umfangreichen Trainingsdaten statistische Strukturen von Sprache erlernt. Viele heutige generative LLMs beruhen auf Transformer-Architekturen und erzeugen Text autoregressiv aus Token-Wahrscheinlichkeiten – daneben gibt es weitere Verfahren wie diskrete Diffusions-Sprachmodelle. Moderne LLM-Systeme können zusätzlich Bilder verarbeiten, externe Werkzeuge nutzen oder über Suche und RAG aktuelle Informationen einbinden. Ein LLM ist dabei weder ein durchsuchbarer Faktenspeicher noch ein eigenständig denkendes System.

Was ist ein Large Language Model?

Large Language Model heißt wörtlich „großes Sprachmodell“. Der Begriff hat drei Teile: Language – das Modell verarbeitet sprachliche Repräsentationen (moderne Systeme oft verbunden mit anderen Modalitäten); Model – ein trainiertes neuronales Modell, keine Datenbank, keine Suchmaschine, keine Wikipedia-Kopie; Large – sehr viele Parameter und Trainingsdaten. Für „Large“ gibt es keine feste wissenschaftliche Grenze ab X Milliarden Parametern; der Begriff ist historisch und relativ zu verstehen. LLMs sind eine Ausprägung generativer KI und der technische Kern heutiger Chatassistenten.

Wie ein LLM Text erzeugt

Viele verbreitete generative LLMs arbeiten autoregressiv: Sie erzeugen Text Schritt für Schritt, indem sie für die nächste Position eine Wahrscheinlichkeitsverteilung über mögliche Tokens berechnen und daraus eines auswählen. Wichtig: Das Modell wählt nicht stur „das eine wahrscheinlichste Wort“, sondern kann über Decoding-Verfahren (z. B. Greedy, Sampling, Temperature, Top-p) aus der Verteilung ziehen – deshalb variieren Antworten.

Ablauf eines autoregressiven LLM Prompt wird zu Tokens, dann Embeddings, dann durch Transformer-Blöcke verarbeitet, ergibt eine Wahrscheinlichkeitsverteilung, aus der das nächste Token gewählt wird; der Vorgang wiederholt sich. Vereinfachtes Beispiel, nicht jedes Sprachmodell arbeitet so. Prompt Tokens Embeddings Transformer-Blöcke Wahrschein-lichkeiten nächstesToken Schleife: das gewählte Token wird angehängt, dann folgt das nächste
Vereinfachtes Beispiel eines autoregressiven Transformer-LLM. Nicht jedes Sprachmodell arbeitet exakt so.

Nicht jedes LLM arbeitet Token für Token

Die Formel „ein LLM sagt immer nur das nächste Token voraus“ ist als allgemeine Definition zu eng. Neben autoregressiven Modellen gibt es u. a. diskrete Diffusions-Sprachmodelle, die Text in parallelen Blöcken durch schrittweises „Entrauschen“ erzeugen statt streng von links nach rechts. Google beschreibt das experimentelle Gemini Diffusion (2025) und das offene DiffusionGemma (2026) ausdrücklich als solche nicht-autoregressive Alternative. Auch State-Space-Modelle wie Mamba sind eine aktive Alternative zur reinen Attention. Merke außerdem: Transformer ≠ LLM – der Transformer ist eine Architektur(-familie), das LLM ein großes Sprachmodell; Transformer werden auch außerhalb von LLMs eingesetzt.

Transformer und Attention

Die meisten aktuellen LLMs beruhen auf der Transformer-Architektur (2017 vorgestellt). Ihr Kernbaustein ist die Selbstaufmerksamkeit (Self-Attention): Das Modell gewichtet für jedes Token, wie stark andere Tokens im Kontext für dessen Bedeutung relevant sind, und verarbeitet die Sequenz im Training parallel. So wird ein und dieselbe Zeichenfolge je nach Kontext unterschiedlich eingeordnet:

Konstruiertes Beispiel: Attention

„Die Bank am Fluss war nass.“ gegenüber „Die Bank genehmigte den Kredit.“ – Attention hilft dem Modell, „Bank“ je nach umgebenden Tokens unterschiedlich zu gewichten. Das ist keine menschliche Aufmerksamkeit, sondern eine gewichtete Verrechnung von Repräsentationen.

Tokens und Embeddings

Ein LLM verarbeitet Text nicht als sichtbare Wörter, sondern als Tokens (modellabhängige Einheiten – Token ≠ Wort). Die Token-IDs werden intern in Embeddings überführt – numerische Vektoren, mit denen das neuronale Netz rechnet. Wie viel Kontext gleichzeitig verarbeitet werden kann, bestimmt das Kontextfenster. Die Details stehen in den verlinkten Artikeln – hier genügt: rein → Tokens → Embeddings → Modell.

Parameter, Größe und Mixture of Experts

Parameter (Gewichte) sind die im Training angepassten Zahlenwerte des Modells. Modellwissen ist über viele Parameter verteilt – ein Parameter ist kein einzelner gespeicherter Fakt. Drei oft verwechselte Größen:

Parameter, Trainings- und Kontext-Tokens
BegriffWas ist gemeint?
Parametergelernte Modellwerte (Gewichte)
Trainings-TokensMenge der im Training verarbeiteten Daten
Kontext-TokensInformation, die bei einer konkreten Anfrage bereitgestellt wird
Aktive vs. Gesamtparameterwie viele Parameter je Token genutzt bzw. insgesamt vorhanden sind

Mehr Parameter bedeuten nicht automatisch ein besseres Modell. Qualität hängt auch von Datenmenge und -qualität, Rechenaufwand, Architektur, Tokenizer, Trainingsziel und Post-Training ab. Die Chinchilla-Forschung (2022) zeigte etwa, dass Modellgröße und Trainingsdaten gemeinsam skalieren sollten und viele frühere Modelle untertrainiert waren.

Dense vs. Mixture of Experts
ArchitekturGrundideeVorteilMögliche Nachteile
Densealle Parameter werden je Token genutzteinfach, robustRechenaufwand steigt mit der Größe
Mixture of Experts (MoE)ein Router aktiviert je Token nur ausgewählte „Experten“mehr Kapazität bei begrenzter aktiver RechenlastRouting, Speicherbedarf, komplexeres Training

Bei MoE ist die Gesamtparameterzahl deshalb oft viel größer als die aktiven Parameter je Token. Beispiel (offene Gewichte, Stand 09.08.2026): Googles DiffusionGemma wird als MoE mit rund 26 Mrd. Gesamt- und nur etwa 4 Mrd. aktiven Parametern beschrieben. Solche Zahlen sind zeitkritisch – immer die offizielle Model Card prüfen.

Training und Inferenz trennen

Beim Training werden die Modellparameter angepasst. Bei einer normalen Nutzeranfrage (Inferenz) wird das Modell in der Regel nicht neu trainiert: Es verarbeitet Prompt, Systemanweisungen, Kontext, ggf. Dateien, Retrieval und Tools mit seinen bereits gelernten Parametern.

Merksatz

Ein langer Chat trainiert das Modell nicht neu. Was „gemerkt“ wirkt, stammt aus dem erneut bereitgestellten Verlauf, aus Memory-Funktionen des Produkts oder aus Retrieval – nicht aus einer Veränderung der Modellparameter.

Pretraining, Post-Training und Base vs. Instruct

Im Pretraining lernt das Modell aus großen Datenmengen allgemeine sprachliche und statistische Strukturen. Es „speichert“ dabei nicht das Internet und lernt auch nicht automatisch „Wahrheit“; welche Daten genau verwendet wurden, legen viele Anbieter nicht vollständig offen. Danach folgt Post-Training, das aus einem rohen Base Model einen nutzbaren Assistenten macht:

  • Base Model: setzt Text statistisch fort.
  • Instruction-Tuned / Chat-Modell: zusätzlich darauf optimiert, Anweisungen wie „Fasse diesen Text in fünf Punkten zusammen.“ als Aufgabe zu behandeln und im Dialog sicher zu antworten.

Verfahren dafür sind u. a. Supervised Fine-Tuning, Instruction Tuning, Präferenzoptimierung, RLHF und Direct Preference Optimization (DPO). RLHF ist nicht die einzige Methode – Anbieter kombinieren unterschiedliche Verfahren und legen ihre Pipelines nicht identisch offen.

LLM, Chatbot, Foundation Model und GPAI

Wichtige Abgrenzungen
BegriffBedeutung / Abgrenzung
LLMdas trainierte Sprachmodell selbst
Chatbot / KI-Assistentein Produkt, das LLM(s) mit Oberfläche, Verlauf, Memory, Tools und Regeln kombiniert – nicht dasselbe wie das Modell
Generative KIOberbegriff für Modelle, die Inhalte erzeugen (auch Bild, Audio, Video). Jedes LLM ist generative KI, nicht umgekehrt (mehr)
Foundation Modelbreit vortrainiertes, anpassbares Modell; viele LLMs sind Foundation Models, aber nicht jedes Foundation Model ist ein Sprachmodell
GPAIGeneral-Purpose AI Model – eine Rechtskategorie des EU AI Act, nicht mit dem technischen Begriff LLM gleichzusetzen (EU AI Act)
Multimodales LLMkann zusätzlich Bilder/Audio/Video verarbeiten; Eingabe- und Ausgabemodalität sind getrennt (mehr)
Modell vs. KI-System Der Nutzer spricht mit einer Anwendung. Die Anwendung nutzt ein LLM, das zusätzlich Websuche, RAG und Tools einbinden kann, und liefert dann eine Antwort. Das Modell ist nur ein Teil des Systems. Nutzer Anwendung LLM Websuche RAG Tools Antwort
Ein modernes KI-System ist häufig mehr als das LLM. Eine Produktfunktion nicht automatisch dem Modell zuschreiben.

Was LLMs praktisch können

LLMs generieren, transformieren, extrahieren, klassifizieren, fassen zusammen, beantworten Fragen und unterstützen beim Coding. Sie können in geeigneten Systemen auch Structured Outputs (z. B. JSON) erzeugen – wobei LLM-generiertes JSON und garantiert schema-validierter Output nicht dasselbe sind. Wichtig: Fähigkeit bedeutet nicht Fehlerfreiheit.

Was LLMs gut können – und was zu prüfen ist
AufgabeTypischer NutzenWas prüfen?
Entwerfen & Umformulierenschnelle erste VariantenTon, Fakten, Auslassungen
Zusammenfassenlange Texte verdichtenwichtige Einschränkungen erhalten?
Übersetzenschnelle ÜbertragungFachbegriffe, Nuancen
Extraktion / KlassifikationDaten aus Text gewinnenVollständigkeit, Randfälle
CodingEntwürfe, Erklärung, DebuggingTests, Linter, Laufzeit
Recherche-UnterstützungEinstieg, StrukturierungPrimärquellen prüfen

Tool Use, Websuche, RAG und Memory

Ein LLM „kennt“ nicht automatisch das aktuelle Internet. Zu unterscheiden sind: Modellwissen (aus Training/Post-Training), Kontext (vom Nutzer/System bereitgestellt) und aktuelles externes Wissen (über Tools, Suche oder RAG).

  • Tool Use / Function Calling: Das Modell wählt bzw. erzeugt eine strukturierte Werkzeuganfrage; die umgebende Software führt die Aktion aus. Auf „Wie viel sind 17,5 % von 48.932,17 €?“ kann das System einen Rechner aufrufen – das LLM ist nicht selbst der Taschenrechner.
  • Websuche: nur verfügbar, wenn das Produkt sie anbindet.
  • RAG: stellt relevante Dokumente als Kontext bereit und verändert nicht die trainierten Parameter. RAG erweitert den verfügbaren Kontext, nicht automatisch das trainierte Wissen.
  • Memory: eine Produktfunktion, die Informationen außerhalb des Modells speichert und später wieder in den Kontext bringt – nicht Teil des Trainings.

Ein LLM allein ist auch kein KI-Agent: Ein Agentensystem kombiniert Modell, Ziele, Werkzeuge, Zustand und Schleifen. Standardisierte Werkzeuganbindungen beschreibt MCP.

Reasoning und Inference-Time-Compute

Manche Modelle und Systeme verwenden für schwierige Aufgaben zusätzliche Rechenzeit bei der Inferenz („reasoning“, „thinking“, Inference-Time-Compute). Das kann die Leistung bei bestimmten Aufgaben verbessern, ist aber:

  • keine Garantie für Korrektheit – ein Modell kann lange „nachdenken“ und trotzdem von einer falschen Voraussetzung ausgehen;
  • nicht dasselbe wie eine vollständig sichtbare Gedankenkette – Anbieter zeigen den internen Reasoning-Prozess oft nur als Zusammenfassung oder gar nicht;
  • kein Ersatz für fehlende Fakten – aktuelle Informationen brauchen weiterhin Quellen, RAG oder Tools.

Grenzen, Halluzinationen und Wissensstand

Weil LLMs plausible Fortsetzungen aus gelernten Mustern erzeugen und keine geprüfte Faktenbank abfragen, können sie halluzinieren – überzeugend, aber falsch oder unbelegt. Ursachen sind vielfältig (Trainingsdaten, Wissenslücken, Kalibrierung, Prompt, Retrieval, Bewertungsanreize), nicht nur „weil es Wahrscheinlichkeiten berechnet“. Ein LLM ist keine relationale Faktenbank, in der jede Aussage mit Quelle gespeichert ist – es kann viele Fakten reproduzieren, aber die Ausgaben sind nicht automatisch verifiziert. Zu trennen ist auch: ein alter Preis ist veraltetes Wissen, eine erfundene Quelle dagegen eine Halluzination.

Merksatz

Eine überzeugende LLM-Antwort ist nicht automatisch eine geprüfte Tatsache. Für belegbare Aussagen bleiben Quellen und redaktionelle Prüfung nötig.

Wann ein LLM sinnvoll ist – und wann klassische Software

Ein LLM ist nicht automatisch die beste Lösung. Es passt gut, wenn mehrere plausible Ausgaben möglich sind, Sprache oder unstrukturierte Daten verarbeitet werden oder Entwürfe gebraucht werden. Klassische, deterministische Software ist oft besser, wenn eine eindeutige Datenbankantwort reicht, feste Regeln gelten, exakte Reproduzierbarkeit nötig ist oder sicherheitskritische Logik ohne Validierung läuft. Eine exakte Steuerberechnung gehört in geprüfte Software, nicht in freie Sprachgenerierung. Das moderne Muster verbindet beides: das LLM als flexible Sprach-/Entscheidungsschicht, spezialisierte Tools als deterministische Funktionen (Rechner, Datenbank, Suche, Code-Ausführung).

Open Weights, lokale LLMs, Datenschutz und Sicherheit

Viele „Open-Source-LLMs“ stellen vor allem Modellgewichte bereit. Zu unterscheiden sind Open Weights, offene Lizenz, veröffentlichter Trainingscode und veröffentlichte Trainingsdaten – „Open Weights“ ist nicht automatisch Open Source. Manche Modelle laufen lokal auf eigener Hardware (Kontrolle, Datenlokalität, Offline-Nutzung), was aber Hardware, Updates, Konfiguration und Zugriffsschutz erfordert – lokal ist nicht automatisch sicher. Quantisierung senkt Speicher- und Rechenbedarf, kann aber Qualität kosten (nicht pauschal „verlustfrei“).

Bei Datenschutz ist das Modell vom Cloudprodukt zu trennen: Anbieter, Tarif, Hosting, Speicherfristen und Trainingsverwendung unterscheiden sich – pauschale Aussagen wie „bezahlte LLMs trainieren nie mit Daten“ stimmen nicht. Bei LLM-Systemen mit Tools steigt zudem die Bedeutung von Prompt-Injection-Schutz, Zugriffskontrollen und Datenleck-Vermeidung. Details: Datenschutz.

Häufige Missverständnisse über LLMs

Mythen über Large Language Models
MissverständnisKlarstellung
„Ein LLM ist ChatGPT.“ChatGPT ist ein Produkt; das LLM ist das zugrunde liegende Modell.
„Alle LLMs arbeiten exakt gleich.“Nein – u. a. autoregressive, Diffusions- und State-Space-Ansätze.
„LLMs suchen Antworten in einer Datenbank.“Nein – sie erzeugen Text aus gelernten Mustern.
„LLMs durchsuchen automatisch das Internet.“Nur, wenn das Produkt Suche/Retrieval anbindet.
„Mehr Parameter = bessere Qualität.“Nein – Daten, Training und Post-Training zählen ebenso.
„Ein langer Chat trainiert das Modell.“Nein – Nutzung verändert die Parameter nicht.
„Reasoning garantiert richtige Antworten.“Nein – mehr Rechenzeit ist keine Wahrheitsgarantie.
„RAG verhindert Halluzinationen.“Nein – RAG reduziert sie, garantiert aber keine Richtigkeit.
„Open Weights = Open Source.“Nein – die Lizenz entscheidet.
„Jedes LLM erzeugt nur Token für Token.“Als pauschale Aussage 2026 nicht mehr korrekt.

Weiterführend: Generative KI, Tokens & Kontextfenster, Multimodale KI, RAG, Halluzinationen, KI-Modelle evaluieren und das Sprachmodell-Verzeichnis.

Quellen und weiterführende Informationen

  1. Vaswani et al. (arXiv): „Attention Is All You Need" – Transformer-Architektur (2017). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  2. Hoffmann et al. (DeepMind · arXiv): „Training Compute-Optimal Large Language Models" (Chinchilla) (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  3. Ouyang et al. (OpenAI · arXiv): „Training language models to follow instructions with human feedback" (InstructGPT/RLHF) (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  4. Rafailov et al. (arXiv): „Direct Preference Optimization" (DPO) (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  5. Fedus, Zoph, Shazeer (arXiv): „Switch Transformers" – Mixture of Experts (2021). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  6. Google DeepMind: Gemini Diffusion – experimentelles Text-Diffusionsmodell (Mai 2025). Anbieter-Dokumentation · abgerufen am 09.08.2026
  7. Google DeepMind: DiffusionGemma – diskrete Text-Diffusion (offene Gewichte) (Juni 2026). Anbieter-Dokumentation · abgerufen am 09.08.2026
  8. Gu & Dao (arXiv): „Mamba: Linear-Time Sequence Modeling with Selective State Spaces" (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  9. OpenAI: „Learning to reason with LLMs" – Reasoning / Test-Time-Compute (interne Gedankenkette nur zusammengefasst) (2024). Anbieter-Publikation · abgerufen am 09.08.2026
  10. Snell et al. (arXiv): „Scaling LLM Test-Time Compute Optimally…" (2024). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  11. Bommasani et al. (Stanford CRFM · arXiv): „On the Opportunities and Risks of Foundation Models" (2021). Forschungsbericht · abgerufen am 09.08.2026
  12. NIST: AI RMF: Generative AI Profile (NIST AI 600-1) – Risiken/Confabulation (2024). Behörde/Standard · abgerufen am 09.08.2026

Häufige Fragen

Was ist ein LLM einfach erklärt?

Ein großes neuronales Sprachmodell, das aus vielen Trainingsdaten Sprachmuster gelernt hat und daraus Text erzeugt oder verarbeitet.

Wofür steht LLM?

Für „Large Language Model“ – großes Sprachmodell.

Wie funktioniert ein Large Language Model?

Viele LLMs erzeugen Text autoregressiv: Sie berechnen für die nächste Position eine Wahrscheinlichkeitsverteilung über Tokens und wählen eines aus. Es gibt aber auch andere Verfahren wie Diffusions-Sprachmodelle.

Ist ChatGPT ein LLM?

ChatGPT ist ein Produkt, das auf einem oder mehreren LLMs basiert. Das LLM ist das Modell, ChatGPT die Anwendung darum herum.

Ist ein LLM dasselbe wie generative KI?

Nein. Ein LLM ist ein Teil der generativen KI. Generative KI umfasst auch Bild-, Audio- und Videomodelle.

Was ist der Unterschied zwischen einem LLM und einem Chatbot?

Das LLM ist das trainierte Modell; ein Chatbot ist eine Anwendung, die es mit Oberfläche, Verlauf, Tools und Regeln kombiniert.

Sind alle LLMs Transformer?

Die meisten aktuellen LLMs sind Transformer, aber nicht alle. Es gibt u. a. State-Space-Modelle und diffusionsbasierte Sprachmodelle.

Was sind Parameter bei einem LLM?

Im Training angepasste Zahlenwerte (Gewichte). Ihre Zahl ist ein grobes Größenmaß, aber kein alleiniger Qualitätsindikator.

Was bedeutet Mixture of Experts?

Eine Architektur, bei der je Token nur ausgewählte „Experten“ aktiviert werden. Dadurch ist die Gesamtparameterzahl oft viel größer als die aktiven Parameter je Token.

Wie wird ein LLM trainiert?

Zuerst Pretraining auf großen Datenmengen, dann Post-Training (z. B. Instruction Tuning, RLHF, DPO), das aus einem Base Model einen nutzbaren Assistenten macht.

Lernt ein LLM während eines Chats weiter?

Nein. Die Modellparameter ändern sich bei der Nutzung nicht. „Erinnerung“ entsteht über Kontext, Memory-Funktionen oder Retrieval.

Kann ein LLM auf das Internet zugreifen?

Nur, wenn das Produkt eine Websuche, einen Browser oder Retrieval anbindet. Das Modell selbst kennt nur sein Trainingswissen.

Warum halluzinieren LLMs?

Weil sie plausible Fortsetzungen erzeugen statt geprüfte Fakten abzurufen. Die Ursachen sind vielfältig; wichtige Aussagen daher prüfen.

Kann ein LLM lokal laufen?

Manche offene Modelle ja, je nach Hardware, Quantisierung und Modellgröße. Lokal ist aber nicht automatisch sicher.