KI verstehen
Was ist generative KI? Funktionsweise, Beispiele und Grenzen
Generative KI bezeichnet KI-Modelle und darauf aufbauende Systeme, die aus gelernten Mustern neue Ausgaben wie Text, Bilder, Audio, Video oder Programmcode erzeugen. Dazu gehören unter anderem Sprach-, Bild- und multimodale Modelle. „Neu“ heißt dabei nicht unabhängig von den Trainingsdaten: Die Ergebnisse beruhen auf gelernten statistischen Strukturen. Sie können sehr überzeugend sein, sind aber nicht automatisch faktisch richtig, rechtlich unproblematisch oder für jeden Zweck geeignet.
Was ist generative KI?
Generative KI bezeichnet KI-Modelle und darauf aufbauende Systeme, die gelernte Strukturen und Muster nutzen, um neue Ausgaben zu erzeugen – Text, Programmcode, Bilder, Audio, Sprache, Video und weitere Datenformen. Die US-Behörde NIST beschreibt generative KI als Modellklasse, die die Struktur und Eigenschaften ihrer Eingabedaten nachbildet, um daraus abgeleitete synthetische Inhalte zu erzeugen.
„Neu“ bedeutet dabei nicht zwangsläufig neuartig oder unabhängig von den Trainingsdaten. Generative Modelle erzeugen Ausgaben auf Grundlage gelernter statistischer Zusammenhänge. Ebenso irreführend sind pauschale Gegenaussagen wie „die KI kopiert einfach ihre Trainingsdaten“ oder „sie kombiniert nur Vorhandenes“ – beides trifft den Kern nicht.
Traditionell unterscheidet das maschinelle Lernen unter anderem generative und diskriminative Ansätze: Ein diskriminatives Modell lernt, Eingaben einzuordnen (welche Klasse?), ein generatives Modell lernt die Datenstruktur so weit, dass es neue Beispiele erzeugen kann. Moderne Foundation Models verwischen diese Grenze in der Anwendung: Dasselbe Modell kann Text erzeugen, Informationen extrahieren, Inhalte klassifizieren oder Bilder analysieren. Eine Klassifikationsaufgabe macht ein generatives Modell also nicht automatisch zu einem klassischen diskriminativen Modell.
Wie funktioniert generative KI?
Stark vereinfacht durchläuft generative KI zwei getrennte Phasen: das einmalige Training und die vielfache Nutzung (Inferenz).
Training und Inferenz unterscheiden
Viele Einsteiger verwechseln beides. Der Unterschied ist zentral:
- Training: Aus großen Datenmengen werden die Modellparameter angepasst. Trainingsziel, Architektur, Daten und Optimierung unterscheiden sich je Modell.
- Post-Training: Je nach System folgen weitere Schritte wie Instruction Tuning, Fine-Tuning, Präferenzoptimierung oder Sicherheitsanpassungen.
- Inferenz: Gibt eine Nutzerin einen Prompt ein, wird das Modell in der Regel nicht neu trainiert. Es nutzt die bereits gelernten Parameter, den aktuellen Kontext und gegebenenfalls angebundene externe Informationen oder Werkzeuge, um eine Ausgabe zu erzeugen.
Nicht alle generativen Modelle funktionieren gleich
Ein verbreiteter Fehler ist die Aussage, generative KI funktioniere immer, indem „das nächste Wort“ vorhergesagt wird. Das trifft auf viele autoregressive Sprachmodelle zu, gilt aber nicht universell. Wichtig ist außerdem: Tokens sind nicht dasselbe wie Wörter, und über Sampling sind mehrere plausible Fortsetzungen möglich.
| Architektur | Grundidee (vereinfacht) | Typisch für |
|---|---|---|
| Transformer / autoregressiv | Verarbeitet Tokens mit Selbstaufmerksamkeit und erzeugt Sequenzen Schritt für Schritt auf Basis bedingter Wahrscheinlichkeiten | viele Sprachmodelle |
| Diffusionsmodelle | Lernen, schrittweise aus verrauschten Repräsentationen strukturierte Ausgaben zu erzeugen | Bild, Video, Audio |
| GANs | Generator und Diskriminator trainieren gegeneinander, bis Ausgaben echt wirken | historisch wichtig für Bildsynthese |
| Variational Autoencoders (VAE) | Encoder verdichtet Eingaben in einen latenten Raum, Decoder erzeugt daraus neue Beispiele | Grundlagen, Bausteine größerer Systeme |
Auch bei Sprache ist nicht alles autoregressiv: diskrete Diffusionsmodelle für Text sind ein aktives Forschungs- und Entwicklungsfeld (Stand 2026). Begriffe wie Flow Matching oder Diffusion Transformer bezeichnen weitere aktuelle Verfahren. Für die Praxis genügt: Es gibt mehrere Wege, Inhalte zu generieren – „Transformer“ ist eine Architektur, „generative KI“ eine Funktionskategorie, und beide sind nicht dasselbe.
Generative KI ist ein Oberbegriff – nicht „ChatGPT“
Viele Begriffe werden vermischt. Diese Übersicht trennt sie:
| Begriff | Bedeutung | Beispielhafte Rolle |
|---|---|---|
| Künstliche Intelligenz (KI) | Oberbegriff für Verfahren, die Aufgaben lösen, die üblicherweise Intelligenz erfordern | das gesamte Feld |
| Maschinelles Lernen (ML) | Teilbereich der KI: Modelle lernen Muster aus Daten | Grundprinzip moderner KI |
| Deep Learning | ML mit tiefen neuronalen Netzen | Basis heutiger großer Modelle |
| Generative KI | Modelle/Systeme, die neue Ausgaben erzeugen | Text-, Bild-, Audio-, Videoerzeugung |
| Large Language Model (LLM) | Auf Sprache bzw. Token-Sequenzen spezialisiertes, meist generatives Modell | Basis vieler Chatassistenten |
| Foundation Model | Breit vortrainiertes, für viele Aufgaben anpassbares Modell | Fachbegriff – nicht jedes ist generativ |
| GPAI (General-Purpose AI Model) | Eigene Rechtskategorie des EU AI Act | regulatorisch, nicht = generative KI |
| Chatbot / KI-Assistent | Anwendung bzw. Oberfläche über einem Modell | Produkt, nicht das Modell selbst |
| Multimodale KI | Verarbeitet oder verbindet mehrere Modalitäten | multimodal ≠ automatisch generativ |
| KI-Agent | System aus Modell plus Zielen, Werkzeugen, Zuständen und Aktionen | mehr als „ein anderes Wort für LLM“ (KI-Agenten) |
| RAG | Verbindet externe Informationen mit der Generierung | Methode, kein eigener Modelltyp (RAG) |
| AGI | Konzept einer allgemeinen künstlichen Intelligenz | nicht gleichzusetzen mit heutiger generativer KI |
Ein Foundation Model ist breit vortrainiert und anpassbar; viele generative Systeme basieren darauf, aber die Begriffe sind nicht synonym. Der Rechtsbegriff GPAI des EU AI Act hat wiederum eine eigene Definition und darf nicht einfach mit „Foundation Model“ oder „generative KI“ gleichgesetzt werden (siehe EU AI Act).
Was kann generative KI erzeugen?
| Modalität | Typische Ausgabe | Typische Aufgaben | Vertiefung |
|---|---|---|---|
| Text & Code | Fließtext, Zusammenfassungen, Programmcode | Schreiben, Zusammenfassen, Übersetzen, Coding | Sprachmodelle |
| Bild | Illustrationen, Konzeptbilder | Entwürfe, Varianten | Bildmodelle |
| Audio | synthetische Sprache, Musik, Klänge | Sprachsynthese, Musik-/Soundgenerierung | Audiomodelle |
| Video | kurze Clips | Bewegtbild aus Text oder Bild | Videomodelle |
| Strukturierte Daten | z. B. JSON nach Vorgabe | unstrukturierte Inhalte in ein Format bringen | Datenanalyse |
Eingabe- und Ausgabemodalität getrennt betrachten: Ein Modell kann Bild und Text als Eingabe verarbeiten und trotzdem nur Text ausgeben. „Multimodal“ sollte deshalb immer mit Richtung gedacht werden. Ein wichtiger Sonderfall ist Audio: Transkription (Speech-to-Text) ist primär eine Erkennungsaufgabe, keine typische Inhaltserzeugung. Generative Audiobeispiele sind Sprachsynthese, Musik- und Klanggenerierung oder Stimmumwandlung.
Konkrete Beispiel-Prompts und was der Mensch jeweils prüfen sollte:
Text
„Fasse diesen Bericht in fünf Punkten zusammen.“ → Entwurf. Prüfen: Fakten, Zahlen, Auslassungen.
Bild
„Erstelle eine sachliche Illustration eines Solarmoduls auf einem Einfamilienhaus.“ → Bild. Prüfen: Eignung, Rechte, Darstellung.
Code
„Schreibe eine JavaScript-Funktion, die doppelte Array-Einträge entfernt.“ → Code. Prüfen: Tests, Randfälle, Sicherheit.
Audio
„Erzeuge aus diesem freigegebenen Text eine neutrale Sprachaufnahme.“ → Sprachsynthese. Prüfen: Einwilligung, Stimmrechte.
Video
„Erzeuge aus diesem Storyboard einen kurzen Clip.“ → Clip. Prüfen: Konsistenz, Rechte, Kennzeichnung.
Daten
„Wandle diese Produktbeschreibungen in dieses JSON-Format um.“ → strukturierte Daten. Prüfen: Schema, Vollständigkeit.
Wann generative KI sinnvoll ist – und wann klassische Software besser
Generative KI ist nicht automatisch die beste Lösung. Sie eignet sich besonders, wenn mehrere plausible Ausgaben möglich sind, Sprache oder unstrukturierte Daten verarbeitet werden, Entwürfe oder Varianten gebraucht werden oder natürliche Sprache als Schnittstelle dient.
Klassische, deterministische Software ist oft die bessere Wahl, wenn exakte Berechnungen, feste Geschäftsregeln, reproduzierbare Ergebnisse, eine eindeutige Datenbankantwort oder sicherheitskritische Logik gefragt sind – dort zählt Validierung mehr als sprachliche Flexibilität.
Für eine Aufgabe wie „17,5 % von 48.932,17 €“ ist ein Taschenrechner oder Code zuverlässiger als freie Sprachgenerierung. Gute Systeme lagern solche Schritte deshalb an Werkzeuge aus.
Modell, Produkt und Werkzeuge – und wo RAG hineinpasst
Eine Fähigkeit eines Produkts darf nicht automatisch dem Modell zugeschrieben werden. Ein typischer Aufbau ist: Nutzer → Anwendung → Modell → optionale Werkzeuge/Datenquellen → Antwort. Eine Anwendung kann zusätzlich Websuche, Dateiupload, Datenbank, Code-Interpreter, Taschenrechner, RAG, externe APIs, MCP oder Agentenfunktionen enthalten.
RAG kurz eingeordnet
Retrieval-Augmented Generation verändert nicht die trainierten Parameter. Es stellt zur Anfrage passende externe Informationen bereit, die in die Generierung einfließen. Das kann Aktualität und Belegbarkeit verbessern, ist aber keine Garantie für richtige Antworten.
Grenzen und Halluzinationen
Eine sprachlich überzeugende Ausgabe ist kein Beweis dafür, dass die enthaltenen Tatsachen korrekt sind. Generative Modelle erzeugen plausible Inhalte, keine geprüften Fakten.
Generative Modelle können falsche Tatsachen erzeugen, Quellen erfinden, Zahlen verwechseln, Kontext falsch interpretieren oder Unbelegtes überzeugend formulieren – ausführlich im Artikel zu KI-Halluzinationen. Die wichtigsten Risiken im Überblick:
| Risiko | Beispiel | Gegenmaßnahme |
|---|---|---|
| Halluzinationen | erfundene Quelle oder falsche Zahl | Primärquellen prüfen, Grounding |
| Bias / Verzerrung | einseitige oder stereotype Ausgaben | kritische Prüfung, vielfältige Tests |
| Datenschutz | vertrauliche Eingaben verlassen den Rechner | Datenverarbeitung prüfen, ggf. lokal |
| Urheber-/Persönlichkeitsrechte | Rechte Dritter an Ausgangs- oder Ausgabematerial | Rechte und Nutzungsbedingungen klären |
| Deepfakes / Missbrauch | täuschend echte, manipulierte Inhalte | Kennzeichnung, Herkunftsnachweise |
| Prompt Injection | manipulierte Inhalte steuern angebundene Systeme | Eingaben absichern |
| Übermäßiges Vertrauen | ungeprüfte Übernahme von Ausgaben | menschliche Kontrolle je nach Risiko |
Datenschutz: Welche Daten nicht eingeben?
Statt „keine sensiblen Daten in Cloud-Tools“ pauschal zu sagen, hilft eine Prüfung vor der Eingabe vertraulicher oder personenbezogener Informationen:
- Welcher Anbieter, welches Produkt, welche Tarifstufe?
- Welche Datenschutzbedingungen und Speicherfristen gelten?
- Können Eingaben zum Training verwendet werden?
- Wo werden Daten verarbeitet, welche administrativen Kontrollen bestehen?
- Gibt es eine passende Vereinbarung zur Auftragsverarbeitung (AVV)?
Lokale KI ist oft die datensparsamere Alternative – aber nicht automatisch „sicher“. Auch lokale Systeme brauchen Updates, Zugriffsschutz, sichere Konfiguration und geeignete Modelle. Details im Bereich Datenschutz.
Urheberrecht und Rechte Dritter
Ob KI-Ergebnisse – etwa Bilder – kommerziell genutzt werden dürfen, ergibt sich nicht allein aus den Trainingsdaten. Zu prüfen sind unter anderem die Nutzungsbedingungen des Anbieters, Rechte an Ausgangsmaterial, mögliche Rechte Dritter, Marken, Persönlichkeitsrechte, die konkrete Ausgestaltung der Ausgabe, das geltende Recht und die Anforderungen des jeweiligen Einsatzes.
Die Inhalte dienen der allgemeinen Information und ersetzen keine individuelle Rechtsberatung.
Vertiefung im Bereich Recht und speziell zum Urheberrecht.
EU AI Act und Kennzeichnung
Seit dem 2. August 2026 gelten die Transparenzpflichten nach Artikel 50 der KI-Verordnung (Verordnung (EU) 2024/1689). Vereinfacht und auf hoher Ebene:
- Anbieter müssen dafür sorgen, dass KI-generierte oder -manipulierte Audio-, Bild-, Video- und Textinhalte maschinenlesbar als künstlich erzeugt markiert werden; interaktive Systeme (Chatbots) müssen erkennbar machen, dass man mit einer KI kommuniziert.
- Betreiber müssen Deepfakes offenlegen und KI-erzeugte Texte zu Angelegenheiten von öffentlichem Interesse kennzeichnen.
Es gibt jedoch Ausnahmen – etwa für rein unterstützende oder geringfügige Bearbeitungsfunktionen, für künstlerische, satirische oder fiktionale Werke und für Texte, die unter menschlicher redaktioneller Verantwortung geprüft werden. Die pauschale Aussage, seit August 2026 müsse jeder KI-generierte Text gekennzeichnet werden, ist deshalb falsch. Die EU-Kommission hat dazu Leitlinien und einen freiwilligen Verhaltenskodex zur Transparenz veröffentlicht.
Begriffe nicht gleichsetzen: „Generative KI“ ist ein technischer Oberbegriff, „Foundation Model“ ein Fachbegriff der Forschung und „GPAI“ eine eigene Rechtskategorie der KI-Verordnung mit eigener Definition und eigenen Pflichten (u. a. seit 2. August 2025). Sie überschneiden sich, sind aber nicht deckungsgleich.
Die Inhalte dieses Abschnitts dienen der allgemeinen Information und ersetzen keine individuelle Rechtsberatung. Maßgeblich sind die offiziellen EU-Quellen zum jeweils aktuellen Stand.
Vertiefung: EU AI Act, KI-Kennzeichnung und Deepfakes.
Häufige Missverständnisse
| Missverständnis | Klarstellung |
|---|---|
| „Generative KI weiß alles aus ihren Trainingsdaten.“ | Sie speichert kein durchsuchbares Faktenarchiv, sondern gelernte Muster. |
| „Generative KI sucht ihre Antwort im Internet.“ | Nur, wenn das konkrete System eine Suche bzw. Retrieval nutzt. |
| „ChatGPT ist die generative KI.“ | ChatGPT ist ein Produkt; generative KI ist der Oberbegriff. |
| „Jedes LLM ist ein Chatbot.“ | Nein – ein LLM ist das Modell, der Chatbot das Produkt darum herum. |
| „Alle generativen Modelle funktionieren gleich.“ | Nein – u. a. autoregressive, Diffusions-, GAN- und VAE-Ansätze. |
| „Generative KI kopiert nur.“ | Zu pauschal; sie erzeugt aus gelernten Strukturen, kopiert aber nicht einfach. |
| „Generierte Inhalte sind automatisch frei nutzbar.“ | Nein – Rechte und Nutzungsbedingungen sind zu prüfen. |
| „Selbstbewusste Antworten sind richtig.“ | Ton ist von Korrektheit entkoppelt. |
| „RAG macht KI fehlerfrei.“ | RAG reduziert Fehler, garantiert aber keine Richtigkeit. |
| „Multimodal heißt, jede Modalität kann ausgegeben werden.“ | Eingabe- und Ausgabemodalität sind getrennt. |
So nutzt du generative KI sinnvoll
- Aufgabe definieren: Was genau soll erzeugt werden?
- Passendes Tool/Modell wählen: nicht jedes Modell passt zu jeder Aufgabe.
- Kontext bereitstellen: nur notwendige und zulässige Daten.
- Ausgabe erzeugen: klare Anforderungen und Format vorgeben.
- Ergebnis prüfen: Fakten, Zahlen, Code, Quellen und Rechte kontrollieren.
- Überarbeiten: KI-Ausgaben sind Entwürfe, keine fertigen Endprodukte.
- Verantwortlich einsetzen: je nach Risikostufe menschliche Kontrolle einbauen.
Passendes KI-Tool finden
Aufgabenbasiert zum geeigneten Werkzeug.
Tool-Finder →WerkzeugKI-Modelle vergleichen
Passende Modellklasse statt Rangliste.
Modell-Finder →WerkzeugPrompt-Builder
Bessere Anweisungen formulieren.
Öffnen →Weiterführend: Was ist KI?, Large Language Models, Multimodale KI, Halluzinationen, Open-Source-KI und die Verzeichnisse KI-Modelle und KI-Tools.
Quellen und weiterführende Informationen
- NIST: AI Risk Management Framework: Generative AI Profile (NIST AI 600-1) – Definition & „Confabulation“ (Juli 2024). Behörde/Standard · abgerufen am 09.08.2026
- Bommasani et al. (Stanford CRFM · arXiv): „On the Opportunities and Risks of Foundation Models“ – Begriff Foundation Model (2021). Forschungsbericht · abgerufen am 09.08.2026
- Vaswani et al. (arXiv): „Attention Is All You Need“ – Transformer-Architektur (2017). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Goodfellow et al. (arXiv): „Generative Adversarial Nets“ – GANs (2014). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Kingma & Welling (arXiv): „Auto-Encoding Variational Bayes“ – VAE (2013). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Ho, Jain, Abbeel (arXiv): „Denoising Diffusion Probabilistic Models“ – Diffusionsmodelle (2020). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Rombach et al. (arXiv): „High-Resolution Image Synthesis with Latent Diffusion Models“ (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Li et al. (arXiv): „Diffusion-LM Improves Controllable Text Generation“ – Diffusion für Text (2022). Forschung · abgerufen am 09.08.2026
- Europäische Union (EUR-Lex): Verordnung (EU) 2024/1689 (KI-Verordnung / AI Act) (2024). EU-Rechtsakt · abgerufen am 09.08.2026
- Europäische Kommission: Transparenzpflichten nach Artikel 50 AI Act (FAQ) (2026). EU-Institution · abgerufen am 09.08.2026
- Europäische Kommission: Leitlinien zu Transparenzpflichten bei KI-generierten Inhalten (2026). EU-Institution · abgerufen am 09.08.2026
- Europäische Kommission: General-Purpose AI Code of Practice (Juli 2025). EU-Institution · abgerufen am 09.08.2026
Häufige Fragen
Was ist generative KI einfach erklärt?
KI-Modelle, die aus gelernten Mustern neue Inhalte wie Text, Bilder, Audio, Video oder Code erzeugen – statt Eingaben nur einzuordnen.
Was ist ein Beispiel für generative KI?
Ein Sprachmodell, das einen Text zusammenfasst, ein Bildmodell, das aus einem Prompt eine Illustration erstellt, oder ein Modell, das aus Text Sprache erzeugt.
Ist ChatGPT generative KI?
ChatGPT ist ein Produkt, das auf generativer KI (einem Sprachmodell) basiert. Generative KI ist der Oberbegriff, ChatGPT nur ein Beispiel.
Ist jedes Sprachmodell generative KI?
Sprachmodelle, die Text erzeugen, sind generative KI. Generative KI umfasst darüber hinaus Bild-, Audio-, Video- und multimodale Modelle.
Was ist der Unterschied zwischen KI und generativer KI?
KI ist der Oberbegriff für viele Verfahren. Generative KI ist der Teil, der neue Ausgaben erzeugt – nicht jede KI ist generativ.
Wie funktioniert generative KI?
Im Training werden Modellparameter aus großen Datenmengen gelernt. Bei der Nutzung (Inferenz) erzeugt das Modell aus Prompt und Kontext eine Ausgabe, ohne neu zu trainieren.
Woher bekommt generative KI ihr Wissen?
Aus den im Training gelernten Mustern – nicht aus einem durchsuchbaren Faktenspeicher. Aktuelle Fakten braucht sie über angebundene Quellen (Suche/RAG).
Sucht generative KI im Internet?
Nur, wenn das konkrete Produkt eine Websuche oder Retrieval nutzt. Ohne solche Anbindung greift das Modell auf Trainingswissen zurück.
Was ist der Unterschied zwischen generativer und multimodaler KI?
Generativ beschreibt, dass neue Inhalte erzeugt werden. Multimodal beschreibt, dass mehrere Datenarten verarbeitet werden. Beides ist nicht dasselbe.
Können generative KI-Systeme falsche Informationen erzeugen?
Ja. Sie erzeugen plausible, aber nicht automatisch korrekte Ausgaben (Halluzinationen). Wichtige Aussagen immer prüfen.
Muss KI-generierter Inhalt gekennzeichnet werden?
Seit dem 2. August 2026 gelten Transparenzpflichten nach Artikel 50 des EU AI Act – mit Ausnahmen. Nicht jeder Text muss pauschal gekennzeichnet werden; maßgeblich ist der Einzelfall.
Welche Daten sollte ich nicht in KI-Tools eingeben?
Vertrauliche oder personenbezogene Daten nur nach Prüfung von Anbieter, Tarif, Datenschutzbedingungen und Trainingsnutzung – im Zweifel lokale KI erwägen.