Grundlagen
KI-Halluzinationen: Warum Modelle falsche oder unbelegte Antworten erzeugen
Eine KI-Halluzination ist eine Ausgabe, die überzeugend formuliert, aber sachlich falsch, erfunden oder nicht durch die vorliegenden Quellen gedeckt ist. Sie entsteht, weil Sprachmodelle wahrscheinliche Fortsetzungen aus gelernten Mustern erzeugen und übliche Bewertungsverfahren eher geratene Antworten belohnen als ein ehrliches „Ich weiß es nicht“. Vollständig verhindern lässt sich das bei offenen Aufgaben nach heutigem Stand nicht – mit angebundenen Quellen, klaren Prompts und konsequenter Prüfung sinkt das Risiko aber deutlich.
Was sind KI-Halluzinationen?
Von einer Halluzination spricht man, wenn ein KI-Modell Inhalte erzeugt, die zwar flüssig und überzeugend klingen, aber falsch, erfunden, nicht überprüfbar oder nicht durch die vorliegenden Quellen gedeckt sind. Die verbreitete Kurzformel „überzeugend, aber falsch“ greift dabei zu kurz: Eine Aussage muss nicht eindeutig „falsch“ sein, um zu halluzinieren – sie kann auch schlicht unbelegt oder einer falschen Quelle zugeschrieben sein.
Für die Praxis lohnt sich eine Unterscheidung, die in der Forschung üblich ist:
| Begriff | Entscheidende Frage |
|---|---|
| Faktizität (Factuality) | Stimmt die Aussage mit überprüfbaren Fakten der realen Welt überein? |
| Quellentreue (Faithfulness) | Ist die Aussage durch die dem Modell gegebenen Quellen bzw. den Kontext tatsächlich gedeckt? |
Beides fällt nicht zusammen: Fasst ein Modell ein PDF zusammen und ergänzt eine an sich wahre Information, die im PDF gar nicht steht, ist die Aussage faktisch korrekt, aber nicht quellentreu. Fachlich trennt man zusätzlich intrinsische Halluzinationen (die Ausgabe widerspricht der Quelle) von extrinsischen (die Ausgabe lässt sich aus der Quelle weder bestätigen noch widerlegen).
Ein Nutzer fragt nach einer wissenschaftlichen Studie. Das Modell liefert Autor, Titel, Zeitschrift und eine DOI – doch die Publikation existiert nicht. Besonders tückisch: Die Ausgabe sieht formal wie eine echte Quelle aus.
Halluzination oder ein anderer KI-Fehler?
Nicht jeder Fehler einer KI ist eine Halluzination. Die Begriffe werden in Forschung und Industrie uneinheitlich verwendet – die US-Behörde NIST spricht etwa bewusst von Confabulation, um die Vermenschlichung durch das Wort „Halluzination“ zu vermeiden. Hilfreich ist die Abgrenzung von benachbarten Fehlertypen:
| Fehlertyp | Abgrenzung zur Halluzination |
|---|---|
| Veraltetes Wissen | Die Antwort war einmal korrekt, ist aber nach dem Trainingsstichtag überholt – ein Aktualitätsproblem, keine Erfindung. |
| Rechen- oder Logikfehler | Falsche Ableitung aus vorhandenen Angaben, nicht frei erfundene Fakten. |
| Instruction-Following-Fehler | Die Anweisung wurde missverstanden oder ignoriert; die genannten Fakten können trotzdem stimmen. |
| Retrieval-/Suchfehler | Es wird ein falsches oder kein Dokument gefunden. Zur Halluzination wird es erst, wenn das Modell die Lücke mit Erfundenem füllt. |
| Prompt Injection | Manipulierte Eingaben steuern das Modell gezielt (siehe Prompt Injection). |
| Sycophancy (Gefälligkeit) | Das Modell bestätigt die Nutzermeinung, statt sachlich zu widersprechen. |
Warum Halluzinationen entstehen
Halluzinationen haben nicht eine einzige Ursache. Die Kurzfassung „ein Sprachmodell sagt nur wahrscheinliche Wörter voraus“ taugt als erster Einstieg, erklärt das Phänomen aber nicht vollständig. Zusammen wirken unter anderem:
- die probabilistische Texterzeugung – das Modell wählt plausible Fortsetzungen, keine geprüften Fakten;
- Wissenslücken sowie unvollständige, widersprüchliche oder fehlerhafte Trainingsdaten;
- veraltetes Wissen nach dem Trainingsstichtag;
- schlechte Unsicherheitskalibrierung – das Modell „weiß nicht, dass es etwas nicht weiß“;
- Optimierung auf hilfreiche, vollständige Antworten;
- Bewertungsverfahren, die Raten belohnen und das Zugeben von Unwissen bestrafen;
- mehrdeutige Prompts oder falsche Voraussetzungen in der Frage;
- widersprüchliche oder sehr lange, unübersichtliche Kontexte;
- Retrieval-Fehler und schlechte RAG-Quellen;
- Fehler bei Tool-/Function-Calling und in agentischen Abläufen.
Eine Arbeit von OpenAI-Forschenden (Kalai et al., 2025) beschreibt zwei Ebenen: Erstens entstehen Fehler bereits statistisch beim Training. Zweitens überleben sie, weil verbreitete Bewertungen vor allem die Trefferquote zählen – wer rät, kann punkten; wer „ich weiß es nicht“ antwortet, bekommt nichts. So wird selbstbewusstes Raten systematisch belohnt.
Formulierungen wie „die KI denkt sich etwas aus“ sind nur ein Bild. Das Modell verfolgt keine Absicht, sondern setzt gelernte Muster fort – deshalb der nüchternere NIST-Begriff Confabulation.
Arten von Halluzinationen
Eine einfache Typologie hilft, Halluzinationen schneller zu erkennen. Die folgenden Kategorien überschneiden sich teilweise und sind keine strenge wissenschaftliche Klassifikation, sondern eine praxistaugliche Orientierung.
| Typ | Was passiert | Beispiel | Woran erkennen |
|---|---|---|---|
| Erfundene Fakten | Eine falsche, aber plausible Tatsache | „90.000 Einwohner“ statt 250.000 | gegen Primärquelle prüfen |
| Erfundene Quellen & Zitate | Autor, Titel, Journal oder DOI existieren nicht | ein „Paper“ mit erfundener DOI | Quelle direkt öffnen und suchen |
| Falsche Zahlen & Daten | Werte oder Datumsangaben werden verändert | „+21 %“ statt „+12 %“ | gegen Originaldokument abgleichen |
| Falsche Quellenzuordnung | Aussage wird einer realen, aber unpassenden Quelle zugeschrieben | echte Studie, falsche Kernaussage | zitierte Stelle nachlesen |
| Kontext-/Treue-Fehler | Antwort ergänzt Inhalte, die nicht in der Vorlage stehen | Zusammenfassung erfindet ein Detail | Aussage im Ausgangstext suchen |
| Tool-/Code-Halluzination | erfundene Funktion, Bibliothek oder API | ein nicht existierender Parameter | Doku prüfen, Code testen |
| Multimodale Halluzination | beschreibt Bild-/Audioinhalt, der fehlt | „Person mit Brille“ – ohne Brille | Medium selbst ansehen |
Typische Beispiele
Die folgenden Fälle sind konstruierte Beispiele zur Veranschaulichung – keine dokumentierten Tests eines bestimmten Produkts.
Das erfundene Paper
Auf die Bitte um Forschung nennt das Modell Autor, Titel, Journal und DOI. Nichts davon existiert – gefährlich, weil es wie eine echte Quelle aussieht.
Die veränderte Zahl
Die Quelle sagt „Umsatz +12 %“, die Zusammenfassung macht daraus „+21 %“. Direkt gegen die Vorlage prüfbar.
Die falsche Voraussetzung
Gefragt wird nach einer Auszeichnung für ein Ereignis, das nie stattfand. Ein schwaches System übernimmt die Annahme und erfindet Details.
Die veraltete Auskunft
Gefragt nach aktuellem Preis, Version oder Gesetz antwortet ein Modell ohne Live-Quelle mit Trainingswissen. Veraltet ist nicht automatisch dasselbe wie Halluzination.
Der Coding-Fehler
Das Modell empfiehlt eine nicht existierende Bibliothek, eine erfundene Methode oder einen falschen API-Parameter.
Die scheinbar belegte RAG-Antwort
Das System hat echte Dokumente, die Antwort nennt sogar Quellen – nur stützt die zitierte Stelle die konkrete Behauptung nicht.
Warum sogar Quellen halluziniert werden
Viele einfache Ratgeber empfehlen: „Bitte die KI einfach um Quellen.“ Das genügt nicht. Ein Modell kann Quellen erfinden, URLs falsch zusammensetzen, echte Publikationen falsch zitieren oder eine reale Quelle mit einer falschen Aussage verbinden.
Prüfe nicht, ob eine KI eine Quelle nennt, sondern ob die Quelle existiert und die konkrete Aussage tatsächlich stützt. Eine Quellenangabe ist noch kein Beleg.
Wie ernst das ist, zeigt der juristische Bereich: In einer Studie der Stanford-Gruppe RegLab/HAI (2024) halluzinierten selbst spezialisierte, quellengestützte Recherchewerkzeuge in rund 17 bis 33 % der geprüften Fälle – deutlich seltener als allgemeine Chatbots, aber keineswegs „halluzinationsfrei“. Fehlerhafte oder falsch zugeordnete Belege waren dabei ein zentrales Muster.
RAG und Grounding: Hilfe, kein Wundermittel
Retrieval-Augmented Generation (RAG) und Grounding – also das Verankern von Antworten in konkreten Quellen – senken das Halluzinationsrisiko oft deutlich. Auch die Anbieter selbst formulieren ihr Ziel jedoch als „reduzieren“, nicht „ausschließen“. Typische Restfehler:
- die passende Quelle wird nicht gefunden;
- ein falsches Dokument landet im Kontext;
- die Quelle ist veraltet;
- nur ein unpassender Ausschnitt wird geliefert;
- das Modell interpretiert den Ausschnitt falsch;
- es ergänzt Wissen außerhalb der Quelle;
- ein Zitat wird der falschen Behauptung zugeordnet.
RAG verbessert also die Wahrscheinlichkeit belegter Antworten, ersetzt aber weder die Details der Umsetzung noch die Prüfung der Ausgabe.
Was Halluzinationen nicht zuverlässig verhindert
Rund um „Anti-Halluzinations-Tricks“ halten sich hartnäckige Mythen. Sie können im Einzelfall helfen, sind aber keine Garantie.
| Verbreiteter Ratschlag | Warum das nicht genügt |
|---|---|
| „Einfach zweimal fragen.“ | Wiederholte Übereinstimmung kann auf denselben systematischen Fehler zurückgehen – Übereinstimmung ist kein Faktenbeweis. |
| „Wenn zwei Modelle dasselbe sagen, stimmt es.“ | Ähnliche Trainingsdaten führen zu ähnlichen Fehlern. |
| „Eine selbstbewusste Antwort ist meist richtig.“ | Der sprachliche Ton ist von der Korrektheit entkoppelt; Modelle werden eher fürs Raten als fürs Zugeben von Unwissen belohnt. |
| „Temperature 0 verhindert Halluzinationen.“ | Weniger Zufall macht Ausgaben reproduzierbar, nicht wahr – auch ein falscher Satz kann stabil wiederkehren. |
| „Schritt-für-Schritt (Chain-of-Thought) löst es.“ | Hilft bei manchen Aufgaben, kann eine falsche Antwort aber auch nachträglich plausibel begründen. |
| „Eine URL oder DOI beweist die Aussage.“ | Links und DOIs lassen sich erfinden oder falsch zuordnen – nur das Öffnen der Quelle zählt. |
Was Nutzer dagegen tun können
- Aktuelle oder strittige Fakten aktiv recherchieren lassen und die Primärquelle selbst öffnen.
- Zahlen, Namen, Daten und Zitate gegen das Original abgleichen.
- Mehrere Behauptungen einzeln prüfen, statt die Antwort als Ganzes zu „glauben“.
- Ausdrücklich erlauben, dass die KI „nicht belegt“ oder „unbekannt“ antwortet.
- Wichtige Entscheidungen nie allein auf generierten Text stützen.
Bessere Prompts – als Hilfsmittel, nicht als Garantie
Gute Prompts können das Risiko senken, aber nicht beseitigen. Eine belastbare Anweisung lautet zum Beispiel:
„Beantworte die Frage ausschließlich anhand der bereitgestellten Quellen. Ist eine Aussage daraus nicht ableitbar, schreibe: ‚In den bereitgestellten Quellen nicht belegt.‘ Nenne für jede zentrale Tatsachenbehauptung die passende Quelle.“
Bausteine für solche Prompts liefert der Prompt-Builder.
Was Entwickler und Unternehmen tun können
Für Entwickler
- Antworten in Quellen verankern (Grounding/RAG) und Belege sichtbar ausgeben.
- Zitate maschinell prüfen (Citation Validation) und einzelne Behauptungen extrahieren.
- Berechnungen an Code oder einen Rechner, Fakten an Datenbanken bzw. APIs auslagern, statt schätzen zu lassen.
- Structured Outputs und – wo möglich – feste Antwortmengen erzwingen.
- Abstention und Unsicherheit zulassen und auswerten.
- Mit eigenen Evals und Monitoring gegen reale Testfälle messen.
Für Unternehmen
- Human-in-the-Loop und klare Freigabeprozesse für riskante Ausgaben.
- Risikoklassen je Anwendungsfall definieren (siehe Risikomanagement).
- Prompts und Modellversionen dokumentieren und versionieren.
- Stichproben, Evals und einen Korrektur- bzw. Incident-Prozess etablieren.
Risiko nach Anwendungsfall
Wie viel Prüfung nötig ist, hängt vom Einsatz ab. Die Einordnung ist eine Orientierung, keine exakte Messung – pseudogenaue Prozentwerte zur „Halluzinationswahrscheinlichkeit“ gibt es hier bewusst nicht.
| Anwendung | Risiko einer falschen Aussage | Notwendige Prüfung |
|---|---|---|
| Ideen sammeln / Brainstorming | niedrig | Plausibilität |
| Marketing-Entwurf | mittel | Namen, Zahlen, Links prüfen |
| Recherche | mittel bis hoch | Originalquellen öffnen |
| Produkt-/Preisdaten (öffentlich) | hoch bei Veröffentlichung | Herstellerquelle am Tag der Nutzung |
| Recht | sehr hoch | qualifizierte fachliche Prüfung |
| Medizin & Gesundheit | sehr hoch | qualifizierte fachliche Prüfung |
| Finanzen | sehr hoch | aktuelle Primärquellen + Fachprüfung |
| Code | je nach Einsatz | Tests, Linter, Laufzeitprüfung |
Der 60-Sekunden-Halluzinationscheck
- Welche Aussage lässt sich überhaupt objektiv überprüfen?
- Welche Originalquelle müsste sie belegen?
- Existiert diese Quelle wirklich?
- Steht die konkrete Behauptung tatsächlich dort?
- Ist die Quelle aktuell genug?
- Stimmen Zahlen, Namen, Daten und Zitate exakt?
- Braucht das Thema – etwa Recht, Medizin oder Finanzen – eine menschliche Fachprüfung?
Halluzinationen bei multimodaler KI
Nicht nur Textmodelle halluzinieren. Auch multimodale Modelle für Bild, Audio, Video oder Diagramme erzeugen Inhalte, die es so nicht gibt:
- Ein Modell beschreibt ein Objekt im Foto, das gar nicht vorhanden ist (sogenannte Object Hallucination).
- Es liest aus einem Diagramm einen Wert ab, der dort nicht dargestellt ist.
- Bei schlechter Texterkennung (OCR) ergänzt es plausible, aber falsche Wörter.
Die Forschung misst solche Fehler mit eigenen Prüfverfahren wie dem POPE-Benchmark. Konkrete Aussagen über einzelne aktuelle Modelle lassen sich ohne belastbaren, datierten Test jedoch nicht seriös treffen.
Können Halluzinationen ganz verschwinden?
Bei offenen, freien Aufgaben lässt sich das Halluzinationsrisiko nach heutigem Stand nicht generell auf null bringen. Eine theoretische Arbeit (Xu et al., 2024) argumentiert sogar, dass ein universell einsetzbares Sprachmodell dies grundsätzlich nicht vollständig vermeiden kann – als formales Argument mit klar begrenztem Modell, nicht als Messwert.
Bei eng begrenzten Aufgaben lässt sich Zuverlässigkeit dagegen stark erhöhen: über deterministische Werkzeuge, Datenbankabfragen, feste Regeln und validierte Structured Outputs. Wichtig bleibt die Unterscheidung: Ein guter Benchmark-Wert ist nicht dasselbe wie Verlässlichkeit in der offenen Praxis mit neuen, unerwarteten Eingaben.
Realistisches Fazit: Halluzinationen lassen sich für klar umrissene Aufgaben stark eindämmen und einhegen, für offene Generierung aber nicht garantiert auf null senken. Deshalb bleibt die Prüfung Teil des Prozesses – nicht die Ausnahme.
Weiterführend: Wie Sprachmodelle funktionieren, RAG, KI-Modelle evaluieren und der Workflow für KI-Recherche.
Quellen und weiterführende Informationen
- Kalai, Nachum, Vempala, Zhang (OpenAI · arXiv): „Why Language Models Hallucinate“ (Sept. 2025). Forschungspreprint · abgerufen am 09.08.2026
- OpenAI: „Why language models hallucinate“ (Blog) (Sept. 2025). Anbieter-Publikation · abgerufen am 09.08.2026
- Wei et al. (OpenAI · arXiv): „Measuring short-form factuality“ (SimpleQA) (Nov. 2024). Forschung/Benchmark · abgerufen am 09.08.2026
- NIST: AI Risk Management Framework: Generative AI Profile (NIST AI 600-1) – Begriff „Confabulation“ (Juli 2024). Behörde/Standard · abgerufen am 09.08.2026
- Anthropic: Claude Docs – „Reduce hallucinations“. Anbieter-Dokumentation · abgerufen am 09.08.2026
- Google: Gemini API – „Grounding with Google Search“. Anbieter-Dokumentation · abgerufen am 09.08.2026
- Ji et al. (ACM Computing Surveys · arXiv): „Survey of Hallucination in Natural Language Generation“ – Faithfulness vs. Factuality, intrinsisch/extrinsisch (2023). Wissenschaftliche Übersicht (Peer-Review) · abgerufen am 09.08.2026
- Huang et al. (arXiv): „A Survey on Hallucination in Large Language Models“ – Taxonomie (Nov. 2023). Wissenschaftliche Übersicht · abgerufen am 09.08.2026
- Magesh et al. (Stanford RegLab/HAI): „Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools“ – RAG-Werkzeuge, 17–33 % (2024/2025). Wissenschaftliche Studie · abgerufen am 09.08.2026
- Xu, Jain, Kankanhalli (arXiv): „Hallucination is Inevitable: An Innate Limitation of Large Language Models“ (Jan. 2024). Forschungspreprint · abgerufen am 09.08.2026
- Farquhar et al. (Nature): „Detecting hallucinations in large language models using semantic entropy“ (Juni 2024). Wissenschaftliche Publikation · abgerufen am 09.08.2026
- Li et al. (arXiv): „Evaluating Object Hallucination in Large Vision-Language Models“ (POPE) (Mai 2023). Forschung/Benchmark · abgerufen am 09.08.2026
Häufige Fragen
Was sind Halluzinationen bei KI?
Überzeugend formulierte KI-Ausgaben, die falsch, erfunden oder nicht durch die vorliegenden Quellen gedeckt sind – von falschen Zahlen über erfundene Zitate bis zu Aussagen, die nicht im Ausgangstext stehen.
Warum erfinden Sprachmodelle Fakten?
Weil sie wahrscheinliche Fortsetzungen aus gelernten Mustern erzeugen statt geprüfte Fakten abzurufen – und weil verbreitete Bewertungen eher Raten belohnen als das Zugeben von Unwissen. Dazu kommen Wissenslücken, veraltete Daten und Retrieval-Fehler.
Halluziniert KI absichtlich?
Nein. Ein Modell verfolgt keine Absicht, sondern setzt Muster fort. Formulierungen wie „die KI lügt“ sind irreführend; NIST spricht neutral von Confabulation.
Kann ein Sprachmodell Quellen erfinden?
Ja. Modelle können Autoren, Titel, URLs und DOIs erfinden oder echte Quellen falsch zitieren. Entscheidend ist nicht, ob eine Quelle genannt wird, sondern ob sie existiert und die konkrete Aussage stützt.
Verhindert RAG Halluzinationen?
RAG und Grounding reduzieren das Risiko deutlich, schließen Halluzinationen aber nicht aus. Fehler entstehen weiter, wenn falsche Ausschnitte abgerufen, Quellen falsch interpretiert oder Zitate falsch zugeordnet werden.
Hilft ein besserer Prompt?
Ein klarer Prompt – etwa mit der Vorgabe, nur belegte Aussagen zu treffen und sonst „nicht belegt“ zu schreiben – senkt das Risiko, ist aber keine Wahrheitsgarantie.
Verhindert Temperature 0 Halluzinationen?
Nein. Eine niedrige Temperatur macht Antworten reproduzierbarer, nicht wahrer. Auch eine falsche Aussage kann bei Temperature 0 stabil wiederkehren.
Woran erkenne ich eine halluzinierte Quelle?
Öffne die Quelle direkt und prüfe, ob Autor, Titel und DOI existieren und ob die zitierte Stelle die Behauptung tatsächlich enthält. Eine plausible URL oder DOI ist kein Beleg.
Halluzinieren auch Bild- und Multimodalmodelle?
Ja. Sie können Objekte beschreiben, die im Bild fehlen, Werte aus Diagrammen falsch ablesen oder bei schlechter OCR falsche Wörter ergänzen.