Grundlagen

Was ist multimodale KI? Text, Bild, Audio und Video gemeinsam verstehen

Multimodale KI verarbeitet, verbindet oder erzeugt Informationen über mehr als eine Modalität wie Text, Bild, Audio oder Video. Ein multimodales System kann etwa ein Diagramm zusammen mit einer Textfrage auswerten, Sprache und Bildinformationen kombinieren oder aus verschiedenen Eingaben eine Antwort ableiten. Welche Modalitäten tatsächlich unterstützt werden, hängt vom konkreten Modell und Produkt ab – und die Eingabemodalitäten sind nicht dasselbe wie die Ausgabemodalitäten.

Was bedeutet „multimodal“?

Eine Modalität ist eine Form beziehungsweise ein Kanal, in dem Informationen dargestellt oder wahrgenommen werden. Typische KI-Modalitäten sind Text, Bild, Audio, Sprache und Video; in der Forschung kommen auch Tiefen-, Wärme-, Sensor-, Bewegungs- oder 3D-Daten vor. Multimodale KI verbindet mehr als eine dieser Modalitäten für eine Aufgabe.

Kurz erklärt: Modalität ≠ Dateiformat

Eine Modalität ist nicht dasselbe wie ein Dateiformat. JPEG und PNG sind zwei Formate, repräsentieren aber beide die Modalität Bild. MP3 und WAV sind Formate für Audio. Ein PDF ist ein Containerformat und kann mehrere Modalitäten gleichzeitig enthalten: Text, Bilder, Diagramme und Tabellen.

Input- und Output-Modalitäten trennen

Die wichtigste Unterscheidung: Was geht hinein, was kommt heraus? Ein Modell kann Text, Bilder, Audio und Video als Eingabe verstehen und trotzdem nur Text ausgeben. Falsch sind daher Aussagen wie „ein Modell ist erst multimodal, wenn es Bilder erzeugen kann“.

Eingabe- und Ausgabemodalitäten
EingabeAusgabeAufgabeEinordnung
Bild + TextTextFoto/Grafik beschreiben, visuelle Fragemultimodaler Input, Text-Output
Video + FrageTextVideoinhalt zusammenfassenmultimodaler Input, Text-Output
Audio + TextTextein Gespräch auswertenmultimodaler Input, Text-Output
TextBildIllustration erzeugencross-modale Generierung
Bild + TextBildBild bearbeiten / Variantemultimodaler Input, Bild-Output
TextAudioSprachsynthesecross-modale Generierung
Text / BildVideokurzen Clip erzeugencross-modale Generierung
Merksatz

Multimodal beschreibt nicht automatisch die Ausgabe. Ein System kann viele Modalitäten als Input verstehen und trotzdem ausschließlich Text ausgeben – und eine Text-zu-Bild-Anwendung verbindet zwei Modalitäten, ohne deshalb Bild und Audio analysieren zu können.

Multimodal, cross-modal, generativ und LLM

Multimodale Verarbeitung nutzt mehrere Modalitäten gemeinsam für eine Aufgabe (Bild + Textfrage → Textantwort). Cross-modale Verarbeitung überträgt Information von einer Modalität in eine andere (Text → Bild, Audio → Text). Die Begriffe sind in Forschung und Industrie nicht überall einheitlich – entscheidend bleibt: welche Modalität kommt hinein, welche kommt heraus?

Multimodal ist nicht dasselbe wie generativ: „multimodal“ sagt, welche Informationsformen verbunden werden, „generativ“, dass neue Ausgaben erzeugt werden. Ein Modell kann Bild und Text für eine Klassifikation verbinden (multimodal, aber nicht zwingend frei generierend); ein reines Textmodell kann generativ sein, ohne multimodal zu sein.

Multimodale KI ist breiter als ein multimodales LLM: Dazu gehören auch Vision-Language-Modelle, multimodale Embedding-Modelle, Audio- und Video-Systeme sowie Robotikmodelle. Gängige Begriffe:

Begriffe rund um multimodale KI
BegriffTypische BedeutungNicht automatisch
VLM (Vision-Language Model)verknüpft visuelle Informationen mit Spracheein großes LLM
MLLM (Multimodal Large Language Model)sprachbasiertes System, das weitere Modalitäten integrierteinheitlich definiert (auch „LVLM“ genannt)
Multimodal Foundation Modelbreit vortrainiert, mehrere Modalitäten, anpassbarzwingend generativ
Multimodales KI-Systemkombiniert ggf. mehrere spezialisierte Modelleein einzelnes Modell

Wie „versteht“ ein Modell ein Bild?

Ein Bild wird nicht wie mit einem menschlichen Auge „gesehen“. „Verstehen“ heißt hier: aus numerischen Repräsentationen der Bild-, Audio- oder Videodaten für eine Aufgabe passende Ausgaben ableiten – ohne Wahrnehmung, Bewusstsein oder Sinne im menschlichen Sinn. Ein häufiges (aber nicht das einzige) Muster:

Beispielhafte multimodale Verarbeitung Bild geht in einen Vision-Encoder, Audio in einen Audio-Encoder, Text wird zu einer Textrepräsentation. Alle drei werden über eine Brücke zusammengeführt und in einer gemeinsamen Verarbeitung genutzt, aus der eine Antwort entsteht. Reale Modelle können anders aufgebaut sein. Bild Text Audio Vision-Encoder Textrepräsentation Audio-Encoder gemeinsameVerarbeitung Antwort
Beispielhafte Architektur – reale Modelle können anders aufgebaut sein.

Wie die Modalitäten zusammengeführt werden, unterscheidet sich je Modell: über einen gemeinsamen Repräsentationsraum (Bild und Text landen als ähnliche Vektoren nah beieinander – Grundlage von Text-zu-Bild-Suche und Cross-Modal Retrieval, siehe Embeddings), über Adapter/Projektionen, über Cross-Attention oder über stärker vereinheitlichte Repräsentationen. Es gibt nicht die eine Architektur für multimodale KI.

Auch die Repräsentation je Modalität ist unterschiedlich: Text wird in Tokens zerlegt; Bilder je nach Architektur über Bild-Patches, Encoder-Repräsentationen oder diskrete visuelle Tokens; Audio über Frames, Spektralbilder oder Audio-Encoder; Video über Frames, zeitliche Merkmale und Tonspur. Nicht jedes Modell macht das gleich – „alles wird tokenisiert“ ist zu pauschal.

Modell, System oder Produkt?

Viele Nutzer sehen nur die Oberfläche. Ein Produkt kann Audio aufnehmen, es per Speech-to-Text transkribieren, den Text durch ein Sprachmodell verarbeiten und die Antwort per Text-to-Speech vorlesen. Für die Nutzerin wirkt das wie eine multimodale KI – technisch können mehrere Modelle beteiligt sein. Daneben gibt es Modelle, die mehrere Modalitäten enger in derselben Architektur verarbeiten. Drei Ebenen helfen:

  • Produkt: die Anwendung, die man bedient.
  • KI-System: Orchestrierung aus Modellen, Tools, Datenquellen und Software.
  • Modell: das eigentliche trainierte Machine-Learning-Modell.
Produkt ≠ Modell

Aus einer Produktfunktion nicht auf die Modellarchitektur schließen. Begriffe wie „nativ multimodal“, „omni“ oder „any-to-any“ sind überwiegend Anbieter-Bezeichnungen ohne einheitliche wissenschaftliche Definition – im Zweifel die offizielle Model Card prüfen: Welche Eingaben, welche Ausgaben sind wirklich belegt?

Typische Anwendungen

  • Bilder verstehen: Bildbeschreibung, visuelle Fragen, Screenshots analysieren.
  • Dokumente: PDFs, Tabellen, Diagramme, Scans, Formulare, Rechnungen – oft mehrere Informationsformen zugleich.
  • Audio und Sprache: Transkription, Gesprächsauswertung, gesprochene Interaktion.
  • Video: Szenen und zeitliche Abläufe beschreiben, Fragen zu Videoinhalten.
  • Generierung: Text → Bild, Text/Bild → Bild, Text/Bild → Video, Text → Audio (Bild-, Video-, Audio-Tools).
  • Coding und Oberflächen: Screenshot → HTML/CSS-Vorschlag, Diagramm → Code, UI-Analyse.
  • Barrierefreiheit: Bildbeschreibung, Vorlesen, Transkription – mit der Einschränkung aus dem Grenzen-Abschnitt.
  • Robotik: visuelle, sprachliche und sensorische Informationen mit Aktionen verbinden (nur Einordnung).

Besonders praxisrelevant sind Dokumente: Fließtext, Tabellen, Diagramme, Layout und visuelle Hierarchie gehören zusammen. Eine reine Textextraktion verliert oft Zusammenhänge; multimodale Analyse kann visuelle Struktur berücksichtigen – aber nicht jede PDF-Seite wird vollständig und fehlerfrei interpretiert (kleine Schrift, schlechte Scans, komplexe Tabellen, mehrspaltiges Layout, Formeln). Video ist mehr als „viele Bilder“ (zeitliche Abläufe, Bewegung, Reihenfolge, Ton), und Audio ist mehr als Sprache (Musik, Geräusche, akustische Ereignisse). Ein Speech-to-Text-System hat daher nicht automatisch die Fähigkeiten eines allgemeinen Audio-Modells.

Konkrete Beispiele

Die folgenden Fälle sind konstruierte Beispiele – keine dokumentierten Produkttests.

Konstruiertes Beispiel

Diagramm

„Welche Kategorie ist 2025 am stärksten gewachsen?“ Das System verbindet Diagrammstruktur mit der Frage – Werte danach gegen die Quelle prüfen.

Konstruiertes Beispiel

Rechnung

„Wie hoch ist der Nettobetrag?“ Bildverständnis/OCR plus Interpretation – Zahlen unbedingt gegen das Original abgleichen.

Konstruiertes Beispiel

Screenshot

„Warum ist dieser Button in der mobilen Ansicht abgeschnitten?“ Bildinformationen plus technische Textfrage.

Konstruiertes Beispiel

Audio

„Fasse nur die vereinbarten nächsten Schritte zusammen.“ Sprachverarbeitung plus Textausgabe – Datenschutz beachten.

Konstruiertes Beispiel

Video

„Welche drei Arbeitsschritte zeigt dieses Video?“ Zusätzlich ist die zeitliche Reihenfolge relevant.

Konstruiertes Beispiel

Bild → Bild

„Erstelle eine Variante mit neutralem Hintergrund.“ Ein-/Ausgabe enthalten Bild; Text steuert die Transformation.

Multimodal oder generativ? Eine Einordnung

Multimodal und generativ sind nicht dasselbe
Aufgabemultimodal?generativ?Warum
Bild + Frage → Textantwortjajazwei Modalitäten hinein, neuer Text hinaus
Bild + Text → Kategoriejaeher neinmehrere Eingaben, aber feste Auswahl statt freier Erzeugung
Text → Bildja (cross-modal)jaModalitätswechsel und neue Ausgabe
Text → Textneinjanur eine Modalität beteiligt
Foto → Objektklassenein (unimodal)neinnur Bild, feste Klasse

Was ist keine multimodale KI? Ein reines Text-zu-Text-Modell, eine reine Bildklassifikation, eine reine Sprachklassifikation, klassische OCR oder ein reines Text-to-Speech – jeweils für sich unimodal. Solche Systeme können aber Bausteine einer multimodalen Pipeline sein.

Grenzen und multimodale Halluzinationen

Mehr Modalitäten bedeuten mehr Kontext – aber auch mehr Fehlerquellen. Neben allgemeinen Halluzinationen gibt es typische multimodale Fehler:

Typische multimodale Fehler
FehlertypWas passiert
Objekthalluzinationein Objekt wird genannt, das im Bild nicht vorhanden ist
AttributfehlerObjekt vorhanden, aber falsche Eigenschaft (z. B. Farbe, Anzahl)
BeziehungsfehlerObjekte vorhanden, ihre Beziehung wird falsch beschrieben
OCR-/Textfehlereine Zahl oder Beschriftung wird falsch gelesen
DiagrammfehlerWerte oder Achsen werden falsch interpretiert
Räumliche Fehlerlinks/rechts, vorne/hinten oder Größen werden verwechselt
Zeit-/Videofehlerdie Reihenfolge von Ereignissen wird falsch gedeutet
Audiofehlergesprochene Wörter oder Geräusche werden falsch erkannt

Visuelles Grounding: Eine Antwort sollte nicht nur plausibel klingen, sondern tatsächlich durch das konkrete Bild, Dokument, Audio oder Video gestützt sein. Zeigt ein Foto Tisch, Laptop und Tasse und behauptet die Antwort zusätzlich „auf dem Bildschirm ist Excel geöffnet“, obwohl das nicht erkennbar ist, ist das eine unbelegte Ergänzung. Die Forschung misst Objekthalluzinationen mit Verfahren wie POPE und CHAIR; pauschale aktuelle Fehlerquoten gibt es hier bewusst nicht.

Wenn Modalitäten sich widersprechen

Was, wenn Quellen widersprüchliche Informationen liefern – ein Bild zeigt einen Hund, der begleitende Text behauptet eine Katze, oder Tonspur und Untertitel weichen ab? Multimodale Systeme müssen unterschiedliche Informationen gewichten, und das kann zu Fehlern führen. Ein Modell löst solche Konflikte nicht immer korrekt – bei wichtigen Aussagen die Modalität mit der belastbarsten Evidenz selbst prüfen.

Datenschutz bei multimodalen Daten

Multimodale Eingaben können besonders sensibel sein: Bilder (Gesichter, Kennzeichen, Wohnräume, Dokumente), Audio (Stimme, Gesprächsinhalte), Video (Personen, Orte, Abläufe) und vor allem Screenshots (E-Mail-Adressen, Kundendaten, Passwörter, API-Schlüssel). Vor dem Upload prüfen: Anbieter, Tarif, Datenverarbeitung, Speicherregeln, Trainingseinstellungen und mögliche Unternehmensvereinbarungen – ohne pauschale Anbieterversprechen. Gesichter oder Stimmen können rechtlich besonders relevant sein; ob eine biometrische Verarbeitung vorliegt, hängt vom konkreten Zweck ab. Details im Bereich Datenschutz.

Prompt Injection und Deepfakes

Prompt Injection steckt nicht nur im Chattext: Verarbeitet ein System Dokumente, Webseiten, Bilder oder Screenshots, können dort versteckte Anweisungen das System beeinflussen, wenn die Anwendung solche Inhalte unsicher als Instruktionen behandelt. Deshalb externe Inhalte als potenziell manipuliert behandeln.

Multimodale und generative KI überschneiden sich stark bei synthetischen Medien – Bildern, Stimmen, Video und Deepfakes. Seit dem 2. August 2026 gelten die Transparenzpflichten nach Artikel 50 des EU AI Act: Anbieter müssen KI-generierte oder -manipulierte Inhalte maschinenlesbar markieren, Betreiber müssen Deepfakes offenlegen – mit Ausnahmen (etwa geringfügige Bearbeitung, künstlerische Werke, redaktionell verantwortete Inhalte). Die pauschale Aussage „jeder KI-Inhalt muss gekennzeichnet werden“ ist unzutreffend. Mehr unter EU AI Act und KI-Kennzeichnung.

Lokale multimodale KI

Manche multimodalen Modelle lassen sich lokal betreiben – der Bedarf hängt aber stark ab von Modellgröße, Quantisierung, Vision-Encoder, Kontext, Bildauflösung sowie RAM und VRAM. „Multimodale Modelle brauchen immer eine High-End-GPU“ stimmt so nicht; ebenso wenig laufen alle problemlos auf Alltagshardware. Konkrete Anforderungen je Modell prüfen – Überblick unter lokale Modelle.

Brauche ich überhaupt multimodale KI?

  • Besteht meine Aufgabe eigentlich nur aus Text?
  • Muss das System Bilder, Audio oder Video wirklich verstehen?
  • Müssen mehrere Informationsarten gemeinsam ausgewertet werden?
  • Soll nur analysiert oder auch etwas erzeugt werden?
  • Wie sensibel sind die Eingabedaten?
  • Wie exakt müssen die Ergebnisse sein und lassen sie sich prüfen?
  • Reicht lokale Verarbeitung oder braucht es Cloud-KI?

Weiterführend: Generative KI, Large Language Models, Embeddings, Halluzinationen, KI-Modelle und der Modell-Finder.

Quellen und weiterführende Informationen

  1. Radford et al. (arXiv): „Learning Transferable Visual Models From Natural Language Supervision“ (CLIP) – gemeinsamer Bild-Text-Raum (2021). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  2. Alayrac et al. (arXiv): „Flamingo: a Visual Language Model for Few-Shot Learning“ – Cross-Attention-Brücke (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  3. Girdhar et al. (arXiv): „ImageBind: One Embedding Space To Bind Them All“ – gemeinsamer Raum über sechs Modalitäten (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  4. Li et al. (arXiv): „BLIP-2“ – Q-Former als Brücke zu eingefrorenem Encoder und LLM (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  5. Liu et al. (arXiv): „Visual Instruction Tuning“ (LLaVA) – Projektion/Adapter zwischen Vision-Encoder und LLM (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  6. Dosovitskiy et al. (arXiv): „An Image is Worth 16x16 Words“ (ViT) – Bilder als Patches/Tokens (2020). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  7. Radford et al. (arXiv): „Robust Speech Recognition via Large-Scale Weak Supervision“ (Whisper) – Spracherkennung (Audio → Text) (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
  8. Yin et al. (arXiv): „A Survey on Multimodal Large Language Models“ – Begriffe MLLM/LVLM (2023). Wissenschaftliche Übersicht · abgerufen am 09.08.2026
  9. Li et al. (arXiv): „Evaluating Object Hallucination in Large Vision-Language Models“ (POPE) (2023). Forschung/Benchmark · abgerufen am 09.08.2026
  10. Bai et al. (arXiv): „Hallucination of Multimodal Large Language Models: A Survey“ – Objekt-/Attribut-/Relationsfehler (2024). Wissenschaftliche Übersicht · abgerufen am 09.08.2026
  11. Europäische Union (EUR-Lex): Verordnung (EU) 2024/1689 (AI Act), Artikel 50 – Transparenz synthetischer Inhalte (2024). EU-Rechtsakt · abgerufen am 09.08.2026

Häufige Fragen

Was bedeutet multimodale KI?

KI, die Informationen über mehr als eine Modalität – etwa Text, Bild, Audio oder Video – verarbeitet, verbindet oder erzeugt.

Was ist eine Modalität bei KI?

Eine Form bzw. ein Kanal, in dem Information dargestellt wird (Text, Bild, Audio, Video …). Eine Modalität ist nicht dasselbe wie ein Dateiformat: JPEG und PNG sind beide „Bild“.

Ist ein Chatbot automatisch multimodal?

Nein. Das hängt vom konkreten Produkt und Modell ab. Ein Chatbot kann rein textbasiert sein oder zusätzlich Bilder, Audio oder Dateien verarbeiten.

Was ist der Unterschied zwischen generativer und multimodaler KI?

Generativ heißt, dass neue Ausgaben erzeugt werden. Multimodal heißt, dass mehrere Modalitäten verbunden werden. Beides ist nicht dasselbe und überschneidet sich nur teilweise.

Ist jedes multimodale Modell ein LLM?

Nein. Multimodale KI ist breiter und umfasst u. a. Vision-Language-Modelle, multimodale Embedding-Modelle sowie Audio- und Video-Systeme.

Was ist ein Vision-Language Model (VLM)?

Ein Modell, das visuelle Informationen mit Sprache verknüpft – etwa um Bilder zu beschreiben oder visuelle Fragen zu beantworten. Es ist nicht automatisch ein großes LLM.

Kann multimodale KI Videos verstehen?

Manche Systeme können Videoinhalte analysieren. Video ist dabei mehr als viele Einzelbilder – zeitliche Abläufe, Bewegung, Reihenfolge und Ton spielen mit hinein.

Was ist der Unterschied zwischen multimodalem Input und Output?

Der Input ist, was ein Modell versteht (z. B. Bild + Text), der Output, was es erzeugt (z. B. nur Text). Beides ist unabhängig voneinander.

Ist Text-zu-Bild schon multimodale KI?

Ja, im Sinne einer cross-modalen Generierung: Eine Modalität (Text) wird in eine andere (Bild) überführt. Das heißt aber nicht, dass dasselbe System auch Bilder oder Audio analysieren kann.

Warum macht multimodale KI Fehler bei Bildern?

Sie kann Objekte, Eigenschaften, Beziehungen, Text (OCR), Diagrammwerte, räumliche Lagen oder zeitliche Abläufe falsch interpretieren. Wichtige Aussagen daher gegen die Quelle prüfen.

Können multimodale Modelle lokal laufen?

Teilweise ja. Der Bedarf hängt von Modellgröße, Quantisierung, Auflösung, RAM und VRAM ab – konkrete Anforderungen je Modell prüfen.