Grundlagen
Was ist multimodale KI? Text, Bild, Audio und Video gemeinsam verstehen
Multimodale KI verarbeitet, verbindet oder erzeugt Informationen über mehr als eine Modalität wie Text, Bild, Audio oder Video. Ein multimodales System kann etwa ein Diagramm zusammen mit einer Textfrage auswerten, Sprache und Bildinformationen kombinieren oder aus verschiedenen Eingaben eine Antwort ableiten. Welche Modalitäten tatsächlich unterstützt werden, hängt vom konkreten Modell und Produkt ab – und die Eingabemodalitäten sind nicht dasselbe wie die Ausgabemodalitäten.
Was bedeutet „multimodal“?
Eine Modalität ist eine Form beziehungsweise ein Kanal, in dem Informationen dargestellt oder wahrgenommen werden. Typische KI-Modalitäten sind Text, Bild, Audio, Sprache und Video; in der Forschung kommen auch Tiefen-, Wärme-, Sensor-, Bewegungs- oder 3D-Daten vor. Multimodale KI verbindet mehr als eine dieser Modalitäten für eine Aufgabe.
Eine Modalität ist nicht dasselbe wie ein Dateiformat. JPEG und PNG sind zwei Formate, repräsentieren aber beide die Modalität Bild. MP3 und WAV sind Formate für Audio. Ein PDF ist ein Containerformat und kann mehrere Modalitäten gleichzeitig enthalten: Text, Bilder, Diagramme und Tabellen.
Input- und Output-Modalitäten trennen
Die wichtigste Unterscheidung: Was geht hinein, was kommt heraus? Ein Modell kann Text, Bilder, Audio und Video als Eingabe verstehen und trotzdem nur Text ausgeben. Falsch sind daher Aussagen wie „ein Modell ist erst multimodal, wenn es Bilder erzeugen kann“.
| Eingabe | Ausgabe | Aufgabe | Einordnung |
|---|---|---|---|
| Bild + Text | Text | Foto/Grafik beschreiben, visuelle Frage | multimodaler Input, Text-Output |
| Video + Frage | Text | Videoinhalt zusammenfassen | multimodaler Input, Text-Output |
| Audio + Text | Text | ein Gespräch auswerten | multimodaler Input, Text-Output |
| Text | Bild | Illustration erzeugen | cross-modale Generierung |
| Bild + Text | Bild | Bild bearbeiten / Variante | multimodaler Input, Bild-Output |
| Text | Audio | Sprachsynthese | cross-modale Generierung |
| Text / Bild | Video | kurzen Clip erzeugen | cross-modale Generierung |
Multimodal beschreibt nicht automatisch die Ausgabe. Ein System kann viele Modalitäten als Input verstehen und trotzdem ausschließlich Text ausgeben – und eine Text-zu-Bild-Anwendung verbindet zwei Modalitäten, ohne deshalb Bild und Audio analysieren zu können.
Multimodal, cross-modal, generativ und LLM
Multimodale Verarbeitung nutzt mehrere Modalitäten gemeinsam für eine Aufgabe (Bild + Textfrage → Textantwort). Cross-modale Verarbeitung überträgt Information von einer Modalität in eine andere (Text → Bild, Audio → Text). Die Begriffe sind in Forschung und Industrie nicht überall einheitlich – entscheidend bleibt: welche Modalität kommt hinein, welche kommt heraus?
Multimodal ist nicht dasselbe wie generativ: „multimodal“ sagt, welche Informationsformen verbunden werden, „generativ“, dass neue Ausgaben erzeugt werden. Ein Modell kann Bild und Text für eine Klassifikation verbinden (multimodal, aber nicht zwingend frei generierend); ein reines Textmodell kann generativ sein, ohne multimodal zu sein.
Multimodale KI ist breiter als ein multimodales LLM: Dazu gehören auch Vision-Language-Modelle, multimodale Embedding-Modelle, Audio- und Video-Systeme sowie Robotikmodelle. Gängige Begriffe:
| Begriff | Typische Bedeutung | Nicht automatisch |
|---|---|---|
| VLM (Vision-Language Model) | verknüpft visuelle Informationen mit Sprache | ein großes LLM |
| MLLM (Multimodal Large Language Model) | sprachbasiertes System, das weitere Modalitäten integriert | einheitlich definiert (auch „LVLM“ genannt) |
| Multimodal Foundation Model | breit vortrainiert, mehrere Modalitäten, anpassbar | zwingend generativ |
| Multimodales KI-System | kombiniert ggf. mehrere spezialisierte Modelle | ein einzelnes Modell |
Wie „versteht“ ein Modell ein Bild?
Ein Bild wird nicht wie mit einem menschlichen Auge „gesehen“. „Verstehen“ heißt hier: aus numerischen Repräsentationen der Bild-, Audio- oder Videodaten für eine Aufgabe passende Ausgaben ableiten – ohne Wahrnehmung, Bewusstsein oder Sinne im menschlichen Sinn. Ein häufiges (aber nicht das einzige) Muster:
Wie die Modalitäten zusammengeführt werden, unterscheidet sich je Modell: über einen gemeinsamen Repräsentationsraum (Bild und Text landen als ähnliche Vektoren nah beieinander – Grundlage von Text-zu-Bild-Suche und Cross-Modal Retrieval, siehe Embeddings), über Adapter/Projektionen, über Cross-Attention oder über stärker vereinheitlichte Repräsentationen. Es gibt nicht die eine Architektur für multimodale KI.
Auch die Repräsentation je Modalität ist unterschiedlich: Text wird in Tokens zerlegt; Bilder je nach Architektur über Bild-Patches, Encoder-Repräsentationen oder diskrete visuelle Tokens; Audio über Frames, Spektralbilder oder Audio-Encoder; Video über Frames, zeitliche Merkmale und Tonspur. Nicht jedes Modell macht das gleich – „alles wird tokenisiert“ ist zu pauschal.
Modell, System oder Produkt?
Viele Nutzer sehen nur die Oberfläche. Ein Produkt kann Audio aufnehmen, es per Speech-to-Text transkribieren, den Text durch ein Sprachmodell verarbeiten und die Antwort per Text-to-Speech vorlesen. Für die Nutzerin wirkt das wie eine multimodale KI – technisch können mehrere Modelle beteiligt sein. Daneben gibt es Modelle, die mehrere Modalitäten enger in derselben Architektur verarbeiten. Drei Ebenen helfen:
- Produkt: die Anwendung, die man bedient.
- KI-System: Orchestrierung aus Modellen, Tools, Datenquellen und Software.
- Modell: das eigentliche trainierte Machine-Learning-Modell.
Aus einer Produktfunktion nicht auf die Modellarchitektur schließen. Begriffe wie „nativ multimodal“, „omni“ oder „any-to-any“ sind überwiegend Anbieter-Bezeichnungen ohne einheitliche wissenschaftliche Definition – im Zweifel die offizielle Model Card prüfen: Welche Eingaben, welche Ausgaben sind wirklich belegt?
Typische Anwendungen
- Bilder verstehen: Bildbeschreibung, visuelle Fragen, Screenshots analysieren.
- Dokumente: PDFs, Tabellen, Diagramme, Scans, Formulare, Rechnungen – oft mehrere Informationsformen zugleich.
- Audio und Sprache: Transkription, Gesprächsauswertung, gesprochene Interaktion.
- Video: Szenen und zeitliche Abläufe beschreiben, Fragen zu Videoinhalten.
- Generierung: Text → Bild, Text/Bild → Bild, Text/Bild → Video, Text → Audio (Bild-, Video-, Audio-Tools).
- Coding und Oberflächen: Screenshot → HTML/CSS-Vorschlag, Diagramm → Code, UI-Analyse.
- Barrierefreiheit: Bildbeschreibung, Vorlesen, Transkription – mit der Einschränkung aus dem Grenzen-Abschnitt.
- Robotik: visuelle, sprachliche und sensorische Informationen mit Aktionen verbinden (nur Einordnung).
Besonders praxisrelevant sind Dokumente: Fließtext, Tabellen, Diagramme, Layout und visuelle Hierarchie gehören zusammen. Eine reine Textextraktion verliert oft Zusammenhänge; multimodale Analyse kann visuelle Struktur berücksichtigen – aber nicht jede PDF-Seite wird vollständig und fehlerfrei interpretiert (kleine Schrift, schlechte Scans, komplexe Tabellen, mehrspaltiges Layout, Formeln). Video ist mehr als „viele Bilder“ (zeitliche Abläufe, Bewegung, Reihenfolge, Ton), und Audio ist mehr als Sprache (Musik, Geräusche, akustische Ereignisse). Ein Speech-to-Text-System hat daher nicht automatisch die Fähigkeiten eines allgemeinen Audio-Modells.
Konkrete Beispiele
Die folgenden Fälle sind konstruierte Beispiele – keine dokumentierten Produkttests.
Diagramm
„Welche Kategorie ist 2025 am stärksten gewachsen?“ Das System verbindet Diagrammstruktur mit der Frage – Werte danach gegen die Quelle prüfen.
Rechnung
„Wie hoch ist der Nettobetrag?“ Bildverständnis/OCR plus Interpretation – Zahlen unbedingt gegen das Original abgleichen.
Screenshot
„Warum ist dieser Button in der mobilen Ansicht abgeschnitten?“ Bildinformationen plus technische Textfrage.
Audio
„Fasse nur die vereinbarten nächsten Schritte zusammen.“ Sprachverarbeitung plus Textausgabe – Datenschutz beachten.
Video
„Welche drei Arbeitsschritte zeigt dieses Video?“ Zusätzlich ist die zeitliche Reihenfolge relevant.
Bild → Bild
„Erstelle eine Variante mit neutralem Hintergrund.“ Ein-/Ausgabe enthalten Bild; Text steuert die Transformation.
Multimodal oder generativ? Eine Einordnung
| Aufgabe | multimodal? | generativ? | Warum |
|---|---|---|---|
| Bild + Frage → Textantwort | ja | ja | zwei Modalitäten hinein, neuer Text hinaus |
| Bild + Text → Kategorie | ja | eher nein | mehrere Eingaben, aber feste Auswahl statt freier Erzeugung |
| Text → Bild | ja (cross-modal) | ja | Modalitätswechsel und neue Ausgabe |
| Text → Text | nein | ja | nur eine Modalität beteiligt |
| Foto → Objektklasse | nein (unimodal) | nein | nur Bild, feste Klasse |
Was ist keine multimodale KI? Ein reines Text-zu-Text-Modell, eine reine Bildklassifikation, eine reine Sprachklassifikation, klassische OCR oder ein reines Text-to-Speech – jeweils für sich unimodal. Solche Systeme können aber Bausteine einer multimodalen Pipeline sein.
Grenzen und multimodale Halluzinationen
Mehr Modalitäten bedeuten mehr Kontext – aber auch mehr Fehlerquellen. Neben allgemeinen Halluzinationen gibt es typische multimodale Fehler:
| Fehlertyp | Was passiert |
|---|---|
| Objekthalluzination | ein Objekt wird genannt, das im Bild nicht vorhanden ist |
| Attributfehler | Objekt vorhanden, aber falsche Eigenschaft (z. B. Farbe, Anzahl) |
| Beziehungsfehler | Objekte vorhanden, ihre Beziehung wird falsch beschrieben |
| OCR-/Textfehler | eine Zahl oder Beschriftung wird falsch gelesen |
| Diagrammfehler | Werte oder Achsen werden falsch interpretiert |
| Räumliche Fehler | links/rechts, vorne/hinten oder Größen werden verwechselt |
| Zeit-/Videofehler | die Reihenfolge von Ereignissen wird falsch gedeutet |
| Audiofehler | gesprochene Wörter oder Geräusche werden falsch erkannt |
Visuelles Grounding: Eine Antwort sollte nicht nur plausibel klingen, sondern tatsächlich durch das konkrete Bild, Dokument, Audio oder Video gestützt sein. Zeigt ein Foto Tisch, Laptop und Tasse und behauptet die Antwort zusätzlich „auf dem Bildschirm ist Excel geöffnet“, obwohl das nicht erkennbar ist, ist das eine unbelegte Ergänzung. Die Forschung misst Objekthalluzinationen mit Verfahren wie POPE und CHAIR; pauschale aktuelle Fehlerquoten gibt es hier bewusst nicht.
Wenn Modalitäten sich widersprechen
Was, wenn Quellen widersprüchliche Informationen liefern – ein Bild zeigt einen Hund, der begleitende Text behauptet eine Katze, oder Tonspur und Untertitel weichen ab? Multimodale Systeme müssen unterschiedliche Informationen gewichten, und das kann zu Fehlern führen. Ein Modell löst solche Konflikte nicht immer korrekt – bei wichtigen Aussagen die Modalität mit der belastbarsten Evidenz selbst prüfen.
Datenschutz bei multimodalen Daten
Multimodale Eingaben können besonders sensibel sein: Bilder (Gesichter, Kennzeichen, Wohnräume, Dokumente), Audio (Stimme, Gesprächsinhalte), Video (Personen, Orte, Abläufe) und vor allem Screenshots (E-Mail-Adressen, Kundendaten, Passwörter, API-Schlüssel). Vor dem Upload prüfen: Anbieter, Tarif, Datenverarbeitung, Speicherregeln, Trainingseinstellungen und mögliche Unternehmensvereinbarungen – ohne pauschale Anbieterversprechen. Gesichter oder Stimmen können rechtlich besonders relevant sein; ob eine biometrische Verarbeitung vorliegt, hängt vom konkreten Zweck ab. Details im Bereich Datenschutz.
Prompt Injection und Deepfakes
Prompt Injection steckt nicht nur im Chattext: Verarbeitet ein System Dokumente, Webseiten, Bilder oder Screenshots, können dort versteckte Anweisungen das System beeinflussen, wenn die Anwendung solche Inhalte unsicher als Instruktionen behandelt. Deshalb externe Inhalte als potenziell manipuliert behandeln.
Multimodale und generative KI überschneiden sich stark bei synthetischen Medien – Bildern, Stimmen, Video und Deepfakes. Seit dem 2. August 2026 gelten die Transparenzpflichten nach Artikel 50 des EU AI Act: Anbieter müssen KI-generierte oder -manipulierte Inhalte maschinenlesbar markieren, Betreiber müssen Deepfakes offenlegen – mit Ausnahmen (etwa geringfügige Bearbeitung, künstlerische Werke, redaktionell verantwortete Inhalte). Die pauschale Aussage „jeder KI-Inhalt muss gekennzeichnet werden“ ist unzutreffend. Mehr unter EU AI Act und KI-Kennzeichnung.
Die Inhalte dienen der allgemeinen Information und ersetzen keine individuelle Rechtsberatung.
Lokale multimodale KI
Manche multimodalen Modelle lassen sich lokal betreiben – der Bedarf hängt aber stark ab von Modellgröße, Quantisierung, Vision-Encoder, Kontext, Bildauflösung sowie RAM und VRAM. „Multimodale Modelle brauchen immer eine High-End-GPU“ stimmt so nicht; ebenso wenig laufen alle problemlos auf Alltagshardware. Konkrete Anforderungen je Modell prüfen – Überblick unter lokale Modelle.
Brauche ich überhaupt multimodale KI?
- Besteht meine Aufgabe eigentlich nur aus Text?
- Muss das System Bilder, Audio oder Video wirklich verstehen?
- Müssen mehrere Informationsarten gemeinsam ausgewertet werden?
- Soll nur analysiert oder auch etwas erzeugt werden?
- Wie sensibel sind die Eingabedaten?
- Wie exakt müssen die Ergebnisse sein und lassen sie sich prüfen?
- Reicht lokale Verarbeitung oder braucht es Cloud-KI?
Weiterführend: Generative KI, Large Language Models, Embeddings, Halluzinationen, KI-Modelle und der Modell-Finder.
Quellen und weiterführende Informationen
- Radford et al. (arXiv): „Learning Transferable Visual Models From Natural Language Supervision“ (CLIP) – gemeinsamer Bild-Text-Raum (2021). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Alayrac et al. (arXiv): „Flamingo: a Visual Language Model for Few-Shot Learning“ – Cross-Attention-Brücke (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Girdhar et al. (arXiv): „ImageBind: One Embedding Space To Bind Them All“ – gemeinsamer Raum über sechs Modalitäten (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Li et al. (arXiv): „BLIP-2“ – Q-Former als Brücke zu eingefrorenem Encoder und LLM (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Liu et al. (arXiv): „Visual Instruction Tuning“ (LLaVA) – Projektion/Adapter zwischen Vision-Encoder und LLM (2023). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Dosovitskiy et al. (arXiv): „An Image is Worth 16x16 Words“ (ViT) – Bilder als Patches/Tokens (2020). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Radford et al. (arXiv): „Robust Speech Recognition via Large-Scale Weak Supervision“ (Whisper) – Spracherkennung (Audio → Text) (2022). Wissenschaftliche Primärquelle · abgerufen am 09.08.2026
- Yin et al. (arXiv): „A Survey on Multimodal Large Language Models“ – Begriffe MLLM/LVLM (2023). Wissenschaftliche Übersicht · abgerufen am 09.08.2026
- Li et al. (arXiv): „Evaluating Object Hallucination in Large Vision-Language Models“ (POPE) (2023). Forschung/Benchmark · abgerufen am 09.08.2026
- Bai et al. (arXiv): „Hallucination of Multimodal Large Language Models: A Survey“ – Objekt-/Attribut-/Relationsfehler (2024). Wissenschaftliche Übersicht · abgerufen am 09.08.2026
- Europäische Union (EUR-Lex): Verordnung (EU) 2024/1689 (AI Act), Artikel 50 – Transparenz synthetischer Inhalte (2024). EU-Rechtsakt · abgerufen am 09.08.2026
Häufige Fragen
Was bedeutet multimodale KI?
KI, die Informationen über mehr als eine Modalität – etwa Text, Bild, Audio oder Video – verarbeitet, verbindet oder erzeugt.
Was ist eine Modalität bei KI?
Eine Form bzw. ein Kanal, in dem Information dargestellt wird (Text, Bild, Audio, Video …). Eine Modalität ist nicht dasselbe wie ein Dateiformat: JPEG und PNG sind beide „Bild“.
Ist ein Chatbot automatisch multimodal?
Nein. Das hängt vom konkreten Produkt und Modell ab. Ein Chatbot kann rein textbasiert sein oder zusätzlich Bilder, Audio oder Dateien verarbeiten.
Was ist der Unterschied zwischen generativer und multimodaler KI?
Generativ heißt, dass neue Ausgaben erzeugt werden. Multimodal heißt, dass mehrere Modalitäten verbunden werden. Beides ist nicht dasselbe und überschneidet sich nur teilweise.
Ist jedes multimodale Modell ein LLM?
Nein. Multimodale KI ist breiter und umfasst u. a. Vision-Language-Modelle, multimodale Embedding-Modelle sowie Audio- und Video-Systeme.
Was ist ein Vision-Language Model (VLM)?
Ein Modell, das visuelle Informationen mit Sprache verknüpft – etwa um Bilder zu beschreiben oder visuelle Fragen zu beantworten. Es ist nicht automatisch ein großes LLM.
Kann multimodale KI Videos verstehen?
Manche Systeme können Videoinhalte analysieren. Video ist dabei mehr als viele Einzelbilder – zeitliche Abläufe, Bewegung, Reihenfolge und Ton spielen mit hinein.
Was ist der Unterschied zwischen multimodalem Input und Output?
Der Input ist, was ein Modell versteht (z. B. Bild + Text), der Output, was es erzeugt (z. B. nur Text). Beides ist unabhängig voneinander.
Ist Text-zu-Bild schon multimodale KI?
Ja, im Sinne einer cross-modalen Generierung: Eine Modalität (Text) wird in eine andere (Bild) überführt. Das heißt aber nicht, dass dasselbe System auch Bilder oder Audio analysieren kann.
Warum macht multimodale KI Fehler bei Bildern?
Sie kann Objekte, Eigenschaften, Beziehungen, Text (OCR), Diagrammwerte, räumliche Lagen oder zeitliche Abläufe falsch interpretieren. Wichtige Aussagen daher gegen die Quelle prüfen.
Können multimodale Modelle lokal laufen?
Teilweise ja. Der Bedarf hängt von Modellgröße, Quantisierung, Auflösung, RAM und VRAM ab – konkrete Anforderungen je Modell prüfen.