Grundlagen

Multimodale KI

Multimodale KI verarbeitet oder erzeugt mehrere Datenarten – etwa Text zusammen mit Bildern, Audio oder Video. So kann ein Modell zum Beispiel den Inhalt eines Fotos beschreiben oder aus Text ein Bild ableiten.

Was „multimodal“ bedeutet

Eine Modalität ist eine Datenart: Text, Bild, Audio, Video. Multimodale Modelle können mehrere davon gemeinsam verarbeiten. Praktisch heißt das etwa: ein hochgeladenes Diagramm erklären, aus einer Skizze Code ableiten oder gesprochene Sprache verstehen.

Typische Anwendungen

Multimodale Ein- und Ausgaben
EingabeAusgabeBeispiel
Bild + TextTextFoto beschreiben, Grafik erklären
TextBildIllustration aus einem Prompt
AudioTextTranskription von Sprache
TextAudioSprachausgabe / Vertonung

Grenzen

Multimodale Fähigkeiten variieren stark je Modell und Version. Für verlässliche Aussagen zu konkreten Fähigkeiten gilt: die offizielle Model Card prüfen. Datenschutz beachten – Bilder und Audio können personenbezogene Daten enthalten.

Quellen und weiterführende Informationen

  1. Google: Gemini – multimodale Fähigkeiten (Dokumentation). Offizielle Dokumentation · abgerufen am 06.08.2026

Häufige Fragen

Kann jedes Modell Bilder verstehen?

Nein. Nur multimodale Modelle mit Bild-Eingabe. Der Funktionsumfang unterscheidet sich je Modell und Version.