Grundlagen
Multimodale KI
Multimodale KI verarbeitet oder erzeugt mehrere Datenarten – etwa Text zusammen mit Bildern, Audio oder Video. So kann ein Modell zum Beispiel den Inhalt eines Fotos beschreiben oder aus Text ein Bild ableiten.
Was „multimodal“ bedeutet
Eine Modalität ist eine Datenart: Text, Bild, Audio, Video. Multimodale Modelle können mehrere davon gemeinsam verarbeiten. Praktisch heißt das etwa: ein hochgeladenes Diagramm erklären, aus einer Skizze Code ableiten oder gesprochene Sprache verstehen.
Typische Anwendungen
| Eingabe | Ausgabe | Beispiel |
|---|---|---|
| Bild + Text | Text | Foto beschreiben, Grafik erklären |
| Text | Bild | Illustration aus einem Prompt |
| Audio | Text | Transkription von Sprache |
| Text | Audio | Sprachausgabe / Vertonung |
Grenzen
Multimodale Fähigkeiten variieren stark je Modell und Version. Für verlässliche Aussagen zu konkreten Fähigkeiten gilt: die offizielle Model Card prüfen. Datenschutz beachten – Bilder und Audio können personenbezogene Daten enthalten.
Quellen und weiterführende Informationen
- Google: Gemini – multimodale Fähigkeiten (Dokumentation). Offizielle Dokumentation · abgerufen am 06.08.2026
Häufige Fragen
Kann jedes Modell Bilder verstehen?
Nein. Nur multimodale Modelle mit Bild-Eingabe. Der Funktionsumfang unterscheidet sich je Modell und Version.