Modelle
Audiomodelle
Audiomodelle verarbeiten oder erzeugen Sprache und Klang – etwa Transkription (Audio zu Text) oder Sprachsynthese (Text zu Audio). Einige offene Modelle laufen lokal und ermöglichen datensparsame Verarbeitung.
Audiomodelle sind praktisch für Untertitel, Protokolle und Vertonung. Anwendungen findest du unter Audio & Sprache.
| Modell | Anbieter | Modalitäten | Offenheit | Lizenz |
|---|---|---|---|---|
| Whisper | OpenAI | audio | Open Weights | MIT (Modellgewichte) |
Einträge im Detail
Whisper Open Weights
Offene Spracherkennung (Transkription), lokal lauffähig, viele Sprachen.
Anbieter: OpenAI · Lizenz: MIT (Modellgewichte)
Grenzen: Qualität je Sprache/Audio unterschiedlich.
Datenschutz: Lokale Transkription ohne Upload möglich.
Offizielle Seite Preise/Doku geprüft 2026-08-06
Angaben können sich zwischen zwei Prüfungen ändern. Maßgeblich sind die offiziellen Model Cards und Anbieterseiten.
Quellen und weiterführende Informationen
- OpenAI: Whisper (offenes Spracherkennungsmodell). Repository · abgerufen am 06.08.2026
Häufige Fragen
Kann ich Sprache lokal transkribieren?
Ja, mit offenen Spracherkennungsmodellen ist lokale Transkription ohne Upload möglich – auf schwächerer Hardware nur langsamer.