Modelle

Audiomodelle

Audiomodelle verarbeiten oder erzeugen Sprache und Klang – etwa Transkription (Audio zu Text) oder Sprachsynthese (Text zu Audio). Einige offene Modelle laufen lokal und ermöglichen datensparsame Verarbeitung.

Audiomodelle sind praktisch für Untertitel, Protokolle und Vertonung. Anwendungen findest du unter Audio & Sprache.

Angaben laut offiziellen Quellen; volatile Details siehe Model Card. Geprüft 2026-08-06
ModellAnbieterModalitätenOffenheitLizenz
WhisperOpenAIaudioOpen WeightsMIT (Modellgewichte)

Einträge im Detail

Whisper Open Weights

Offene Spracherkennung (Transkription), lokal lauffähig, viele Sprachen.

Anbieter: OpenAI · Lizenz: MIT (Modellgewichte)

Grenzen: Qualität je Sprache/Audio unterschiedlich.

Datenschutz: Lokale Transkription ohne Upload möglich.

Offizielle Seite Preise/Doku geprüft 2026-08-06

Aktualität

Angaben können sich zwischen zwei Prüfungen ändern. Maßgeblich sind die offiziellen Model Cards und Anbieterseiten.

Quellen und weiterführende Informationen

  1. OpenAI: Whisper (offenes Spracherkennungsmodell). Repository · abgerufen am 06.08.2026

Häufige Fragen

Kann ich Sprache lokal transkribieren?

Ja, mit offenen Spracherkennungsmodellen ist lokale Transkription ohne Upload möglich – auf schwächerer Hardware nur langsamer.