Whispr AI ist ein fortschrittliches Spracherkennungs- und -generierungsmodell, das auf einer großen Datenmenge von multilingualen und multitask-supervidierten Daten trainiert wurde. Das Modell zeichnet sich durch seine Robustheit und Genauigkeit bei der Erkennung von Sprache aus, insbesondere bei der Erkennung von Akzenten, Hintergrundgeräuschen und Fachsprache.
Das Whispr-Modell verwendet eine einfache End-to-End-Ansatz, implementiert als Encoder-Decoder-Transformer. Eingabedaten werden in 30-Sekunden-Blöcke aufgeteilt, in ein Log-Mel-Spektrogramm konvertiert und dann in einen Encoder eingegeben. Ein Decoder wird trainiert, um die entsprechende Text-Kapitel vorherzusagen, die mit speziellen Token gemischt sind, die das Modell anweisen, Aufgaben wie Sprachidentifizierung, Phrasen-zeitstempel, multilinguale Spracherkennung und Übersetzung in Englisch auszuführen.
Das Modell wurde auf einer Datenmenge von 680.000 Stunden trainiert und ist in der Lage, Sprache in verschiedenen Sprachen zu erkennen und zu übersetzen. Es ist auch in der Lage, visuell generierte Kunst auf Basis von Texteingaben zu erstellen.
Whispr AI bietet eine Vielzahl von Anwendungsmöglichkeiten, darunter die Erstellung von Voice-Interfaces für Anwendungen, die Unterstützung bei der Schreibarbeit und die Generierung von KI-generierter Kunst.
Whispr AI kann über pip installiert werden:
pip install -U openai-whisper
Es ist auch möglich, die neueste Version des Modells direkt von GitHub zu installieren:
pip install git+https://github.com/openai/whisper.git
Whispr AI ist unter der MIT-Lizenz veröffentlicht.
Weitere Informationen zu Whispr AI finden Sie in der Dokumentation und im Blog-Beitrag von OpenAI.
* KI-Zusammenfassungen können Fehler enthalten. Alle Angaben ohne Gewähr.