Skip to main content
Speech-to-Text transkribiert gesprochene Audioaufnahmen in geschriebenen Text. Sende eine Audiodatei an /audio/transcriptions, wähle ein Transkriptionsmodell und lege das gewünschte Antwortformat fest.

Grundlegende Nutzung

Unterstützte Eingaben

Gängige Audioformate sind mp3, mp4, mpeg, mpga, m4a, wav, webm, flac und ogg. Aktuelle Modellunterstützung und Preise findest du auf der Seite Speech-to-Text-Modelle.

Antwortformate

Verwende Untertitelformate, wenn das Transkript mit einer Medienwiedergabe kombiniert wird. Verwende json oder text, wenn das Transkript in Zusammenfassungen, Suche oder nachgelagerte Chat-Prompts einfließt.

Tipps für den Produktiveinsatz

  • Halte das Audio klar und vermeide nach Möglichkeit sich überlappende Sprecher.
  • Teile sehr lange Aufnahmen in kleinere Chunks auf, wenn dein Workflow geringere Latenz oder einfachere Wiederholungen benötigt.
  • Speichere den ursprünglichen Audiopfad, die Modell-ID und das Antwortformat mit jedem Transkript, um die Nachvollziehbarkeit zu gewährleisten.

Verwandte Ressourcen