Skip to main content
Text-to-Speech wandelt geschriebenen Text in gesprochenes Audio um. Wähle ein TTS-Modell, wähle eine von diesem Modell unterstützte Stimme, sende den Text an /audio/speech und speichere die binäre Audioantwort. Nutze diese Anleitung für die Standard-Sprachgenerierung. Wenn du Sprache aus einer benutzerdefinierten Referenzstimme erzeugen möchtest, siehe Voice Cloning.

Grundlegende Nutzung

Modell und Stimme auswählen

Stimmen sind modellspezifisch. Der voice-Wert muss zu dem gewählten model passen. Auf der Seite Text-to-Speech-Modelle kannst du verfügbare Modelle und Stimmen durchsuchen. Der Voice-Picker listet die exakten Voice-IDs auf, die du in deiner Anfrage übergeben musst.
Voice-IDs unterscheiden zwischen Groß- und Kleinschreibung. Wenn du das TTS-Modell wechselst, aktualisiere gleichzeitig den voice-Wert.

Aufbau der Anfrage

Tipps für den Produktiveinsatz

  • Zwischenspeichere erzeugtes Audio, wenn derselbe Quelltext und dieselbe Stimme wiederverwendet werden.
  • Normalisiere und korrigiere den Text vor der Synthese. Interpunktion beeinflusst Tempo und Intonation.
  • Speichere die Ausgabe mit der korrekten Dateiendung für das Antwortformat des Modells.

Verwandte Ressourcen