Skip to main content
Lo speech-to-text trascrive l’audio parlato in testo scritto. Invia un file audio a /audio/transcriptions, scegli un modello di trascrizione e seleziona il formato di risposta desiderato.

Utilizzo di Base

Input Supportati

I formati audio comuni includono mp3, mp4, mpeg, mpga, m4a, wav, webm, flac e ogg. Consulta la pagina Modelli Speech-to-Text per il supporto dei modelli e i prezzi aggiornati.

Formati di Risposta

Usa i formati per sottotitoli quando la trascrizione verrà abbinata a una riproduzione multimediale. Usa json o text quando la trascrizione alimenta riassunti, ricerca o prompt di chat a valle.

Consigli per la Produzione

  • Mantieni l’audio chiaro ed evita, se possibile, la sovrapposizione tra parlanti.
  • Suddividi registrazioni molto lunghe in chunk più piccoli se il tuo flusso richiede minore latenza o retry più semplici.
  • Memorizza il percorso audio originale, l’ID del modello e il formato di risposta insieme a ogni trascrizione per esigenze di tracciabilità.

Risorse Correlate