Skip to main content
La voz a texto transcribe audio hablado a texto escrito. Envía un archivo de audio a /audio/transcriptions, elige un modelo de transcripción y selecciona el formato de respuesta que deseas recibir.

Uso básico

Entradas admitidas

Los formatos de audio comunes incluyen mp3, mp4, mpeg, mpga, m4a, wav, webm, flac y ogg. Consulta la página de Modelos de Voz a Texto para conocer el soporte de modelos y precios actuales.

Formatos de respuesta

Usa formatos de subtítulos cuando la transcripción se combine con la reproducción de contenido multimedia. Usa json o text cuando la transcripción alimente resúmenes, búsqueda o prompts de chat posteriores.

Consejos para producción

  • Mantén el audio claro y evita solapamientos entre hablantes cuando sea posible.
  • Divide las grabaciones muy largas en fragmentos más pequeños si tu flujo de trabajo necesita menor latencia o reintentos más sencillos.
  • Almacena la ruta original del audio, el ID del modelo y el formato de respuesta con cada transcripción para facilitar la auditoría.

Recursos relacionados