Skip to main content
POST
string
required
TTS model. tts-1 (faster, lower quality) or tts-1-hd (slower, higher fidelity).
string
required
Text to convert to speech. Maximum 4096 characters.
string
required
Voice preset. Options: alloy, echo, fable, onyx, nova, shimmer.
  • alloy — neutral, versatile
  • echo — male, authoritative
  • fable — British accent, storytelling
  • onyx — deep, powerful
  • nova — female, friendly
  • shimmer — female, soft
string
default:"mp3"
Audio format. Options: mp3, opus, aac, flac, wav. Use opus for lowest latency.
number
default:"1.0"
Playback speed. Range: 0.25 to 4.0. 1.0 = normal speed.