28

models

Speech Generation

The best AI text-to-speech and voice synthesis models, all available on Segmind via a single pay-per-use API. This collection includes models from ElevenLabs, Google Gemini TTS, Chatterbox, and more — covering everything from natural conversational voices to expressive character speech and multilingual narration. Whether you need realistic voiceovers for video content, interactive voice agents, podcast production, e-learning narration, or audiobook creation, these models deliver production-quality audio from plain text. Key models include ElevenLabs Turbo for ultra-low latency streaming TTS, Gemini 2.5 Flash TTS and Gemini 2.5 Pro TTS for high-fidelity multilingual speech, and Chatterbox Turbo for rapid, expressive voice generation. The collection also includes voice cloning, voice design, dialogue generation with timestamps, and speech-to-speech conversion models for complete voice production workflows. On Segmind, generate professional audio with a single API call and chain TTS models with video generation or lipsync tools in Workflows to automate complete multimedia content pipelines.

Text to Audio
Text To Audio
Coming Soon

Seed Audio 2.0

Text To Audio

Sarvam Bulbul v3 TTS

1.7s
Text To Audio

Lyria 3 Pro

34.4s
Text To Audio

Lyria 3

16.1s
Text To Audio

Kokoro 82M

1.0s
Text To Audio

Sonilo Text to Audio

15.5s
Text To Audio

ElevenLabs Music

11.9s
Text To Audio

Seed Audio 1.0

31.6s
Text To Audio

Grok Text-to-Speech

5.5s
Text To Audio

Gemini 3.1 Flash TTS

14.3s
Text To Audio

Sam Audio Large

11.5s
Text To Audio

Gemini TTS 2.5 Flash

6.4s
Text To Audio

Gemini TTS 2.5 Pro

14.1s
Text To Audio

Chatterbox Turbo TTS

7.1s
Text To Audio

Elevenlabs Dialogue

2.2s
Text To Audio

VeenaMax TTS

13.0s
Text To Audio

Veena TTS

45.2s
Text To Audio

Chatterbox TTS

21.8s
Text To Audio

Lyria 2

29.0s
Text To Audio

Ace Step Music

9.4s
Text To Audio

Dia (Text to Speech)

13.7s
Text To Audio

3B Orpheus TTS (0.1)

6.2s
Text To Audio

Meta MusicGen Medium

31.0s
Text To Audio

MyShell Text To Speech

7.6s
Text To Audio

Openvoice

5.4s
Text To Audio

ElevenLabs Dubbing

80.2s
Text To Audio

Elevenlabs Sound Generation

3.9s
Text To Audio

Elevenlabs Text To Speech

9.9s