NextFin

StepFun Releases Step Audio 3 Model Series

Summarized by NextFin AI
  • StepFun released the Step Audio 3 series of models, now available on the company's open platform.
  • The lineup includes five specialized models: StepAudio 3 Realtime for full-duplex voice interaction, ASR for speech recognition, TTS for text-to-speech, Gen for unified audio generation, and Music.
  • Models support real-time interaction, context-aware transcription, natural speech synthesis, and multi-type audio creation from natural-language prompts.
  • The models are accessible via StepFun's domestic and international open platforms.

NextFin News — StepFun has released its Step Audio 3 series of models, which are now available on the company’s open platform.

The lineup includes StepAudio 3 Realtime for full-duplex voice interaction, StepAudio 3 ASR for speech recognition, StepAudio 3 TTS for text-to-speech, StepAudio 3 Gen for unified audio generation covering speech, sound effects and music, and StepAudio 3 Music.

The models support real-time interaction, context-aware transcription, natural speech synthesis and multi-type audio creation from natural-language prompts. They are accessible via StepFun’s domestic and international open platforms.

Explore more exclusive insights at nextfin.ai.

Search
NextFinNextFin
NextFin.Al
No Noise, only Signal.
Open App