LLM Reference

StepAudio 2.5 Models by StepFun

StepFunProprietary
3 models2026

Last refreshed 2026-06-29. Next refresh: weekly.

Details

ResearcherStepFun
LicenseProprietary
Commercial useCommercial use: conditional
Models3
Released2026

Capabilities

MultimodalAll models

Links

Website

About

StepAudio 2.5 is StepFun's unified audio-language foundation model family, introduced in May 2026 (arXiv:2605.23463). It covers three API-accessible capabilities — text-to-speech (TTS), automatic speech recognition (ASR), and real-time conversational voice (Realtime) — all built on a shared decoder architecture. The family claims top scores across five voice AI benchmarks, surpassing GPT Realtime and Gemini Live on tested dimensions. Supports Chinese and English.

Decision facts

Best fit
voicespeech recognitiontext to speech
Capability starting point
StepAudio 2.5 Realtime with multimodal inputs
Lowest tracked input
Not tracked
Closest related family
Step

Current Variants

Use-when guidance is based on each model's tracked capabilities, context window, release date, and replacement status.

3 in view

Use when the workload needs voice, multimodal inputs, and audio.

2026-05voicemultimodal inputsaudio

Use when the workload needs speech recognition, 4B parameters, and multimodal inputs.

2026-05speech recognition4B parametersmultimodal inputs

Use when the workload needs text to speech, multimodal inputs, and audio.

2026-04text to speechmultimodal inputsaudio

Release Timeline

2 release groups
2026-05
2 current
StepAudio 2.5 ASR
speech recognition4B parametersmultimodal inputs
Current
StepAudio 2.5 Realtime
voicemultimodal inputsaudio
Current
2026-04
1 current
StepAudio 2.5 TTS
text to speechmultimodal inputsaudio
Current

Specifications(3 models)

StepAudio 2.5 model specifications comparison
ModelReleasedParametersMultimodal
StepAudio 2.5 Realtime2026-05Yes
StepAudio 2.5 ASR2026-054BYes
StepAudio 2.5 TTS2026-04Yes

Available From(1 provider)