GLM-ASR Models by Zhipu AI
1 model
Last refreshed 2026-07-11. Next refresh: weekly.
Capabilities
MultimodalAll models
Links
WebsiteAbout
GLM-ASR is Zhipu AI's speech-recognition family for reusable audio transcription models, including real-time and multilingual speech-to-text API access.
Decision facts
- Best fit
- audiospeech recognitionvision and multimodal work
- Capability starting point
- GLM-ASR-2512 with multimodal inputs
- Lowest tracked input
- Not tracked
- Closest related family
- GLM-5
Current Variants
Use-when guidance is based on each model's tracked capabilities, context window, release date, and replacement status.
1 in view
GLM-ASR-2512Current
Use when the workload needs speech recognition, multimodal inputs, and audio.
Unknown releasespeech recognitionmultimodal inputsaudio
| Model | Use when | Released | Signals | Status |
|---|---|---|---|---|
| GLM-ASR-2512 | Use when the workload needs speech recognition, multimodal inputs, and audio. | Unknown release | speech recognitionmultimodal inputsaudio | Current |
Release Timeline
1 release groupUnknown release
1 current
GLM-ASR-2512
Currentspeech recognitionmultimodal inputsaudio
Specifications(1 models)
| Model | Released | Multimodal |
|---|---|---|
| GLM-ASR-2512 | — | Yes |





