GLM-Realtime Models by Zhipu AI
1 model
Last refreshed 2026-07-11. Next refresh: weekly.
Capabilities
VisionAll models
MultimodalAll models
Links
WebsiteAbout
GLM-Realtime is Zhipu AI's real-time voice and multimodal family for live audio, video, and text interaction over WebSocket and SDK APIs.
Decision facts
- Best fit
- audiomultimodalrealtime voice
- Capability starting point
- GLM-Realtime with multimodal inputs
- Lowest tracked input
- Not tracked
- Closest related family
- GLM-5
Current Variants
Use-when guidance is based on each model's tracked capabilities, context window, release date, and replacement status.
1 in view
GLM-RealtimeCurrent
Use when the workload needs realtime voice, multimodal inputs, and audio.
Unknown releaserealtime voicemultimodal inputsaudio
| Model | Use when | Released | Signals | Status |
|---|---|---|---|---|
| GLM-Realtime | Use when the workload needs realtime voice, multimodal inputs, and audio. | Unknown release | realtime voicemultimodal inputsaudio | Current |
Release Timeline
1 release groupUnknown release
1 current
GLM-Realtime
Currentrealtime voicemultimodal inputsaudio
Specifications(1 models)
| Model | Released | Vision | Multimodal |
|---|---|---|---|
| GLM-Realtime | — | Yes | Yes |





