GLM 4.6
z-ai/glm-4.6
Compare with GLM 4.6V, GLM 4.5 Air, GLM 4.5V
CompareGLM 4.6
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100% | 99.92% | 99.17% | 99.17% | 488ms | 8.81s | 50 tps | 203K | $0.500 / $2.00 | |
| Healthy | 100% | 99.31% | 98.76% | 98.76% | 1.05s | 11.5s | 32 tps | 198K | $0.430 / $1.75 | |
| Degraded | 97.50% | 95.53% | 91.77% | 91.77% | 1.06s | 25.3s | 21 tps | 203K | $0.600 / $2.20 | |
| Degraded | 91.11% | 97.23% | 96.74% | 96.74% | 1.32s | 37.5s | 27 tps | 205K | $0.550 / $2.20 | |
| Degraded | — | 92.88% | 97.11% | 97.11% | 660ms | 20.8s | 44 tps | 203K | $0.600 / $2.20 |
- DeepInfra100%Healthy24h 99.92%
- 7d
- 99.17%
- 30d
- 99.17%
- p50
- 488ms
- p99
- 8.81s
- Throughput
- 50 tps
- Context
- 203K
- $/Mtok
- $0.500 / $2.00
deepinfra/fp4fp4 - Venice100%Healthy24h 99.31%
- 7d
- 98.76%
- 30d
- 98.76%
- p50
- 1.05s
- p99
- 11.5s
- Throughput
- 32 tps
- Context
- 198K
- $/Mtok
- $0.430 / $1.75
venice/fp4fp4 - Z.AI97.50%Degraded24h 95.53%
- 7d
- 91.77%
- 30d
- 91.77%
- p50
- 1.06s
- p99
- 25.3s
- Throughput
- 21 tps
- Context
- 203K
- $/Mtok
- $0.600 / $2.20
z-ai/fp4fp4 - Novita91.11%Degraded24h 97.23%
- 7d
- 96.74%
- 30d
- 96.74%
- p50
- 1.32s
- p99
- 37.5s
- Throughput
- 27 tps
- Context
- 205K
- $/Mtok
- $0.550 / $2.20
novita/bf16bf16 - Degraded24h 92.88%
- 7d
- 97.11%
- 30d
- 97.11%
- p50
- 660ms
- p99
- 20.8s
- Throughput
- 44 tps
- Context
- 203K
- $/Mtok
- $0.600 / $2.20
atlas-cloud/fp8fp8
Measured 1m ago. Latency and throughput are OpenRouter's rolling 30-minute windows.
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.