GLM 4.7: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 95.74% | 96.76% | 96.76% | 1.50s | 20.3s | 14 tps | 203K | $0.400 / $1.75◆ (best) | |
Googlegoogle-vertex | Healthy | 100%◆ (best) | 99.78% | 99.91%◆ (best) | 99.91%◆ (best) | 521ms◆ (best) | 2.86s◆ (best) | 94 tps◆ (best) | 200K | $0.600 / $2.20 |
| Degraded | 97.78% | 91.89% | 94.88% | 94.88% | 1.40s | 14.0s | 12 tps | 131K | $0.600 / $2.50 | |
| Degraded | 97.44% | 92.08% | 95.23% | 95.23% | 1.41s | 14.6s | 14 tps | 198K | $0.550 / $2.65 | |
| Healthy | 97.03% | 93.16% | 91.58% | 91.58% | 2.27s | 22.7s | 26 tps | 203K | $0.600 / $2.20 | |
| Degraded | 96.00% | 93.79% | 94.19% | 94.19% | 2.04s | 34.1s | 18 tps | 205K | $0.540 / $1.98 | |
| Degraded | 93.83% | 93.08% | 92.93% | 92.93% | 1.80s | 22.7s | 28 tps | 200K | $0.480 / $1.76 | |
| Degraded | 92.57% | 90.27% | 94.23% | 94.23% | 1.17s | 12.2s | 24 tps | 203K | $0.520 / $1.85 |
- DeepInfra100%◆ (best)Healthy24h 95.74%
- 7d
- 96.76%
- 30d
- 96.76%
- p50
- 1.50s
- p99
- 20.3s
- Throughput
- 14 tps
- Context
- 203K
- $/Mtok
- $0.400 / $1.75◆ (best)
deepinfra/fp4fp4 - Google100%◆ (best)Healthy24h 99.78%
- 7d
- 99.91%◆ (best)
- 30d
- 99.91%◆ (best)
- p50
- 521ms◆ (best)
- p99
- 2.86s◆ (best)
- Throughput
- 94 tps◆ (best)
- Context
- 200K
- $/Mtok
- $0.600 / $2.20
google-vertex - Mancer 297.78%Degraded24h 91.89%
- 7d
- 94.88%
- 30d
- 94.88%
- p50
- 1.40s
- p99
- 14.0s
- Throughput
- 12 tps
- Context
- 131K
- $/Mtok
- $0.600 / $2.50
mancer/fp4fp4 - Venice97.44%Degraded24h 92.08%
- 7d
- 95.23%
- 30d
- 95.23%
- p50
- 1.41s
- p99
- 14.6s
- Throughput
- 14 tps
- Context
- 198K
- $/Mtok
- $0.550 / $2.65
venice/fp4fp4 - Z.AI97.03%Healthy24h 93.16%
- 7d
- 91.58%
- 30d
- 91.58%
- p50
- 2.27s
- p99
- 22.7s
- Throughput
- 26 tps
- Context
- 203K
- $/Mtok
- $0.600 / $2.20
z-ai/fp4fp4 - Novita96.00%Degraded24h 93.79%
- 7d
- 94.19%
- 30d
- 94.19%
- p50
- 2.04s
- p99
- 34.1s
- Throughput
- 18 tps
- Context
- 205K
- $/Mtok
- $0.540 / $1.98
novita/fp8fp8 - StreamLake93.83%Degraded24h 93.08%
- 7d
- 92.93%
- 30d
- 92.93%
- p50
- 1.80s
- p99
- 22.7s
- Throughput
- 28 tps
- Context
- 200K
- $/Mtok
- $0.480 / $1.76
streamlake/fp8fp8 - AtlasCloud92.57%Degraded24h 90.27%
- 7d
- 94.23%
- 30d
- 94.23%
- p50
- 1.17s
- p99
- 12.2s
- Throughput
- 24 tps
- Context
- 203K
- $/Mtok
- $0.520 / $1.85
atlas-cloud/fp8fp8
Measured 2m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.