GLM 4.7: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
Googlegoogle-vertex | Healthy | 100%◆ (best) | 99.79% | 99.91%◆ (best) | 99.91%◆ (best) | 539ms◆ (best) | 2.63s◆ (best) | 91 tps◆ (best) | 200K | $0.600 / $2.20 |
| Degraded | 94.21% | 93.10% | 92.96% | 92.96% | 2.15s | 33.8s | 31 tps | 200K | $0.480 / $1.76 | |
| Degraded | 93.97% | 90.27% | 94.18% | 94.18% | 1.12s | 12.2s | 30 tps | 203K | $0.520 / $1.85 | |
| Degraded | 93.48% | 93.43% | 91.66% | 91.66% | 2.20s | 25.0s | 26 tps | 203K | $0.600 / $2.20 | |
| Degraded | 92.59% | 93.72% | 94.22% | 94.22% | 1.85s | 35.8s | 21 tps | 205K | $0.540 / $1.98 | |
| Down | 88.93% | 95.64% | 96.78% | 96.78% | 1.43s | 25.4s | 14 tps | 203K | $0.400 / $1.75◆ (best) | |
| Down | 87.18% | 91.74% | 95.23% | 95.23% | 1.45s | 23.2s | 13 tps | 198K | $0.550 / $2.65 | |
| Down | 52.56% | 91.03% | 94.88% | 94.88% | 1.45s | 22.4s | 12 tps | 131K | $0.600 / $2.50 |
- Google100%◆ (best)Healthy24h 99.79%
- 7d
- 99.91%◆ (best)
- 30d
- 99.91%◆ (best)
- p50
- 539ms◆ (best)
- p99
- 2.63s◆ (best)
- Throughput
- 91 tps◆ (best)
- Context
- 200K
- $/Mtok
- $0.600 / $2.20
google-vertex - StreamLake94.21%Degraded24h 93.10%
- 7d
- 92.96%
- 30d
- 92.96%
- p50
- 2.15s
- p99
- 33.8s
- Throughput
- 31 tps
- Context
- 200K
- $/Mtok
- $0.480 / $1.76
streamlake/fp8fp8 - AtlasCloud93.97%Degraded24h 90.27%
- 7d
- 94.18%
- 30d
- 94.18%
- p50
- 1.12s
- p99
- 12.2s
- Throughput
- 30 tps
- Context
- 203K
- $/Mtok
- $0.520 / $1.85
atlas-cloud/fp8fp8 - Z.AI93.48%Degraded24h 93.43%
- 7d
- 91.66%
- 30d
- 91.66%
- p50
- 2.20s
- p99
- 25.0s
- Throughput
- 26 tps
- Context
- 203K
- $/Mtok
- $0.600 / $2.20
z-ai/fp4fp4 - Novita92.59%Degraded24h 93.72%
- 7d
- 94.22%
- 30d
- 94.22%
- p50
- 1.85s
- p99
- 35.8s
- Throughput
- 21 tps
- Context
- 205K
- $/Mtok
- $0.540 / $1.98
novita/fp8fp8 - DeepInfra88.93%Down24h 95.64%
- 7d
- 96.78%
- 30d
- 96.78%
- p50
- 1.43s
- p99
- 25.4s
- Throughput
- 14 tps
- Context
- 203K
- $/Mtok
- $0.400 / $1.75◆ (best)
deepinfra/fp4fp4 - Venice87.18%Down24h 91.74%
- 7d
- 95.23%
- 30d
- 95.23%
- p50
- 1.45s
- p99
- 23.2s
- Throughput
- 13 tps
- Context
- 198K
- $/Mtok
- $0.550 / $2.65
venice/fp4fp4 - Mancer 252.56%Down24h 91.03%
- 7d
- 94.88%
- 30d
- 94.88%
- p50
- 1.45s
- p99
- 22.4s
- Throughput
- 12 tps
- Context
- 131K
- $/Mtok
- $0.600 / $2.50
mancer/fp4fp4
Measured 3m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window, averaged over the hour.
Throughput
Median tokens per second.