Gemma 4 26B A4B : providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 99.47% | 99.36% | 99.36% | 1.29s | 4.52s | 21 tps | 262K | $0.120 / $0.400 | |
| Healthy | 99.94% | 99.83% | 99.82%◆ (best) | 99.82%◆ (best) | 694ms | 2.28s◆ (best) | 31 tps | 262K | $0.100 / $0.400 | |
| Healthy | 99.90% | 99.84% | 99.45% | 99.45% | 402ms◆ (best) | 2.32s | 25 tps | 262K | $0.070 / $0.340 | |
Cloudflarecloudflare | Healthy | 99.89% | 99.73% | 94.59% | 94.59% | 587ms | 14.1s | 56 tps◆ (best) | 256K | $0.100 / $0.300 |
| Healthy | 99.70% | 99.04% | 98.65% | 98.65% | 531ms | 5.31s | 36 tps | 262K | $0.130 / $0.400 | |
| Healthy | 99.68% | 99.40% | 99.34% | 99.34% | 970ms | 5.64s | 32 tps | 256K | $0.130 / $0.400 | |
| Healthy | 99.42% | 97.99% | 95.77% | 95.77% | 811ms | 8.65s | 29 tps | 262K | $0.130 / $0.400 | |
Googlegoogle-vertex/global | Healthy | 98.49% | 98.65% | 98.10% | 98.10% | 441ms | 11.8s | 25 tps | 262K | $0.150 / $0.600 |
Darkbloomdarkbloom | Healthy | 95.52% | 95.70% | 95.82% | 95.82% | 3.56s | 19.4s | 6.0 tps | 131K | $0.050 / $0.250◆ (best) |
- SiliconFlow100%◆ (best)Healthy24h 99.47%
- 7d
- 99.36%
- 30d
- 99.36%
- p50
- 1.29s
- p99
- 4.52s
- Throughput
- 21 tps
- Context
- 262K
- $/Mtok
- $0.120 / $0.400
siliconflow/fp8fp8 - NextBit99.94%Healthy24h 99.83%
- 7d
- 99.82%◆ (best)
- 30d
- 99.82%◆ (best)
- p50
- 694ms
- p99
- 2.28s◆ (best)
- Throughput
- 31 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.400
nextbit/bf16bf16 - DeepInfra99.90%Healthy24h 99.84%
- 7d
- 99.45%
- 30d
- 99.45%
- p50
- 402ms◆ (best)
- p99
- 2.32s
- Throughput
- 25 tps
- Context
- 262K
- $/Mtok
- $0.070 / $0.340
deepinfra/fp8fp8 - Cloudflare99.89%Healthy24h 99.73%
- 7d
- 94.59%
- 30d
- 94.59%
- p50
- 587ms
- p99
- 14.1s
- Throughput
- 56 tps◆ (best)
- Context
- 256K
- $/Mtok
- $0.100 / $0.300
cloudflare - Parasail99.70%Healthy24h 99.04%
- 7d
- 98.65%
- 30d
- 98.65%
- p50
- 531ms
- p99
- 5.31s
- Throughput
- 36 tps
- Context
- 262K
- $/Mtok
- $0.130 / $0.400
parasail/bf16bf16 - Venice99.68%Healthy24h 99.40%
- 7d
- 99.34%
- 30d
- 99.34%
- p50
- 970ms
- p99
- 5.64s
- Throughput
- 32 tps
- Context
- 256K
- $/Mtok
- $0.130 / $0.400
venice/bf16bf16 - Novita99.42%Healthy24h 97.99%
- 7d
- 95.77%
- 30d
- 95.77%
- p50
- 811ms
- p99
- 8.65s
- Throughput
- 29 tps
- Context
- 262K
- $/Mtok
- $0.130 / $0.400
novita/bf16bf16 - Google98.49%Healthy24h 98.65%
- 7d
- 98.10%
- 30d
- 98.10%
- p50
- 441ms
- p99
- 11.8s
- Throughput
- 25 tps
- Context
- 262K
- $/Mtok
- $0.150 / $0.600
google-vertex/global - Darkbloom95.52%Healthy24h 95.70%
- 7d
- 95.82%
- 30d
- 95.82%
- p50
- 3.56s
- p99
- 19.4s
- Throughput
- 6.0 tps
- Context
- 131K
- $/Mtok
- $0.050 / $0.250◆ (best)
darkbloom
Measured 3m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window, averaged over the hour.
Throughput
Median tokens per second.