Gemma 4 26B A4B : providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
Cloudflarecloudflare | Healthy | 100%◆ (best) | 99.53% | 94.59% | 94.59% | 566ms | 11.7s | 54 tps◆ (best) | 256K | $0.100 / $0.300 |
| Healthy | 100%◆ (best) | 97.48% | 95.77% | 95.77% | 830ms | 5.72s | 23 tps | 262K | $0.130 / $0.400 | |
| Healthy | 99.86% | 99.84% | 99.45% | 99.45% | 420ms | 4.13s◆ (best) | 20 tps | 262K | $0.070 / $0.340 | |
| Healthy | 99.64% | 99.83% | 99.82%◆ (best) | 99.82%◆ (best) | 814ms | 5.56s | 19 tps | 262K | $0.100 / $0.400 | |
| Healthy | 99.44% | 99.50% | 99.36% | 99.36% | 1.31s | 7.49s | 19 tps | 262K | $0.120 / $0.400 | |
| Healthy | 99.40% | 99.39% | 99.34% | 99.34% | 960ms | 7.27s | 19 tps | 256K | $0.130 / $0.400 | |
| Healthy | 99.10% | 98.96% | 98.65% | 98.65% | 677ms | 8.13s | 23 tps | 262K | $0.130 / $0.400 | |
Googlegoogle-vertex/global | Healthy | 98.84% | 98.57% | 98.10% | 98.10% | 386ms◆ (best) | 9.33s | 29 tps | 262K | $0.150 / $0.600 |
Darkbloomdarkbloom | Healthy | 97.09% | 95.66% | 95.82% | 95.82% | 3.46s | 21.0s | 6.0 tps | 131K | $0.050 / $0.250◆ (best) |
- Cloudflare100%◆ (best)Healthy24h 99.53%
- 7d
- 94.59%
- 30d
- 94.59%
- p50
- 566ms
- p99
- 11.7s
- Throughput
- 54 tps◆ (best)
- Context
- 256K
- $/Mtok
- $0.100 / $0.300
cloudflare - Novita100%◆ (best)Healthy24h 97.48%
- 7d
- 95.77%
- 30d
- 95.77%
- p50
- 830ms
- p99
- 5.72s
- Throughput
- 23 tps
- Context
- 262K
- $/Mtok
- $0.130 / $0.400
novita/bf16bf16 - DeepInfra99.86%Healthy24h 99.84%
- 7d
- 99.45%
- 30d
- 99.45%
- p50
- 420ms
- p99
- 4.13s◆ (best)
- Throughput
- 20 tps
- Context
- 262K
- $/Mtok
- $0.070 / $0.340
deepinfra/fp8fp8 - NextBit99.64%Healthy24h 99.83%
- 7d
- 99.82%◆ (best)
- 30d
- 99.82%◆ (best)
- p50
- 814ms
- p99
- 5.56s
- Throughput
- 19 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.400
nextbit/bf16bf16 - SiliconFlow99.44%Healthy24h 99.50%
- 7d
- 99.36%
- 30d
- 99.36%
- p50
- 1.31s
- p99
- 7.49s
- Throughput
- 19 tps
- Context
- 262K
- $/Mtok
- $0.120 / $0.400
siliconflow/fp8fp8 - Venice99.40%Healthy24h 99.39%
- 7d
- 99.34%
- 30d
- 99.34%
- p50
- 960ms
- p99
- 7.27s
- Throughput
- 19 tps
- Context
- 256K
- $/Mtok
- $0.130 / $0.400
venice/bf16bf16 - Parasail99.10%Healthy24h 98.96%
- 7d
- 98.65%
- 30d
- 98.65%
- p50
- 677ms
- p99
- 8.13s
- Throughput
- 23 tps
- Context
- 262K
- $/Mtok
- $0.130 / $0.400
parasail/bf16bf16 - Google98.84%Healthy24h 98.57%
- 7d
- 98.10%
- 30d
- 98.10%
- p50
- 386ms◆ (best)
- p99
- 9.33s
- Throughput
- 29 tps
- Context
- 262K
- $/Mtok
- $0.150 / $0.600
google-vertex/global - Darkbloom97.09%Healthy24h 95.66%
- 7d
- 95.82%
- 30d
- 95.82%
- p50
- 3.46s
- p99
- 21.0s
- Throughput
- 6.0 tps
- Context
- 131K
- $/Mtok
- $0.050 / $0.250◆ (best)
darkbloom
Measured 4m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.