Llama 3.3 70B Instruct: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 98.64% | 97.83% | 97.83% | 167ms◆ (best) | 1.46s | 50 tps | 128K | $0.710 / $0.710 | |
| Healthy | 100%◆ (best) | 99.74% | 99.08% | 99.08% | 380ms | 2.51s | 47 tps | 131K | $0.250 / $0.750 | |
Googlegoogle-vertex/us-central1 | Healthy | 100%◆ (best) | 99.99% | 100%◆ (best) | 100%◆ (best) | 389ms | 2.09s | 39 tps | 128K | $0.720 / $0.720 |
Groqgroq | Healthy | 100%◆ (best) | 99.91% | 99.57% | 99.57% | 198ms | 616ms◆ (best) | 18 tps | 131K | $0.590 / $0.790 |
| Healthy | 99.64% | 97.01% | 97.28% | 97.28% | 777ms | 5.11s | 22 tps | 131K | $0.200 / $0.520 | |
| Healthy | 99.33% | 98.31% | 97.90% | 97.90% | 625ms | 5.92s | 35 tps | 131K | $0.220 / $0.500 | |
| Healthy | 98.51% | 95.94% | 94.55% | 94.55% | 682ms | 5.58s | 29 tps | 24K | $0.293 / $2.25 | |
| Healthy | 97.99% | 94.77% | 94.32% | 94.32% | 792ms | 6.61s | 28 tps | 12K | $0.135 / $0.400 | |
Googlegoogle-vertex | Healthy | 97.78% | 98.81% | 98.30% | 98.30% | 393ms | 2.01s | 38 tps | 128K | $0.720 / $0.720 |
SambaNovasambanova-turbo | Degraded | 96.71% | 96.75% | 95.41% | 95.41% | 672ms | 5.68s | 79 tps◆ (best) | 131K | $0.450 / $0.900 |
| Degraded | 96.02% | 96.82% | 96.49% | 96.49% | 841ms | 7.50s | 7.0 tps | 131K | $0.100 / $0.320◆ (best) | |
| Down | — | 41.46% | 42.69% | 42.69% | 1.86s | 14.3s | 7.0 tps | 131K | $0.130 / $0.400 | |
Togethertogether | No data | — | 98.50% | 97.76% | 97.76% | 680ms | 3.14s | 30 tps | 131K | $1.04 / $1.04 |
- CoreWeave100%◆ (best)Healthy24h 98.64%
- 7d
- 97.83%
- 30d
- 97.83%
- p50
- 167ms◆ (best)
- p99
- 1.46s
- Throughput
- 50 tps
- Context
- 128K
- $/Mtok
- $0.710 / $0.710
coreweave/fp16fp16 - Crusoe100%◆ (best)Healthy24h 99.74%
- 7d
- 99.08%
- 30d
- 99.08%
- p50
- 380ms
- p99
- 2.51s
- Throughput
- 47 tps
- Context
- 131K
- $/Mtok
- $0.250 / $0.750
crusoe/bf16bf16 - Google100%◆ (best)Healthy24h 99.99%
- 7d
- 100%◆ (best)
- 30d
- 100%◆ (best)
- p50
- 389ms
- p99
- 2.09s
- Throughput
- 39 tps
- Context
- 128K
- $/Mtok
- $0.720 / $0.720
google-vertex/us-central1 - Groq100%◆ (best)Healthy24h 99.91%
- 7d
- 99.57%
- 30d
- 99.57%
- p50
- 198ms
- p99
- 616ms◆ (best)
- Throughput
- 18 tps
- Context
- 131K
- $/Mtok
- $0.590 / $0.790
groq - AkashML99.64%Healthy24h 97.01%
- 7d
- 97.28%
- 30d
- 97.28%
- p50
- 777ms
- p99
- 5.11s
- Throughput
- 22 tps
- Context
- 131K
- $/Mtok
- $0.200 / $0.520
akashml/fp8fp8 - Parasail99.33%Healthy24h 98.31%
- 7d
- 97.90%
- 30d
- 97.90%
- p50
- 625ms
- p99
- 5.92s
- Throughput
- 35 tps
- Context
- 131K
- $/Mtok
- $0.220 / $0.500
parasail/fp8fp8 - Cloudflare98.51%Healthy24h 95.94%
- 7d
- 94.55%
- 30d
- 94.55%
- p50
- 682ms
- p99
- 5.58s
- Throughput
- 29 tps
- Context
- 24K
- $/Mtok
- $0.293 / $2.25
cloudflare/fp8fp8 - Novita97.99%Healthy24h 94.77%
- 7d
- 94.32%
- 30d
- 94.32%
- p50
- 792ms
- p99
- 6.61s
- Throughput
- 28 tps
- Context
- 12K
- $/Mtok
- $0.135 / $0.400
novita/bf16bf16 - Google97.78%Healthy24h 98.81%
- 7d
- 98.30%
- 30d
- 98.30%
- p50
- 393ms
- p99
- 2.01s
- Throughput
- 38 tps
- Context
- 128K
- $/Mtok
- $0.720 / $0.720
google-vertex - SambaNova96.71%Degraded24h 96.75%
- 7d
- 95.41%
- 30d
- 95.41%
- p50
- 672ms
- p99
- 5.68s
- Throughput
- 79 tps◆ (best)
- Context
- 131K
- $/Mtok
- $0.450 / $0.900
sambanova-turbo - DeepInfra96.02%Degraded24h 96.82%
- 7d
- 96.49%
- 30d
- 96.49%
- p50
- 841ms
- p99
- 7.50s
- Throughput
- 7.0 tps
- Context
- 131K
- $/Mtok
- $0.100 / $0.320◆ (best)
deepinfra/turbofp8 - Down24h 41.46%
- 7d
- 42.69%
- 30d
- 42.69%
- p50
- 1.86s
- p99
- 14.3s
- Throughput
- 7.0 tps
- Context
- 131K
- $/Mtok
- $0.130 / $0.400
nebius/fp8fp8 - No data24h 98.50%
- 7d
- 97.76%
- 30d
- 97.76%
- p50
- 680ms
- p99
- 3.14s
- Throughput
- 30 tps
- Context
- 131K
- $/Mtok
- $1.04 / $1.04
together
Measured 4m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.