Llama 3.3 70B Instruct: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 96.97% | 97.25% | 97.25% | 776ms | 5.62s | 21 tps | 131K | $0.200 / $0.520 | |
| Healthy | 100%◆ (best) | 98.60% | 97.79% | 97.79% | 155ms◆ (best) | 1.54s | 38 tps | 128K | $0.710 / $0.710 | |
| Healthy | 100%◆ (best) | 99.74% | 99.07% | 99.07% | 366ms | 2.58s | 53 tps | 131K | $0.250 / $0.750 | |
Groqgroq | Healthy | 100%◆ (best) | 99.91% | 99.56% | 99.56% | 214ms | 724ms◆ (best) | 16 tps | 131K | $0.590 / $0.790 |
SambaNovasambanova-turbo | Healthy | 99.64% | 96.74% | 95.40% | 95.40% | 584ms | 5.33s | 105 tps◆ (best) | 131K | $0.450 / $0.900 |
| Healthy | 98.64% | 98.29% | 97.89% | 97.89% | 675ms | 5.94s | 37 tps | 131K | $0.220 / $0.500 | |
| Healthy | 98.54% | 94.81% | 94.26% | 94.26% | 774ms | 4.18s | 29 tps | 12K | $0.135 / $0.400 | |
| Healthy | 97.37% | 95.99% | 94.52% | 94.52% | 741ms | 6.63s | 29 tps | 24K | $0.293 / $2.25 | |
| Degraded | 93.33% | 96.87% | 96.51% | 96.51% | 914ms | 8.25s | 8.0 tps | 131K | $0.100 / $0.320◆ (best) | |
Googlegoogle-vertex | No data | — | 98.83% | 98.27% | 98.27% | 377ms | 2.50s | 35 tps | 128K | $0.720 / $0.720 |
Googlegoogle-vertex/us-central1 | No data | — | 99.99% | 100%◆ (best) | 100%◆ (best) | 362ms | 2.37s | 46 tps | 128K | $0.720 / $0.720 |
| No data | — | 40.94% | 42.81% | 42.81% | 4.62s | 28.7s | 1.0 tps | 131K | $0.130 / $0.400 | |
Togethertogether | No data | — | 98.44% | 97.80% | 97.80% | 1.38s | 6.62s | 14 tps | 131K | $1.04 / $1.04 |
- AkashML100%◆ (best)Healthy24h 96.97%
- 7d
- 97.25%
- 30d
- 97.25%
- p50
- 776ms
- p99
- 5.62s
- Throughput
- 21 tps
- Context
- 131K
- $/Mtok
- $0.200 / $0.520
akashml/fp8fp8 - CoreWeave100%◆ (best)Healthy24h 98.60%
- 7d
- 97.79%
- 30d
- 97.79%
- p50
- 155ms◆ (best)
- p99
- 1.54s
- Throughput
- 38 tps
- Context
- 128K
- $/Mtok
- $0.710 / $0.710
coreweave/fp16fp16 - Crusoe100%◆ (best)Healthy24h 99.74%
- 7d
- 99.07%
- 30d
- 99.07%
- p50
- 366ms
- p99
- 2.58s
- Throughput
- 53 tps
- Context
- 131K
- $/Mtok
- $0.250 / $0.750
crusoe/bf16bf16 - Groq100%◆ (best)Healthy24h 99.91%
- 7d
- 99.56%
- 30d
- 99.56%
- p50
- 214ms
- p99
- 724ms◆ (best)
- Throughput
- 16 tps
- Context
- 131K
- $/Mtok
- $0.590 / $0.790
groq - SambaNova99.64%Healthy24h 96.74%
- 7d
- 95.40%
- 30d
- 95.40%
- p50
- 584ms
- p99
- 5.33s
- Throughput
- 105 tps◆ (best)
- Context
- 131K
- $/Mtok
- $0.450 / $0.900
sambanova-turbo - Parasail98.64%Healthy24h 98.29%
- 7d
- 97.89%
- 30d
- 97.89%
- p50
- 675ms
- p99
- 5.94s
- Throughput
- 37 tps
- Context
- 131K
- $/Mtok
- $0.220 / $0.500
parasail/fp8fp8 - Novita98.54%Healthy24h 94.81%
- 7d
- 94.26%
- 30d
- 94.26%
- p50
- 774ms
- p99
- 4.18s
- Throughput
- 29 tps
- Context
- 12K
- $/Mtok
- $0.135 / $0.400
novita/bf16bf16 - Cloudflare97.37%Healthy24h 95.99%
- 7d
- 94.52%
- 30d
- 94.52%
- p50
- 741ms
- p99
- 6.63s
- Throughput
- 29 tps
- Context
- 24K
- $/Mtok
- $0.293 / $2.25
cloudflare/fp8fp8 - DeepInfra93.33%Degraded24h 96.87%
- 7d
- 96.51%
- 30d
- 96.51%
- p50
- 914ms
- p99
- 8.25s
- Throughput
- 8.0 tps
- Context
- 131K
- $/Mtok
- $0.100 / $0.320◆ (best)
deepinfra/turbofp8 - No data24h 98.83%
- 7d
- 98.27%
- 30d
- 98.27%
- p50
- 377ms
- p99
- 2.50s
- Throughput
- 35 tps
- Context
- 128K
- $/Mtok
- $0.720 / $0.720
google-vertex - No data24h 99.99%
- 7d
- 100%◆ (best)
- 30d
- 100%◆ (best)
- p50
- 362ms
- p99
- 2.37s
- Throughput
- 46 tps
- Context
- 128K
- $/Mtok
- $0.720 / $0.720
google-vertex/us-central1 - No data24h 40.94%
- 7d
- 42.81%
- 30d
- 42.81%
- p50
- 4.62s
- p99
- 28.7s
- Throughput
- 1.0 tps
- Context
- 131K
- $/Mtok
- $0.130 / $0.400
nebius/fp8fp8 - No data24h 98.44%
- 7d
- 97.80%
- 30d
- 97.80%
- p50
- 1.38s
- p99
- 6.62s
- Throughput
- 14 tps
- Context
- 131K
- $/Mtok
- $1.04 / $1.04
together
Measured 2m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.