Qwen3.5-9B: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 99.89% | 99.50% | 99.52% | 2.69s | 18.0s | 18 tps | 262K | $0.080 / $0.130◆ (best) | |
| Healthy | 100%◆ (best) | 99.74% | 99.72% | 98.15% | 957ms | 4.99s | 24 tps | 262K | $0.100 / $0.150 | |
| Healthy | 100%◆ (best) | 99.98% | 98.99% | 98.58% | 732ms | 646s | 48 tps | 262K | $0.100 / $0.250 | |
| Healthy | 100%◆ (best) | 99.78% | 99.79%◆ (best) | 99.53%◆ (best) | 912ms | 2.82s◆ (best) | 74 tps | 256K | $0.100 / $0.150 | |
Togethertogether | Healthy | 99.44% | 99.40% | 98.27% | 97.64% | 254ms◆ (best) | 4.63s | 86 tps◆ (best) | 262K | $0.170 / $0.250 |
| Healthy | 98.92% | 98.99% | 97.84% | 95.24% | 1.37s | 12.5s | 27 tps | 262K | $0.100 / $0.150 |
- Darkbloom100%◆ (best)Healthy24h 99.89%
- 7d
- 99.50%
- 30d
- 99.52%
- p50
- 2.69s
- p99
- 18.0s
- Throughput
- 18 tps
- Context
- 262K
- $/Mtok
- $0.080 / $0.130◆ (best)
darkbloom/fp4fp4 - DeepInfra100%◆ (best)Healthy24h 99.74%
- 7d
- 99.72%
- 30d
- 98.15%
- p50
- 957ms
- p99
- 4.99s
- Throughput
- 24 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.150
deepinfra/bf16bf16 - Parasail100%◆ (best)Healthy24h 99.98%
- 7d
- 98.99%
- 30d
- 98.58%
- p50
- 732ms
- p99
- 646s
- Throughput
- 48 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.250
parasail/bf16bf16 - Venice100%◆ (best)Healthy24h 99.78%
- 7d
- 99.79%◆ (best)
- 30d
- 99.53%◆ (best)
- p50
- 912ms
- p99
- 2.82s◆ (best)
- Throughput
- 74 tps
- Context
- 256K
- $/Mtok
- $0.100 / $0.150
venice/fp8fp8 - Together99.44%Healthy24h 99.40%
- 7d
- 98.27%
- 30d
- 97.64%
- p50
- 254ms◆ (best)
- p99
- 4.63s
- Throughput
- 86 tps◆ (best)
- Context
- 262K
- $/Mtok
- $0.170 / $0.250
together - SiliconFlow98.92%Healthy24h 98.99%
- 7d
- 97.84%
- 30d
- 95.24%
- p50
- 1.37s
- p99
- 12.5s
- Throughput
- 27 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.150
siliconflow/fp8fp8
Measured 1m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window.
Throughput
Median tokens per second.