Qwen3.5-9B: providers compared
Every endpoint serving this model, side by side. ◆ marks the best value in each column — per model, never fleet-wide.
Current state
| State | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Healthy | 100%◆ (best) | 99.74% | 99.72% | 98.17% | 909ms | 3.78s◆ (best) | 35 tps | 262K | $0.100 / $0.150 | |
| Healthy | 100%◆ (best) | 99.98% | 99.00% | 98.59% | 708ms◆ (best) | 472s | 43 tps | 262K | $0.100 / $0.250 | |
| Healthy | 100%◆ (best) | 98.95% | 97.85% | 95.24% | 1.38s | 13.6s | 22 tps | 262K | $0.100 / $0.150 | |
| Healthy | 99.53% | 99.89% | 99.50% | 99.52% | 2.58s | 16.2s | 16 tps | 262K | $0.080 / $0.130◆ (best) | |
| Healthy | 99.47% | 99.76% | 99.79%◆ (best) | 99.57%◆ (best) | 801ms | 10.4s | 84 tps◆ (best) | 256K | $0.100 / $0.150 | |
Togethertogether | Healthy | 98.84% | 99.40% | 98.27% | 97.64% | 790ms | 13.4s | 77 tps | 262K | $0.170 / $0.250 |
- DeepInfra100%◆ (best)Healthy24h 99.74%
- 7d
- 99.72%
- 30d
- 98.17%
- p50
- 909ms
- p99
- 3.78s◆ (best)
- Throughput
- 35 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.150
deepinfra/bf16bf16 - Parasail100%◆ (best)Healthy24h 99.98%
- 7d
- 99.00%
- 30d
- 98.59%
- p50
- 708ms◆ (best)
- p99
- 472s
- Throughput
- 43 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.250
parasail/bf16bf16 - SiliconFlow100%◆ (best)Healthy24h 98.95%
- 7d
- 97.85%
- 30d
- 95.24%
- p50
- 1.38s
- p99
- 13.6s
- Throughput
- 22 tps
- Context
- 262K
- $/Mtok
- $0.100 / $0.150
siliconflow/fp8fp8 - Darkbloom99.53%Healthy24h 99.89%
- 7d
- 99.50%
- 30d
- 99.52%
- p50
- 2.58s
- p99
- 16.2s
- Throughput
- 16 tps
- Context
- 262K
- $/Mtok
- $0.080 / $0.130◆ (best)
darkbloom/fp4fp4 - Venice99.47%Healthy24h 99.76%
- 7d
- 99.79%◆ (best)
- 30d
- 99.57%◆ (best)
- p50
- 801ms
- p99
- 10.4s
- Throughput
- 84 tps◆ (best)
- Context
- 256K
- $/Mtok
- $0.100 / $0.150
venice/fp8fp8 - Together98.84%Healthy24h 99.40%
- 7d
- 98.27%
- 30d
- 97.64%
- p50
- 790ms
- p99
- 13.4s
- Throughput
- 77 tps
- Context
- 262K
- $/Mtok
- $0.170 / $0.250
together
Measured 2m ago. Latency and throughput are OpenRouter's rolling 30-minute windows. ◆ marks the best value in each column among these endpoints.
Price vs latency
One dot per endpoint at the latest round · further left = faster, lower = cheaper · hover a dot for its tag
History
Availability
Axis starts at 90% so small differences stay visible; it expands to 0 when an endpoint falls below.
Time to first token
Logarithmic axis — the fleet spans two orders of magnitude. P50 is OpenRouter's rolling 30-minute window, averaged over the hour.
Throughput
Median tokens per second.