OpenAI compatible API · Attested · Public status
DeepInfra performance
Measured TTFT, TTFB, effective throughput, uptime, and sampled model routes for DeepInfra.
Onebase URL to migrate
100sof models and routes
0prompt or output logs. Always.
deepinfra
47 samples
Continuously sampled provider performance. TrustedRouter reports unsupported route and probe-configuration rows separately from provider downtime. Prompt and output content is not stored.
| p50 TTFT | 1653 ms |
|---|---|
| p95 TTFT | 7050 ms |
| p50 TTFB | 1835 ms |
| Effective throughput | 53 tok/s n=15 |
| Uptime | 97.87% |
Measured model routes
| Model | p50 TTFT | p50 TTFB | Effective throughput | Uptime | Config excluded | Availability samples |
|---|---|---|---|---|---|---|
| qwen/qwen3.5-27b | 369 ms | 368 ms | — | 100.00% | — | 1 |
| qwen/qwen3.5-9b | 476 ms | 476 ms | — | 100.00% | — | 2 |
| z-ai/glm-4.6 | 504 ms | 504 ms | — | 100.00% | — | 1 |
| qwen/qwen3-30b-a3b | 548 ms | 548 ms | — | 100.00% | — | 1 |
| qwen/qwen3.5-35b-a3b | 698 ms | 698 ms | — | 100.00% | — | 2 |
| qwen/qwen3-235b-a22b-thinking-2507 | 764 ms | 764 ms | — | 100.00% | — | 1 |
| deepseek/deepseek-v4-flash | 882 ms | 882 ms | 37 tok/s n=1 | 100.00% | — | 1 |
| openai/gpt-oss-120b | 923 ms | 923 ms | 28 tok/s n=1 | 100.00% | — | 1 |
| google/gemma-3-12b-it | 938 ms | 938 ms | — | 100.00% | — | 2 |
| tencent/hy3 | 1187 ms | 1187 ms | 53 tok/s n=1 | 100.00% | — | 1 |
| qwen/qwen3.5-397b-a17b | 1338 ms | 1338 ms | — | 100.00% | — | 2 |
| nousresearch/hermes-3-llama-3.1-405b | 1498 ms | 1498 ms | — | 100.00% | — | 2 |
| qwen/qwen3-14b | 1595 ms | 1594 ms | — | 100.00% | — | 4 |
| google/gemma-3-27b-it | 1645 ms | 1645 ms | — | 100.00% | — | 1 |
| meta-llama/llama-3.1-70b-instruct | 1653 ms | 1653 ms | — | 100.00% | — | 1 |
| deepseek/deepseek-r1-0528 | 1838 ms | 1838 ms | — | 100.00% | — | 1 |
| z-ai/glm-4.7 | 1874 ms | 1873 ms | — | 100.00% | — | 1 |
| moonshotai/kimi-k2.5 | 2274 ms | 2274 ms | — | 100.00% | — | 3 |
| google/gemini-2.5-flash | 2584 ms | 2583 ms | — | 100.00% | — | 1 |
| openai/gpt-oss-20b | 2819 ms | 2819 ms | — | 100.00% | — | 3 |
| deepseek/deepseek-v3.1-terminus | 2857 ms | 2856 ms | — | 100.00% | — | 2 |
| google/gemini-3.1-flash-lite | 2872 ms | 2872 ms | — | 100.00% | — | 2 |
| gryphe/mythomax-l2-13b | 3012 ms | 3012 ms | — | 100.00% | — | 1 |
| qwen/qwen3.6-35b-a3b | 3189 ms | 3189 ms | — | 100.00% | — | 1 |
| google/gemma-3-4b-it | 3238 ms | 3238 ms | — | 100.00% | — | 1 |
| z-ai/glm-5 | 3512 ms | 3512 ms | — | 100.00% | — | 3 |
| thinkingmachines/inkling-small | 3641 ms | 3641 ms | 63 tok/s n=1 | 100.00% | — | 1 |
| minimax/minimax-m2.7 | 8778 ms | 8778 ms | — | 100.00% | — | 3 |
| deepseek/deepseek-v4-flash-0731 | — | — | 63 tok/s n=1 | — | — | 0 |
| deepseek/deepseek-v4-pro | — | — | 73 tok/s n=2 | — | — | 0 |
| google/gemma-4-31b-it | — | — | 54 tok/s n=2 | — | — | 0 |
| minimax/minimax-m3 | — | — | 19 tok/s n=2 | — | — | 0 |
| moonshotai/kimi-k2.6 | — | — | 37 tok/s n=1 | — | — | 0 |
| qwen/qwen3.5-122b-a10b | — | — | — | 0.00% | — | 1 |
| thinkingmachines/inkling | — | — | 67 tok/s n=1 | — | — | 0 |
| z-ai/glm-5.2 | — | — | 49 tok/s n=2 | — | — | 0 |