OpenAI compatible API · Attested · Public status
Venice performance
Review measured TTFT, TTFB, effective throughput, uptime, and sampled model routes for Venice on TrustedRouter using metadata-only production probes.
Onebase URL to migrate
100sof models and routes
0prompt or output logs. Always.
Venicevenice
46 samplesContinuously sampled provider performance. TrustedRouter reports unsupported route and probe-configuration rows separately from provider downtime. Prompt and output content is not stored.
| p50 TTFT | 2700 ms |
|---|---|
| p95 TTFT | 14142 ms |
| p50 TTFB | 3520 ms |
| Effective throughput | 39 tok/s n=9 |
| Uptime | 93.48% |
Measured model routes
| Model | p50 TTFT | p50 TTFB | Effective throughput | Uptime | Config excluded | Availability samples |
|---|---|---|---|---|---|---|
| nvidia/nemotron-3.5-lightning | 827 ms | 826 ms | 50 tok/s n=1 | 100.00% | — | 2 |
| qwen/qwen3-5-35b-a3b | 1064 ms | 1064 ms | — | 100.00% | — | 2 |
| moonshotai/kimi-k3 | 1468 ms | 1468 ms | 39 tok/s n=2 | 100.00% | — | 2 |
| deepseek/deepseek-v4-flash-0731-fast | 1709 ms | 1709 ms | — | 100.00% | — | 1 |
| z-ai/glm-5.2 | 1725 ms | 1725 ms | 20 tok/s n=1 | 100.00% | — | 2 |
| qwen/qwen3-235b-a22b-instruct-2507 | 1777 ms | 1777 ms | — | 100.00% | — | 2 |
| moonshotai/kimi-k2-6 | 1884 ms | 1884 ms | — | 100.00% | — | 2 |
| qwen/qwen3-vl-235b-a22b | 2562 ms | 2561 ms | — | 100.00% | — | 1 |
| qwen/qwen3-next-80b | 2700 ms | 2699 ms | — | 100.00% | — | 1 |
| z-ai/glm-4.7 | 2719 ms | 2719 ms | — | 100.00% | — | 2 |
| qwen/qwen3-235b-a22b-thinking-2507 | 3076 ms | 3075 ms | — | 100.00% | — | 1 |
| google/gemma-4-uncensored | 3085 ms | 3085 ms | — | 100.00% | — | 1 |
| minimax/minimax-m25 | 3513 ms | 3513 ms | — | 100.00% | — | 2 |
| z-ai/glm-5v-turbo | 3521 ms | 3520 ms | — | 100.00% | — | 1 |
| meta-llama/llama-3.2-3b | 3825 ms | 3824 ms | — | 100.00% | — | 1 |
| moonshotai/kimi-k2-7-code | 4001 ms | 4000 ms | — | 100.00% | — | 1 |
| qwen/qwen-3-8-2-4t-a95b | 4218 ms | 4218 ms | — | 100.00% | — | 3 |
| qwen/qwen-3-6-plus | 4370 ms | 4370 ms | — | 100.00% | — | 3 |
| qwen/qwen-3-7-plus | 4545 ms | 4545 ms | — | 100.00% | — | 3 |
| z-ai/glm-4.6 | 4658 ms | 4658 ms | — | 100.00% | — | 1 |
| z-ai/glm-5 | 5333 ms | 5333 ms | — | 100.00% | — | 1 |
| deepseek/deepseek-v4-pro-0423 | 8112 ms | 8111 ms | 28 tok/s n=2 | 100.00% | — | 1 |
| z-ai/glm-5-turbo | 15060 ms | 15059 ms | — | 100.00% | — | 1 |
| qwen/qwen3.6-27b | 889 ms | 888 ms | — | 75.00% | — | 8 |
| deepseek/deepseek-v3.2 | — | — | — | 0.00% | — | 1 |
| deepseek/deepseek-v4-flash | — | — | 50 tok/s n=2 | — | — | 0 |
| deepseek/deepseek-v4-flash-0731 | — | — | 58 tok/s n=1 | — | — | 0 |