RTX 4090 D vs RTX PRO 6000 Blackwell
Best verified output tok/s per model (single-stream generation). Hover a value for the quant.
RTX 4090 D2 verified runs · best 70.9 tok/s
RTX PRO 6000 Blackwell29 verified runs · best 1271.3 tok/s
| Model | RTX 4090 D | RTX PRO 6000 Blackwell |
|---|---|---|
| MobileLLM-125M | — | 1271.3 |
| Qwen2.5-0.5B-Instruct | — | 1060.0 |
| MobileLLM-350M | — | 980.8 |
| SmolLM2-360M-Instruct | — | 968.1 |
| Qwen3-0.6B | — | 956.4 |
| Llama-3.2-1B-Instruct | — | 699.9 |
| gemma-3-1b-it | — | 664.3 |
| Llama-3.2-3B-Instruct | — | 489.2 |
| Ling-3.0-tiny | — | 369.1 |
| Qwen3.6-35B-A3B | — | 330.2 |
| Ornith-1.0-35B | — | 309.7 |
| Qwen3.8-27B | 70.9 | 296.0 |
| DeepSeek-Coder-V2-Lite-Instruct | — | 237.3 |
| Qwen3-Coder-Next | — | 174.3 |
| Llama-3.1-8B-Instruct | — | 158.1 |
| Muse-Glimmer-30B | — | 152.2 |
| Qwen3.8-27B-MTP | — | 112.1 |
| Qwen3.6-27B | — | 101.4 |
| Qwen3-14B | — | 90.8 |
| Kimi-Linear-48B-A3B-Instruct | — | 90.0 |
| Qwen3.6-27B-MTP | — | 60.1 |
| Qwen2.5-Coder-14B-Instruct | — | 50.3 |
| Qwen3-Coder-30B-A3B-Instruct | — | 26.1 |