DGX Spark x1 vs RTX 5090
Best verified output tok/s per model (single-stream generation). Hover a value for the quant.
DGX Spark x13 verified runs · best 72.0 tok/s
RTX 509024 verified runs · best 2231.4 tok/s
| Model | DGX Spark x1 | RTX 5090 |
|---|---|---|
| LFM2-350M-NVFP4A16 | — | 2231.4 |
| NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 | — | 446.7 |
| Qwen3.8-27B | — | 435.1 |
| Ornith-1.0-35B-PrismaAURA-4.75bit-vllm-MTP | — | 283.1 |
| Kimi-Linear-48B-A3B-Instruct | — | 280.8 |
| Ornith-1.5-35B-A3B-NVFP4 | — | 258.8 |
| North-Mini-Code-1.0 | — | 258.4 |
| Qwen3.6-35B-A3B-MTP-GGUF | — | 222.9 |
| Laguna-XS-2.1-NVFP4 | — | 216.7 |
| Qwen3.8-27B-nvfp4-NInfer | — | 213.0 |
| Laguna-XS-2.1-INT4 | — | 206.2 |
| KAT-Coder-V2.5-Dev-AWQ-W4A16-ASYM | — | 201.2 |
| Ornith-1.0-35B-AWQ-INT4 | — | 196.6 |
| Qwen3.8-27B-GPTQ-W4A16 | — | 137.9 |
| Muse-Glimmer-30B-NVFP4 | — | 124.8 |
| Qwen3.6-27B-NVFP4 | — | 120.9 |
| Huihui-Qwen3.8-27B-abliterated-NVFP4 | — | 117.7 |
| Qwen3.8-27B-W4A16-AWQ | — | 108.0 |
| Qwen3.8-27B-5090-goldilocks-GGUF | — | 93.5 |
| Qwen3.8-27B-GGUF | — | 79.4 |
| Qwen3.8-Flash-Next | 72.0 | — |
| Qwen3.6-27B-MTP-GGUF | — | 28.3 |
| DeepSeek-V4-Flash-0731-MXFP4-GGUF | — | 26.4 |
| Qwen3.8-27B-FP8 | — | 16.8 |
| Qwen3.6-27B-GGUF | — | 4.1 |