Qwen3.8-27B-MTP
7recorded runs
117.7best tok/s
3verified
Fastest GPUs for this model (best tok/s)
- RTX 5090117.7
- RTX PRO 6000 Blackwell112.1
- Intel Arc Pro B7060.9
- CMP 170HX57.6
- Tesla V100 x238.3
| GPU | Model | Quant | Backend | Ctx | tok/s | prompt tok/s | VRAM GB | Source |
|---|---|---|---|---|---|---|---|---|
| RTX PRO 6000 Blackwell · 96 GB | Qwen3.8-27B-MTP | NVFP4 | vllm 0.27.1 | 2048 | 112.1 ✓ | — | — | src |
| CMP 170HX · 64 GB | Qwen3.8-27B-MTP | INT8-W8A16 | vllm 0.27.1 | 131336 | 46.4 ✓ | 1323.5 | — | src |
| CMP 170HX · 64 GB | Qwen3.8-27B-MTP | MTP-Q8_0 | llama.cpp 0.3.0-dev+b10705 | 131295 | 27.4 ✓ | 598.5 | — | src |
| RTX 5090 · 32 GB | Qwen3.8-27B-MTP | NVFP4 | vllm unknown | 172800 | 117.7 … | 7466.2 | — | src |
| Intel Arc Pro B70 · 32 GB | Qwen3.8-27B-MTP | GPTQ | vllm unknown | 2048 | 60.9 … | 456.7 | — | src |
| CMP 170HX · 64 GB | Qwen3.8-27B-MTP | MTP-Q4_K_M | llama.cpp 0.3.0-dev+b10705 | 17370 | 57.6 … | 671.2 | — | src |
| Tesla V100 x2 · 32 GB | Qwen3.8-27B-MTP | Q6_K | llama.cpp unknown | 262144 | 38.3 … | 282.1 | — | src |