Qwen3.5-0.8B-MTP
Qwen family · 0.8B params
1recorded run
476.1best tok/s
1verified
Fastest GPUs for this model (best tok/s)
- RTX 3090476.1
All benchmarks Methodology
| GPU | Model | Quant | Backend | Ctx |
tok/s | prompt tok/s | VRAM GB | Source |
| RTX 3090 · 24 GB | Qwen3.5-0.8B-MTP | Q6_K_XL | llama.cpp 0.3.0-dev (build 1, commit d7bd3bf) | 24576 | 476.1 ✓ | 6693.2 | 1.6 | src |