gemma-4-12B-it-qat
Gemma family · 12.0B params
3recorded runs
130.8best tok/s
1verified
All benchmarks Methodology
| GPU | Model | Quant | Backend | Ctx |
tok/s | prompt tok/s | VRAM GB | Source |
| RTX 3080 · 10 GB | gemma-4-12B-it-qat | Q4_0 | llama.cpp b10472 | 262144 | 71.2 ✓ | 2671.1 | 9.7 | src |
| RTX 5090 · 32 GB | gemma-4-12B-it-qat | Q4_0 | lmstudio unknown | 2048 | 130.8 … | 368.7 | — | src |
| RTX 3090 · 24 GB | gemma-4-12B-it-qat | UD-Q4_K_XL | llama.cpp unknown | 512 | 126.5 … | 1871.8 | 11.8 | src |