Qwen

Qwen3-30B-A3B-Instruct-2507 — performance reports

Community-submitted & scraped throughput measurements. Sortable by generation speed.

← Back to model
Ran this model? Log in to submit your own performance result.
Rig / GPU Quant Runtime Context Prompt tok/s Gen tok/s VRAM (GB) Source Reporter
RTX 3090 GGUF · Q4_K_M llama.cpp 4,096 2,988.60 153.60 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 16,384 4,669.17 141.63 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · Q4_K_M llama.cpp 16,384 5,084.45 139.76 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 16,384 4,548.53 139.71 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 16,384 2,205.58 121.88 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 16,384 1,958.99 113.84 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 32,768 2,877.53 110.65 scraped anonymous
RTX 4090 GGUF · Q4_K_M llama.cpp 32,768 2,726.03 105.57 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · Q4_K_M llama.cpp 32,768 3,863.04 103.33 scraped anonymous
AMD Ryzen AI Max+ 395 (128 GB) GGUF · IQ4_XS llama.cpp 2,048 103.18 scraped anonymous
AMD Ryzen AI Max+ 395 (128 GB) GGUF · IQ4_XS llama.cpp 2,048 100.04 scraped anonymous
RTX 3090 Ti GGUF · Q4_K_M llama.cpp 32,768 1,483.93 91.97 scraped anonymous
RTX 3090 GGUF · Q4_K_M llama.cpp 32,768 1,336.79 87.21 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · Q4_K_M llama.cpp 65,536 2,864.83 80.15 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 65,536 1,512.46 76.56 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 16,384 1,901.13 75.35 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · Q4_K_M llama.cpp 131,072 1,270.31 56.14 scraped anonymous
RTX 5090 GGUF · Q4_K_M llama.cpp 131,072 716.76 52.84 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 32,768 1,275.59 48.13 scraped anonymous
RTX A6000 GGUF · Q4_K_M llama.cpp 65,536 764.16 27.57 scraped anonymous

selected to compare · pick at least 2