openai

gpt-oss-20b — performance reports

Community-submitted & scraped throughput measurements. Sortable by generation speed.

← Back to model
Ran this model? Log in to submit your own performance result.
Rig / GPU Quant Runtime Context Prompt tok/s Gen tok/s VRAM (GB) Source Reporter
RTX Pro 6000 Blackwell 96GB GGUF · F16 llama.cpp 2,048 11,521.95 286.91 scraped anonymous
RTX 5090 GGUF · F16 llama.cpp 2,048 9,848.38 282.51 scraped anonymous
RTX 5090 GGUF · F16 llama.cpp 16,384 7,168.10 249.19 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · F16 llama.cpp 16,384 7,478.71 237.92 scraped anonymous
RTX 4090 GGUF · F16 llama.cpp 2,048 8,022.33 221.95 scraped anonymous
RTX 5090 GGUF · F16 llama.cpp 32,768 5,183.08 215.08 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · F16 llama.cpp 32,768 5,039.46 207.45 scraped anonymous
RTX 5080 GGUF · F16 llama.cpp 2,048 7,476.55 204.85 scraped anonymous
RTX 5070 Ti GGUF · F16 llama.cpp 2,048 6,339.76 189.45 scraped anonymous
RTX 4080 Super GGUF · F16 llama.cpp 2,048 8,170.95 186.51 scraped anonymous
RTX Pro 6000 Blackwell 96GB GGUF · F16 llama.cpp 65,536 171.33 scraped anonymous
RTX 5090 GGUF · F16 llama.cpp 65,536 3,019.74 168.95 scraped anonymous
RTX 4090 GGUF · F16 llama.cpp 16,384 6,302.76 163.92 scraped anonymous
RTX 3090 GGUF · F16 llama.cpp 2,048 5,170.56 161.77 scraped anonymous
RTX 3090 GGUF · F16 llama.cpp 4,096 4,400.30 147.50 scraped anonymous
RTX 5080 GGUF · F16 llama.cpp 16,384 4,932.33 140.48 scraped anonymous
RTX 4090 GGUF · F16 llama.cpp 32,768 4,641.50 140.34 scraped anonymous
RTX 3090 Ti GGUF · F16 llama.cpp 16,384 3,440.06 137.55 scraped anonymous
RTX 5070 Ti GGUF · F16 llama.cpp 16,384 4,940.71 133.05 scraped anonymous
RTX 3090 GGUF · F16 llama.cpp 16,384 3,243.60 128.51 scraped anonymous

selected to compare · pick at least 2