Benchmark result
Qwen3.8-Flash-Next-oQ4e-mtp on Apple M4 Max — 72.6 tok/s
Measured with oMLX 0.32.0 on September 27, 2026.
What the model built
Open full screen →The coding scenario asks for a playable game in a single HTML file. This is exactly what the model returned, unedited.
How this run compares
8th fastest of 90 runs of this model on Apple M4 Max · median 60.1 tok/s.
sort
- 175.5tok/s79.5oMLX · oQ4e · KV none
- 275.5tok/s83.2oMLX · oQ4e · KV none
- 375.4tok/s82.2oMLX · oQ4e · KV none
- 475.2tok/s77.9oMLX · oQ4e · KV none
- 575.1tok/s80.6oMLX · oQ4e · KV none
- 674.0tok/s84.2oMLX · oQ4e · KV none
- 773.6tok/s79.6oMLX · oQ4e · KV none
- 872.6tok/s82.8oMLX · oQ4e · KV nonethis run
- 971.6tok/s84.0oMLX · oQ4e · KV none
- 1071.3tok/s76.6oMLX · oQ4e · KV none
- 1171.1tok/s79.9oMLX · oQ4e · KV none
- 1270.9tok/s84.6oMLX · oQ4e · KV none
- 1367.6tok/s81.7oMLX · KV none
- 1467.5tok/s83.9oMLX · oQ4e · KV none
- 1566.8tok/s84.4oMLX · KV none
- 1666.6tok/s80.2oMLX · KV none
- 1766.5tok/s83.4oMLX · KV none
- 1866.5tok/s82.5oMLX · KV none
- 1966.5tok/s76.5oMLX · KV none
- 2066.5tok/s77.1oMLX · KV none
- 2166.3tok/s83.4oMLX · KV none
- 2266.2tok/s80.5oMLX · KV none
- 2366.2tok/s78.5oMLX · KV none
- 2466.2tok/s80.7oMLX · KV none
- 2566.2tok/s81.4oMLX · KV none
- 2666.2tok/s84.0oMLX · KV none
- 2765.9tok/s81.5oMLX · KV none
- 2865.7tok/s80.9oMLX · KV none
- 2965.5tok/s83.3oMLX · KV none
- 3065.5tok/s82.9oMLX · oQ4e · KV none
- 3165.4tok/s80.2oMLX · KV none
- 3265.2tok/s79.0oMLX · KV none
- 3365.2tok/s84.7oMLX · KV none
- 3464.6tok/s84.4oMLX · oQ4e · KV none
- 3564.4tok/s84.7oMLX · KV none
- 3664.1tok/s76.1oMLX · KV none
- 3763.9tok/s84.4oMLX · KV none
- 3863.8tok/s79.0oMLX · KV none
- 3963.7tok/s82.8oMLX · KV none
- 4063.3tok/s81.0oMLX · KV none
- 4160.8tok/s84.4oMLX · KV none
- 4260.5tok/s83.9oMLX · KV none
- 4360.4tok/s82.1oMLX · KV none
- 4460.3tok/s85.7oMLX · KV none
- 4560.2tok/s82.9oMLX · KV none
- 4660.1tok/s77.8oMLX · KV none
- 4760.0tok/s82.5oMLX · KV none
- 4860.0tok/s85.3oMLX · KV none
- 4959.9tok/s81.8oMLX · KV none
- 5059.9tok/s86.5oMLX · KV none
- 5159.7tok/s83.1oMLX · KV none
- 5259.6tok/s80.8oMLX · KV none
- 5359.6tok/s82.5oMLX · KV none
- 5459.5tok/s84.8oMLX · KV none
- 5559.5tok/s81.7oMLX · KV none
- 5659.3tok/s82.8oMLX · KV none
- 5759.0tok/s75.5oMLX · KV none
- 5859.0tok/s84.4oMLX · KV none
- 5959.0tok/s82.4oMLX · KV none
- 6058.9tok/s80.7oMLX · KV none
- 6158.8tok/s85.6oMLX · KV none
- 6258.8tok/s79.9oMLX · oQ4e · KV none
- 6358.7tok/s80.3oMLX · KV none
- 6458.7tok/s78.6oMLX · KV none
- 6558.6tok/s83.1oMLX · KV none
- 6658.6tok/s75.8oMLX · KV none
- 6758.5tok/s81.8oMLX · KV none
- 6858.3tok/s83.0oMLX · KV none
- 6957.9tok/s83.2oMLX · KV none
- 7057.9tok/s80.4oMLX · KV none
- 7157.8tok/s76.5oMLX · KV none
- 7256.0tok/s82.5oMLX · KV none
- 7355.9tok/s84.2oMLX · KV none
- 7447.0tok/s80.9oMLX · KV none
- 7546.5tok/s76.1oMLX · KV none
- 7646.4tok/s82.6oMLX · KV none
- 7746.3tok/s84.6oMLX · KV none
- 7846.2tok/s80.5oMLX · KV none
- 7946.1tok/s80.8oMLX · KV none
- 8046.1tok/s83.2oMLX · KV none
- 8146.0tok/s82.8oMLX · KV none
- 8245.8tok/s83.8oMLX · KV none
- 8345.7tok/s85.3oMLX · KV none
- 8445.6tok/s79.5oMLX · KV none
- 8545.4tok/s83.8oMLX · KV none
- 8645.1tok/s85.1oMLX · KV none
- 8744.8tok/s83.5oMLX · KV none
- 8844.3tok/s80.4oMLX · KV none
- 8944.1tok/s83.8oMLX · KV none
- 9038.4tok/s87.5oMLX · KV none
Qwen3.8-Flash-Next-oQ4e-mtp on other hardware
Reproduce this run
tooloMLX 0.32.0
modelQwen3.8-Flash-Next-oQ4e-mtp (oQ4e)
context262,144
kv cachenone
effortmedium
samplingtemperature 1 · top_p 0.95 · top_k 20 · repetition_penalty 1
clientv0.4.80+98
Set those in oMLX, then:
llm-benchmark benchmark --model "Qwen3.8-Flash-Next-oQ4e-mtp" --tool "oMLX"The client prompts for context length and thinking mode, and for the KV cache dtype on Unsloth Studio. Sampling is left at the model default — the values above are what the tool reported using, not overrides the client sent.