Benchmark result
Qwen3.8-27B-oQ8e-mtp on Apple M4 Max — 34.2 tok/s
Measured with oMLX 0.32.0 on September 23, 2026.
What the model built
Open full screen →The coding scenario asks for a playable game in a single HTML file. This is exactly what the model returned, unedited.
How this run compares
33rd fastest of 66 runs of this model on Apple M4 Max · median 34.2 tok/s.
sort
- 137.7tok/s82.1oMLX · oQ8e · KV none
- 236.4tok/s76.3oMLX · oQ8e · KV none
- 335.5tok/s78.6oMLX · oQ8e · KV none
- 435.5tok/s85.9oMLX · oQ8e · KV none
- 535.2tok/s82.3oMLX · KV none
- 635.2tok/s83.9oMLX · KV none
- 735.2tok/s80.0oMLX · oQ8e · KV none
- 835.1tok/s85.5oMLX · oQ8e · KV none
- 935.1tok/s85.9oMLX · KV none
- 1035.1tok/s81.7oMLX · KV none
- 1135.0tok/s85.3oMLX · KV none
- 1235.0tok/s82.4oMLX · KV none
- 1334.9tok/s81.8oMLX · KV none
- 1434.8tok/s78.6oMLX · KV none
- 1534.8tok/s86.0oMLX · oQ8e · KV none
- 1634.8tok/s82.2oMLX · KV none
- 1734.7tok/s85.9oMLX · KV none
- 1834.7tok/s82.6oMLX · KV none
- 1934.7tok/s81.5oMLX · KV none
- 2034.7tok/s68.4oMLX · oQ8e · KV none
- 2134.6tok/s84.1oMLX · KV none
- 2234.6tok/s82.7oMLX · oQ8e · KV none
- 2334.6tok/s86.8oMLX · KV none
- 2434.5tok/s84.8oMLX · oQ8e · KV none
- 2534.4tok/s87.1oMLX · oQ8e · KV none
- 2634.4tok/s86.3oMLX · KV none
- 2734.4tok/s86.4oMLX · oQ8e · KV none
- 2834.3tok/s82.1oMLX · KV none
- 2934.3tok/s81.6oMLX · KV none
- 3034.3tok/s87.2oMLX · oQ8e · KV none
- 3134.3tok/s79.2oMLX · oQ8e · KV none
- 3234.2tok/s84.8oMLX · oQ8e · KV none
- 3334.2tok/s81.4oMLX · oQ8e · KV nonethis run
- 3434.2tok/s84.0oMLX · oQ8e · KV none
- 3534.2tok/s84.2oMLX · oQ8e · KV none
- 3634.0tok/s85.6oMLX · oQ8e · KV none
- 3734.0tok/s82.2oMLX · oQ8e · KV none
- 3834.0tok/s84.2oMLX · KV none
- 3933.9tok/s82.2oMLX · KV none
- 4033.8tok/s83.6oMLX · KV none
- 4133.8tok/s84.1oMLX · KV none
- 4233.8tok/s83.9oMLX · KV none
- 4333.7tok/s85.1oMLX · KV none
- 4433.7tok/s84.6oMLX · KV none
- 4533.7tok/s88.4oMLX · KV none
- 4633.7tok/s82.4oMLX · oQ8e · KV none
- 4733.7tok/s85.9oMLX · KV none
- 4833.7tok/s78.2oMLX · oQ8e · KV none
- 4933.6tok/s83.1oMLX · KV none
- 5033.6tok/s81.1oMLX · oQ8e · KV none
- 5133.6tok/s85.8oMLX · KV none
- 5233.5tok/s83.9oMLX · oQ8e · KV none
- 5333.5tok/s84.3oMLX · KV none
- 5433.4tok/s84.3oMLX · oQ8e · KV none
- 5533.4tok/s85.8oMLX · oQ8e · KV none
- 5633.4tok/s87.4oMLX · oQ8e · KV none
- 5733.4tok/s82.0oMLX · KV none
- 5833.3tok/s82.1oMLX · KV none
- 5933.1tok/s76.4oMLX · KV none
- 6033.0tok/s84.1oMLX · KV none
- 6132.8tok/s82.8oMLX · oQ8e · KV none
- 6232.7tok/s84.5oMLX · KV none
- 6332.7tok/s84.4oMLX · KV none
- 6432.5tok/s70.1oMLX · KV none
- 6532.4tok/s76.1oMLX · KV none
- 6631.9tok/s84.5oMLX · oQ8e · KV none
Qwen3.8-27B-oQ8e-mtp on other hardware
Reproduce this run
tooloMLX 0.32.0
modelQwen3.8-27B-oQ8e-mtp (oQ8e)
context262,144
kv cachenone
effortmedium
samplingtemperature 1 · top_p 0.95 · top_k 20 · repetition_penalty 1
clientv0.4.80+98
Set those in oMLX, then:
llm-benchmark benchmark --model "Qwen3.8-27B-oQ8e-mtp" --tool "oMLX"The client prompts for context length and thinking mode, and for the KV cache dtype on Unsloth Studio. Sampling is left at the model default — the values above are what the tool reported using, not overrides the client sent.