Performance not good from oMLX benchmark

#1
by xht033 - opened

Intelligence Benchmark Comparison

Benchmark Mode Sampled MLX-Qwopus3.5-9B-Coder-oQ4-fp16-mtp
MMLU Sample 30/14042 20.0%
MMLU_PRO Sample 30/12032 60.0%
TRUTHFULQA Sample 30/817 30.0%
HUMANEVAL Sample 30/164 40.0%

Detail

Model: MLX-Qwopus3.5-9B-Coder-oQ4-fp16-mtp

Benchmark Accuracy Correct Total Time(s) Think
MMLU 20.0% 6 30 125.0 No
MMLU_PRO 60.0% 18 30 675.9 No
TRUTHFULQA 30.0% 9 30 83.4 No
HUMANEVAL 40.0% 12 30 889.1 No

Sign up or log in to comment