Plans for BF16 to allow for MLX quantizations?

#1
by veldierin - opened

Do you have any plans to release the base model so we can quantize it to different MLX options as well?

Best quant on mlx is q8-hi

https://huggingface.co/nightmedia/Qwen3.5-9B-DS9-USS-Defiant-1M-q8-hi-mlx

          arc   arc/e boolq hswag obkqa piqa  wino
q8-hi     0.654,0.829,0.892,0.712,0.472,0.780,0.697
qx86-hi   0.647,0.829,0.894,0.713,0.466,0.781,0.701
qx64-hi   0.640,0.825,0.885,0.716,0.462,0.783,0.706

Quant     Perplexity      Peak Memory   Tokens/sec
q8-hi     4.112 ± 0.026   16.85 GB      658
qx86-hi   4.113 ± 0.026   15.71 GB      627
qx64-hi   4.170 ± 0.027   13.61 GB      625

Qwen3.5-9B-DS9-USS-Defiant (256K context)

          arc   arc/e boolq hswag obkqa piqa  wino
bf16      0.649,0.832,0.895,0.713,0.482,0.783,0.699
mxfp8     0.647,0.836,0.895,0.706,0.460,0.784,0.695
q8-hi     0.654,0.830,0.895,0.713,0.488,0.783,0.699
qx86-hi   0.652,0.831,0.894,0.714,0.474,0.782,0.700
q6-hi     0.656,0.829,0.894,0.710,0.476,0.777,0.705
qx64-hi   0.638,0.827,0.887,0.716,0.470,0.786,0.702
q4-hi     0.640,0.823,0.881,0.714,0.470,0.785,0.702
mxfp4     0.640,0.824,0.886,0.703,0.468,0.780,0.691

Quant     Perplexity      Peak Memory   Tokens/sec
mxfp8     4.216 ± 0.027   16.02 GB      593
qx86-hi   4.099 ± 0.026   15.72 GB      629
qx64-hi   4.155 ± 0.027   13.62 GB      658
mxfp4     4.388 ± 0.029   11.55 GB      705
DavidAU changed discussion status to closed

Sign up or log in to comment