empero-ai commited on
Commit
b1f9d1d
·
verified ·
1 Parent(s): 51bdd06

Add IQ2_M, Q2_K, IQ3_M, Q3_K_M, IQ4_XS (imatrix-calibrated); update file table and checksums

Browse files
Files changed (2) hide show
  1. README.md +10 -1
  2. SHA256SUMS +6 -1
README.md CHANGED
@@ -36,6 +36,11 @@ This card is about choosing a file and running it. The capability writeup, bench
36
 
37
  | File | Quant | Size | Notes |
38
  |---|---|---:|---|
 
 
 
 
 
39
  | `Qwen3.8-35B-A3B-Q4_K_M.gguf` | Q4_K_M | 21.713 GB | **Recommended.** Best quality/size balance for most users. |
40
  | `Qwen3.8-35B-A3B-Q5_K_M.gguf` | Q5_K_M | 25.348 GB | Higher quality, modest size increase. |
41
  | `Qwen3.8-35B-A3B-Q6_K.gguf` | Q6_K | 29.209 GB | Near-lossless. |
@@ -43,6 +48,8 @@ This card is about choosing a file and running it. The capability writeup, bench
43
  | `Qwen3.8-35B-A3B-BF16.gguf` | BF16 | 71.067 GB | Full precision reference. |
44
  | `mmproj-Qwen3.8-35B-A3B-F16.gguf` | F16 | 0.899 GB | Vision projector. Pair with any text quant above for image input. |
45
 
 
 
46
  Sizes are exact decimal GB from the uploaded files (1 GB = 1,000,000,000 bytes).
47
 
48
  ### What fits?
@@ -51,7 +58,9 @@ Weight-size guidance at modest context. The KV cache is the dominant cost at lon
51
 
52
  | Quant | Guidance |
53
  |---|---|
54
- | Q4_K_M | 24 GB VRAM for a full GPU load; runs comfortably on CPU with 32 GB RAM. |
 
 
55
  | Q5_K_M / Q6_K | 32 GB VRAM, or 48 GB system RAM. |
56
  | Q8_0 | 48 GB VRAM, or 64 GB system RAM. |
57
  | BF16 | 80 GB+ VRAM, or 96 GB system RAM. Reference only. |
 
36
 
37
  | File | Quant | Size | Notes |
38
  |---|---|---:|---|
39
+ | `Qwen3.8-35B-A3B-IQ2_M.gguf` | IQ2_M | 12.558 GB | Smallest usable. Fits a 16 GB card. |
40
+ | `Qwen3.8-35B-A3B-Q2_K.gguf` | Q2_K | 13.839 GB | 2-bit K-quant; widest runtime support at this size. |
41
+ | `Qwen3.8-35B-A3B-IQ3_M.gguf` | IQ3_M | 16.340 GB | Strong quality per byte at 3-bit. |
42
+ | `Qwen3.8-35B-A3B-Q3_K_M.gguf` | Q3_K_M | 17.664 GB | Conventional 3-bit K-quant. |
43
+ | `Qwen3.8-35B-A3B-IQ4_XS.gguf` | IQ4_XS | 19.628 GB | Near Q4_K_M quality, ~2 GB smaller. |
44
  | `Qwen3.8-35B-A3B-Q4_K_M.gguf` | Q4_K_M | 21.713 GB | **Recommended.** Best quality/size balance for most users. |
45
  | `Qwen3.8-35B-A3B-Q5_K_M.gguf` | Q5_K_M | 25.348 GB | Higher quality, modest size increase. |
46
  | `Qwen3.8-35B-A3B-Q6_K.gguf` | Q6_K | 29.209 GB | Near-lossless. |
 
48
  | `Qwen3.8-35B-A3B-BF16.gguf` | BF16 | 71.067 GB | Full precision reference. |
49
  | `mmproj-Qwen3.8-35B-A3B-F16.gguf` | F16 | 0.899 GB | Vision projector. Pair with any text quant above for image input. |
50
 
51
+ The IQ\* quants and the 2/3-bit K-quants are calibrated with an importance matrix, which is what keeps them coherent at these bit-widths.
52
+
53
  Sizes are exact decimal GB from the uploaded files (1 GB = 1,000,000,000 bytes).
54
 
55
  ### What fits?
 
58
 
59
  | Quant | Guidance |
60
  |---|---|
61
+ | IQ2_M / Q2_K | 16 GB VRAM, or 16 GB system RAM. The smallest that stay coherent. |
62
+ | IQ3_M / Q3_K_M | 20-24 GB VRAM, or 24 GB system RAM. |
63
+ | IQ4_XS / Q4_K_M | 24 GB VRAM for a full GPU load; comfortable on CPU with 32 GB RAM. |
64
  | Q5_K_M / Q6_K | 32 GB VRAM, or 48 GB system RAM. |
65
  | Q8_0 | 48 GB VRAM, or 64 GB system RAM. |
66
  | BF16 | 80 GB+ VRAM, or 96 GB system RAM. Reference only. |
SHA256SUMS CHANGED
@@ -1,6 +1,11 @@
1
- d5ff4a315a370b7b2ddaa7d0a756605f16daf8358f9e6173db08705f1fe0bb4f Qwen3.8-35B-A3B-BF16.gguf
 
 
 
 
2
  196103269085bc54c9b8f49ed21e9f53e1b56b465e8b796c6d8e31e06f63cfa5 Qwen3.8-35B-A3B-Q4_K_M.gguf
3
  f1903bac4ee3eec1f9013735298867c96d97dfb55c71f826a714b17214abc4ad Qwen3.8-35B-A3B-Q5_K_M.gguf
4
  0bb743311ee5d58eeeeff67d42d0e62a52347539e825ceb320d1a2178003f47b Qwen3.8-35B-A3B-Q6_K.gguf
5
  7d986d310e686a91cb514cdd819719b4f80ace899c9aaad7bfccfdf4670a9bb3 Qwen3.8-35B-A3B-Q8_0.gguf
 
6
  4381cb5110074396c2c7b39221fffae0c31886aa95b674de8e103d97edf58b94 mmproj-Qwen3.8-35B-A3B-F16.gguf
 
1
+ 9c095175f7af0c4acc18e552f0dd7ac8180d81f9ac4bf38d62a03c76a0d6e084 Qwen3.8-35B-A3B-IQ2_M.gguf
2
+ a738c481e78099626bc43a9d4e5e0478266ab7bab5a788225da61310a1dd24dc Qwen3.8-35B-A3B-Q2_K.gguf
3
+ 0ad7b253ecee6de7b38ecaf82ea5553d302c3f924961b7091b7088cc99a30f95 Qwen3.8-35B-A3B-IQ3_M.gguf
4
+ 48a5197d37318de7984d0e1d38c66ae00ac5b873ea0920242a1889cc2d35c4a9 Qwen3.8-35B-A3B-Q3_K_M.gguf
5
+ b645af45431ef9b41f43cae51c9323b2d0ca84f23031d483d2105c643ae58d65 Qwen3.8-35B-A3B-IQ4_XS.gguf
6
  196103269085bc54c9b8f49ed21e9f53e1b56b465e8b796c6d8e31e06f63cfa5 Qwen3.8-35B-A3B-Q4_K_M.gguf
7
  f1903bac4ee3eec1f9013735298867c96d97dfb55c71f826a714b17214abc4ad Qwen3.8-35B-A3B-Q5_K_M.gguf
8
  0bb743311ee5d58eeeeff67d42d0e62a52347539e825ceb320d1a2178003f47b Qwen3.8-35B-A3B-Q6_K.gguf
9
  7d986d310e686a91cb514cdd819719b4f80ace899c9aaad7bfccfdf4670a9bb3 Qwen3.8-35B-A3B-Q8_0.gguf
10
+ d5ff4a315a370b7b2ddaa7d0a756605f16daf8358f9e6173db08705f1fe0bb4f Qwen3.8-35B-A3B-BF16.gguf
11
  4381cb5110074396c2c7b39221fffae0c31886aa95b674de8e103d97edf58b94 mmproj-Qwen3.8-35B-A3B-F16.gguf