froggeric commited on
Commit
c12be7c
·
verified ·
1 Parent(s): 88436f3

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +24 -26
README.md CHANGED
@@ -104,15 +104,14 @@ Numbers below are total memory used (model + KV cache + 0.9 GB recurrent state).
104
 
105
  | RAM | Quant | KV cache | Max context | Total used | Vision |
106
  |---|---|---|---|---:|---|
107
- | 16 GB | `IQ2_M` | `q4_0` | 32K | 11.4 GB | ✗ |
108
- | 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **15.0 GB** | ✓ |
109
  | 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
110
- | 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.2 GB** | ✗ |
111
- | 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.2 GB | ✓ |
112
- | 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.0 GB | |
113
- | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **30.4 GB** | ✓ |
114
- | 48 GB | `Q8_0` | `q8_0` | 262K | 36.4 GB | ✓ |
115
- | 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **36.4 GB** | ✓ |
116
 
117
  ### NVIDIA GPU
118
 
@@ -120,26 +119,25 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
120
 
121
  | VRAM | Quant | KV cache | Max context | Total VRAM used | Vision |
122
  |---|---|---|---|---:|---|
123
- | 16 GB | `IQ2_M` | `q4_0` | 150K | 15.8 GB | ✓ |
124
- | 16 GB | **`IQ3_M`** | `q4_0` | 90K | **15.9 GB** | |
125
- | 24 GB | **`Q4_K_M`** | `q4_0` | **262K** | **23.6 GB** | ✓ |
126
- | 24 GB | `IQ4_XS` | `q8_0` | 200K | 23.8 GB | ✓ |
127
- | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **32.5 GB** | ✓ |
128
- | 48 GB | `Q8_0` | `q4_0` | 262K | 34.4 GB | ✓ |
129
- | 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
130
- | 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
131
 
132
  > **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
133
  >
134
- > **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K with vision.
135
  >
136
- > **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (30.4 GB). `Q8_0`/q8_0 for perfection (36.4 GB).
137
  >
138
- > **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `IQ4_XS`/q8_0 for higher KV quality at 200K.
139
  >
140
- > **48 GB GPU:** `Q6_K`/q8_0 262K at high quality (32.5 GB). `Q8_0`/q4_0 also fits (34.4 GB).
 
 
141
 
142
- For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, `IQ4_XS` with `q4_0` and larger context is often sufficient.
143
 
144
  Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
145
 
@@ -259,9 +257,9 @@ Effect on hardware requirements (Q5_K_M, 80K context):
259
 
260
  | KV type | Model + recurrent + KV | Hardware |
261
  |---|---|---|
262
- | f16 | 24 GB | 32 GB Mac |
263
  | **q8_0** | **22 GB** | **32 GB Mac** |
264
- | q4_0 | 20 GB | 24 GB Mac |
265
 
266
  ---
267
 
@@ -309,11 +307,11 @@ Uses cached n-grams from previous prompts.
309
  |---|---:|---|---|---|
310
  | `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
311
  | `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
312
- | **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** |
313
  | `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
314
- | `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 16 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
315
  | `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
316
- | `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
317
  | `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
318
 
319
  All tiers include MTP heads. Q8_0 is the direct conversion; all other tiers were quantized from it with an importance matrix. Q5_K_M is the sweet spot — use Q4_K_M if you're tight on RAM, Q8_0 if you want perfection. GPU means NVIDIA (RTX 3090/4090 = 24 GB, A6000 = 48 GB, A100 = 80 GB).
 
104
 
105
  | RAM | Quant | KV cache | Max context | Total used | Vision |
106
  |---|---|---|---|---:|---|
107
+ | 16 GB | **`IQ2_M`** | `q4_0` | **32K** | **11.1 GB** | ✗ |
108
+ | 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **16.0 GB** | ✓ |
109
  | 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
110
+ | 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.5 GB** | ✗ |
111
+ | 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.8 GB | ✓ |
112
+ | 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.4 GB | |
113
+ | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **31.2 GB** | ✓ |
114
+ | 48 GB | `Q8_0` | `q8_0` | 262K | 37.3 GB | ✓ |
 
115
 
116
  ### NVIDIA GPU
117
 
 
119
 
120
  | VRAM | Quant | KV cache | Max context | Total VRAM used | Vision |
121
  |---|---|---|---|---:|---|
122
+ | 16 GB | **`IQ2_M`** | `q4_0` | **200K** | **15.7 GB** | ✓ |
123
+ | 24 GB | **`Q4_K_M`** | `q4_0` | **262K** | **22.8 GB** | |
124
+ | 24 GB | `Q5_K_M` | `q4_0` | 180K | 24.0 GB | ✓ |
125
+ | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **32.2 GB** | ✓ |
126
+ | 48 GB | `Q8_0` | `q8_0` | 262K | 38.3 GB | ✓ |
 
 
 
127
 
128
  > **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
129
  >
130
+ > **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K text-only.
131
  >
132
+ > **48 GB+ Mac:** `Q6_K`/q8_0 — best quality at 262K with vision (31.2 GB). `Q8_0`/q8_0 for perfection (37.3 GB).
133
  >
134
+ > **16 GB GPU:** `IQ2_M`/q4_0 200K with vision.
135
  >
136
+ > **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `Q5_K_M`/q4_0 for higher quality at 180K with vision.
137
+ >
138
+ > **48 GB+ GPU:** `Q6_K`/q8_0 — 262K at high quality with vision (32.2 GB). `Q8_0`/q8_0 for perfection (38.3 GB).
139
 
140
+ For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, lower quants with `q4_0` KV and larger context are often sufficient.
141
 
142
  Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
143
 
 
257
 
258
  | KV type | Model + recurrent + KV | Hardware |
259
  |---|---|---|
260
+ | f16 | 24 GB | 48 GB Mac |
261
  | **q8_0** | **22 GB** | **32 GB Mac** |
262
+ | q4_0 | 21 GB | 32 GB Mac |
263
 
264
  ---
265
 
 
307
  |---|---:|---|---|---|
308
  | `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
309
  | `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
310
+ | **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 48 GB GPU** |
311
  | `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
312
+ | `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
313
  | `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
314
+ | `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU |
315
  | `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
316
 
317
  All tiers include MTP heads. Q8_0 is the direct conversion; all other tiers were quantized from it with an importance matrix. Q5_K_M is the sweet spot — use Q4_K_M if you're tight on RAM, Q8_0 if you want perfection. GPU means NVIDIA (RTX 3090/4090 = 24 GB, A6000 = 48 GB, A100 = 80 GB).