Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -104,15 +104,14 @@ Numbers below are total memory used (model + KV cache + 0.9 GB recurrent state).
|
|
| 104 |
|
| 105 |
| RAM | Quant | KV cache | Max context | Total used | Vision |
|
| 106 |
|---|---|---|---|---:|---|
|
| 107 |
-
| 16 GB | `IQ2_M` | `q4_0` | 32K | 11.
|
| 108 |
-
| 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **
|
| 109 |
| 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
|
| 110 |
-
| 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.
|
| 111 |
-
| 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.
|
| 112 |
-
| 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.
|
| 113 |
-
| 48 GB | **`Q6_K`** | `q8_0` | **262K** | **
|
| 114 |
-
| 48 GB | `Q8_0` | `q8_0` | 262K |
|
| 115 |
-
| 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **36.4 GB** | ✓ |
|
| 116 |
|
| 117 |
### NVIDIA GPU
|
| 118 |
|
|
@@ -120,26 +119,25 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
|
|
| 120 |
|
| 121 |
| VRAM | Quant | KV cache | Max context | Total VRAM used | Vision |
|
| 122 |
|---|---|---|---|---:|---|
|
| 123 |
-
| 16 GB | `IQ2_M` | `q4_0` |
|
| 124 |
-
|
|
| 125 |
-
| 24 GB |
|
| 126 |
-
|
|
| 127 |
-
| 48 GB |
|
| 128 |
-
| 48 GB | `Q8_0` | `q4_0` | 262K | 34.4 GB | ✓ |
|
| 129 |
-
| 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
|
| 130 |
-
| 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
|
| 131 |
|
| 132 |
> **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
|
| 133 |
>
|
| 134 |
-
> **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K
|
| 135 |
>
|
| 136 |
-
> **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (
|
| 137 |
>
|
| 138 |
-
> **
|
| 139 |
>
|
| 140 |
-
> **
|
|
|
|
|
|
|
| 141 |
|
| 142 |
-
For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG,
|
| 143 |
|
| 144 |
Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
|
| 145 |
|
|
@@ -259,9 +257,9 @@ Effect on hardware requirements (Q5_K_M, 80K context):
|
|
| 259 |
|
| 260 |
| KV type | Model + recurrent + KV | Hardware |
|
| 261 |
|---|---|---|
|
| 262 |
-
| f16 | 24 GB |
|
| 263 |
| **q8_0** | **22 GB** | **32 GB Mac** |
|
| 264 |
-
| q4_0 |
|
| 265 |
|
| 266 |
---
|
| 267 |
|
|
@@ -309,11 +307,11 @@ Uses cached n-grams from previous prompts.
|
|
| 309 |
|---|---:|---|---|---|
|
| 310 |
| `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 311 |
| `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 312 |
-
| **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac ·
|
| 313 |
| `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 314 |
-
| `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac ·
|
| 315 |
| `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 316 |
-
| `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac ·
|
| 317 |
| `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
|
| 318 |
|
| 319 |
All tiers include MTP heads. Q8_0 is the direct conversion; all other tiers were quantized from it with an importance matrix. Q5_K_M is the sweet spot — use Q4_K_M if you're tight on RAM, Q8_0 if you want perfection. GPU means NVIDIA (RTX 3090/4090 = 24 GB, A6000 = 48 GB, A100 = 80 GB).
|
|
|
|
| 104 |
|
| 105 |
| RAM | Quant | KV cache | Max context | Total used | Vision |
|
| 106 |
|---|---|---|---|---:|---|
|
| 107 |
+
| 16 GB | **`IQ2_M`** | `q4_0` | **32K** | **11.1 GB** | ✗ |
|
| 108 |
+
| 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **16.0 GB** | ✓ |
|
| 109 |
| 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
|
| 110 |
+
| 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.5 GB** | ✗ |
|
| 111 |
+
| 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.8 GB | ✓ |
|
| 112 |
+
| 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.4 GB | ✗ |
|
| 113 |
+
| 48 GB | **`Q6_K`** | `q8_0` | **262K** | **31.2 GB** | ✓ |
|
| 114 |
+
| 48 GB | `Q8_0` | `q8_0` | 262K | 37.3 GB | ✓ |
|
|
|
|
| 115 |
|
| 116 |
### NVIDIA GPU
|
| 117 |
|
|
|
|
| 119 |
|
| 120 |
| VRAM | Quant | KV cache | Max context | Total VRAM used | Vision |
|
| 121 |
|---|---|---|---|---:|---|
|
| 122 |
+
| 16 GB | **`IQ2_M`** | `q4_0` | **200K** | **15.7 GB** | ✓ |
|
| 123 |
+
| 24 GB | **`Q4_K_M`** | `q4_0` | **262K** | **22.8 GB** | ✓ |
|
| 124 |
+
| 24 GB | `Q5_K_M` | `q4_0` | 180K | 24.0 GB | ✓ |
|
| 125 |
+
| 48 GB | **`Q6_K`** | `q8_0` | **262K** | **32.2 GB** | ✓ |
|
| 126 |
+
| 48 GB | `Q8_0` | `q8_0` | 262K | 38.3 GB | ✓ |
|
|
|
|
|
|
|
|
|
|
| 127 |
|
| 128 |
> **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
|
| 129 |
>
|
| 130 |
+
> **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K text-only.
|
| 131 |
>
|
| 132 |
+
> **48 GB+ Mac:** `Q6_K`/q8_0 — best quality at 262K with vision (31.2 GB). `Q8_0`/q8_0 for perfection (37.3 GB).
|
| 133 |
>
|
| 134 |
+
> **16 GB GPU:** `IQ2_M`/q4_0 — 200K with vision.
|
| 135 |
>
|
| 136 |
+
> **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `Q5_K_M`/q4_0 for higher quality at 180K with vision.
|
| 137 |
+
>
|
| 138 |
+
> **48 GB+ GPU:** `Q6_K`/q8_0 — 262K at high quality with vision (32.2 GB). `Q8_0`/q8_0 for perfection (38.3 GB).
|
| 139 |
|
| 140 |
+
For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, lower quants with `q4_0` KV and larger context are often sufficient.
|
| 141 |
|
| 142 |
Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
|
| 143 |
|
|
|
|
| 257 |
|
| 258 |
| KV type | Model + recurrent + KV | Hardware |
|
| 259 |
|---|---|---|
|
| 260 |
+
| f16 | 24 GB | 48 GB Mac |
|
| 261 |
| **q8_0** | **22 GB** | **32 GB Mac** |
|
| 262 |
+
| q4_0 | 21 GB | 32 GB Mac |
|
| 263 |
|
| 264 |
---
|
| 265 |
|
|
|
|
| 307 |
|---|---:|---|---|---|
|
| 308 |
| `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 309 |
| `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 310 |
+
| **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 48 GB GPU** |
|
| 311 |
| `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 312 |
+
| `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 313 |
| `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 314 |
+
| `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU |
|
| 315 |
| `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
|
| 316 |
|
| 317 |
All tiers include MTP heads. Q8_0 is the direct conversion; all other tiers were quantized from it with an importance matrix. Q5_K_M is the sweet spot — use Q4_K_M if you're tight on RAM, Q8_0 if you want perfection. GPU means NVIDIA (RTX 3090/4090 = 24 GB, A6000 = 48 GB, A100 = 80 GB).
|