Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -100,20 +100,19 @@ Find your hardware below — each row gives the best quant, KV cache type, and m
|
|
| 100 |
|
| 101 |
Qwen3.6-27B is a hybrid model — only **16 of 65 layers** use KV cache (verified). The other 48 are linear attention (fixed 898 MiB recurrent state). KV memory is **~4× less** than a standard dense model. Runtimes that don't handle this (e.g. vllm) allocate KV for all 65 layers and show much higher memory usage.
|
| 102 |
|
| 103 |
-
Numbers below are
|
| 104 |
|
| 105 |
-
| RAM | Quant | KV cache | Max context |
|
| 106 |
|---|---|---|---|---:|---|
|
| 107 |
-
| 16 GB | `IQ2_M` | `q4_0` | 32K | 11.
|
| 108 |
-
| 24 GB | **`IQ3_M`** | `q4_0` | **
|
| 109 |
-
| 24 GB | `
|
| 110 |
-
| 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **
|
| 111 |
-
| 32 GB | `
|
| 112 |
-
| 32 GB | `
|
| 113 |
-
| 48 GB | **`Q6_K`** | `q8_0` | **262K** | **
|
| 114 |
-
| 48 GB | `Q8_0` | `q8_0` | 262K |
|
| 115 |
-
|
|
| 116 |
-
| 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **37.4 GB** | ✓ |
|
| 117 |
|
| 118 |
### NVIDIA GPU
|
| 119 |
|
|
@@ -130,11 +129,11 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
|
|
| 130 |
| 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
|
| 131 |
| 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
|
| 132 |
|
| 133 |
-
> **24 GB Mac:** `IQ3_M`/q4_0
|
| 134 |
>
|
| 135 |
-
> **32 GB Mac:** `Q5_K_M`/q4_0 — 262K
|
| 136 |
>
|
| 137 |
-
> **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (
|
| 138 |
>
|
| 139 |
> **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `IQ4_XS`/q8_0 for higher KV quality at 200K.
|
| 140 |
>
|
|
@@ -142,7 +141,7 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
|
|
| 142 |
|
| 143 |
For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, `IQ4_XS` with `q4_0` and larger context is often sufficient.
|
| 144 |
|
| 145 |
-
Vision adds ~0.9 GB for mmproj. macOS needs
|
| 146 |
|
| 147 |
---
|
| 148 |
|
|
@@ -309,11 +308,11 @@ Uses cached n-grams from previous prompts.
|
|
| 309 |
| File | Size | Min. (4K ctx) | Recommended (80K ctx) | Max (262K ctx) |
|
| 310 |
|---|---:|---|---|---|
|
| 311 |
| `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 312 |
-
| `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU |
|
| 313 |
-
| **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **
|
| 314 |
-
| `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB |
|
| 315 |
-
| `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 16 GB GPU |
|
| 316 |
-
| `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
|
| 317 |
| `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
|
| 318 |
| `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
|
| 319 |
|
|
@@ -329,15 +328,15 @@ Approximate VRAM on Apple Silicon (unified memory), using Q5_K_M as reference. I
|
|
| 329 |
|
| 330 |
| Context | Model | KV (f16) | KV (q8_0) | KV (q4_0) | Total (q8_0) | Min. Mac (q8_0) |
|
| 331 |
|---|---|---|---|---|---|---|
|
| 332 |
-
| 4K | 18 GB | 0.3 GB | 0.1 GB | — | 19 GB |
|
| 333 |
-
| 8K | 18 GB | 0.5 GB | 0.3 GB | — | 19 GB |
|
| 334 |
-
| 32K | 18 GB | 2.1 GB | 1.0 GB | — | 20 GB |
|
| 335 |
| 64K | 18 GB | 4.1 GB | 2.1 GB | — | 21 GB | 32 GB |
|
| 336 |
| **80K (recommended)** | **18 GB** | **5.2 GB** | **2.6 GB** | **—** | **22 GB** | **32 GB** |
|
| 337 |
| 128K | 18 GB | 8.3 GB | 4.1 GB | — | 23 GB | 32 GB |
|
| 338 |
-
| 262K (max native) | 18 GB | 17.0 GB | 8.5 GB | 4.3 GB | 27 GB | 48 GB |
|
| 339 |
|
| 340 |
-
"Total" = model + recurrent state + KV cache.
|
| 341 |
|
| 342 |
<details>
|
| 343 |
<summary>Memory for all quant tiers (4K context, q8_0 KV)</summary>
|
|
@@ -346,8 +345,8 @@ Approximate VRAM on Apple Silicon (unified memory), using Q5_K_M as reference. I
|
|
| 346 |
|---|---|---|---|---|
|
| 347 |
| Q8_0 | 27 GB | 1.0 GB | 28 GB | 48 GB |
|
| 348 |
| Q6_K | 21 GB | 1.0 GB | 22 GB | 32 GB |
|
| 349 |
-
| Q5_K_M | 18 GB | 1.0 GB | 19 GB |
|
| 350 |
-
| Q4_K_M | 16 GB | 1.0 GB | 17 GB |
|
| 351 |
| IQ4_XS | 14 GB | 1.0 GB | 15 GB | 24 GB |
|
| 352 |
| IQ3_M | 12 GB | 1.0 GB | 13 GB | 24 GB |
|
| 353 |
| IQ2_M | 10 GB | 1.0 GB | 11 GB | 16 GB |
|
|
|
|
| 100 |
|
| 101 |
Qwen3.6-27B is a hybrid model — only **16 of 65 layers** use KV cache (verified). The other 48 are linear attention (fixed 898 MiB recurrent state). KV memory is **~4× less** than a standard dense model. Runtimes that don't handle this (e.g. vllm) allocate KV for all 65 layers and show much higher memory usage.
|
| 102 |
|
| 103 |
+
Numbers below are total memory used (model + KV cache + 0.9 GB recurrent state). Must leave **≥ 8 GB for macOS** (16 GB Macs excepted).
|
| 104 |
|
| 105 |
+
| RAM | Quant | KV cache | Max context | Total used | Vision |
|
| 106 |
|---|---|---|---|---:|---|
|
| 107 |
+
| 16 GB | `IQ2_M` | `q4_0` | 32K | 11.4 GB | ✗ |
|
| 108 |
+
| 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **15.0 GB** | ✓ |
|
| 109 |
+
| 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
|
| 110 |
+
| 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.2 GB** | ✗ |
|
| 111 |
+
| 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.2 GB | ✓ |
|
| 112 |
+
| 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.0 GB | ✓ |
|
| 113 |
+
| 48 GB | **`Q6_K`** | `q8_0` | **262K** | **30.4 GB** | ✓ |
|
| 114 |
+
| 48 GB | `Q8_0` | `q8_0` | 262K | 36.4 GB | ✓ |
|
| 115 |
+
| 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **36.4 GB** | ✓ |
|
|
|
|
| 116 |
|
| 117 |
### NVIDIA GPU
|
| 118 |
|
|
|
|
| 129 |
| 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
|
| 130 |
| 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
|
| 131 |
|
| 132 |
+
> **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
|
| 133 |
>
|
| 134 |
+
> **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K with vision.
|
| 135 |
>
|
| 136 |
+
> **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (30.4 GB). `Q8_0`/q8_0 for perfection (36.4 GB).
|
| 137 |
>
|
| 138 |
> **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `IQ4_XS`/q8_0 for higher KV quality at 200K.
|
| 139 |
>
|
|
|
|
| 141 |
|
| 142 |
For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, `IQ4_XS` with `q4_0` and larger context is often sufficient.
|
| 143 |
|
| 144 |
+
Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
|
| 145 |
|
| 146 |
---
|
| 147 |
|
|
|
|
| 308 |
| File | Size | Min. (4K ctx) | Recommended (80K ctx) | Max (262K ctx) |
|
| 309 |
|---|---:|---|---|---|
|
| 310 |
| `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 311 |
+
| `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
|
| 312 |
+
| **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** |
|
| 313 |
+
| `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 314 |
+
| `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 16 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 315 |
+
| `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
|
| 316 |
| `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
|
| 317 |
| `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
|
| 318 |
|
|
|
|
| 328 |
|
| 329 |
| Context | Model | KV (f16) | KV (q8_0) | KV (q4_0) | Total (q8_0) | Min. Mac (q8_0) |
|
| 330 |
|---|---|---|---|---|---|---|
|
| 331 |
+
| 4K | 18 GB | 0.3 GB | 0.1 GB | — | 19 GB | 32 GB |
|
| 332 |
+
| 8K | 18 GB | 0.5 GB | 0.3 GB | — | 19 GB | 32 GB |
|
| 333 |
+
| 32K | 18 GB | 2.1 GB | 1.0 GB | — | 20 GB | 32 GB |
|
| 334 |
| 64K | 18 GB | 4.1 GB | 2.1 GB | — | 21 GB | 32 GB |
|
| 335 |
| **80K (recommended)** | **18 GB** | **5.2 GB** | **2.6 GB** | **—** | **22 GB** | **32 GB** |
|
| 336 |
| 128K | 18 GB | 8.3 GB | 4.1 GB | — | 23 GB | 32 GB |
|
| 337 |
+
| 262K (max native) | 18 GB | 17.0 GB | 8.5 GB | 4.3 GB | 27 GB | 48 GB* |
|
| 338 |
|
| 339 |
+
"Total" = model + recurrent state + KV cache. macOS needs ≥ 8 GB (16 GB Macs excepted). \*32 GB Mac at 262K needs q4_0 KV (23 GB total). With vision: add 0.9 GB for the mmproj.
|
| 340 |
|
| 341 |
<details>
|
| 342 |
<summary>Memory for all quant tiers (4K context, q8_0 KV)</summary>
|
|
|
|
| 345 |
|---|---|---|---|---|
|
| 346 |
| Q8_0 | 27 GB | 1.0 GB | 28 GB | 48 GB |
|
| 347 |
| Q6_K | 21 GB | 1.0 GB | 22 GB | 32 GB |
|
| 348 |
+
| Q5_K_M | 18 GB | 1.0 GB | 19 GB | 32 GB |
|
| 349 |
+
| Q4_K_M | 16 GB | 1.0 GB | 17 GB | 32 GB |
|
| 350 |
| IQ4_XS | 14 GB | 1.0 GB | 15 GB | 24 GB |
|
| 351 |
| IQ3_M | 12 GB | 1.0 GB | 13 GB | 24 GB |
|
| 352 |
| IQ2_M | 10 GB | 1.0 GB | 11 GB | 16 GB |
|