froggeric commited on
Commit
88436f3
·
verified ·
1 Parent(s): f206512

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +27 -28
README.md CHANGED
@@ -100,20 +100,19 @@ Find your hardware below — each row gives the best quant, KV cache type, and m
100
 
101
  Qwen3.6-27B is a hybrid model — only **16 of 65 layers** use KV cache (verified). The other 48 are linear attention (fixed 898 MiB recurrent state). KV memory is **~4× less** than a standard dense model. Runtimes that don't handle this (e.g. vllm) allocate KV for all 65 layers and show much higher memory usage.
102
 
103
- Numbers below are model memory (measured). **Add 4–8 GB for macOS** to get the real RAM needed.
104
 
105
- | RAM | Quant | KV cache | Max context | Model memory | Vision |
106
  |---|---|---|---|---:|---|
107
- | 16 GB | `IQ2_M` | `q4_0` | 32K | 11.7 GB | ✗ |
108
- | 24 GB | **`IQ3_M`** | `q4_0` | **262K** | **18.7 GB** | ✓ |
109
- | 24 GB | `IQ4_XS` | `q4_0` | 100K | 18.0 GB | ✓ |
110
- | 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **24.6 GB** | ✓ |
111
- | 32 GB | `Q5_K_M` | `q8_0` | 150K | 25.0 GB | ✓ |
112
- | 32 GB | `Q6_K` | `q4_0` | 262K | 27.5 GB | ✓ |
113
- | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **31.5 GB** | ✓ |
114
- | 48 GB | `Q8_0` | `q8_0` | 262K | 37.4 GB | ✓ |
115
- | 48 GB | `Q5_K_M` | `q4_0` | 262K | 24.6 GB | ✓ |
116
- | 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **37.4 GB** | ✓ |
117
 
118
  ### NVIDIA GPU
119
 
@@ -130,11 +129,11 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
130
  | 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
131
  | 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
132
 
133
- > **24 GB Mac:** `IQ3_M`/q4_0 reaches 262K with vision (18.7 GB model). `IQ4_XS` for slightly better quality at shorter context.
134
  >
135
- > **32 GB Mac:** `Q5_K_M`/q4_0 — 262K context with vision (24.6 GB model). `Q5_K_M`/q8_0 for better KV quality at 150K. `Q6_K`/q4_0 at 262K is tight (27.5 GB + system).
136
  >
137
- > **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (31.5 GB). `Q8_0`/q8_0 for perfection (37.4 GB).
138
  >
139
  > **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `IQ4_XS`/q8_0 for higher KV quality at 200K.
140
  >
@@ -142,7 +141,7 @@ Same model memory as Apple Silicon, plus ~1 GB CUDA overhead.
142
 
143
  For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, `IQ4_XS` with `q4_0` and larger context is often sufficient.
144
 
145
- Vision adds ~0.9 GB for mmproj. macOS needs 4–8 GB for itself (6 GB recommended). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
146
 
147
  ---
148
 
@@ -309,11 +308,11 @@ Uses cached n-grams from previous prompts.
309
  | File | Size | Min. (4K ctx) | Recommended (80K ctx) | Max (262K ctx) |
310
  |---|---:|---|---|---|
311
  | `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
312
- | `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
313
- | **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **24 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** |
314
- | `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
315
- | `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
316
- | `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 24 GB Mac · 24 GB GPU |
317
  | `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
318
  | `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
319
 
@@ -329,15 +328,15 @@ Approximate VRAM on Apple Silicon (unified memory), using Q5_K_M as reference. I
329
 
330
  | Context | Model | KV (f16) | KV (q8_0) | KV (q4_0) | Total (q8_0) | Min. Mac (q8_0) |
331
  |---|---|---|---|---|---|---|
332
- | 4K | 18 GB | 0.3 GB | 0.1 GB | — | 19 GB | 24 GB |
333
- | 8K | 18 GB | 0.5 GB | 0.3 GB | — | 19 GB | 24 GB |
334
- | 32K | 18 GB | 2.1 GB | 1.0 GB | — | 20 GB | 24 GB |
335
  | 64K | 18 GB | 4.1 GB | 2.1 GB | — | 21 GB | 32 GB |
336
  | **80K (recommended)** | **18 GB** | **5.2 GB** | **2.6 GB** | **—** | **22 GB** | **32 GB** |
337
  | 128K | 18 GB | 8.3 GB | 4.1 GB | — | 23 GB | 32 GB |
338
- | 262K (max native) | 18 GB | 17.0 GB | 8.5 GB | 4.3 GB | 27 GB | 48 GB |
339
 
340
- "Total" = model + recurrent state + KV cache. Add 4–8 GB for macOS system overhead (6 GB recommended). At 262K with q4_0 KV, total drops to 23 GB — fits 32 GB Mac. With vision: add 0.9 GB for the mmproj.
341
 
342
  <details>
343
  <summary>Memory for all quant tiers (4K context, q8_0 KV)</summary>
@@ -346,8 +345,8 @@ Approximate VRAM on Apple Silicon (unified memory), using Q5_K_M as reference. I
346
  |---|---|---|---|---|
347
  | Q8_0 | 27 GB | 1.0 GB | 28 GB | 48 GB |
348
  | Q6_K | 21 GB | 1.0 GB | 22 GB | 32 GB |
349
- | Q5_K_M | 18 GB | 1.0 GB | 19 GB | 24 GB |
350
- | Q4_K_M | 16 GB | 1.0 GB | 17 GB | 24 GB |
351
  | IQ4_XS | 14 GB | 1.0 GB | 15 GB | 24 GB |
352
  | IQ3_M | 12 GB | 1.0 GB | 13 GB | 24 GB |
353
  | IQ2_M | 10 GB | 1.0 GB | 11 GB | 16 GB |
 
100
 
101
  Qwen3.6-27B is a hybrid model — only **16 of 65 layers** use KV cache (verified). The other 48 are linear attention (fixed 898 MiB recurrent state). KV memory is **~4× less** than a standard dense model. Runtimes that don't handle this (e.g. vllm) allocate KV for all 65 layers and show much higher memory usage.
102
 
103
+ Numbers below are total memory used (model + KV cache + 0.9 GB recurrent state). Must leave **≥ 8 GB for macOS** (16 GB Macs excepted).
104
 
105
+ | RAM | Quant | KV cache | Max context | Total used | Vision |
106
  |---|---|---|---|---:|---|
107
+ | 16 GB | `IQ2_M` | `q4_0` | 32K | 11.4 GB | ✗ |
108
+ | 24 GB | **`IQ3_M`** | `q4_0` | **128K** | **15.0 GB** | ✓ |
109
+ | 24 GB | `IQ3_M` | `q4_0` | 180K | 15.9 GB | ✗ |
110
+ | 32 GB | **`Q5_K_M`** | `q4_0` | **262K** | **23.2 GB** | ✗ |
111
+ | 32 GB | `Q4_K_M` | `q4_0` | 262K | 21.2 GB | ✓ |
112
+ | 32 GB | `Q5_K_M` | `q8_0` | 128K | 23.0 GB | ✓ |
113
+ | 48 GB | **`Q6_K`** | `q8_0` | **262K** | **30.4 GB** | ✓ |
114
+ | 48 GB | `Q8_0` | `q8_0` | 262K | 36.4 GB | ✓ |
115
+ | 64+ GB | **`Q8_0`** | `q8_0` | **262K** | **36.4 GB** | ✓ |
 
116
 
117
  ### NVIDIA GPU
118
 
 
129
  | 48 GB | `Q5_K_M` | `q4_0` | 262K | 25.6 GB | ✓ |
130
  | 80 GB | **`Q8_0`** | `q8_0` | **262K** | **38.4 GB** | ✓ |
131
 
132
+ > **24 GB Mac:** `IQ3_M`/q4_0 — 128K with vision, 180K text-only.
133
  >
134
+ > **32 GB Mac:** `Q5_K_M`/q4_0 — 262K text-only. For vision at 262K, use `Q4_K_M`. `Q5_K_M`/q8_0 for higher KV quality at 128K with vision.
135
  >
136
+ > **48 GB Mac:** `Q6_K`/q8_0 — best quality at 262K (30.4 GB). `Q8_0`/q8_0 for perfection (36.4 GB).
137
  >
138
  > **24 GB GPU:** `Q4_K_M`/q4_0 reaches 262K with vision. `IQ4_XS`/q8_0 for higher KV quality at 200K.
139
  >
 
141
 
142
  For coding and reasoning, prioritize higher quants with `q8_0` KV. For general chat and RAG, `IQ4_XS` with `q4_0` and larger context is often sufficient.
143
 
144
+ Vision adds ~0.9 GB for mmproj. macOS needs **≥ 8 GB** for itself (16 GB Macs excepted — use ~4 GB). You can increase available memory by raising the wired memory limit, e.g. for a 96 GB Mac: `sudo sysctl iogpu.wired_limit_mb=90112` (88 GB). NVIDIA reserves ~1 GB for CUDA.
145
 
146
  ---
147
 
 
308
  | File | Size | Min. (4K ctx) | Recommended (80K ctx) | Max (262K ctx) |
309
  |---|---:|---|---|---|
310
  | `Qwen3.6-27B-Q8_0-mtp.gguf` | 27 GB | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
311
+ | `Qwen3.6-27B-Q6_K-mtp.gguf` | 21 GB | 32 GB Mac · 24 GB GPU | 48 GB Mac · 48 GB GPU | 48 GB Mac · 48 GB GPU |
312
+ | **`Qwen3.6-27B-Q5_K_M-mtp.gguf`** | **18 GB** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** | **32 GB Mac · 24 GB GPU** |
313
+ | `Qwen3.6-27B-Q4_K_M-mtp.gguf` | 16 GB | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
314
+ | `Qwen3.6-27B-IQ4_XS-mtp.gguf` | 14 GB | 24 GB Mac · 16 GB GPU | 32 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
315
+ | `Qwen3.6-27B-IQ3_M-mtp.gguf` | 12 GB | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU | 32 GB Mac · 24 GB GPU |
316
  | `Qwen3.6-27B-IQ2_M-mtp.gguf` | 10 GB | 16 GB Mac · 16 GB GPU | 24 GB Mac · 16 GB GPU | 24 GB Mac · 24 GB GPU |
317
  | `mmproj-Qwen3.6-27B-f16.gguf` | 885 MB | Vision encoder (optional, any tier) | — | — |
318
 
 
328
 
329
  | Context | Model | KV (f16) | KV (q8_0) | KV (q4_0) | Total (q8_0) | Min. Mac (q8_0) |
330
  |---|---|---|---|---|---|---|
331
+ | 4K | 18 GB | 0.3 GB | 0.1 GB | — | 19 GB | 32 GB |
332
+ | 8K | 18 GB | 0.5 GB | 0.3 GB | — | 19 GB | 32 GB |
333
+ | 32K | 18 GB | 2.1 GB | 1.0 GB | — | 20 GB | 32 GB |
334
  | 64K | 18 GB | 4.1 GB | 2.1 GB | — | 21 GB | 32 GB |
335
  | **80K (recommended)** | **18 GB** | **5.2 GB** | **2.6 GB** | **—** | **22 GB** | **32 GB** |
336
  | 128K | 18 GB | 8.3 GB | 4.1 GB | — | 23 GB | 32 GB |
337
+ | 262K (max native) | 18 GB | 17.0 GB | 8.5 GB | 4.3 GB | 27 GB | 48 GB* |
338
 
339
+ "Total" = model + recurrent state + KV cache. macOS needs ≥ 8 GB (16 GB Macs excepted). \*32 GB Mac at 262K needs q4_0 KV (23 GB total). With vision: add 0.9 GB for the mmproj.
340
 
341
  <details>
342
  <summary>Memory for all quant tiers (4K context, q8_0 KV)</summary>
 
345
  |---|---|---|---|---|
346
  | Q8_0 | 27 GB | 1.0 GB | 28 GB | 48 GB |
347
  | Q6_K | 21 GB | 1.0 GB | 22 GB | 32 GB |
348
+ | Q5_K_M | 18 GB | 1.0 GB | 19 GB | 32 GB |
349
+ | Q4_K_M | 16 GB | 1.0 GB | 17 GB | 32 GB |
350
  | IQ4_XS | 14 GB | 1.0 GB | 15 GB | 24 GB |
351
  | IQ3_M | 12 GB | 1.0 GB | 13 GB | 24 GB |
352
  | IQ2_M | 10 GB | 1.0 GB | 11 GB | 16 GB |