danielhanchen commited on
Commit
3d7a4fb
·
verified ·
1 Parent(s): 0a3dba9

Add root-level mtp- drafter for -hf auto-discovery; rename MTP/ drafters to mtp- prefix; update MTP README

Browse files
.gitattributes CHANGED
@@ -67,3 +67,7 @@ gemma-4-26B-A4B-it-UD-Q4_K_S_XS.gguf filter=lfs diff=lfs merge=lfs -text
67
  MTP/gemma-4-26B-A4B-it-MTP-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
68
  MTP/gemma-4-26B-A4B-it-MTP-BF16.gguf filter=lfs diff=lfs merge=lfs -text
69
  MTP/gemma-4-26B-A4B-it-MTP-F16.gguf filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
67
  MTP/gemma-4-26B-A4B-it-MTP-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
68
  MTP/gemma-4-26B-A4B-it-MTP-BF16.gguf filter=lfs diff=lfs merge=lfs -text
69
  MTP/gemma-4-26B-A4B-it-MTP-F16.gguf filter=lfs diff=lfs merge=lfs -text
70
+ mtp-gemma-4-26B-A4B-it-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
71
+ MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
72
+ MTP/mtp-gemma-4-26B-A4B-it-BF16.gguf filter=lfs diff=lfs merge=lfs -text
73
+ MTP/mtp-gemma-4-26B-A4B-it-F16.gguf filter=lfs diff=lfs merge=lfs -text
MTP/README.md CHANGED
@@ -8,9 +8,11 @@ MTP was merged into llama.cpp on 2026-06-07 (PR ggml-org/llama.cpp#23398). You n
8
 
9
  ## Files
10
 
11
- - `gemma-4-26B-A4B-it-MTP-Q8_0.gguf` (smallest, recommended)
12
- - `gemma-4-26B-A4B-it-MTP-BF16.gguf`
13
- - `gemma-4-26B-A4B-it-MTP-F16.gguf`
 
 
14
 
15
  ## Build llama.cpp
16
 
@@ -23,20 +25,32 @@ cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=90
23
  cmake --build build --config Release -j --target llama-server
24
  ```
25
 
26
- ## Run
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
27
 
28
  ```bash
29
- # grab the main model (any quant) and one drafter
30
  hf download unsloth/gemma-4-26B-A4B-it-GGUF gemma-4-26B-A4B-it-UD-Q4_K_M.gguf --local-dir .
31
- hf download unsloth/gemma-4-26B-A4B-it-GGUF MTP/gemma-4-26B-A4B-it-MTP-Q8_0.gguf --local-dir .
32
 
33
  ./build/bin/llama-server \
34
  -m gemma-4-26B-A4B-it-UD-Q4_K_M.gguf \
35
- --model-draft MTP/gemma-4-26B-A4B-it-MTP-Q8_0.gguf \
36
  --spec-type draft-mtp --spec-draft-n-max 4 \
37
  -ngl 999 -fa on
38
  ```
39
 
40
- Multi GPU: add `--spec-draft-device CUDA0 -sm layer`.
41
-
42
- The drafter pairs with any quant of the 26B-A4B. Quantized KV cache works.
 
8
 
9
  ## Files
10
 
11
+ A `mtp-` prefixed Q8_0 copy sits at the repo root so `-hf` can auto-discover it. All three precisions live in `MTP/`:
12
+
13
+ - `mtp-gemma-4-26B-A4B-it-Q8_0.gguf` (smallest, recommended; same file is mirrored at the repo root)
14
+ - `mtp-gemma-4-26B-A4B-it-BF16.gguf`
15
+ - `mtp-gemma-4-26B-A4B-it-F16.gguf`
16
 
17
  ## Build llama.cpp
18
 
 
25
  cmake --build build --config Release -j --target llama-server
26
  ```
27
 
28
+ ## Run, the easy way
29
+
30
+ A recent llama.cpp finds the drafter automatically from the root `mtp-` file, so `-hf` is all you need. No `--model-draft`.
31
+
32
+ ```bash
33
+ ./build/bin/llama-server \
34
+ -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_M \
35
+ --spec-type draft-mtp --spec-draft-n-max 4 \
36
+ -ngl 999 -fa on
37
+ ```
38
+
39
+ If your build is too old to auto-discover the sibling, use the explicit form below.
40
+
41
+ ## Run with an explicit drafter
42
+
43
+ Use this to choose a precision or point at a local file.
44
 
45
  ```bash
 
46
  hf download unsloth/gemma-4-26B-A4B-it-GGUF gemma-4-26B-A4B-it-UD-Q4_K_M.gguf --local-dir .
47
+ hf download unsloth/gemma-4-26B-A4B-it-GGUF MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf --local-dir .
48
 
49
  ./build/bin/llama-server \
50
  -m gemma-4-26B-A4B-it-UD-Q4_K_M.gguf \
51
+ --model-draft MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf \
52
  --spec-type draft-mtp --spec-draft-n-max 4 \
53
  -ngl 999 -fa on
54
  ```
55
 
56
+ Multi GPU: add `--spec-draft-device CUDA0 -sm layer`. The drafter pairs with any quant of the 26B-A4B. Quantized KV cache works.
 
 
MTP/mtp-gemma-4-26B-A4B-it-BF16.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01cdef467d12d51474b821542eb113cd8ac6ac3649b2a9f5f0a6f3a2eacd59a0
3
+ size 855228576
MTP/mtp-gemma-4-26B-A4B-it-F16.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:36bf2f6710cf06ff1a5d026cca49ba88bd3451d8588a484ca5a79c5e30aa45f2
3
+ size 855228576
MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6326fb9f5e487aa8dcdd313a091e3c67724cb2a666ec3b7d2895b5b26d93ed1b
3
+ size 461766816
mtp-gemma-4-26B-A4B-it-Q8_0.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6326fb9f5e487aa8dcdd313a091e3c67724cb2a666ec3b7d2895b5b26d93ed1b
3
+ size 461766816