danielhanchen commited on
Commit
1ea961e
·
verified ·
1 Parent(s): d360509

Rename MTP drafters: root mtp-gemma-4-*-it.gguf for -hf; MTP/ files use -MTP suffix; update README

Browse files
.gitattributes CHANGED
@@ -71,3 +71,7 @@ mtp-gemma-4-26B-A4B-it-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
71
  MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
72
  MTP/mtp-gemma-4-26B-A4B-it-BF16.gguf filter=lfs diff=lfs merge=lfs -text
73
  MTP/mtp-gemma-4-26B-A4B-it-F16.gguf filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
71
  MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
72
  MTP/mtp-gemma-4-26B-A4B-it-BF16.gguf filter=lfs diff=lfs merge=lfs -text
73
  MTP/mtp-gemma-4-26B-A4B-it-F16.gguf filter=lfs diff=lfs merge=lfs -text
74
+ mtp-gemma-4-26B-A4B-it.gguf filter=lfs diff=lfs merge=lfs -text
75
+ MTP/gemma-4-26B-A4B-it-Q8_0-MTP.gguf filter=lfs diff=lfs merge=lfs -text
76
+ MTP/gemma-4-26B-A4B-it-BF16-MTP.gguf filter=lfs diff=lfs merge=lfs -text
77
+ MTP/gemma-4-26B-A4B-it-F16-MTP.gguf filter=lfs diff=lfs merge=lfs -text
MTP/README.md CHANGED
@@ -8,11 +8,11 @@ MTP was merged into llama.cpp on 2026-06-07 (PR ggml-org/llama.cpp#23398). You n
8
 
9
  ## Files
10
 
11
- A `mtp-` prefixed Q8_0 copy sits at the repo root so `-hf` can auto-discover it. All three precisions live in `MTP/`:
12
 
13
- - `mtp-gemma-4-26B-A4B-it-Q8_0.gguf` (smallest, recommended; same file is mirrored at the repo root)
14
- - `mtp-gemma-4-26B-A4B-it-BF16.gguf`
15
- - `mtp-gemma-4-26B-A4B-it-F16.gguf`
16
 
17
  ## Build llama.cpp
18
 
@@ -44,11 +44,11 @@ Use this to choose a precision or point at a local file.
44
 
45
  ```bash
46
  hf download unsloth/gemma-4-26B-A4B-it-GGUF gemma-4-26B-A4B-it-UD-Q4_K_M.gguf --local-dir .
47
- hf download unsloth/gemma-4-26B-A4B-it-GGUF MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf --local-dir .
48
 
49
  ./build/bin/llama-server \
50
  -m gemma-4-26B-A4B-it-UD-Q4_K_M.gguf \
51
- --model-draft MTP/mtp-gemma-4-26B-A4B-it-Q8_0.gguf \
52
  --spec-type draft-mtp --spec-draft-n-max 4 \
53
  -ngl 999 -fa on
54
  ```
 
8
 
9
  ## Files
10
 
11
+ For `-hf` auto-discovery a Q8_0 drafter sits at the repo root as `mtp-gemma-4-26B-A4B-it.gguf`. The same three precisions live in `MTP/`:
12
 
13
+ - `gemma-4-26B-A4B-it-Q8_0-MTP.gguf` (smallest, recommended; mirrored at the repo root as `mtp-gemma-4-26B-A4B-it.gguf`)
14
+ - `gemma-4-26B-A4B-it-BF16-MTP.gguf`
15
+ - `gemma-4-26B-A4B-it-F16-MTP.gguf`
16
 
17
  ## Build llama.cpp
18
 
 
44
 
45
  ```bash
46
  hf download unsloth/gemma-4-26B-A4B-it-GGUF gemma-4-26B-A4B-it-UD-Q4_K_M.gguf --local-dir .
47
+ hf download unsloth/gemma-4-26B-A4B-it-GGUF MTP/gemma-4-26B-A4B-it-Q8_0-MTP.gguf --local-dir .
48
 
49
  ./build/bin/llama-server \
50
  -m gemma-4-26B-A4B-it-UD-Q4_K_M.gguf \
51
+ --model-draft MTP/gemma-4-26B-A4B-it-Q8_0-MTP.gguf \
52
  --spec-type draft-mtp --spec-draft-n-max 4 \
53
  -ngl 999 -fa on
54
  ```
MTP/gemma-4-26B-A4B-it-BF16-MTP.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01cdef467d12d51474b821542eb113cd8ac6ac3649b2a9f5f0a6f3a2eacd59a0
3
+ size 855228576
MTP/gemma-4-26B-A4B-it-F16-MTP.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:36bf2f6710cf06ff1a5d026cca49ba88bd3451d8588a484ca5a79c5e30aa45f2
3
+ size 855228576
MTP/gemma-4-26B-A4B-it-Q8_0-MTP.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6326fb9f5e487aa8dcdd313a091e3c67724cb2a666ec3b7d2895b5b26d93ed1b
3
+ size 461766816
mtp-gemma-4-26B-A4B-it.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6326fb9f5e487aa8dcdd313a091e3c67724cb2a666ec3b7d2895b5b26d93ed1b
3
+ size 461766816