ddh0 commited on
Commit
7e02b01
·
verified ·
1 Parent(s): 029c1c1

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +16 -1
README.md CHANGED
@@ -5,4 +5,19 @@ base_model_relation: quantized
5
  quantized_by: ddh0
6
  ---
7
 
8
- GGUF quantizations of [GLM-4.5-Air](https://huggingface.co/zai-org/GLM-4.5-Air).
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
5
  quantized_by: ddh0
6
  ---
7
 
8
+ # GLM-4.5-Air-GGUF
9
+
10
+ This repository contains several custom GGUF quantizations of [GLM-4.5-Air](https://huggingface.co/zai-org/GLM-4.5-Air), to be used with [llama.cpp](https://github.com/ggml-org/llama.cpp):
11
+
12
+ | Filename | Size (GiB) | Average BPW | Direct link |
13
+ | --- | --- | --- | --- |
14
+ | GLM-4.5-Air-Q8_0-FFN-IQ3_S-IQ3_S-Q5_0.gguf | 57.43 | 4.47 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-IQ3_S-IQ3_S-Q5_0.gguf) |
15
+ | GLM-4.5-Air-Q8_0-FFN-IQ4_XS-IQ4_XS-Q5_0.gguf | 63.86 | 4.97 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-IQ4_XS-IQ4_XS-Q5_0.gguf) |
16
+ | GLM-4.5-Air-Q8_0-FFN-Q4_K-Q4_K-Q5_1.gguf | 67.82 | 5.27 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-Q4_K-Q4_K-Q5_1.gguf) |
17
+ | GLM-4.5-Air-Q8_0-FFN-Q4_K-Q4_K-Q8_0.gguf | 77.71 | 6.04 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-Q4_K-Q4_K-Q8_0.gguf) |
18
+ | GLM-4.5-Air-Q8_0-FFN-Q5_K-Q5_K-Q8_0.gguf | 85.63 | 6.66 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-Q5_K-Q5_K-Q8_0.gguf) |
19
+ | GLM-4.5-Air-Q8_0-FFN-Q6_K-Q6_K-Q8_0.gguf | 94.04 | 7.31 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0-FFN-Q6_K-Q6_K-Q8_0.gguf) |
20
+ | GLM-4.5-Air-Q8_0.gguf | 109.39 | 8.50 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-Q8_0.gguf) |
21
+ | GLM-4.5-Air-bf16.gguf | 205.81 | 16.00 | [Download](https://huggingface.co/ddh0/GLM-4.5-Air-GGUF/resolve/main/GLM-4.5-Air-bf16.gguf) |
22
+
23
+ These quantizations use Q8_0 for all tensors by default - only the dense FFN block and conditional experts are downgraded. The shared expert is always kept in Q8_0.