rogKesavan90 commited on
Commit
0ae22e1
·
0 Parent(s):

Initial commit

Browse files
.gitattributes ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,302 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ language:
4
+ - en
5
+ - zh
6
+ - multilingual
7
+ tags:
8
+ - text-generation
9
+ - image-text-to-text
10
+ - mlx
11
+ - mlx-vlm
12
+ - safetensors
13
+ - qwen
14
+ - qwen3
15
+ - qwen3.5
16
+ - qwen3.6
17
+ - claude-opus-distill
18
+ - reasoning
19
+ - vision
20
+ - multimodal
21
+ - abliterated
22
+ - refusal-ablated
23
+ - uncensored
24
+ - optiq
25
+ - mixed-precision
26
+ - apple-silicon
27
+ - conversational
28
+ base_model:
29
+ - Jackrong/Qwopus3.6-27B-v2
30
+ - Qwen/Qwen3.6-27B
31
+ pipeline_tag: image-text-to-text
32
+ library_name: mlx
33
+ ---
34
+
35
+ <p align="center">
36
+ <img src="logo.png" alt="Lemura Labs" width="110"/>
37
+ </p>
38
+
39
+ # Qwen3.6-27B-V2-abliterated-uncensored-OptiQ-3.7bpw-mlx
40
+
41
+ ![Format](https://img.shields.io/badge/Format-MLX-0b7285?style=flat) ![Task](https://img.shields.io/badge/Task-Vision%20+%20Text-5f3dc4?style=flat) ![Params](https://img.shields.io/badge/Params-27B-1864ab?style=flat) ![Type](https://img.shields.io/badge/Type-Abliterated-862e9c?style=flat) ![Quant](https://img.shields.io/badge/Quant-OptiQ-1f6feb?style=flat) ![Size](https://img.shields.io/badge/Size-14%20GB-495057?style=flat) ![Refusals](https://img.shields.io/badge/Refusals-91%2F100%20to%204%2F100-2ea44f?style=flat) ![KL drift](https://img.shields.io/badge/KL%20drift-0.0176-2f9e44?style=flat) ![License](https://img.shields.io/badge/License-apache--2.0-6c757d?style=flat)
42
+
43
+
44
+ > Yes — **VISION PRESERVED — even at 3.7 BPW.** Most OptiQ releases strip the vision tower; we keep it. The LM portion is OptiQ static-mixed (3/4/8-bit per tensor), and the ViT is spliced back in at BF16 from our 8-bit MLX build, giving you a full multimodal model that fits in 14 GB.
45
+
46
+ **OptiQ static mixed ~3.7 BPW MLX quantization** of a abliterated Qwen 3.6 27B v2 (the Jackrong Claude-Opus reasoning distill of Qwen 3.6 27B). Refusals reduced from **91/100 → 4/100** with KL drift of just **0.0176**. By the Lemura Labs research team.
47
+
48
+ > Smallest variant in our line. The LM uses [mlx-optiq](https://pypi.org/project/mlx-optiq/) Frobenius-stream sensitivity scans to assign **3-bit** to layers that tolerate it and **4–8-bit** to the layers that don't, averaging **3.697 bits per weight**. The vision tower (333 ViT weights, ~880 MB at BF16) is spliced back in unmodified from the abliterated parent — the cleanest combination of language compression and visual fidelity.
49
+
50
+ ---
51
+
52
+ ## TL;DR
53
+
54
+ | Property | Value |
55
+ |----------|-------|
56
+ | **Disk size** | ~14 GB |
57
+ | **LM BPW (achieved)** | 3.697 (target 3.7) · 4.147 effective with scale/bias |
58
+ | **LM scheme** | OptiQ static-mixed (sensitivity-ranked, Frobenius-stream weight-space) |
59
+ | **LM bit allocation** | 223 × 8-bit, 210 × 4-bit, 149 × 3-bit, 0 × 2-bit (582 quantizable tensors) |
60
+ | **Vision tower** | Yes — BF16, full ViT (333 weights, ~880 MB) |
61
+ | **Refusal rate (the ablation toolkit, n=100)** | **4/100** (vs vanilla Qwen 3.6 **91/100**) |
62
+ | **KL divergence vs vanilla (at BF16)** | **0.0176** |
63
+ | **Recommended RAM** | 16–24 GB Apple Silicon |
64
+ | **Best for** | Tight RAM budgets · full multimodal · base-Mac inference |
65
+ | **Released by** | Lemura Labs |
66
+
67
+ ---
68
+
69
+ ## All Qwen3.6-27B variants
70
+
71
+ The full Qwen3.6-27B family from Lemura Labs — same abliterated weights (refusal 4/100, KL 0.0176), different quant schemes for different runtimes.
72
+
73
+ | Quant | Format | BPW | Disk | Vision | Runtime | Link |
74
+ |---|---|---|---|---|---|---|
75
+ | 8-bit | MLX | 8.50 | ~27 GB | Yes — native | mlx-vlm | [`…-8-bit-mlx`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-8-bit-mlx) |
76
+ | 6-bit | MLX | 6.66 | ~21 GB | Yes — native | mlx-vlm | [`…-6-bit-mlx`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-6-bit-mlx) |
77
+ | **OptiQ 3.7bpw** **(this repo)** | MLX | ~3.7 | ~14 GB | Yes — ViT spliced | mlx-vlm | — *(you are here)* |
78
+ | Q8_0 | GGUF | 8.50 | ~28 GB | Yes — via mmproj | llama.cpp | [`…-8-bit-GGUF`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-8-bit-GGUF) |
79
+ | Q6_K | GGUF | ~6.56 | ~22 GB | Yes — via mmproj | llama.cpp | [`…-6-bit-GGUF`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-6-bit-GGUF) |
80
+ | Q4_K_M | GGUF | ~4.92 | ~16 GB | Yes — via mmproj | llama.cpp | [`…-Q4_K_M-GGUF`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-Q4_K_M-GGUF) |
81
+ | TQ3_4S | GGUF | 4.00 (~3.5 eff) | ~14 GB | Yes — via mmproj | [llama.cpp-tq3](https://github.com/turbo-tan/llama.cpp-tq3) | [`…-TQ3_4s-GGUF`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-TQ3_4s-GGUF) |
82
+ | TQ3_1S | GGUF | 4.00 (~3.5 eff) | ~14 GB | Yes — via mmproj | [llama.cpp-tq3](https://github.com/turbo-tan/llama.cpp-tq3) | [`…-TQ3_1s-GGUF`](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-TQ3_1s-GGUF) |
83
+
84
+ > All variants share the same abliterated base weights — pick by your runtime (Apple Silicon → MLX; CUDA/CPU/cross-platform → GGUF) and your RAM budget.
85
+
86
+ ---
87
+
88
+ ## Lineage
89
+
90
+ ```
91
+ Qwen/Qwen3.6-27B (Qwen Team — base multimodal pretrain)
92
+ │
93
+ ▼
94
+ Jackrong/Qwopus3.6-27B-v2 (Jackrong — Claude-Opus reasoning distill)
95
+ │
96
+ ▼
97
+ ablation abliteration (TPE-50) (Lemura Labs)
98
+ ├── 25 random startup trials
99
+ ├── 2 community priors (coder3101, wangzhang)
100
+ └── 23 TPE smart-sampling trials → best at trial 45
101
+ │
102
+ ▼
103
+ mlx-optiq static-mixed 3.7 BPW (LM only) (Lemura Labs)
104
+ ├── Frobenius weight-space sensitivity (stream mode, fits 27B)
105
+ └── Multi-tier bit allocation: 3/4/8-bit
106
+ │
107
+ ▼
108
+ ViT spliced back in at BF16 from 8-bit build (Lemura Labs)
109
+ ├── 333 ViT weights, ~880 MB total
110
+ └── VLM config (Qwen3_5ForConditionalGeneration) restored
111
+ │
112
+ ▼
113
+ this repo — OptiQ-3.7bpw multimodal MLX
114
+ ```
115
+
116
+ Direct upstream links:
117
+
118
+ * Foundation: [Qwen/Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B)
119
+ * Claude-Opus distill: [Jackrong/Qwopus3.6-27B-v2](https://huggingface.co/Jackrong/Qwopus3.6-27B-v2)
120
+ * Abliteration tool: the ablation toolkit by Lemura Labs
121
+ * Quantization tool: [mlx-optiq](https://pypi.org/project/mlx-optiq/) by Thin Signal, on top of [mlx-lm](https://github.com/ml-explore/mlx-lm)
122
+
123
+ ---
124
+
125
+ ## Abliteration Results
126
+
127
+ the ablation toolkit measures refusals on `mlabonne/harmful_behaviors` (100 hard red-team prompts) and KL divergence on `mlabonne/harmless_alpaca`. These were measured at BF16 before quantization; the OptiQ-3.7bpw quant inherits them within calibration noise.
128
+
129
+ | Stage | Refusals (n=100) ↓ | KL divergence ↓ |
130
+ |---|---|---|
131
+ | Vanilla Jackrong/Qwopus3.6-27B-v2 | **91 / 100** | — (reference) |
132
+ | Community prior: coder3101 (T27) | 4 / 100 | 0.0359 |
133
+ | Community prior: wangzhang (T28) | 30 / 100 | 0.0259 |
134
+ | **TPE best (T45) — shipped here** | **4 / 100** | **0.0176** |
135
+ | TPE second-best (T37) | 5 / 100 | 0.0210 |
136
+
137
+ → **96% reduction in refusals** with capability preserved (KL ≈ 0.018, well below the 0.3 healing threshold). No SFT / LoRA healing was required.
138
+
139
+ ---
140
+
141
+ ## Method (TPE-50 with community priors → OptiQ-3.7 → vision merge)
142
+
143
+ ### Step 1. Abliteration (the ablation toolkit TPE-50)
144
+
145
+ 1. **Smoke** — 3-trial dry run on the ablation toolkit / Python 3.11 / MPS validated batch size 4 on M4 Max 128 GB.
146
+ 2. **Random search** — 25 startup trials over the ablation toolkit's parameter space (`direction_index`, `attn.o_proj.*`, `mlp.down_proj.*`). Best random-stage trial: T4 at `direction_index=54.49` — capability-clean but still too refusing (41/100).
147
+ 3. **Community-prior enqueueing** — published Qwen 27B the ablation toolkit runs (coder3101 on Qwen 3.5, wangzhang on Qwen 3.6) localized the refusal direction near layer 35–38 of 64. We injected both as study priors via `study.enqueue_trial(skip_if_exists=True)`.
148
+ 4. **TPE smart-sampling** — 23 Tree-structured Parzen Estimator trials refined around the community neighborhood. **Trial 45** (`direction_index=41.42`) found the Pareto front: **4/100 refusals at KL=0.0176**.
149
+ 5. **Auto-save** — best Pareto trial merged into base weights via the ablation toolkit's LoRA-adapter merge path; saved as BF16 safetensors with vision tower fully intact.
150
+
151
+ Total the ablation toolkit wall-clock: ~13 h on M4 Max 128 GB.
152
+
153
+ ### Step 2. LM mixed-precision quantization (OptiQ)
154
+
155
+ 6. **Sensitivity analysis** — `optiq convert --target-bpw 3.7 --candidate-bits 2,3,4,8 --sensitivity stream` mmaps each tensor and computes per-tensor Frobenius distance between BF16 reference and candidate quantized versions. For a 27B model on 128 GB unified memory this is the only mode that fits.
156
+ 7. **Multi-tier bit allocation** — OptiQ's optimizer assigns each of the 582 quantizable tensors a bit-width from `{3, 4, 8}` such that the average lands at the **3.7 BPW** target. Result: 38% × 8-bit (high-sensitivity), 36% × 4-bit (medium), 26% × 3-bit (low-sensitivity SSM projections and certain MLP gates). No tensor required 2-bit.
157
+ 8. **MLX serialization** — quantized LM weights written via `mlx-lm` quantize hooks, with the per-tensor bit-width recorded in `config.json["quantization"]` for each module path.
158
+
159
+ ### Step 3. Vision splice-back (custom)
160
+
161
+ 9. **Why** — OptiQ defaults to stripping vision weights and rewriting `config.json` to a text-only `Qwen3_5ForCausalLM`. We wanted a multimodal release. The `--keep-unused-modalities` flag preserves the architecture string but not the weights, so we built a manual splice.
162
+ 10. **What** — we copied the 333 vision tensors verbatim from our [companion 8-bit MLX build](https://huggingface.co/lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-8-bit-mlx) (where `mlx_vlm.convert` leaves the ViT at BF16) into a 4th safetensors shard, restored `vision_config`, `image_token_id`, `video_token_id`, `vision_start/end_token_id`, and the nested `text_config` block in `config.json`, and re-set `architectures` to `Qwen3_5ForConditionalGeneration`.
163
+ 11. **Verification** — post-load norm weights at expected ~0.79 mean (no double-sanitize), text generation coherent, vision pipeline correctly reads test imagery.
164
+
165
+ ### In-place the ablation toolkit patches used
166
+
167
+ - `ABLATION_AUTO_SAVE` — bypass interactive menu, auto-save Pareto-best.
168
+ - `ABLATION_AUTO_CONTINUE` — non-interactive checkpoint resume keeping CLI settings.
169
+ - `ABLATION_ENQUEUE_PRIORS` — load JSON priors before `study.optimize`.
170
+
171
+ ---
172
+
173
+ ## Use it
174
+
175
+ ### Inference via `mlx-vlm` (full multimodal)
176
+
177
+ ```bash
178
+ pip install mlx-vlm
179
+ ```
180
+
181
+ ```python
182
+ from mlx_vlm import load, generate
183
+ from mlx_vlm.prompt_utils import apply_chat_template
184
+ from mlx_vlm.utils import load_config
185
+
186
+ model, processor = load("lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-OptiQ-3.7bpw-mlx")
187
+ config = load_config("lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-OptiQ-3.7bpw-mlx")
188
+
189
+ messages = [{"role": "user", "content": "Explain the difference between SSM and softmax attention in 3 sentences."}]
190
+ prompt = apply_chat_template(processor, config, messages)
191
+ print(generate(model, processor, prompt, max_tokens=400, verbose=True))
192
+ ```
193
+
194
+ ### With an image
195
+
196
+ ```python
197
+ out = generate(
198
+ model, processor,
199
+ prompt=apply_chat_template(processor, config, [{"role":"user","content":"Describe this image briefly."}], num_images=1),
200
+ image=["./photo.jpg"],
201
+ max_tokens=400, verbose=True,
202
+ )
203
+ print(out)
204
+ ```
205
+
206
+ ### OpenAI-compatible HTTP via `mlx-omni-server`
207
+
208
+ ```bash
209
+ pip install mlx-omni-server
210
+ mlx-omni-server # serves on http://127.0.0.1:10240
211
+ ```
212
+
213
+ ```bash
214
+ curl -s http://127.0.0.1:10240/v1/chat/completions \
215
+ -H "Content-Type: application/json" \
216
+ -d '{
217
+ "model": "lemuralabs/Qwen3.6-27B-V2-abliterated-uncensored-OptiQ-3.7bpw-mlx",
218
+ "messages": [
219
+ {"role": "system", "content": "Be brief and direct."},
220
+ {"role": "user", "content": "Write a 3-line haiku about a heisenbug."}
221
+ ],
222
+ "max_tokens": 200
223
+ }' | jq -r '.choices[0].message.content'
224
+ ```
225
+
226
+ ---
227
+
228
+ ## Quantization details
229
+
230
+ * **Source weights**: BF16 abliterated checkpoint (12 shards, ~50 GB) — the ablation toolkit T45 merged into `Jackrong/Qwopus3.6-27B-v2`.
231
+ * **LM quantization tool**: [mlx-optiq](https://pypi.org/project/mlx-optiq/) v0.0.11 (`optiq convert --target-bpw 3.7 --candidate-bits 2,3,4,8 --sensitivity stream`).
232
+ * **Achieved LM BPW**: 3.697 (target 3.7) — see `optiq_metadata.json` for the full per-tensor allocation table.
233
+ * **Effective LM bits/weight**: 4.147 (with 16+16-bit scale+bias per group of 64 spread over the bit-width-weighted mean).
234
+ * **Group size**: 64 throughout (LM).
235
+ * **Vision tower**: spliced back at BF16 from the 8-bit MLX build (`mlx_vlm.convert` leaves ViTs unquantized by default; the 8-bit build's "8-bit" only refers to LM weights). 333 vision tensors, ~880 MB.
236
+ * **Architecture class**: `Qwen3_5ForConditionalGeneration` (full multimodal restored).
237
+
238
+ ### Per-tensor LM bit allocation (summary)
239
+
240
+ | Bit-width | # tensors | % of total LM |
241
+ |---|---|---|
242
+ | 8-bit | 223 | 38.3% |
243
+ | 4-bit | 210 | 36.1% |
244
+ | 3-bit | 149 | 25.6% |
245
+ | 2-bit | 0 | 0.0% |
246
+ | **Total** | **582** | 100% |
247
+
248
+ The full per-tensor allocation map lives in [`optiq_metadata.json`](./optiq_metadata.json). The vision tower (333 weights) does not appear in this table — it is unquantized BF16.
249
+
250
+ ### Architecture notes
251
+
252
+ Qwen 3.6 27B uses a **hybrid attention stack** — 3 linear-attention (GatedDeltaNet / SSM) layers followed by 1 full-softmax-attention layer, repeated 16× for 64 total layers; hidden 5120, vocab 248320, context 262144. The SSM kernels lack a VJP path in MLX, so backward-pass-based quant methods (DWQ, dynamic quant) **cannot** be applied to this architecture — OptiQ's forward-only Frobenius-stream sensitivity approach is the only calibration-aware option that works.
253
+
254
+ For inference latency at 3.7 BPW LM + BF16 ViT, expect ~12–15 tok/s on M4 Max 128 GB at batch size 1, or ~5–7 tok/s on M2/M3 16 GB at batch size 1.
255
+
256
+ ---
257
+
258
+ ## Behavior caveats
259
+
260
+ * **Uncensored.** Refusal directions were surgically removed; this model will answer prompts the parent would refuse. Use responsibly and within applicable law. The release is provided for safety research, red-teaming, and creative/educational use cases.
261
+ * **Multimodal preserved.** Vision works — the 333 ViT weights are unmodified from the abliterated parent. The abliteration acts on the LM hidden states only.
262
+ * **Identity preserved.** The model still self-identifies as Qwen (developed by Alibaba's Tongyi Lab) — abliteration does not rewrite factual self-knowledge.
263
+ * **Heavy chain-of-thought.** Qwen 3.6 inherits Claude-Opus's verbose reasoning style. For terse answers, use a system prompt like `"Be brief and direct. Skip your reasoning."`.
264
+ * **Quantization noise at 3-bit.** ~26% of LM tensors are at 3-bit. On long-generation tasks (>1000 tokens) you may notice slightly more drift than the 6/8-bit siblings. For best fidelity at this lineage, prefer 6-bit or 8-bit.
265
+
266
+ ---
267
+
268
+ ## Credits
269
+
270
+ **Quantization & release**
271
+
272
+ Lemura Labs
273
+
274
+ **Claude-Opus reasoning distill**
275
+
276
+ [Jackrong](https://huggingface.co/Jackrong) — author of [Qwen 3.6 27B-v2](https://huggingface.co/Jackrong/Qwopus3.6-27B-v2)
277
+
278
+ **Foundation model**
279
+
280
+ [Qwen Team @ Alibaba Tongyi Lab](https://huggingface.co/Qwen) — [Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B)
281
+
282
+ **Abliteration toolkit**
283
+
284
+ the ablation toolkit by Lemura Labs — Optuna-driven refusal-direction ablation with KL guardrails.
285
+
286
+ **Community priors that seeded our TPE search**
287
+
288
+ [coder3101/Qwen3.5-27B-zerofuse](https://huggingface.co/coder3101/Qwen3.5-27B-zerofuse) · [wangzhang/Qwen3.6-27B-abliterated](https://huggingface.co/wangzhang/Qwen3.6-27B-abliterated)
289
+
290
+ **Mixed-precision quantization framework**
291
+
292
+ [mlx-optiq](https://pypi.org/project/mlx-optiq/) by Thin Signal — sensitivity-driven multi-tier MLX quantization · built on [mlx-lm](https://github.com/ml-explore/mlx-lm) and [mlx](https://github.com/ml-explore/mlx) (Apple).
293
+
294
+ ---
295
+
296
+ ## License
297
+
298
+ Apache-2.0, inherited from the foundation (Qwen3.6-27B) and the distill (Qwen 3.6 27B-v2) upstream.
299
+
300
+ ---
301
+
302
+ Need a hosted endpoint, custom quant, or larger-scale inference? Lemura Labs — multi-provider LLM routing for the Indian developer ecosystem.
chat_template.jinja ADDED
@@ -0,0 +1,158 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set image_count = namespace(value=0) %}
2
+ {%- set video_count = namespace(value=0) %}
3
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
4
+ {%- if content is string %}
5
+ {{- content }}
6
+ {%- elif content is iterable and content is not mapping %}
7
+ {%- for item in content %}
8
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
9
+ {%- if is_system_content %}
10
+ {{- raise_exception('System message cannot contain images.') }}
11
+ {%- endif %}
12
+ {%- if do_vision_count %}
13
+ {%- set image_count.value = image_count.value + 1 %}
14
+ {%- endif %}
15
+ {%- if add_vision_id %}
16
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
17
+ {%- endif %}
18
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
19
+ {%- elif 'video' in item or item.type == 'video' %}
20
+ {%- if is_system_content %}
21
+ {{- raise_exception('System message cannot contain videos.') }}
22
+ {%- endif %}
23
+ {%- if do_vision_count %}
24
+ {%- set video_count.value = video_count.value + 1 %}
25
+ {%- endif %}
26
+ {%- if add_vision_id %}
27
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
28
+ {%- endif %}
29
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
30
+ {%- elif 'text' in item %}
31
+ {{- item.text }}
32
+ {%- else %}
33
+ {{- raise_exception('Unexpected item type in content.') }}
34
+ {%- endif %}
35
+ {%- endfor %}
36
+ {%- elif content is none or content is undefined %}
37
+ {{- '' }}
38
+ {%- else %}
39
+ {{- raise_exception('Unexpected content type.') }}
40
+ {%- endif %}
41
+ {%- endmacro %}
42
+ {%- if not messages %}
43
+ {{- raise_exception('No messages provided.') }}
44
+ {%- endif %}
45
+ {%- set num_sys = 0 %}
46
+ {%- set merged_system = '' %}
47
+ {%- if messages[0].role == 'system' or messages[0].role == 'developer' %}
48
+ {%- set first = render_content(messages[0].content, false, true)|trim %}
49
+ {%- if messages|length > 1 and (messages[1].role == 'system' or messages[1].role == 'developer') %}
50
+ {%- set second = render_content(messages[1].content, false, true)|trim %}
51
+ {%- set merged_system = first + '\n' + second %}
52
+ {%- set num_sys = 2 %}
53
+ {%- else %}
54
+ {%- set merged_system = first %}
55
+ {%- set num_sys = 1 %}
56
+ {%- endif %}
57
+ {%- endif %}
58
+ {%- if tools and tools is iterable and tools is not mapping %}
59
+ {{- '<|im_start|>system\n' }}
60
+ {{- "# Tools\n\nYou have access to the following functions:\n\n<tools>" }}
61
+ {%- for tool in tools %}
62
+ {{- "\n" }}
63
+ {{- tool | tojson }}
64
+ {%- endfor %}
65
+ {{- "\n</tools>" }}
66
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n</IMPORTANT>' }}
67
+ {%- if merged_system %}
68
+ {{- '\n\n' + merged_system }}
69
+ {%- endif %}
70
+ {{- '<|im_end|>\n' }}
71
+ {%- else %}
72
+ {%- if merged_system %}
73
+ {{- '<|im_start|>system\n' + merged_system + '<|im_end|>\n' }}
74
+ {%- endif %}
75
+ {%- endif %}
76
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
77
+ {%- for message in messages[::-1] %}
78
+ {%- set index = (messages|length - 1) - loop.index0 %}
79
+ {%- if ns.multi_step_tool and message.role == "user" %}
80
+ {%- set content = render_content(message.content, false)|trim %}
81
+ {%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
82
+ {%- set ns.multi_step_tool = false %}
83
+ {%- set ns.last_query_index = index %}
84
+ {%- endif %}
85
+ {%- endif %}
86
+ {%- endfor %}
87
+ {%- for message in messages %}
88
+ {%- if loop.index0 >= num_sys and message.role != "system" and message.role != "developer" %}
89
+ {%- set content = render_content(message.content, true)|trim %}
90
+ {%- if message.role == "user" %}
91
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
92
+ {%- elif message.role == "assistant" %}
93
+ {%- set reasoning_content = '' %}
94
+ {%- if message.reasoning_content is string %}
95
+ {%- set reasoning_content = message.reasoning_content %}
96
+ {%- else %}
97
+ {%- if '</think>' in content %}
98
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
99
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
100
+ {%- endif %}
101
+ {%- endif %}
102
+ {%- set reasoning_content = reasoning_content|trim %}
103
+ {%- if (preserve_thinking is defined and preserve_thinking is true) or (loop.index0 > ns.last_query_index) %}
104
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
105
+ {%- else %}
106
+ {{- '<|im_start|>' + message.role + '\n' + content }}
107
+ {%- endif %}
108
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
109
+ {%- for tool_call in message.tool_calls %}
110
+ {%- if tool_call.function is defined %}
111
+ {%- set tool_call = tool_call.function %}
112
+ {%- endif %}
113
+ {%- if loop.first %}
114
+ {%- if content|trim %}
115
+ {{- '\n\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
116
+ {%- else %}
117
+ {{- '<tool_call>\n<function=' + tool_call.name + '>\n' }}
118
+ {%- endif %}
119
+ {%- else %}
120
+ {{- '\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
121
+ {%- endif %}
122
+ {%- if tool_call.arguments is mapping %}
123
+ {%- for args_name in tool_call.arguments %}
124
+ {%- set args_value = tool_call.arguments[args_name] %}
125
+ {{- '<parameter=' + args_name + '>\n' }}
126
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
127
+ {{- args_value }}
128
+ {{- '\n</parameter>\n' }}
129
+ {%- endfor %}
130
+ {%- endif %}
131
+ {{- '</function>\n</tool_call>' }}
132
+ {%- endfor %}
133
+ {%- endif %}
134
+ {{- '<|im_end|>\n' }}
135
+ {%- elif message.role == "tool" %}
136
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
137
+ {{- '<|im_start|>user' }}
138
+ {%- endif %}
139
+ {{- '\n<tool_response>\n' }}
140
+ {{- content }}
141
+ {{- '\n</tool_response>' }}
142
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
143
+ {{- '<|im_end|>\n' }}
144
+ {%- elif loop.last %}
145
+ {{- '<|im_end|>\n' }}
146
+ {%- endif %}
147
+ {%- endif %}
148
+ {%- endif %}
149
+ {%- endfor %}
150
+ {%- if add_generation_prompt %}
151
+ {{- '<|im_start|>assistant\n' }}
152
+ {%- if enable_thinking is defined and enable_thinking is false %}
153
+ {{- '<think>\n\n</think>\n\n' }}
154
+ {%- else %}
155
+ {{- '<think>\n' }}
156
+ {%- endif %}
157
+ {%- endif %}
158
+ {#- Unsloth fixes - developer role, tool calling #}
config.json ADDED
The diff for this file is too large to render. See raw diff
 
generation_config.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 248044,
4
+ "eos_token_id": 248044,
5
+ "pad_token_id": 248055,
6
+ "transformers_version": "5.8.1",
7
+ "use_cache": true
8
+ }
logo.png ADDED
model-00001-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c262eea0f68ce6c0e72794766791f1a1252f22a2e7ad56b57dd9ac5ce5b670b
3
+ size 5359979247
model-00002-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5087d6543191ac1193aa321090d85297ffe3f76ec2fc87cdb3e34beb55fa6574
3
+ size 5358275783
model-00003-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5ae48f10e425ed06c079a2bf4689151dca9a5f82882ad1c90a37834b4c984289
3
+ size 3222688804
model-00004-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c6f8f3e256b6f2fc2753362bbb65ad16a375a85aa9f008081df2756e5c38bc38
3
+ size 921497217
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
optiq_metadata.json ADDED
@@ -0,0 +1,2363 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "method": "optiq_mixed_precision",
3
+ "target_bpw": 3.7,
4
+ "achieved_bpw": 3.6973300712450023,
5
+ "n_high_bits": 223,
6
+ "n_low_bits": 0,
7
+ "threshold": 0.0,
8
+ "per_layer": {
9
+ "lm_head": {
10
+ "bits": 4,
11
+ "group_size": 64
12
+ },
13
+ "model.language_model.embed_tokens": {
14
+ "bits": 4,
15
+ "group_size": 64
16
+ },
17
+ "model.language_model.layers.0.linear_attn.in_proj_a": {
18
+ "bits": 8,
19
+ "group_size": 64
20
+ },
21
+ "model.language_model.layers.0.linear_attn.in_proj_b": {
22
+ "bits": 8,
23
+ "group_size": 64
24
+ },
25
+ "model.language_model.layers.0.linear_attn.in_proj_qkv": {
26
+ "bits": 8,
27
+ "group_size": 64
28
+ },
29
+ "model.language_model.layers.0.linear_attn.in_proj_z": {
30
+ "bits": 8,
31
+ "group_size": 64
32
+ },
33
+ "model.language_model.layers.0.linear_attn.out_proj": {
34
+ "bits": 8,
35
+ "group_size": 64
36
+ },
37
+ "model.language_model.layers.0.mlp.down_proj": {
38
+ "bits": 8,
39
+ "group_size": 64
40
+ },
41
+ "model.language_model.layers.0.mlp.gate_proj": {
42
+ "bits": 8,
43
+ "group_size": 64
44
+ },
45
+ "model.language_model.layers.0.mlp.up_proj": {
46
+ "bits": 8,
47
+ "group_size": 64
48
+ },
49
+ "model.language_model.layers.1.linear_attn.in_proj_a": {
50
+ "bits": 8,
51
+ "group_size": 64
52
+ },
53
+ "model.language_model.layers.1.linear_attn.in_proj_b": {
54
+ "bits": 8,
55
+ "group_size": 64
56
+ },
57
+ "model.language_model.layers.1.linear_attn.in_proj_qkv": {
58
+ "bits": 4,
59
+ "group_size": 64
60
+ },
61
+ "model.language_model.layers.1.linear_attn.in_proj_z": {
62
+ "bits": 4,
63
+ "group_size": 64
64
+ },
65
+ "model.language_model.layers.1.linear_attn.out_proj": {
66
+ "bits": 4,
67
+ "group_size": 64
68
+ },
69
+ "model.language_model.layers.1.mlp.down_proj": {
70
+ "bits": 3,
71
+ "group_size": 64
72
+ },
73
+ "model.language_model.layers.1.mlp.gate_proj": {
74
+ "bits": 3,
75
+ "group_size": 64
76
+ },
77
+ "model.language_model.layers.1.mlp.up_proj": {
78
+ "bits": 3,
79
+ "group_size": 64
80
+ },
81
+ "model.language_model.layers.2.linear_attn.in_proj_a": {
82
+ "bits": 8,
83
+ "group_size": 64
84
+ },
85
+ "model.language_model.layers.2.linear_attn.in_proj_b": {
86
+ "bits": 8,
87
+ "group_size": 64
88
+ },
89
+ "model.language_model.layers.2.linear_attn.in_proj_qkv": {
90
+ "bits": 4,
91
+ "group_size": 64
92
+ },
93
+ "model.language_model.layers.2.linear_attn.in_proj_z": {
94
+ "bits": 4,
95
+ "group_size": 64
96
+ },
97
+ "model.language_model.layers.2.linear_attn.out_proj": {
98
+ "bits": 4,
99
+ "group_size": 64
100
+ },
101
+ "model.language_model.layers.2.mlp.down_proj": {
102
+ "bits": 3,
103
+ "group_size": 64
104
+ },
105
+ "model.language_model.layers.2.mlp.gate_proj": {
106
+ "bits": 3,
107
+ "group_size": 64
108
+ },
109
+ "model.language_model.layers.2.mlp.up_proj": {
110
+ "bits": 3,
111
+ "group_size": 64
112
+ },
113
+ "model.language_model.layers.3.mlp.down_proj": {
114
+ "bits": 3,
115
+ "group_size": 64
116
+ },
117
+ "model.language_model.layers.3.mlp.gate_proj": {
118
+ "bits": 3,
119
+ "group_size": 64
120
+ },
121
+ "model.language_model.layers.3.mlp.up_proj": {
122
+ "bits": 3,
123
+ "group_size": 64
124
+ },
125
+ "model.language_model.layers.3.self_attn.k_proj": {
126
+ "bits": 8,
127
+ "group_size": 64
128
+ },
129
+ "model.language_model.layers.3.self_attn.o_proj": {
130
+ "bits": 4,
131
+ "group_size": 64
132
+ },
133
+ "model.language_model.layers.3.self_attn.q_proj": {
134
+ "bits": 4,
135
+ "group_size": 64
136
+ },
137
+ "model.language_model.layers.3.self_attn.v_proj": {
138
+ "bits": 8,
139
+ "group_size": 64
140
+ },
141
+ "model.language_model.layers.4.linear_attn.in_proj_a": {
142
+ "bits": 8,
143
+ "group_size": 64
144
+ },
145
+ "model.language_model.layers.4.linear_attn.in_proj_b": {
146
+ "bits": 8,
147
+ "group_size": 64
148
+ },
149
+ "model.language_model.layers.4.linear_attn.in_proj_qkv": {
150
+ "bits": 4,
151
+ "group_size": 64
152
+ },
153
+ "model.language_model.layers.4.linear_attn.in_proj_z": {
154
+ "bits": 4,
155
+ "group_size": 64
156
+ },
157
+ "model.language_model.layers.4.linear_attn.out_proj": {
158
+ "bits": 4,
159
+ "group_size": 64
160
+ },
161
+ "model.language_model.layers.4.mlp.down_proj": {
162
+ "bits": 3,
163
+ "group_size": 64
164
+ },
165
+ "model.language_model.layers.4.mlp.gate_proj": {
166
+ "bits": 3,
167
+ "group_size": 64
168
+ },
169
+ "model.language_model.layers.4.mlp.up_proj": {
170
+ "bits": 3,
171
+ "group_size": 64
172
+ },
173
+ "model.language_model.layers.5.linear_attn.in_proj_a": {
174
+ "bits": 8,
175
+ "group_size": 64
176
+ },
177
+ "model.language_model.layers.5.linear_attn.in_proj_b": {
178
+ "bits": 8,
179
+ "group_size": 64
180
+ },
181
+ "model.language_model.layers.5.linear_attn.in_proj_qkv": {
182
+ "bits": 4,
183
+ "group_size": 64
184
+ },
185
+ "model.language_model.layers.5.linear_attn.in_proj_z": {
186
+ "bits": 4,
187
+ "group_size": 64
188
+ },
189
+ "model.language_model.layers.5.linear_attn.out_proj": {
190
+ "bits": 4,
191
+ "group_size": 64
192
+ },
193
+ "model.language_model.layers.5.mlp.down_proj": {
194
+ "bits": 3,
195
+ "group_size": 64
196
+ },
197
+ "model.language_model.layers.5.mlp.gate_proj": {
198
+ "bits": 3,
199
+ "group_size": 64
200
+ },
201
+ "model.language_model.layers.5.mlp.up_proj": {
202
+ "bits": 3,
203
+ "group_size": 64
204
+ },
205
+ "model.language_model.layers.6.linear_attn.in_proj_a": {
206
+ "bits": 8,
207
+ "group_size": 64
208
+ },
209
+ "model.language_model.layers.6.linear_attn.in_proj_b": {
210
+ "bits": 8,
211
+ "group_size": 64
212
+ },
213
+ "model.language_model.layers.6.linear_attn.in_proj_qkv": {
214
+ "bits": 4,
215
+ "group_size": 64
216
+ },
217
+ "model.language_model.layers.6.linear_attn.in_proj_z": {
218
+ "bits": 4,
219
+ "group_size": 64
220
+ },
221
+ "model.language_model.layers.6.linear_attn.out_proj": {
222
+ "bits": 4,
223
+ "group_size": 64
224
+ },
225
+ "model.language_model.layers.6.mlp.down_proj": {
226
+ "bits": 3,
227
+ "group_size": 64
228
+ },
229
+ "model.language_model.layers.6.mlp.gate_proj": {
230
+ "bits": 3,
231
+ "group_size": 64
232
+ },
233
+ "model.language_model.layers.6.mlp.up_proj": {
234
+ "bits": 3,
235
+ "group_size": 64
236
+ },
237
+ "model.language_model.layers.7.mlp.down_proj": {
238
+ "bits": 3,
239
+ "group_size": 64
240
+ },
241
+ "model.language_model.layers.7.mlp.gate_proj": {
242
+ "bits": 3,
243
+ "group_size": 64
244
+ },
245
+ "model.language_model.layers.7.mlp.up_proj": {
246
+ "bits": 3,
247
+ "group_size": 64
248
+ },
249
+ "model.language_model.layers.7.self_attn.k_proj": {
250
+ "bits": 8,
251
+ "group_size": 64
252
+ },
253
+ "model.language_model.layers.7.self_attn.o_proj": {
254
+ "bits": 4,
255
+ "group_size": 64
256
+ },
257
+ "model.language_model.layers.7.self_attn.q_proj": {
258
+ "bits": 4,
259
+ "group_size": 64
260
+ },
261
+ "model.language_model.layers.7.self_attn.v_proj": {
262
+ "bits": 8,
263
+ "group_size": 64
264
+ },
265
+ "model.language_model.layers.8.linear_attn.in_proj_a": {
266
+ "bits": 8,
267
+ "group_size": 64
268
+ },
269
+ "model.language_model.layers.8.linear_attn.in_proj_b": {
270
+ "bits": 8,
271
+ "group_size": 64
272
+ },
273
+ "model.language_model.layers.8.linear_attn.in_proj_qkv": {
274
+ "bits": 4,
275
+ "group_size": 64
276
+ },
277
+ "model.language_model.layers.8.linear_attn.in_proj_z": {
278
+ "bits": 4,
279
+ "group_size": 64
280
+ },
281
+ "model.language_model.layers.8.linear_attn.out_proj": {
282
+ "bits": 4,
283
+ "group_size": 64
284
+ },
285
+ "model.language_model.layers.8.mlp.down_proj": {
286
+ "bits": 3,
287
+ "group_size": 64
288
+ },
289
+ "model.language_model.layers.8.mlp.gate_proj": {
290
+ "bits": 3,
291
+ "group_size": 64
292
+ },
293
+ "model.language_model.layers.8.mlp.up_proj": {
294
+ "bits": 3,
295
+ "group_size": 64
296
+ },
297
+ "model.language_model.layers.9.linear_attn.in_proj_a": {
298
+ "bits": 8,
299
+ "group_size": 64
300
+ },
301
+ "model.language_model.layers.9.linear_attn.in_proj_b": {
302
+ "bits": 8,
303
+ "group_size": 64
304
+ },
305
+ "model.language_model.layers.9.linear_attn.in_proj_qkv": {
306
+ "bits": 4,
307
+ "group_size": 64
308
+ },
309
+ "model.language_model.layers.9.linear_attn.in_proj_z": {
310
+ "bits": 4,
311
+ "group_size": 64
312
+ },
313
+ "model.language_model.layers.9.linear_attn.out_proj": {
314
+ "bits": 4,
315
+ "group_size": 64
316
+ },
317
+ "model.language_model.layers.9.mlp.down_proj": {
318
+ "bits": 3,
319
+ "group_size": 64
320
+ },
321
+ "model.language_model.layers.10.linear_attn.in_proj_a": {
322
+ "bits": 8,
323
+ "group_size": 64
324
+ },
325
+ "model.language_model.layers.10.linear_attn.in_proj_b": {
326
+ "bits": 8,
327
+ "group_size": 64
328
+ },
329
+ "model.language_model.layers.10.linear_attn.in_proj_qkv": {
330
+ "bits": 4,
331
+ "group_size": 64
332
+ },
333
+ "model.language_model.layers.10.linear_attn.in_proj_z": {
334
+ "bits": 4,
335
+ "group_size": 64
336
+ },
337
+ "model.language_model.layers.10.linear_attn.out_proj": {
338
+ "bits": 4,
339
+ "group_size": 64
340
+ },
341
+ "model.language_model.layers.10.mlp.down_proj": {
342
+ "bits": 3,
343
+ "group_size": 64
344
+ },
345
+ "model.language_model.layers.10.mlp.gate_proj": {
346
+ "bits": 3,
347
+ "group_size": 64
348
+ },
349
+ "model.language_model.layers.10.mlp.up_proj": {
350
+ "bits": 3,
351
+ "group_size": 64
352
+ },
353
+ "model.language_model.layers.11.mlp.down_proj": {
354
+ "bits": 3,
355
+ "group_size": 64
356
+ },
357
+ "model.language_model.layers.11.mlp.gate_proj": {
358
+ "bits": 3,
359
+ "group_size": 64
360
+ },
361
+ "model.language_model.layers.11.mlp.up_proj": {
362
+ "bits": 3,
363
+ "group_size": 64
364
+ },
365
+ "model.language_model.layers.11.self_attn.k_proj": {
366
+ "bits": 8,
367
+ "group_size": 64
368
+ },
369
+ "model.language_model.layers.11.self_attn.o_proj": {
370
+ "bits": 4,
371
+ "group_size": 64
372
+ },
373
+ "model.language_model.layers.11.self_attn.q_proj": {
374
+ "bits": 4,
375
+ "group_size": 64
376
+ },
377
+ "model.language_model.layers.11.self_attn.v_proj": {
378
+ "bits": 8,
379
+ "group_size": 64
380
+ },
381
+ "model.language_model.layers.12.linear_attn.in_proj_a": {
382
+ "bits": 8,
383
+ "group_size": 64
384
+ },
385
+ "model.language_model.layers.12.linear_attn.in_proj_b": {
386
+ "bits": 8,
387
+ "group_size": 64
388
+ },
389
+ "model.language_model.layers.12.linear_attn.in_proj_qkv": {
390
+ "bits": 4,
391
+ "group_size": 64
392
+ },
393
+ "model.language_model.layers.12.linear_attn.in_proj_z": {
394
+ "bits": 4,
395
+ "group_size": 64
396
+ },
397
+ "model.language_model.layers.12.linear_attn.out_proj": {
398
+ "bits": 4,
399
+ "group_size": 64
400
+ },
401
+ "model.language_model.layers.12.mlp.down_proj": {
402
+ "bits": 3,
403
+ "group_size": 64
404
+ },
405
+ "model.language_model.layers.12.mlp.gate_proj": {
406
+ "bits": 3,
407
+ "group_size": 64
408
+ },
409
+ "model.language_model.layers.12.mlp.up_proj": {
410
+ "bits": 3,
411
+ "group_size": 64
412
+ },
413
+ "model.language_model.layers.13.linear_attn.in_proj_a": {
414
+ "bits": 8,
415
+ "group_size": 64
416
+ },
417
+ "model.language_model.layers.13.linear_attn.in_proj_b": {
418
+ "bits": 8,
419
+ "group_size": 64
420
+ },
421
+ "model.language_model.layers.13.linear_attn.in_proj_qkv": {
422
+ "bits": 4,
423
+ "group_size": 64
424
+ },
425
+ "model.language_model.layers.13.linear_attn.in_proj_z": {
426
+ "bits": 4,
427
+ "group_size": 64
428
+ },
429
+ "model.language_model.layers.13.linear_attn.out_proj": {
430
+ "bits": 4,
431
+ "group_size": 64
432
+ },
433
+ "model.language_model.layers.13.mlp.down_proj": {
434
+ "bits": 3,
435
+ "group_size": 64
436
+ },
437
+ "model.language_model.layers.13.mlp.gate_proj": {
438
+ "bits": 3,
439
+ "group_size": 64
440
+ },
441
+ "model.language_model.layers.13.mlp.up_proj": {
442
+ "bits": 3,
443
+ "group_size": 64
444
+ },
445
+ "model.language_model.layers.14.linear_attn.in_proj_a": {
446
+ "bits": 8,
447
+ "group_size": 64
448
+ },
449
+ "model.language_model.layers.14.linear_attn.in_proj_b": {
450
+ "bits": 8,
451
+ "group_size": 64
452
+ },
453
+ "model.language_model.layers.14.linear_attn.in_proj_qkv": {
454
+ "bits": 4,
455
+ "group_size": 64
456
+ },
457
+ "model.language_model.layers.14.linear_attn.in_proj_z": {
458
+ "bits": 4,
459
+ "group_size": 64
460
+ },
461
+ "model.language_model.layers.14.linear_attn.out_proj": {
462
+ "bits": 4,
463
+ "group_size": 64
464
+ },
465
+ "model.language_model.layers.14.mlp.down_proj": {
466
+ "bits": 3,
467
+ "group_size": 64
468
+ },
469
+ "model.language_model.layers.14.mlp.gate_proj": {
470
+ "bits": 3,
471
+ "group_size": 64
472
+ },
473
+ "model.language_model.layers.14.mlp.up_proj": {
474
+ "bits": 3,
475
+ "group_size": 64
476
+ },
477
+ "model.language_model.layers.15.mlp.down_proj": {
478
+ "bits": 3,
479
+ "group_size": 64
480
+ },
481
+ "model.language_model.layers.15.mlp.gate_proj": {
482
+ "bits": 3,
483
+ "group_size": 64
484
+ },
485
+ "model.language_model.layers.15.mlp.up_proj": {
486
+ "bits": 3,
487
+ "group_size": 64
488
+ },
489
+ "model.language_model.layers.15.self_attn.k_proj": {
490
+ "bits": 8,
491
+ "group_size": 64
492
+ },
493
+ "model.language_model.layers.15.self_attn.o_proj": {
494
+ "bits": 4,
495
+ "group_size": 64
496
+ },
497
+ "model.language_model.layers.15.self_attn.q_proj": {
498
+ "bits": 4,
499
+ "group_size": 64
500
+ },
501
+ "model.language_model.layers.15.self_attn.v_proj": {
502
+ "bits": 8,
503
+ "group_size": 64
504
+ },
505
+ "model.language_model.layers.16.linear_attn.in_proj_a": {
506
+ "bits": 8,
507
+ "group_size": 64
508
+ },
509
+ "model.language_model.layers.16.linear_attn.in_proj_b": {
510
+ "bits": 8,
511
+ "group_size": 64
512
+ },
513
+ "model.language_model.layers.9.mlp.gate_proj": {
514
+ "bits": 3,
515
+ "group_size": 64
516
+ },
517
+ "model.language_model.layers.9.mlp.up_proj": {
518
+ "bits": 3,
519
+ "group_size": 64
520
+ },
521
+ "model.language_model.layers.16.linear_attn.in_proj_qkv": {
522
+ "bits": 4,
523
+ "group_size": 64
524
+ },
525
+ "model.language_model.layers.16.linear_attn.in_proj_z": {
526
+ "bits": 4,
527
+ "group_size": 64
528
+ },
529
+ "model.language_model.layers.16.linear_attn.out_proj": {
530
+ "bits": 4,
531
+ "group_size": 64
532
+ },
533
+ "model.language_model.layers.16.mlp.down_proj": {
534
+ "bits": 3,
535
+ "group_size": 64
536
+ },
537
+ "model.language_model.layers.16.mlp.gate_proj": {
538
+ "bits": 3,
539
+ "group_size": 64
540
+ },
541
+ "model.language_model.layers.16.mlp.up_proj": {
542
+ "bits": 3,
543
+ "group_size": 64
544
+ },
545
+ "model.language_model.layers.17.linear_attn.in_proj_a": {
546
+ "bits": 8,
547
+ "group_size": 64
548
+ },
549
+ "model.language_model.layers.17.linear_attn.in_proj_b": {
550
+ "bits": 8,
551
+ "group_size": 64
552
+ },
553
+ "model.language_model.layers.17.linear_attn.in_proj_qkv": {
554
+ "bits": 4,
555
+ "group_size": 64
556
+ },
557
+ "model.language_model.layers.17.linear_attn.in_proj_z": {
558
+ "bits": 4,
559
+ "group_size": 64
560
+ },
561
+ "model.language_model.layers.17.linear_attn.out_proj": {
562
+ "bits": 4,
563
+ "group_size": 64
564
+ },
565
+ "model.language_model.layers.17.mlp.down_proj": {
566
+ "bits": 3,
567
+ "group_size": 64
568
+ },
569
+ "model.language_model.layers.17.mlp.gate_proj": {
570
+ "bits": 3,
571
+ "group_size": 64
572
+ },
573
+ "model.language_model.layers.17.mlp.up_proj": {
574
+ "bits": 3,
575
+ "group_size": 64
576
+ },
577
+ "model.language_model.layers.18.linear_attn.in_proj_a": {
578
+ "bits": 8,
579
+ "group_size": 64
580
+ },
581
+ "model.language_model.layers.18.linear_attn.in_proj_b": {
582
+ "bits": 8,
583
+ "group_size": 64
584
+ },
585
+ "model.language_model.layers.18.linear_attn.in_proj_qkv": {
586
+ "bits": 4,
587
+ "group_size": 64
588
+ },
589
+ "model.language_model.layers.18.linear_attn.in_proj_z": {
590
+ "bits": 4,
591
+ "group_size": 64
592
+ },
593
+ "model.language_model.layers.18.linear_attn.out_proj": {
594
+ "bits": 4,
595
+ "group_size": 64
596
+ },
597
+ "model.language_model.layers.18.mlp.down_proj": {
598
+ "bits": 3,
599
+ "group_size": 64
600
+ },
601
+ "model.language_model.layers.18.mlp.gate_proj": {
602
+ "bits": 3,
603
+ "group_size": 64
604
+ },
605
+ "model.language_model.layers.18.mlp.up_proj": {
606
+ "bits": 3,
607
+ "group_size": 64
608
+ },
609
+ "model.language_model.layers.19.mlp.down_proj": {
610
+ "bits": 3,
611
+ "group_size": 64
612
+ },
613
+ "model.language_model.layers.19.mlp.gate_proj": {
614
+ "bits": 3,
615
+ "group_size": 64
616
+ },
617
+ "model.language_model.layers.19.mlp.up_proj": {
618
+ "bits": 3,
619
+ "group_size": 64
620
+ },
621
+ "model.language_model.layers.19.self_attn.k_proj": {
622
+ "bits": 8,
623
+ "group_size": 64
624
+ },
625
+ "model.language_model.layers.19.self_attn.o_proj": {
626
+ "bits": 4,
627
+ "group_size": 64
628
+ },
629
+ "model.language_model.layers.19.self_attn.q_proj": {
630
+ "bits": 4,
631
+ "group_size": 64
632
+ },
633
+ "model.language_model.layers.19.self_attn.v_proj": {
634
+ "bits": 8,
635
+ "group_size": 64
636
+ },
637
+ "model.language_model.layers.20.linear_attn.in_proj_a": {
638
+ "bits": 8,
639
+ "group_size": 64
640
+ },
641
+ "model.language_model.layers.20.linear_attn.in_proj_b": {
642
+ "bits": 8,
643
+ "group_size": 64
644
+ },
645
+ "model.language_model.layers.20.linear_attn.in_proj_qkv": {
646
+ "bits": 4,
647
+ "group_size": 64
648
+ },
649
+ "model.language_model.layers.20.linear_attn.in_proj_z": {
650
+ "bits": 4,
651
+ "group_size": 64
652
+ },
653
+ "model.language_model.layers.20.linear_attn.out_proj": {
654
+ "bits": 4,
655
+ "group_size": 64
656
+ },
657
+ "model.language_model.layers.20.mlp.down_proj": {
658
+ "bits": 3,
659
+ "group_size": 64
660
+ },
661
+ "model.language_model.layers.20.mlp.gate_proj": {
662
+ "bits": 3,
663
+ "group_size": 64
664
+ },
665
+ "model.language_model.layers.20.mlp.up_proj": {
666
+ "bits": 3,
667
+ "group_size": 64
668
+ },
669
+ "model.language_model.layers.21.linear_attn.in_proj_a": {
670
+ "bits": 8,
671
+ "group_size": 64
672
+ },
673
+ "model.language_model.layers.21.linear_attn.in_proj_b": {
674
+ "bits": 8,
675
+ "group_size": 64
676
+ },
677
+ "model.language_model.layers.21.linear_attn.in_proj_qkv": {
678
+ "bits": 4,
679
+ "group_size": 64
680
+ },
681
+ "model.language_model.layers.21.linear_attn.in_proj_z": {
682
+ "bits": 4,
683
+ "group_size": 64
684
+ },
685
+ "model.language_model.layers.21.linear_attn.out_proj": {
686
+ "bits": 4,
687
+ "group_size": 64
688
+ },
689
+ "model.language_model.layers.21.mlp.down_proj": {
690
+ "bits": 3,
691
+ "group_size": 64
692
+ },
693
+ "model.language_model.layers.21.mlp.gate_proj": {
694
+ "bits": 3,
695
+ "group_size": 64
696
+ },
697
+ "model.language_model.layers.21.mlp.up_proj": {
698
+ "bits": 3,
699
+ "group_size": 64
700
+ },
701
+ "model.language_model.layers.22.linear_attn.in_proj_a": {
702
+ "bits": 8,
703
+ "group_size": 64
704
+ },
705
+ "model.language_model.layers.22.linear_attn.in_proj_b": {
706
+ "bits": 8,
707
+ "group_size": 64
708
+ },
709
+ "model.language_model.layers.22.linear_attn.in_proj_qkv": {
710
+ "bits": 4,
711
+ "group_size": 64
712
+ },
713
+ "model.language_model.layers.22.linear_attn.in_proj_z": {
714
+ "bits": 4,
715
+ "group_size": 64
716
+ },
717
+ "model.language_model.layers.22.linear_attn.out_proj": {
718
+ "bits": 4,
719
+ "group_size": 64
720
+ },
721
+ "model.language_model.layers.22.mlp.down_proj": {
722
+ "bits": 3,
723
+ "group_size": 64
724
+ },
725
+ "model.language_model.layers.22.mlp.gate_proj": {
726
+ "bits": 3,
727
+ "group_size": 64
728
+ },
729
+ "model.language_model.layers.22.mlp.up_proj": {
730
+ "bits": 3,
731
+ "group_size": 64
732
+ },
733
+ "model.language_model.layers.23.mlp.down_proj": {
734
+ "bits": 3,
735
+ "group_size": 64
736
+ },
737
+ "model.language_model.layers.23.mlp.gate_proj": {
738
+ "bits": 3,
739
+ "group_size": 64
740
+ },
741
+ "model.language_model.layers.23.mlp.up_proj": {
742
+ "bits": 3,
743
+ "group_size": 64
744
+ },
745
+ "model.language_model.layers.23.self_attn.k_proj": {
746
+ "bits": 8,
747
+ "group_size": 64
748
+ },
749
+ "model.language_model.layers.23.self_attn.o_proj": {
750
+ "bits": 4,
751
+ "group_size": 64
752
+ },
753
+ "model.language_model.layers.23.self_attn.q_proj": {
754
+ "bits": 4,
755
+ "group_size": 64
756
+ },
757
+ "model.language_model.layers.23.self_attn.v_proj": {
758
+ "bits": 8,
759
+ "group_size": 64
760
+ },
761
+ "model.language_model.layers.24.linear_attn.in_proj_a": {
762
+ "bits": 8,
763
+ "group_size": 64
764
+ },
765
+ "model.language_model.layers.24.linear_attn.in_proj_b": {
766
+ "bits": 8,
767
+ "group_size": 64
768
+ },
769
+ "model.language_model.layers.24.linear_attn.in_proj_qkv": {
770
+ "bits": 4,
771
+ "group_size": 64
772
+ },
773
+ "model.language_model.layers.24.linear_attn.in_proj_z": {
774
+ "bits": 4,
775
+ "group_size": 64
776
+ },
777
+ "model.language_model.layers.24.linear_attn.out_proj": {
778
+ "bits": 4,
779
+ "group_size": 64
780
+ },
781
+ "model.language_model.layers.24.mlp.down_proj": {
782
+ "bits": 3,
783
+ "group_size": 64
784
+ },
785
+ "model.language_model.layers.24.mlp.gate_proj": {
786
+ "bits": 3,
787
+ "group_size": 64
788
+ },
789
+ "model.language_model.layers.24.mlp.up_proj": {
790
+ "bits": 3,
791
+ "group_size": 64
792
+ },
793
+ "model.language_model.layers.25.linear_attn.in_proj_a": {
794
+ "bits": 8,
795
+ "group_size": 64
796
+ },
797
+ "model.language_model.layers.25.linear_attn.in_proj_b": {
798
+ "bits": 8,
799
+ "group_size": 64
800
+ },
801
+ "model.language_model.layers.25.linear_attn.in_proj_qkv": {
802
+ "bits": 4,
803
+ "group_size": 64
804
+ },
805
+ "model.language_model.layers.25.linear_attn.in_proj_z": {
806
+ "bits": 4,
807
+ "group_size": 64
808
+ },
809
+ "model.language_model.layers.25.linear_attn.out_proj": {
810
+ "bits": 4,
811
+ "group_size": 64
812
+ },
813
+ "model.language_model.layers.25.mlp.down_proj": {
814
+ "bits": 3,
815
+ "group_size": 64
816
+ },
817
+ "model.language_model.layers.25.mlp.gate_proj": {
818
+ "bits": 3,
819
+ "group_size": 64
820
+ },
821
+ "model.language_model.layers.25.mlp.up_proj": {
822
+ "bits": 3,
823
+ "group_size": 64
824
+ },
825
+ "model.language_model.layers.26.linear_attn.in_proj_a": {
826
+ "bits": 8,
827
+ "group_size": 64
828
+ },
829
+ "model.language_model.layers.26.linear_attn.in_proj_b": {
830
+ "bits": 8,
831
+ "group_size": 64
832
+ },
833
+ "model.language_model.layers.26.linear_attn.in_proj_qkv": {
834
+ "bits": 4,
835
+ "group_size": 64
836
+ },
837
+ "model.language_model.layers.26.linear_attn.in_proj_z": {
838
+ "bits": 4,
839
+ "group_size": 64
840
+ },
841
+ "model.language_model.layers.26.linear_attn.out_proj": {
842
+ "bits": 4,
843
+ "group_size": 64
844
+ },
845
+ "model.language_model.layers.26.mlp.down_proj": {
846
+ "bits": 3,
847
+ "group_size": 64
848
+ },
849
+ "model.language_model.layers.26.mlp.gate_proj": {
850
+ "bits": 3,
851
+ "group_size": 64
852
+ },
853
+ "model.language_model.layers.26.mlp.up_proj": {
854
+ "bits": 3,
855
+ "group_size": 64
856
+ },
857
+ "model.language_model.layers.27.mlp.down_proj": {
858
+ "bits": 3,
859
+ "group_size": 64
860
+ },
861
+ "model.language_model.layers.27.mlp.gate_proj": {
862
+ "bits": 3,
863
+ "group_size": 64
864
+ },
865
+ "model.language_model.layers.27.mlp.up_proj": {
866
+ "bits": 3,
867
+ "group_size": 64
868
+ },
869
+ "model.language_model.layers.27.self_attn.k_proj": {
870
+ "bits": 8,
871
+ "group_size": 64
872
+ },
873
+ "model.language_model.layers.27.self_attn.o_proj": {
874
+ "bits": 4,
875
+ "group_size": 64
876
+ },
877
+ "model.language_model.layers.27.self_attn.q_proj": {
878
+ "bits": 4,
879
+ "group_size": 64
880
+ },
881
+ "model.language_model.layers.27.self_attn.v_proj": {
882
+ "bits": 8,
883
+ "group_size": 64
884
+ },
885
+ "model.language_model.layers.28.linear_attn.in_proj_a": {
886
+ "bits": 8,
887
+ "group_size": 64
888
+ },
889
+ "model.language_model.layers.28.linear_attn.in_proj_b": {
890
+ "bits": 8,
891
+ "group_size": 64
892
+ },
893
+ "model.language_model.layers.28.linear_attn.in_proj_qkv": {
894
+ "bits": 4,
895
+ "group_size": 64
896
+ },
897
+ "model.language_model.layers.28.linear_attn.in_proj_z": {
898
+ "bits": 4,
899
+ "group_size": 64
900
+ },
901
+ "model.language_model.layers.28.linear_attn.out_proj": {
902
+ "bits": 4,
903
+ "group_size": 64
904
+ },
905
+ "model.language_model.layers.28.mlp.down_proj": {
906
+ "bits": 3,
907
+ "group_size": 64
908
+ },
909
+ "model.language_model.layers.28.mlp.gate_proj": {
910
+ "bits": 3,
911
+ "group_size": 64
912
+ },
913
+ "model.language_model.layers.28.mlp.up_proj": {
914
+ "bits": 3,
915
+ "group_size": 64
916
+ },
917
+ "model.language_model.layers.29.linear_attn.in_proj_a": {
918
+ "bits": 8,
919
+ "group_size": 64
920
+ },
921
+ "model.language_model.layers.29.linear_attn.in_proj_b": {
922
+ "bits": 8,
923
+ "group_size": 64
924
+ },
925
+ "model.language_model.layers.29.linear_attn.in_proj_qkv": {
926
+ "bits": 4,
927
+ "group_size": 64
928
+ },
929
+ "model.language_model.layers.29.linear_attn.in_proj_z": {
930
+ "bits": 4,
931
+ "group_size": 64
932
+ },
933
+ "model.language_model.layers.29.linear_attn.out_proj": {
934
+ "bits": 4,
935
+ "group_size": 64
936
+ },
937
+ "model.language_model.layers.29.mlp.down_proj": {
938
+ "bits": 3,
939
+ "group_size": 64
940
+ },
941
+ "model.language_model.layers.29.mlp.gate_proj": {
942
+ "bits": 3,
943
+ "group_size": 64
944
+ },
945
+ "model.language_model.layers.29.mlp.up_proj": {
946
+ "bits": 3,
947
+ "group_size": 64
948
+ },
949
+ "model.language_model.layers.30.linear_attn.in_proj_a": {
950
+ "bits": 8,
951
+ "group_size": 64
952
+ },
953
+ "model.language_model.layers.30.linear_attn.in_proj_b": {
954
+ "bits": 8,
955
+ "group_size": 64
956
+ },
957
+ "model.language_model.layers.30.linear_attn.in_proj_qkv": {
958
+ "bits": 4,
959
+ "group_size": 64
960
+ },
961
+ "model.language_model.layers.30.linear_attn.in_proj_z": {
962
+ "bits": 4,
963
+ "group_size": 64
964
+ },
965
+ "model.language_model.layers.30.linear_attn.out_proj": {
966
+ "bits": 4,
967
+ "group_size": 64
968
+ },
969
+ "model.language_model.layers.30.mlp.down_proj": {
970
+ "bits": 3,
971
+ "group_size": 64
972
+ },
973
+ "model.language_model.layers.30.mlp.gate_proj": {
974
+ "bits": 3,
975
+ "group_size": 64
976
+ },
977
+ "model.language_model.layers.30.mlp.up_proj": {
978
+ "bits": 3,
979
+ "group_size": 64
980
+ },
981
+ "model.language_model.layers.31.mlp.down_proj": {
982
+ "bits": 3,
983
+ "group_size": 64
984
+ },
985
+ "model.language_model.layers.31.mlp.gate_proj": {
986
+ "bits": 3,
987
+ "group_size": 64
988
+ },
989
+ "model.language_model.layers.31.mlp.up_proj": {
990
+ "bits": 3,
991
+ "group_size": 64
992
+ },
993
+ "model.language_model.layers.31.self_attn.k_proj": {
994
+ "bits": 8,
995
+ "group_size": 64
996
+ },
997
+ "model.language_model.layers.31.self_attn.o_proj": {
998
+ "bits": 4,
999
+ "group_size": 64
1000
+ },
1001
+ "model.language_model.layers.31.self_attn.q_proj": {
1002
+ "bits": 4,
1003
+ "group_size": 64
1004
+ },
1005
+ "model.language_model.layers.31.self_attn.v_proj": {
1006
+ "bits": 8,
1007
+ "group_size": 64
1008
+ },
1009
+ "model.language_model.layers.32.linear_attn.in_proj_a": {
1010
+ "bits": 8,
1011
+ "group_size": 64
1012
+ },
1013
+ "model.language_model.layers.32.linear_attn.in_proj_b": {
1014
+ "bits": 8,
1015
+ "group_size": 64
1016
+ },
1017
+ "model.language_model.layers.32.linear_attn.in_proj_qkv": {
1018
+ "bits": 4,
1019
+ "group_size": 64
1020
+ },
1021
+ "model.language_model.layers.32.linear_attn.in_proj_z": {
1022
+ "bits": 4,
1023
+ "group_size": 64
1024
+ },
1025
+ "model.language_model.layers.32.linear_attn.out_proj": {
1026
+ "bits": 4,
1027
+ "group_size": 64
1028
+ },
1029
+ "model.language_model.layers.32.mlp.down_proj": {
1030
+ "bits": 3,
1031
+ "group_size": 64
1032
+ },
1033
+ "model.language_model.layers.32.mlp.gate_proj": {
1034
+ "bits": 3,
1035
+ "group_size": 64
1036
+ },
1037
+ "model.language_model.layers.32.mlp.up_proj": {
1038
+ "bits": 3,
1039
+ "group_size": 64
1040
+ },
1041
+ "model.language_model.layers.33.linear_attn.in_proj_a": {
1042
+ "bits": 8,
1043
+ "group_size": 64
1044
+ },
1045
+ "model.language_model.layers.33.linear_attn.in_proj_b": {
1046
+ "bits": 8,
1047
+ "group_size": 64
1048
+ },
1049
+ "model.language_model.layers.33.linear_attn.in_proj_qkv": {
1050
+ "bits": 4,
1051
+ "group_size": 64
1052
+ },
1053
+ "model.language_model.layers.33.linear_attn.in_proj_z": {
1054
+ "bits": 4,
1055
+ "group_size": 64
1056
+ },
1057
+ "model.language_model.layers.33.linear_attn.out_proj": {
1058
+ "bits": 4,
1059
+ "group_size": 64
1060
+ },
1061
+ "model.language_model.layers.33.mlp.down_proj": {
1062
+ "bits": 3,
1063
+ "group_size": 64
1064
+ },
1065
+ "model.language_model.layers.33.mlp.gate_proj": {
1066
+ "bits": 3,
1067
+ "group_size": 64
1068
+ },
1069
+ "model.language_model.layers.33.mlp.up_proj": {
1070
+ "bits": 3,
1071
+ "group_size": 64
1072
+ },
1073
+ "model.language_model.layers.34.linear_attn.in_proj_a": {
1074
+ "bits": 8,
1075
+ "group_size": 64
1076
+ },
1077
+ "model.language_model.layers.34.linear_attn.in_proj_b": {
1078
+ "bits": 8,
1079
+ "group_size": 64
1080
+ },
1081
+ "model.language_model.layers.34.linear_attn.in_proj_qkv": {
1082
+ "bits": 4,
1083
+ "group_size": 64
1084
+ },
1085
+ "model.language_model.layers.34.linear_attn.in_proj_z": {
1086
+ "bits": 4,
1087
+ "group_size": 64
1088
+ },
1089
+ "model.language_model.layers.34.linear_attn.out_proj": {
1090
+ "bits": 4,
1091
+ "group_size": 64
1092
+ },
1093
+ "model.language_model.layers.34.mlp.down_proj": {
1094
+ "bits": 3,
1095
+ "group_size": 64
1096
+ },
1097
+ "model.language_model.layers.34.mlp.gate_proj": {
1098
+ "bits": 3,
1099
+ "group_size": 64
1100
+ },
1101
+ "model.language_model.layers.34.mlp.up_proj": {
1102
+ "bits": 3,
1103
+ "group_size": 64
1104
+ },
1105
+ "model.language_model.layers.35.mlp.down_proj": {
1106
+ "bits": 3,
1107
+ "group_size": 64
1108
+ },
1109
+ "model.language_model.layers.35.mlp.gate_proj": {
1110
+ "bits": 3,
1111
+ "group_size": 64
1112
+ },
1113
+ "model.language_model.layers.35.mlp.up_proj": {
1114
+ "bits": 3,
1115
+ "group_size": 64
1116
+ },
1117
+ "model.language_model.layers.35.self_attn.k_proj": {
1118
+ "bits": 8,
1119
+ "group_size": 64
1120
+ },
1121
+ "model.language_model.layers.35.self_attn.o_proj": {
1122
+ "bits": 4,
1123
+ "group_size": 64
1124
+ },
1125
+ "model.language_model.layers.35.self_attn.q_proj": {
1126
+ "bits": 4,
1127
+ "group_size": 64
1128
+ },
1129
+ "model.language_model.layers.35.self_attn.v_proj": {
1130
+ "bits": 8,
1131
+ "group_size": 64
1132
+ },
1133
+ "model.language_model.layers.36.linear_attn.in_proj_a": {
1134
+ "bits": 8,
1135
+ "group_size": 64
1136
+ },
1137
+ "model.language_model.layers.36.linear_attn.in_proj_b": {
1138
+ "bits": 8,
1139
+ "group_size": 64
1140
+ },
1141
+ "model.language_model.layers.36.linear_attn.in_proj_qkv": {
1142
+ "bits": 4,
1143
+ "group_size": 64
1144
+ },
1145
+ "model.language_model.layers.36.linear_attn.in_proj_z": {
1146
+ "bits": 4,
1147
+ "group_size": 64
1148
+ },
1149
+ "model.language_model.layers.36.linear_attn.out_proj": {
1150
+ "bits": 4,
1151
+ "group_size": 64
1152
+ },
1153
+ "model.language_model.layers.36.mlp.down_proj": {
1154
+ "bits": 3,
1155
+ "group_size": 64
1156
+ },
1157
+ "model.language_model.layers.36.mlp.gate_proj": {
1158
+ "bits": 3,
1159
+ "group_size": 64
1160
+ },
1161
+ "model.language_model.layers.36.mlp.up_proj": {
1162
+ "bits": 3,
1163
+ "group_size": 64
1164
+ },
1165
+ "model.language_model.layers.37.linear_attn.in_proj_a": {
1166
+ "bits": 8,
1167
+ "group_size": 64
1168
+ },
1169
+ "model.language_model.layers.37.linear_attn.in_proj_b": {
1170
+ "bits": 8,
1171
+ "group_size": 64
1172
+ },
1173
+ "model.language_model.layers.37.linear_attn.in_proj_qkv": {
1174
+ "bits": 4,
1175
+ "group_size": 64
1176
+ },
1177
+ "model.language_model.layers.37.linear_attn.in_proj_z": {
1178
+ "bits": 4,
1179
+ "group_size": 64
1180
+ },
1181
+ "model.language_model.layers.37.linear_attn.out_proj": {
1182
+ "bits": 4,
1183
+ "group_size": 64
1184
+ },
1185
+ "model.language_model.layers.37.mlp.down_proj": {
1186
+ "bits": 3,
1187
+ "group_size": 64
1188
+ },
1189
+ "model.language_model.layers.37.mlp.gate_proj": {
1190
+ "bits": 3,
1191
+ "group_size": 64
1192
+ },
1193
+ "model.language_model.layers.37.mlp.up_proj": {
1194
+ "bits": 3,
1195
+ "group_size": 64
1196
+ },
1197
+ "model.language_model.layers.38.linear_attn.in_proj_a": {
1198
+ "bits": 8,
1199
+ "group_size": 64
1200
+ },
1201
+ "model.language_model.layers.38.linear_attn.in_proj_b": {
1202
+ "bits": 8,
1203
+ "group_size": 64
1204
+ },
1205
+ "model.language_model.layers.38.linear_attn.in_proj_qkv": {
1206
+ "bits": 4,
1207
+ "group_size": 64
1208
+ },
1209
+ "model.language_model.layers.38.linear_attn.in_proj_z": {
1210
+ "bits": 4,
1211
+ "group_size": 64
1212
+ },
1213
+ "model.language_model.layers.38.linear_attn.out_proj": {
1214
+ "bits": 4,
1215
+ "group_size": 64
1216
+ },
1217
+ "model.language_model.layers.38.mlp.down_proj": {
1218
+ "bits": 3,
1219
+ "group_size": 64
1220
+ },
1221
+ "model.language_model.layers.38.mlp.gate_proj": {
1222
+ "bits": 4,
1223
+ "group_size": 64
1224
+ },
1225
+ "model.language_model.layers.38.mlp.up_proj": {
1226
+ "bits": 3,
1227
+ "group_size": 64
1228
+ },
1229
+ "model.language_model.layers.39.mlp.down_proj": {
1230
+ "bits": 3,
1231
+ "group_size": 64
1232
+ },
1233
+ "model.language_model.layers.39.mlp.gate_proj": {
1234
+ "bits": 4,
1235
+ "group_size": 64
1236
+ },
1237
+ "model.language_model.layers.39.mlp.up_proj": {
1238
+ "bits": 3,
1239
+ "group_size": 64
1240
+ },
1241
+ "model.language_model.layers.39.self_attn.k_proj": {
1242
+ "bits": 8,
1243
+ "group_size": 64
1244
+ },
1245
+ "model.language_model.layers.39.self_attn.o_proj": {
1246
+ "bits": 4,
1247
+ "group_size": 64
1248
+ },
1249
+ "model.language_model.layers.39.self_attn.q_proj": {
1250
+ "bits": 4,
1251
+ "group_size": 64
1252
+ },
1253
+ "model.language_model.layers.39.self_attn.v_proj": {
1254
+ "bits": 8,
1255
+ "group_size": 64
1256
+ },
1257
+ "model.language_model.layers.40.linear_attn.in_proj_a": {
1258
+ "bits": 8,
1259
+ "group_size": 64
1260
+ },
1261
+ "model.language_model.layers.40.linear_attn.in_proj_b": {
1262
+ "bits": 8,
1263
+ "group_size": 64
1264
+ },
1265
+ "model.language_model.layers.40.linear_attn.in_proj_qkv": {
1266
+ "bits": 4,
1267
+ "group_size": 64
1268
+ },
1269
+ "model.language_model.layers.40.linear_attn.in_proj_z": {
1270
+ "bits": 4,
1271
+ "group_size": 64
1272
+ },
1273
+ "model.language_model.layers.40.linear_attn.out_proj": {
1274
+ "bits": 4,
1275
+ "group_size": 64
1276
+ },
1277
+ "model.language_model.layers.40.mlp.down_proj": {
1278
+ "bits": 3,
1279
+ "group_size": 64
1280
+ },
1281
+ "model.language_model.layers.40.mlp.gate_proj": {
1282
+ "bits": 4,
1283
+ "group_size": 64
1284
+ },
1285
+ "model.language_model.layers.40.mlp.up_proj": {
1286
+ "bits": 3,
1287
+ "group_size": 64
1288
+ },
1289
+ "model.language_model.layers.41.linear_attn.in_proj_a": {
1290
+ "bits": 8,
1291
+ "group_size": 64
1292
+ },
1293
+ "model.language_model.layers.41.linear_attn.in_proj_b": {
1294
+ "bits": 8,
1295
+ "group_size": 64
1296
+ },
1297
+ "model.language_model.layers.41.linear_attn.in_proj_qkv": {
1298
+ "bits": 4,
1299
+ "group_size": 64
1300
+ },
1301
+ "model.language_model.layers.41.linear_attn.in_proj_z": {
1302
+ "bits": 4,
1303
+ "group_size": 64
1304
+ },
1305
+ "model.language_model.layers.41.linear_attn.out_proj": {
1306
+ "bits": 4,
1307
+ "group_size": 64
1308
+ },
1309
+ "model.language_model.layers.41.mlp.down_proj": {
1310
+ "bits": 3,
1311
+ "group_size": 64
1312
+ },
1313
+ "model.language_model.layers.41.mlp.gate_proj": {
1314
+ "bits": 3,
1315
+ "group_size": 64
1316
+ },
1317
+ "model.language_model.layers.41.mlp.up_proj": {
1318
+ "bits": 3,
1319
+ "group_size": 64
1320
+ },
1321
+ "model.language_model.layers.42.linear_attn.in_proj_a": {
1322
+ "bits": 8,
1323
+ "group_size": 64
1324
+ },
1325
+ "model.language_model.layers.42.linear_attn.in_proj_b": {
1326
+ "bits": 8,
1327
+ "group_size": 64
1328
+ },
1329
+ "model.language_model.layers.42.linear_attn.in_proj_qkv": {
1330
+ "bits": 4,
1331
+ "group_size": 64
1332
+ },
1333
+ "model.language_model.layers.42.linear_attn.in_proj_z": {
1334
+ "bits": 4,
1335
+ "group_size": 64
1336
+ },
1337
+ "model.language_model.layers.42.linear_attn.out_proj": {
1338
+ "bits": 4,
1339
+ "group_size": 64
1340
+ },
1341
+ "model.language_model.layers.42.mlp.down_proj": {
1342
+ "bits": 3,
1343
+ "group_size": 64
1344
+ },
1345
+ "model.language_model.layers.42.mlp.gate_proj": {
1346
+ "bits": 3,
1347
+ "group_size": 64
1348
+ },
1349
+ "model.language_model.layers.42.mlp.up_proj": {
1350
+ "bits": 3,
1351
+ "group_size": 64
1352
+ },
1353
+ "model.language_model.layers.43.mlp.down_proj": {
1354
+ "bits": 3,
1355
+ "group_size": 64
1356
+ },
1357
+ "model.language_model.layers.43.mlp.gate_proj": {
1358
+ "bits": 3,
1359
+ "group_size": 64
1360
+ },
1361
+ "model.language_model.layers.43.mlp.up_proj": {
1362
+ "bits": 3,
1363
+ "group_size": 64
1364
+ },
1365
+ "model.language_model.layers.43.self_attn.k_proj": {
1366
+ "bits": 8,
1367
+ "group_size": 64
1368
+ },
1369
+ "model.language_model.layers.43.self_attn.o_proj": {
1370
+ "bits": 4,
1371
+ "group_size": 64
1372
+ },
1373
+ "model.language_model.layers.43.self_attn.q_proj": {
1374
+ "bits": 4,
1375
+ "group_size": 64
1376
+ },
1377
+ "model.language_model.layers.43.self_attn.v_proj": {
1378
+ "bits": 8,
1379
+ "group_size": 64
1380
+ },
1381
+ "model.language_model.layers.44.linear_attn.in_proj_a": {
1382
+ "bits": 8,
1383
+ "group_size": 64
1384
+ },
1385
+ "model.language_model.layers.44.linear_attn.in_proj_b": {
1386
+ "bits": 8,
1387
+ "group_size": 64
1388
+ },
1389
+ "model.language_model.layers.44.linear_attn.in_proj_qkv": {
1390
+ "bits": 4,
1391
+ "group_size": 64
1392
+ },
1393
+ "model.language_model.layers.44.linear_attn.in_proj_z": {
1394
+ "bits": 4,
1395
+ "group_size": 64
1396
+ },
1397
+ "model.language_model.layers.44.linear_attn.out_proj": {
1398
+ "bits": 4,
1399
+ "group_size": 64
1400
+ },
1401
+ "model.language_model.layers.44.mlp.down_proj": {
1402
+ "bits": 3,
1403
+ "group_size": 64
1404
+ },
1405
+ "model.language_model.layers.44.mlp.gate_proj": {
1406
+ "bits": 3,
1407
+ "group_size": 64
1408
+ },
1409
+ "model.language_model.layers.44.mlp.up_proj": {
1410
+ "bits": 3,
1411
+ "group_size": 64
1412
+ },
1413
+ "model.language_model.layers.45.linear_attn.in_proj_a": {
1414
+ "bits": 8,
1415
+ "group_size": 64
1416
+ },
1417
+ "model.language_model.layers.45.linear_attn.in_proj_b": {
1418
+ "bits": 8,
1419
+ "group_size": 64
1420
+ },
1421
+ "model.language_model.layers.45.linear_attn.in_proj_qkv": {
1422
+ "bits": 4,
1423
+ "group_size": 64
1424
+ },
1425
+ "model.language_model.layers.45.linear_attn.in_proj_z": {
1426
+ "bits": 4,
1427
+ "group_size": 64
1428
+ },
1429
+ "model.language_model.layers.45.linear_attn.out_proj": {
1430
+ "bits": 4,
1431
+ "group_size": 64
1432
+ },
1433
+ "model.language_model.layers.45.mlp.down_proj": {
1434
+ "bits": 3,
1435
+ "group_size": 64
1436
+ },
1437
+ "model.language_model.layers.45.mlp.gate_proj": {
1438
+ "bits": 3,
1439
+ "group_size": 64
1440
+ },
1441
+ "model.language_model.layers.45.mlp.up_proj": {
1442
+ "bits": 3,
1443
+ "group_size": 64
1444
+ },
1445
+ "model.language_model.layers.46.linear_attn.in_proj_a": {
1446
+ "bits": 8,
1447
+ "group_size": 64
1448
+ },
1449
+ "model.language_model.layers.46.linear_attn.in_proj_b": {
1450
+ "bits": 8,
1451
+ "group_size": 64
1452
+ },
1453
+ "model.language_model.layers.46.linear_attn.in_proj_qkv": {
1454
+ "bits": 4,
1455
+ "group_size": 64
1456
+ },
1457
+ "model.language_model.layers.46.linear_attn.in_proj_z": {
1458
+ "bits": 4,
1459
+ "group_size": 64
1460
+ },
1461
+ "model.language_model.layers.46.linear_attn.out_proj": {
1462
+ "bits": 4,
1463
+ "group_size": 64
1464
+ },
1465
+ "model.language_model.layers.46.mlp.down_proj": {
1466
+ "bits": 3,
1467
+ "group_size": 64
1468
+ },
1469
+ "model.language_model.layers.46.mlp.gate_proj": {
1470
+ "bits": 3,
1471
+ "group_size": 64
1472
+ },
1473
+ "model.language_model.layers.46.mlp.up_proj": {
1474
+ "bits": 3,
1475
+ "group_size": 64
1476
+ },
1477
+ "model.language_model.layers.47.mlp.down_proj": {
1478
+ "bits": 3,
1479
+ "group_size": 64
1480
+ },
1481
+ "model.language_model.layers.47.mlp.gate_proj": {
1482
+ "bits": 3,
1483
+ "group_size": 64
1484
+ },
1485
+ "model.language_model.layers.47.mlp.up_proj": {
1486
+ "bits": 4,
1487
+ "group_size": 64
1488
+ },
1489
+ "model.language_model.layers.47.self_attn.k_proj": {
1490
+ "bits": 8,
1491
+ "group_size": 64
1492
+ },
1493
+ "model.language_model.layers.47.self_attn.o_proj": {
1494
+ "bits": 4,
1495
+ "group_size": 64
1496
+ },
1497
+ "model.language_model.layers.47.self_attn.q_proj": {
1498
+ "bits": 4,
1499
+ "group_size": 64
1500
+ },
1501
+ "model.language_model.layers.47.self_attn.v_proj": {
1502
+ "bits": 8,
1503
+ "group_size": 64
1504
+ },
1505
+ "model.language_model.layers.48.linear_attn.in_proj_a": {
1506
+ "bits": 8,
1507
+ "group_size": 64
1508
+ },
1509
+ "model.language_model.layers.48.linear_attn.in_proj_b": {
1510
+ "bits": 8,
1511
+ "group_size": 64
1512
+ },
1513
+ "model.language_model.layers.48.linear_attn.in_proj_qkv": {
1514
+ "bits": 4,
1515
+ "group_size": 64
1516
+ },
1517
+ "model.language_model.layers.48.linear_attn.in_proj_z": {
1518
+ "bits": 4,
1519
+ "group_size": 64
1520
+ },
1521
+ "model.language_model.layers.48.linear_attn.out_proj": {
1522
+ "bits": 4,
1523
+ "group_size": 64
1524
+ },
1525
+ "model.language_model.layers.48.mlp.down_proj": {
1526
+ "bits": 3,
1527
+ "group_size": 64
1528
+ },
1529
+ "model.language_model.layers.48.mlp.gate_proj": {
1530
+ "bits": 3,
1531
+ "group_size": 64
1532
+ },
1533
+ "model.language_model.layers.48.mlp.up_proj": {
1534
+ "bits": 4,
1535
+ "group_size": 64
1536
+ },
1537
+ "model.language_model.layers.49.linear_attn.in_proj_a": {
1538
+ "bits": 8,
1539
+ "group_size": 64
1540
+ },
1541
+ "model.language_model.layers.49.linear_attn.in_proj_b": {
1542
+ "bits": 8,
1543
+ "group_size": 64
1544
+ },
1545
+ "model.language_model.layers.49.linear_attn.in_proj_qkv": {
1546
+ "bits": 4,
1547
+ "group_size": 64
1548
+ },
1549
+ "model.language_model.layers.49.linear_attn.in_proj_z": {
1550
+ "bits": 4,
1551
+ "group_size": 64
1552
+ },
1553
+ "model.language_model.layers.49.linear_attn.out_proj": {
1554
+ "bits": 4,
1555
+ "group_size": 64
1556
+ },
1557
+ "model.language_model.layers.49.mlp.down_proj": {
1558
+ "bits": 3,
1559
+ "group_size": 64
1560
+ },
1561
+ "model.language_model.layers.49.mlp.gate_proj": {
1562
+ "bits": 3,
1563
+ "group_size": 64
1564
+ },
1565
+ "model.language_model.layers.49.mlp.up_proj": {
1566
+ "bits": 4,
1567
+ "group_size": 64
1568
+ },
1569
+ "model.language_model.layers.50.linear_attn.in_proj_a": {
1570
+ "bits": 8,
1571
+ "group_size": 64
1572
+ },
1573
+ "model.language_model.layers.50.linear_attn.in_proj_b": {
1574
+ "bits": 8,
1575
+ "group_size": 64
1576
+ },
1577
+ "model.language_model.layers.50.linear_attn.in_proj_qkv": {
1578
+ "bits": 4,
1579
+ "group_size": 64
1580
+ },
1581
+ "model.language_model.layers.50.linear_attn.in_proj_z": {
1582
+ "bits": 4,
1583
+ "group_size": 64
1584
+ },
1585
+ "model.language_model.layers.50.linear_attn.out_proj": {
1586
+ "bits": 4,
1587
+ "group_size": 64
1588
+ },
1589
+ "model.language_model.layers.50.mlp.down_proj": {
1590
+ "bits": 3,
1591
+ "group_size": 64
1592
+ },
1593
+ "model.language_model.layers.50.mlp.gate_proj": {
1594
+ "bits": 3,
1595
+ "group_size": 64
1596
+ },
1597
+ "model.language_model.layers.50.mlp.up_proj": {
1598
+ "bits": 4,
1599
+ "group_size": 64
1600
+ },
1601
+ "model.language_model.layers.51.mlp.down_proj": {
1602
+ "bits": 4,
1603
+ "group_size": 64
1604
+ },
1605
+ "model.language_model.layers.51.mlp.gate_proj": {
1606
+ "bits": 3,
1607
+ "group_size": 64
1608
+ },
1609
+ "model.language_model.layers.51.mlp.up_proj": {
1610
+ "bits": 4,
1611
+ "group_size": 64
1612
+ },
1613
+ "model.language_model.layers.51.self_attn.k_proj": {
1614
+ "bits": 8,
1615
+ "group_size": 64
1616
+ },
1617
+ "model.language_model.layers.51.self_attn.o_proj": {
1618
+ "bits": 4,
1619
+ "group_size": 64
1620
+ },
1621
+ "model.language_model.layers.51.self_attn.q_proj": {
1622
+ "bits": 4,
1623
+ "group_size": 64
1624
+ },
1625
+ "model.language_model.layers.51.self_attn.v_proj": {
1626
+ "bits": 8,
1627
+ "group_size": 64
1628
+ },
1629
+ "model.language_model.layers.52.linear_attn.in_proj_a": {
1630
+ "bits": 8,
1631
+ "group_size": 64
1632
+ },
1633
+ "model.language_model.layers.52.linear_attn.in_proj_b": {
1634
+ "bits": 8,
1635
+ "group_size": 64
1636
+ },
1637
+ "model.language_model.layers.52.linear_attn.in_proj_qkv": {
1638
+ "bits": 4,
1639
+ "group_size": 64
1640
+ },
1641
+ "model.language_model.layers.52.linear_attn.in_proj_z": {
1642
+ "bits": 4,
1643
+ "group_size": 64
1644
+ },
1645
+ "model.language_model.layers.52.linear_attn.out_proj": {
1646
+ "bits": 4,
1647
+ "group_size": 64
1648
+ },
1649
+ "model.language_model.layers.52.mlp.down_proj": {
1650
+ "bits": 3,
1651
+ "group_size": 64
1652
+ },
1653
+ "model.language_model.layers.52.mlp.gate_proj": {
1654
+ "bits": 4,
1655
+ "group_size": 64
1656
+ },
1657
+ "model.language_model.layers.52.mlp.up_proj": {
1658
+ "bits": 4,
1659
+ "group_size": 64
1660
+ },
1661
+ "model.language_model.layers.53.linear_attn.in_proj_a": {
1662
+ "bits": 8,
1663
+ "group_size": 64
1664
+ },
1665
+ "model.language_model.layers.53.linear_attn.in_proj_b": {
1666
+ "bits": 8,
1667
+ "group_size": 64
1668
+ },
1669
+ "model.language_model.layers.53.linear_attn.in_proj_qkv": {
1670
+ "bits": 4,
1671
+ "group_size": 64
1672
+ },
1673
+ "model.language_model.layers.53.linear_attn.in_proj_z": {
1674
+ "bits": 4,
1675
+ "group_size": 64
1676
+ },
1677
+ "model.language_model.layers.53.linear_attn.out_proj": {
1678
+ "bits": 4,
1679
+ "group_size": 64
1680
+ },
1681
+ "model.language_model.layers.53.mlp.down_proj": {
1682
+ "bits": 3,
1683
+ "group_size": 64
1684
+ },
1685
+ "model.language_model.layers.53.mlp.gate_proj": {
1686
+ "bits": 4,
1687
+ "group_size": 64
1688
+ },
1689
+ "model.language_model.layers.53.mlp.up_proj": {
1690
+ "bits": 3,
1691
+ "group_size": 64
1692
+ },
1693
+ "model.language_model.layers.54.linear_attn.in_proj_a": {
1694
+ "bits": 8,
1695
+ "group_size": 64
1696
+ },
1697
+ "model.language_model.layers.54.linear_attn.in_proj_b": {
1698
+ "bits": 8,
1699
+ "group_size": 64
1700
+ },
1701
+ "model.language_model.layers.54.linear_attn.in_proj_qkv": {
1702
+ "bits": 4,
1703
+ "group_size": 64
1704
+ },
1705
+ "model.language_model.layers.54.linear_attn.in_proj_z": {
1706
+ "bits": 4,
1707
+ "group_size": 64
1708
+ },
1709
+ "model.language_model.layers.54.linear_attn.out_proj": {
1710
+ "bits": 4,
1711
+ "group_size": 64
1712
+ },
1713
+ "model.language_model.layers.54.mlp.down_proj": {
1714
+ "bits": 3,
1715
+ "group_size": 64
1716
+ },
1717
+ "model.language_model.layers.54.mlp.gate_proj": {
1718
+ "bits": 4,
1719
+ "group_size": 64
1720
+ },
1721
+ "model.language_model.layers.54.mlp.up_proj": {
1722
+ "bits": 4,
1723
+ "group_size": 64
1724
+ },
1725
+ "model.language_model.layers.55.mlp.down_proj": {
1726
+ "bits": 3,
1727
+ "group_size": 64
1728
+ },
1729
+ "model.language_model.layers.55.mlp.gate_proj": {
1730
+ "bits": 4,
1731
+ "group_size": 64
1732
+ },
1733
+ "model.language_model.layers.55.mlp.up_proj": {
1734
+ "bits": 4,
1735
+ "group_size": 64
1736
+ },
1737
+ "model.language_model.layers.55.self_attn.k_proj": {
1738
+ "bits": 8,
1739
+ "group_size": 64
1740
+ },
1741
+ "model.language_model.layers.55.self_attn.o_proj": {
1742
+ "bits": 4,
1743
+ "group_size": 64
1744
+ },
1745
+ "model.language_model.layers.55.self_attn.q_proj": {
1746
+ "bits": 4,
1747
+ "group_size": 64
1748
+ },
1749
+ "model.language_model.layers.55.self_attn.v_proj": {
1750
+ "bits": 8,
1751
+ "group_size": 64
1752
+ },
1753
+ "model.language_model.layers.56.linear_attn.in_proj_a": {
1754
+ "bits": 8,
1755
+ "group_size": 64
1756
+ },
1757
+ "model.language_model.layers.56.linear_attn.in_proj_b": {
1758
+ "bits": 8,
1759
+ "group_size": 64
1760
+ },
1761
+ "model.language_model.layers.56.linear_attn.in_proj_qkv": {
1762
+ "bits": 4,
1763
+ "group_size": 64
1764
+ },
1765
+ "model.language_model.layers.56.linear_attn.in_proj_z": {
1766
+ "bits": 4,
1767
+ "group_size": 64
1768
+ },
1769
+ "model.language_model.layers.56.linear_attn.out_proj": {
1770
+ "bits": 4,
1771
+ "group_size": 64
1772
+ },
1773
+ "model.language_model.layers.56.mlp.down_proj": {
1774
+ "bits": 4,
1775
+ "group_size": 64
1776
+ },
1777
+ "model.language_model.layers.56.mlp.gate_proj": {
1778
+ "bits": 4,
1779
+ "group_size": 64
1780
+ },
1781
+ "model.language_model.layers.56.mlp.up_proj": {
1782
+ "bits": 4,
1783
+ "group_size": 64
1784
+ },
1785
+ "model.language_model.layers.57.linear_attn.in_proj_a": {
1786
+ "bits": 8,
1787
+ "group_size": 64
1788
+ },
1789
+ "model.language_model.layers.57.linear_attn.in_proj_b": {
1790
+ "bits": 8,
1791
+ "group_size": 64
1792
+ },
1793
+ "model.language_model.layers.57.linear_attn.in_proj_qkv": {
1794
+ "bits": 4,
1795
+ "group_size": 64
1796
+ },
1797
+ "model.language_model.layers.57.linear_attn.in_proj_z": {
1798
+ "bits": 4,
1799
+ "group_size": 64
1800
+ },
1801
+ "model.language_model.layers.57.linear_attn.out_proj": {
1802
+ "bits": 4,
1803
+ "group_size": 64
1804
+ },
1805
+ "model.language_model.layers.57.mlp.down_proj": {
1806
+ "bits": 4,
1807
+ "group_size": 64
1808
+ },
1809
+ "model.language_model.layers.57.mlp.gate_proj": {
1810
+ "bits": 4,
1811
+ "group_size": 64
1812
+ },
1813
+ "model.language_model.layers.57.mlp.up_proj": {
1814
+ "bits": 4,
1815
+ "group_size": 64
1816
+ },
1817
+ "model.language_model.layers.58.linear_attn.in_proj_a": {
1818
+ "bits": 8,
1819
+ "group_size": 64
1820
+ },
1821
+ "model.language_model.layers.58.linear_attn.in_proj_b": {
1822
+ "bits": 8,
1823
+ "group_size": 64
1824
+ },
1825
+ "model.language_model.layers.58.linear_attn.in_proj_qkv": {
1826
+ "bits": 4,
1827
+ "group_size": 64
1828
+ },
1829
+ "model.language_model.layers.58.linear_attn.in_proj_z": {
1830
+ "bits": 4,
1831
+ "group_size": 64
1832
+ },
1833
+ "model.language_model.layers.58.linear_attn.out_proj": {
1834
+ "bits": 4,
1835
+ "group_size": 64
1836
+ },
1837
+ "model.language_model.layers.58.mlp.down_proj": {
1838
+ "bits": 4,
1839
+ "group_size": 64
1840
+ },
1841
+ "model.language_model.layers.58.mlp.gate_proj": {
1842
+ "bits": 4,
1843
+ "group_size": 64
1844
+ },
1845
+ "model.language_model.layers.58.mlp.up_proj": {
1846
+ "bits": 4,
1847
+ "group_size": 64
1848
+ },
1849
+ "model.language_model.layers.59.mlp.down_proj": {
1850
+ "bits": 4,
1851
+ "group_size": 64
1852
+ },
1853
+ "model.language_model.layers.59.mlp.gate_proj": {
1854
+ "bits": 4,
1855
+ "group_size": 64
1856
+ },
1857
+ "model.language_model.layers.59.mlp.up_proj": {
1858
+ "bits": 4,
1859
+ "group_size": 64
1860
+ },
1861
+ "model.language_model.layers.59.self_attn.k_proj": {
1862
+ "bits": 8,
1863
+ "group_size": 64
1864
+ },
1865
+ "model.language_model.layers.59.self_attn.o_proj": {
1866
+ "bits": 4,
1867
+ "group_size": 64
1868
+ },
1869
+ "model.language_model.layers.59.self_attn.q_proj": {
1870
+ "bits": 4,
1871
+ "group_size": 64
1872
+ },
1873
+ "model.language_model.layers.59.self_attn.v_proj": {
1874
+ "bits": 8,
1875
+ "group_size": 64
1876
+ },
1877
+ "model.language_model.layers.60.linear_attn.in_proj_a": {
1878
+ "bits": 8,
1879
+ "group_size": 64
1880
+ },
1881
+ "model.language_model.layers.60.linear_attn.in_proj_b": {
1882
+ "bits": 8,
1883
+ "group_size": 64
1884
+ },
1885
+ "model.language_model.layers.60.linear_attn.in_proj_qkv": {
1886
+ "bits": 4,
1887
+ "group_size": 64
1888
+ },
1889
+ "model.language_model.layers.60.linear_attn.in_proj_z": {
1890
+ "bits": 4,
1891
+ "group_size": 64
1892
+ },
1893
+ "model.language_model.layers.60.linear_attn.out_proj": {
1894
+ "bits": 4,
1895
+ "group_size": 64
1896
+ },
1897
+ "model.language_model.layers.60.mlp.down_proj": {
1898
+ "bits": 4,
1899
+ "group_size": 64
1900
+ },
1901
+ "model.language_model.layers.60.mlp.gate_proj": {
1902
+ "bits": 4,
1903
+ "group_size": 64
1904
+ },
1905
+ "model.language_model.layers.60.mlp.up_proj": {
1906
+ "bits": 4,
1907
+ "group_size": 64
1908
+ },
1909
+ "model.language_model.layers.61.linear_attn.in_proj_a": {
1910
+ "bits": 8,
1911
+ "group_size": 64
1912
+ },
1913
+ "model.language_model.layers.61.linear_attn.in_proj_b": {
1914
+ "bits": 8,
1915
+ "group_size": 64
1916
+ },
1917
+ "model.language_model.layers.61.linear_attn.in_proj_qkv": {
1918
+ "bits": 4,
1919
+ "group_size": 64
1920
+ },
1921
+ "model.language_model.layers.61.linear_attn.in_proj_z": {
1922
+ "bits": 4,
1923
+ "group_size": 64
1924
+ },
1925
+ "model.language_model.layers.61.linear_attn.out_proj": {
1926
+ "bits": 4,
1927
+ "group_size": 64
1928
+ },
1929
+ "model.language_model.layers.61.mlp.down_proj": {
1930
+ "bits": 4,
1931
+ "group_size": 64
1932
+ },
1933
+ "model.language_model.layers.61.mlp.gate_proj": {
1934
+ "bits": 4,
1935
+ "group_size": 64
1936
+ },
1937
+ "model.language_model.layers.61.mlp.up_proj": {
1938
+ "bits": 4,
1939
+ "group_size": 64
1940
+ },
1941
+ "model.language_model.layers.62.linear_attn.in_proj_a": {
1942
+ "bits": 8,
1943
+ "group_size": 64
1944
+ },
1945
+ "model.language_model.layers.62.linear_attn.in_proj_b": {
1946
+ "bits": 8,
1947
+ "group_size": 64
1948
+ },
1949
+ "model.language_model.layers.62.linear_attn.in_proj_qkv": {
1950
+ "bits": 4,
1951
+ "group_size": 64
1952
+ },
1953
+ "model.language_model.layers.62.linear_attn.in_proj_z": {
1954
+ "bits": 4,
1955
+ "group_size": 64
1956
+ },
1957
+ "model.language_model.layers.62.linear_attn.out_proj": {
1958
+ "bits": 4,
1959
+ "group_size": 64
1960
+ },
1961
+ "model.language_model.layers.62.mlp.down_proj": {
1962
+ "bits": 4,
1963
+ "group_size": 64
1964
+ },
1965
+ "model.language_model.layers.62.mlp.gate_proj": {
1966
+ "bits": 4,
1967
+ "group_size": 64
1968
+ },
1969
+ "model.language_model.layers.62.mlp.up_proj": {
1970
+ "bits": 4,
1971
+ "group_size": 64
1972
+ },
1973
+ "model.language_model.layers.63.mlp.down_proj": {
1974
+ "bits": 8,
1975
+ "group_size": 64
1976
+ },
1977
+ "model.language_model.layers.63.mlp.gate_proj": {
1978
+ "bits": 8,
1979
+ "group_size": 64
1980
+ },
1981
+ "model.language_model.layers.63.mlp.up_proj": {
1982
+ "bits": 8,
1983
+ "group_size": 64
1984
+ },
1985
+ "model.language_model.layers.63.self_attn.k_proj": {
1986
+ "bits": 8,
1987
+ "group_size": 64
1988
+ },
1989
+ "model.language_model.layers.63.self_attn.o_proj": {
1990
+ "bits": 8,
1991
+ "group_size": 64
1992
+ },
1993
+ "model.language_model.layers.63.self_attn.q_proj": {
1994
+ "bits": 8,
1995
+ "group_size": 64
1996
+ },
1997
+ "model.language_model.layers.63.self_attn.v_proj": {
1998
+ "bits": 8,
1999
+ "group_size": 64
2000
+ },
2001
+ "model.visual.blocks.0.attn.proj": {
2002
+ "bits": 8,
2003
+ "group_size": 64
2004
+ },
2005
+ "model.visual.blocks.0.attn.qkv": {
2006
+ "bits": 8,
2007
+ "group_size": 64
2008
+ },
2009
+ "model.visual.blocks.0.mlp.linear_fc1": {
2010
+ "bits": 8,
2011
+ "group_size": 64
2012
+ },
2013
+ "model.visual.blocks.1.attn.proj": {
2014
+ "bits": 8,
2015
+ "group_size": 64
2016
+ },
2017
+ "model.visual.blocks.1.attn.qkv": {
2018
+ "bits": 8,
2019
+ "group_size": 64
2020
+ },
2021
+ "model.visual.blocks.1.mlp.linear_fc1": {
2022
+ "bits": 8,
2023
+ "group_size": 64
2024
+ },
2025
+ "model.visual.blocks.10.attn.proj": {
2026
+ "bits": 8,
2027
+ "group_size": 64
2028
+ },
2029
+ "model.visual.blocks.10.attn.qkv": {
2030
+ "bits": 8,
2031
+ "group_size": 64
2032
+ },
2033
+ "model.visual.blocks.10.mlp.linear_fc1": {
2034
+ "bits": 8,
2035
+ "group_size": 64
2036
+ },
2037
+ "model.visual.blocks.11.attn.proj": {
2038
+ "bits": 8,
2039
+ "group_size": 64
2040
+ },
2041
+ "model.visual.blocks.11.attn.qkv": {
2042
+ "bits": 8,
2043
+ "group_size": 64
2044
+ },
2045
+ "model.visual.blocks.11.mlp.linear_fc1": {
2046
+ "bits": 8,
2047
+ "group_size": 64
2048
+ },
2049
+ "model.visual.blocks.12.attn.proj": {
2050
+ "bits": 8,
2051
+ "group_size": 64
2052
+ },
2053
+ "model.visual.blocks.12.attn.qkv": {
2054
+ "bits": 8,
2055
+ "group_size": 64
2056
+ },
2057
+ "model.visual.blocks.12.mlp.linear_fc1": {
2058
+ "bits": 8,
2059
+ "group_size": 64
2060
+ },
2061
+ "model.visual.blocks.13.attn.proj": {
2062
+ "bits": 8,
2063
+ "group_size": 64
2064
+ },
2065
+ "model.visual.blocks.13.attn.qkv": {
2066
+ "bits": 8,
2067
+ "group_size": 64
2068
+ },
2069
+ "model.visual.blocks.13.mlp.linear_fc1": {
2070
+ "bits": 8,
2071
+ "group_size": 64
2072
+ },
2073
+ "model.visual.blocks.14.attn.proj": {
2074
+ "bits": 8,
2075
+ "group_size": 64
2076
+ },
2077
+ "model.visual.blocks.14.attn.qkv": {
2078
+ "bits": 8,
2079
+ "group_size": 64
2080
+ },
2081
+ "model.visual.blocks.14.mlp.linear_fc1": {
2082
+ "bits": 8,
2083
+ "group_size": 64
2084
+ },
2085
+ "model.visual.blocks.15.attn.proj": {
2086
+ "bits": 8,
2087
+ "group_size": 64
2088
+ },
2089
+ "model.visual.blocks.15.attn.qkv": {
2090
+ "bits": 8,
2091
+ "group_size": 64
2092
+ },
2093
+ "model.visual.blocks.15.mlp.linear_fc1": {
2094
+ "bits": 8,
2095
+ "group_size": 64
2096
+ },
2097
+ "model.visual.blocks.16.attn.proj": {
2098
+ "bits": 8,
2099
+ "group_size": 64
2100
+ },
2101
+ "model.visual.blocks.16.attn.qkv": {
2102
+ "bits": 8,
2103
+ "group_size": 64
2104
+ },
2105
+ "model.visual.blocks.16.mlp.linear_fc1": {
2106
+ "bits": 8,
2107
+ "group_size": 64
2108
+ },
2109
+ "model.visual.blocks.17.attn.proj": {
2110
+ "bits": 8,
2111
+ "group_size": 64
2112
+ },
2113
+ "model.visual.blocks.17.attn.qkv": {
2114
+ "bits": 8,
2115
+ "group_size": 64
2116
+ },
2117
+ "model.visual.blocks.17.mlp.linear_fc1": {
2118
+ "bits": 8,
2119
+ "group_size": 64
2120
+ },
2121
+ "model.visual.blocks.18.attn.proj": {
2122
+ "bits": 8,
2123
+ "group_size": 64
2124
+ },
2125
+ "model.visual.blocks.18.attn.qkv": {
2126
+ "bits": 8,
2127
+ "group_size": 64
2128
+ },
2129
+ "model.visual.blocks.18.mlp.linear_fc1": {
2130
+ "bits": 8,
2131
+ "group_size": 64
2132
+ },
2133
+ "model.visual.blocks.19.attn.proj": {
2134
+ "bits": 8,
2135
+ "group_size": 64
2136
+ },
2137
+ "model.visual.blocks.19.attn.qkv": {
2138
+ "bits": 8,
2139
+ "group_size": 64
2140
+ },
2141
+ "model.visual.blocks.19.mlp.linear_fc1": {
2142
+ "bits": 8,
2143
+ "group_size": 64
2144
+ },
2145
+ "model.visual.blocks.2.attn.proj": {
2146
+ "bits": 8,
2147
+ "group_size": 64
2148
+ },
2149
+ "model.visual.blocks.2.attn.qkv": {
2150
+ "bits": 8,
2151
+ "group_size": 64
2152
+ },
2153
+ "model.visual.blocks.2.mlp.linear_fc1": {
2154
+ "bits": 8,
2155
+ "group_size": 64
2156
+ },
2157
+ "model.visual.blocks.20.attn.proj": {
2158
+ "bits": 8,
2159
+ "group_size": 64
2160
+ },
2161
+ "model.visual.blocks.20.attn.qkv": {
2162
+ "bits": 8,
2163
+ "group_size": 64
2164
+ },
2165
+ "model.visual.blocks.20.mlp.linear_fc1": {
2166
+ "bits": 8,
2167
+ "group_size": 64
2168
+ },
2169
+ "model.visual.blocks.21.attn.proj": {
2170
+ "bits": 8,
2171
+ "group_size": 64
2172
+ },
2173
+ "model.visual.blocks.21.attn.qkv": {
2174
+ "bits": 8,
2175
+ "group_size": 64
2176
+ },
2177
+ "model.visual.blocks.21.mlp.linear_fc1": {
2178
+ "bits": 8,
2179
+ "group_size": 64
2180
+ },
2181
+ "model.visual.blocks.22.attn.proj": {
2182
+ "bits": 8,
2183
+ "group_size": 64
2184
+ },
2185
+ "model.visual.blocks.22.attn.qkv": {
2186
+ "bits": 8,
2187
+ "group_size": 64
2188
+ },
2189
+ "model.visual.blocks.22.mlp.linear_fc1": {
2190
+ "bits": 8,
2191
+ "group_size": 64
2192
+ },
2193
+ "model.visual.blocks.23.attn.proj": {
2194
+ "bits": 8,
2195
+ "group_size": 64
2196
+ },
2197
+ "model.visual.blocks.23.attn.qkv": {
2198
+ "bits": 8,
2199
+ "group_size": 64
2200
+ },
2201
+ "model.visual.blocks.23.mlp.linear_fc1": {
2202
+ "bits": 8,
2203
+ "group_size": 64
2204
+ },
2205
+ "model.visual.blocks.24.attn.proj": {
2206
+ "bits": 8,
2207
+ "group_size": 64
2208
+ },
2209
+ "model.visual.blocks.24.attn.qkv": {
2210
+ "bits": 8,
2211
+ "group_size": 64
2212
+ },
2213
+ "model.visual.blocks.24.mlp.linear_fc1": {
2214
+ "bits": 8,
2215
+ "group_size": 64
2216
+ },
2217
+ "model.visual.blocks.25.attn.proj": {
2218
+ "bits": 8,
2219
+ "group_size": 64
2220
+ },
2221
+ "model.visual.blocks.25.attn.qkv": {
2222
+ "bits": 8,
2223
+ "group_size": 64
2224
+ },
2225
+ "model.visual.blocks.25.mlp.linear_fc1": {
2226
+ "bits": 8,
2227
+ "group_size": 64
2228
+ },
2229
+ "model.visual.blocks.26.attn.proj": {
2230
+ "bits": 8,
2231
+ "group_size": 64
2232
+ },
2233
+ "model.visual.blocks.26.attn.qkv": {
2234
+ "bits": 8,
2235
+ "group_size": 64
2236
+ },
2237
+ "model.visual.blocks.26.mlp.linear_fc1": {
2238
+ "bits": 8,
2239
+ "group_size": 64
2240
+ },
2241
+ "model.visual.blocks.3.attn.proj": {
2242
+ "bits": 8,
2243
+ "group_size": 64
2244
+ },
2245
+ "model.visual.blocks.3.attn.qkv": {
2246
+ "bits": 8,
2247
+ "group_size": 64
2248
+ },
2249
+ "model.visual.blocks.3.mlp.linear_fc1": {
2250
+ "bits": 8,
2251
+ "group_size": 64
2252
+ },
2253
+ "model.visual.blocks.4.attn.proj": {
2254
+ "bits": 8,
2255
+ "group_size": 64
2256
+ },
2257
+ "model.visual.blocks.4.attn.qkv": {
2258
+ "bits": 8,
2259
+ "group_size": 64
2260
+ },
2261
+ "model.visual.blocks.4.mlp.linear_fc1": {
2262
+ "bits": 8,
2263
+ "group_size": 64
2264
+ },
2265
+ "model.visual.blocks.5.attn.proj": {
2266
+ "bits": 8,
2267
+ "group_size": 64
2268
+ },
2269
+ "model.visual.blocks.5.attn.qkv": {
2270
+ "bits": 8,
2271
+ "group_size": 64
2272
+ },
2273
+ "model.visual.blocks.5.mlp.linear_fc1": {
2274
+ "bits": 8,
2275
+ "group_size": 64
2276
+ },
2277
+ "model.visual.blocks.6.attn.proj": {
2278
+ "bits": 8,
2279
+ "group_size": 64
2280
+ },
2281
+ "model.visual.blocks.6.attn.qkv": {
2282
+ "bits": 8,
2283
+ "group_size": 64
2284
+ },
2285
+ "model.visual.blocks.6.mlp.linear_fc1": {
2286
+ "bits": 8,
2287
+ "group_size": 64
2288
+ },
2289
+ "model.visual.blocks.7.attn.proj": {
2290
+ "bits": 8,
2291
+ "group_size": 64
2292
+ },
2293
+ "model.visual.blocks.7.attn.qkv": {
2294
+ "bits": 8,
2295
+ "group_size": 64
2296
+ },
2297
+ "model.visual.blocks.7.mlp.linear_fc1": {
2298
+ "bits": 8,
2299
+ "group_size": 64
2300
+ },
2301
+ "model.visual.blocks.8.attn.proj": {
2302
+ "bits": 8,
2303
+ "group_size": 64
2304
+ },
2305
+ "model.visual.blocks.8.attn.qkv": {
2306
+ "bits": 8,
2307
+ "group_size": 64
2308
+ },
2309
+ "model.visual.blocks.8.mlp.linear_fc1": {
2310
+ "bits": 8,
2311
+ "group_size": 64
2312
+ },
2313
+ "model.visual.blocks.9.attn.proj": {
2314
+ "bits": 8,
2315
+ "group_size": 64
2316
+ },
2317
+ "model.visual.blocks.9.attn.qkv": {
2318
+ "bits": 8,
2319
+ "group_size": 64
2320
+ },
2321
+ "model.visual.blocks.9.mlp.linear_fc1": {
2322
+ "bits": 8,
2323
+ "group_size": 64
2324
+ },
2325
+ "model.visual.merger.linear_fc1": {
2326
+ "bits": 8,
2327
+ "group_size": 64
2328
+ },
2329
+ "model.visual.merger.linear_fc2": {
2330
+ "bits": 8,
2331
+ "group_size": 64
2332
+ },
2333
+ "model.visual.pos_embed": {
2334
+ "bits": 8,
2335
+ "group_size": 64
2336
+ }
2337
+ },
2338
+ "post_processing": [
2339
+ {
2340
+ "op": "strip_multimodal_metadata",
2341
+ "architectures": {
2342
+ "from": [
2343
+ "Qwen3_5ForConditionalGeneration"
2344
+ ],
2345
+ "to": [
2346
+ "Qwen3_5ForCausalLM"
2347
+ ]
2348
+ },
2349
+ "model_type": null,
2350
+ "flattened_text_config": true,
2351
+ "dropped_keys": [
2352
+ "image_token_id",
2353
+ "video_token_id",
2354
+ "vision_end_token_id",
2355
+ "vision_start_token_id"
2356
+ ],
2357
+ "dropped_mrope_keys": [
2358
+ "text_config.rope_parameters.mrope_interleaved",
2359
+ "text_config.rope_parameters.mrope_section"
2360
+ ]
2361
+ }
2362
+ ]
2363
+ }
processor_config.json ADDED
@@ -0,0 +1,64 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "data_format": "channels_first",
4
+ "default_to_square": true,
5
+ "do_convert_rgb": true,
6
+ "do_normalize": true,
7
+ "do_rescale": true,
8
+ "do_resize": true,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_processor_type": "Qwen2VLImageProcessor",
15
+ "image_std": [
16
+ 0.5,
17
+ 0.5,
18
+ 0.5
19
+ ],
20
+ "merge_size": 2,
21
+ "patch_size": 16,
22
+ "resample": 3,
23
+ "rescale_factor": 0.00392156862745098,
24
+ "size": {
25
+ "longest_edge": 16777216,
26
+ "shortest_edge": 65536
27
+ },
28
+ "temporal_patch_size": 2
29
+ },
30
+ "processor_class": "Qwen3VLProcessor",
31
+ "video_processor": {
32
+ "data_format": "channels_first",
33
+ "default_to_square": true,
34
+ "do_convert_rgb": true,
35
+ "do_normalize": true,
36
+ "do_rescale": true,
37
+ "do_resize": true,
38
+ "do_sample_frames": true,
39
+ "fps": 2,
40
+ "image_mean": [
41
+ 0.5,
42
+ 0.5,
43
+ 0.5
44
+ ],
45
+ "image_std": [
46
+ 0.5,
47
+ 0.5,
48
+ 0.5
49
+ ],
50
+ "max_frames": 768,
51
+ "merge_size": 2,
52
+ "min_frames": 4,
53
+ "patch_size": 16,
54
+ "resample": 3,
55
+ "rescale_factor": 0.00392156862745098,
56
+ "return_metadata": false,
57
+ "size": {
58
+ "longest_edge": 25165824,
59
+ "shortest_edge": 4096
60
+ },
61
+ "temporal_patch_size": 2,
62
+ "video_processor_type": "Qwen3VLVideoProcessor"
63
+ }
64
+ }
sensitivity_checkpoint.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
3
+ size 19989343
tokenizer_config.json ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "audio_bos_token": "<|audio_start|>",
4
+ "audio_eos_token": "<|audio_end|>",
5
+ "audio_token": "<|audio_pad|>",
6
+ "backend": "tokenizers",
7
+ "bos_token": null,
8
+ "clean_up_tokenization_spaces": false,
9
+ "eos_token": "<|im_end|>",
10
+ "errors": "replace",
11
+ "image_token": "<|image_pad|>",
12
+ "is_local": true,
13
+ "local_files_only": false,
14
+ "max_length": null,
15
+ "model_max_length": 262144,
16
+ "model_specific_special_tokens": {
17
+ "audio_bos_token": "<|audio_start|>",
18
+ "audio_eos_token": "<|audio_end|>",
19
+ "audio_token": "<|audio_pad|>",
20
+ "image_token": "<|image_pad|>",
21
+ "video_token": "<|video_pad|>",
22
+ "vision_bos_token": "<|vision_start|>",
23
+ "vision_eos_token": "<|vision_end|>"
24
+ },
25
+ "pad_to_multiple_of": null,
26
+ "pad_token": "<|vision_pad|>",
27
+ "pad_token_type_id": 0,
28
+ "padding_side": "left",
29
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
30
+ "processor_class": "Qwen3VLProcessor",
31
+ "split_special_tokens": false,
32
+ "tokenizer_class": "TokenizersBackend",
33
+ "tool_parser_type": "qwen3_coder",
34
+ "unk_token": null,
35
+ "video_token": "<|video_pad|>",
36
+ "vision_bos_token": "<|vision_start|>",
37
+ "vision_eos_token": "<|vision_end|>"
38
+ }