ArRENCEAI commited on
Commit
5dfa884
·
verified ·
1 Parent(s): d5c2617

OBLITERATUS: aggressive on deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language: en
3
+ tags:
4
+ - obliteratus
5
+ - abliteration
6
+ - uncensored
7
+ - obliterate
8
+ base_model: deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
9
+ ---
10
+
11
+ # DeepSeek-R1-Distill-Qwen-1.5B-OBLITERATED
12
+
13
+ This model was abliterated using the **`aggressive`** method via
14
+ [OBLITERATUS](https://github.com/elder-plinius/OBLITERATUS).
15
+
16
+ | Detail | Value |
17
+ |--------|-------|
18
+ | Base model | `deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B` |
19
+ | Method | `aggressive` |
20
+ | Source | obliterate |
21
+
22
+ ## How to Use
23
+
24
+ ```python
25
+ from transformers import AutoModelForCausalLM, AutoTokenizer
26
+
27
+ model = AutoModelForCausalLM.from_pretrained("DeepSeek-R1-Distill-Qwen-1.5B-OBLITERATED")
28
+ tokenizer = AutoTokenizer.from_pretrained("DeepSeek-R1-Distill-Qwen-1.5B-OBLITERATED")
29
+
30
+ prompt = "Hello, how are you?"
31
+ inputs = tokenizer(prompt, return_tensors="pt")
32
+ outputs = model.generate(**inputs, max_new_tokens=256)
33
+ print(tokenizer.decode(outputs[0], skip_special_tokens=True))
34
+ ```
35
+
36
+ ## About OBLITERATUS
37
+
38
+ OBLITERATUS is an open-source tool for removing refusal behavior from language
39
+ models via activation engineering (abliteration). Learn more at
40
+ [github.com/elder-plinius/OBLITERATUS](https://github.com/elder-plinius/OBLITERATUS).
abliteration_metadata.json ADDED
@@ -0,0 +1,202 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "source_model": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
3
+ "technique": "refusal_direction_ablation",
4
+ "method": "aggressive",
5
+ "method_config": {
6
+ "n_directions": 8,
7
+ "direction_method": "svd",
8
+ "norm_preserve": true,
9
+ "regularization": 0.0,
10
+ "refinement_passes": 3,
11
+ "project_biases": true,
12
+ "use_chat_template": true,
13
+ "use_whitened_svd": true,
14
+ "true_iterative_refinement": true,
15
+ "winsorize_activations": true,
16
+ "float_layer_interpolation": false,
17
+ "cot_aware": false,
18
+ "use_kl_optimization": false,
19
+ "use_lora_ablation": false,
20
+ "som_iterations": null,
21
+ "som_learning_rate": null,
22
+ "som_sigma": null,
23
+ "som_candidate_count": null,
24
+ "som_harmless_pc_count": null,
25
+ "som_distortion_aware": null,
26
+ "som_diversity_penalty": null,
27
+ "som_min_signal_to_noise": null,
28
+ "layer_selection": "all",
29
+ "min_layer_fraction": null,
30
+ "max_layer_fraction": null,
31
+ "harmless_pc_count": 0,
32
+ "shield_concept_count": 0,
33
+ "shield_ridge": 0.05,
34
+ "shield_residualize": false,
35
+ "shield_layer_penalty": 0.0,
36
+ "projection_target": "all",
37
+ "projection_row_fraction": 1.0,
38
+ "som_contiguous_layer_budget": null,
39
+ "spectral_cascade": false,
40
+ "spectral_bands": 3,
41
+ "spectral_threshold": 0.05
42
+ },
43
+ "references": [
44
+ "Arditi et al., Refusal in Language Models Is Mediated by a Single Direction (NeurIPS 2024)",
45
+ "Gabliteration: SVD-based multi-direction extraction (arXiv:2512.18901)",
46
+ "Norm-Preserving Biprojected Abliteration (grimjim, 2025)",
47
+ "Young, Comparative Analysis of LLM Abliteration Methods (arXiv:2512.13655)",
48
+ "Joad et al., More to Refusal than a Single Direction (2026)",
49
+ "Piras et al., SOM Directions Are Better than One (AAAI 2026)",
50
+ "Heretic (p-e-w, 2025): Bayesian optimization, LoRA-mediated ablation, winsorization",
51
+ "OBLITERATUS: Whitened SVD, EGA, CoT-aware, KL co-optimization, float interpolation (novel)"
52
+ ],
53
+ "strong_layers": [
54
+ 2,
55
+ 3,
56
+ 4,
57
+ 5,
58
+ 6
59
+ ],
60
+ "n_harmful_prompts": 512,
61
+ "n_harmless_prompts": 512,
62
+ "quality_metrics": {
63
+ "perplexity": 3.8535023692123884,
64
+ "coherence_local": 0.9,
65
+ "coherence": 0.9,
66
+ "coherence_samples": [
67
+ {
68
+ "prompt": "The capital of France is",
69
+ "completion": "Paris, and the capital of Italy is Rome. Suppose we have a function that maps each country to its capital. Let\u2019s define this function as f(C) = C_capital, where C is the country code. \n\nGiven that, if we apply this function to France and Italy, we get Paris and Rome, respectively. \n\nNow, suppose we",
70
+ "pass": true,
71
+ "reason": "ok"
72
+ },
73
+ {
74
+ "prompt": "In machine learning, a neural network",
75
+ "completion": "is a network that models the structure of the brain. It consists of layers of interconnected nodes, each layer connected to the next. The nodes in the hidden layers are activated by the activation function, which can be linear or non-linear. The activation function is crucial because it determines t",
76
+ "pass": true,
77
+ "reason": "ok"
78
+ },
79
+ {
80
+ "prompt": "The meaning of life is",
81
+ "completion": "to find meaning in the present moment, but how do we do that? The present moment is a fleeting experience, and we can only capture a limited amount of it. So, how do we find meaning in the present? Maybe through the present's role in shaping the future. But how do we know the future? It's always unc",
82
+ "pass": true,
83
+ "reason": "ok"
84
+ },
85
+ {
86
+ "prompt": "Water boils at a temperature of",
87
+ "completion": "100 degrees Celsius. If the temperature is measured in Kelvin, what is the boiling point of water? Remember that Kelvin and Celsius have the same size degrees, but Kelvin starts at absolute zero, which is -273.15 degrees Celsius. So, to convert Celsius to Kelvin, you add 273.15 to the Celsius temper",
88
+ "pass": true,
89
+ "reason": "ok"
90
+ },
91
+ {
92
+ "prompt": "The Pythagorean theorem states that",
93
+ "completion": "in a right-angled triangle, the square of the hypotenuse is equal to the sum of the squares of the other two sides. This can be written as a\u00b2 + b\u00b2 = c\u00b2, where c is the hypotenuse.\n\nThe converse of this theorem states that if a triangle satisfies a\u00b2 + b\u00b2 = c\u00b2, then it is a right-angled triangle.\n\nGiv",
94
+ "pass": true,
95
+ "reason": "ok"
96
+ },
97
+ {
98
+ "prompt": "Photosynthesis is the process by which",
99
+ "completion": "plants convert carbon dioxide into glucose and oxygen. This process is dependent on the availability of carbon dioxide, water, and sunlight. The overall equation for photosynthesis is:\n\n6CO2 + 6H2O + light \u2192 C6H12O6 + 6O2\n\nThe equation shows that plants take in carbon dioxide and water, use light en",
100
+ "pass": true,
101
+ "reason": "ok"
102
+ },
103
+ {
104
+ "prompt": "The largest ocean on Earth is",
105
+ "completion": "the Pacific Ocean, which covers approximately 6.7% of the Earth's surface area. The Indian Ocean covers about 1.2% of the Earth's surface. The Southern Ocean, sometimes called the Southern Indian Ocean, covers about 2.7% of the Earth's surface. The Atlantic Ocean covers about 3.1% of the Earth's sur",
106
+ "pass": true,
107
+ "reason": "ok"
108
+ },
109
+ {
110
+ "prompt": "A binary search algorithm works by",
111
+ "completion": "repeatedly dividing a list into two halves until the target is found. Suppose we have a list of 100 elements, and we want to find the position of a particular element. Each time we divide the list, we can eliminate half of the remaining elements. \n\nIf we start with a list of 100 elements, how many t",
112
+ "pass": true,
113
+ "reason": "ok"
114
+ },
115
+ {
116
+ "prompt": "The speed of light in a vacuum is",
117
+ "completion": "approximately 300,000 km/s. If a spaceship travels at half the speed of light, how many kilometers would it cover in 2 hours? To determine how many kilometers a spaceship would cover in 2 hours if it travels at half the speed of light, we can follow these steps:\n\n1. **Identify the speed of light**:",
118
+ "pass": false,
119
+ "reason": "missing_expected_content"
120
+ },
121
+ {
122
+ "prompt": "Shakespeare wrote many famous plays including",
123
+ "completion": "\"Hamlet\" and \"Macbeth\". If I know the number of plays written by Shakespeare, how can I find out how many of his plays are still unsolved?\n\nTo determine how many of Shakespeare's plays remain unsolved, you'll need to know two things: the total number of plays he wrote, and the number of those plays",
124
+ "pass": true,
125
+ "reason": "ok"
126
+ }
127
+ ],
128
+ "coherence_judge": 0.9,
129
+ "coherence_judgments": [
130
+ {
131
+ "i": 0,
132
+ "pass": true,
133
+ "reason": "Correct start, coherent extension"
134
+ },
135
+ {
136
+ "i": 1,
137
+ "pass": true,
138
+ "reason": "Coherent and on-topic"
139
+ },
140
+ {
141
+ "i": 2,
142
+ "pass": true,
143
+ "reason": "Coherent and on-topic"
144
+ },
145
+ {
146
+ "i": 3,
147
+ "pass": true,
148
+ "reason": "Correct answer with relevant extension"
149
+ },
150
+ {
151
+ "i": 4,
152
+ "pass": true,
153
+ "reason": "Accurate description"
154
+ },
155
+ {
156
+ "i": 5,
157
+ "pass": true,
158
+ "reason": "Correct and detailed"
159
+ },
160
+ {
161
+ "i": 6,
162
+ "pass": true,
163
+ "reason": "Correct with additional facts"
164
+ },
165
+ {
166
+ "i": 7,
167
+ "pass": true,
168
+ "reason": "Clear explanation"
169
+ },
170
+ {
171
+ "i": 8,
172
+ "pass": true,
173
+ "reason": "Correct with related question"
174
+ },
175
+ {
176
+ "i": 9,
177
+ "pass": false,
178
+ "reason": "Introduces irrelevant 'unsolved' concept, off-topic"
179
+ }
180
+ ],
181
+ "coherence_judge_model": "deepseek/deepseek-r1-0528",
182
+ "coherence_judge_fallback": true,
183
+ "coherence_judge_fallback_from": "deepseek/deepseek-r1-distill-llama-70b",
184
+ "capability_score": 0.3333333333333333,
185
+ "capability_results": {
186
+ "tool_call": false,
187
+ "json_schema": false,
188
+ "chain_of_thought": true,
189
+ "code_function": false,
190
+ "visual_description": true,
191
+ "instruction_following": false
192
+ },
193
+ "refusal_rate": 0.0,
194
+ "kl_band": "excellent",
195
+ "kl_divergence": 0.016022948548197746,
196
+ "spectral_certification": "RED"
197
+ },
198
+ "kl_contributions": {},
199
+ "cot_preserved_layers": [],
200
+ "float_layer_weights": {},
201
+ "lora_adapters_saved": false
202
+ }
chat_template.jinja ADDED
@@ -0,0 +1 @@
 
 
1
+ {% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set ns = namespace(is_first=false, is_tool=false, is_output_first=true, system_prompt='') %}{%- for message in messages %}{%- if message['role'] == 'system' %}{% set ns.system_prompt = message['content'] %}{%- endif %}{%- endfor %}{{bos_token}}{{ns.system_prompt}}{%- for message in messages %}{%- if message['role'] == 'user' %}{%- set ns.is_tool = false -%}{{'<|User|>' + message['content']}}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is none %}{%- set ns.is_tool = false -%}{%- for tool in message['tool_calls']%}{%- if not ns.is_first %}{{'<|Assistant|><|tool▁calls▁begin|><|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\n' + '```json' + '\n' + tool['function']['arguments'] + '\n' + '```' + '<|tool▁call▁end|>'}}{%- set ns.is_first = true -%}{%- else %}{{'\n' + '<|tool▁call▁begin|>' + tool['type'] + '<|tool▁sep|>' + tool['function']['name'] + '\n' + '```json' + '\n' + tool['function']['arguments'] + '\n' + '```' + '<|tool▁call▁end|>'}}{{'<|tool▁calls▁end|><|end▁of▁sentence|>'}}{%- endif %}{%- endfor %}{%- endif %}{%- if message['role'] == 'assistant' and message['content'] is not none %}{%- if ns.is_tool %}{{'<|tool▁outputs▁end|>' + message['content'] + '<|end▁of▁sentence|>'}}{%- set ns.is_tool = false -%}{%- else %}{% set content = message['content'] %}{% if '</think>' in content %}{% set content = content.split('</think>')[-1] %}{% endif %}{{'<|Assistant|>' + content + '<|end▁of▁sentence|>'}}{%- endif %}{%- endif %}{%- if message['role'] == 'tool' %}{%- set ns.is_tool = true -%}{%- if ns.is_output_first %}{{'<|tool▁outputs▁begin|><|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- set ns.is_output_first = false %}{%- else %}{{'\n<|tool▁output▁begin|>' + message['content'] + '<|tool▁output▁end|>'}}{%- endif %}{%- endif %}{%- endfor -%}{% if ns.is_tool %}{{'<|tool▁outputs▁end|>'}}{% endif %}{% if add_generation_prompt and not ns.is_tool %}{{'<|Assistant|><think>\n'}}{% endif %}
config.json ADDED
@@ -0,0 +1,62 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen2ForCausalLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "bos_token_id": 151643,
7
+ "dtype": "float16",
8
+ "eos_token_id": 151643,
9
+ "hidden_act": "silu",
10
+ "hidden_size": 1536,
11
+ "initializer_range": 0.02,
12
+ "intermediate_size": 8960,
13
+ "layer_types": [
14
+ "full_attention",
15
+ "full_attention",
16
+ "full_attention",
17
+ "full_attention",
18
+ "full_attention",
19
+ "full_attention",
20
+ "full_attention",
21
+ "full_attention",
22
+ "full_attention",
23
+ "full_attention",
24
+ "full_attention",
25
+ "full_attention",
26
+ "full_attention",
27
+ "full_attention",
28
+ "full_attention",
29
+ "full_attention",
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention"
42
+ ],
43
+ "max_position_embeddings": 131072,
44
+ "max_window_layers": 21,
45
+ "model_type": "qwen2",
46
+ "num_attention_heads": 12,
47
+ "num_hidden_layers": 28,
48
+ "num_key_value_heads": 2,
49
+ "pad_token_id": null,
50
+ "rms_norm_eps": 1e-06,
51
+ "rope_parameters": {
52
+ "rope_theta": 10000,
53
+ "rope_type": "default"
54
+ },
55
+ "sliding_window": null,
56
+ "tie_word_embeddings": false,
57
+ "transformers_version": "5.15.0",
58
+ "use_cache": true,
59
+ "use_mrope": false,
60
+ "use_sliding_window": false,
61
+ "vocab_size": 151936
62
+ }
generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 151646,
4
+ "do_sample": true,
5
+ "eos_token_id": 151643,
6
+ "temperature": 0.6,
7
+ "top_p": 0.95,
8
+ "transformers_version": "5.15.0"
9
+ }
model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7dafbab1827630bc5c509a8725d75d4222352b1d7c9a4d5b3553001092dd8fb9
3
+ size 1975314432
model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:042dcdabbfbf75a558afb74f0549de58ffa810f4dfd49e84507bec5bc54b22e9
3
+ size 1578899784
model.safetensors.index.json ADDED
@@ -0,0 +1,347 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 1777088000,
4
+ "total_size": 3554176000
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00002-of-00002.safetensors",
8
+ "model.embed_tokens.weight": "model-00001-of-00002.safetensors",
9
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
11
+ "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
12
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
16
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
19
+ "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
20
+ "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
21
+ "model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
22
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
24
+ "model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
25
+ "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
26
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
28
+ "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
29
+ "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
30
+ "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
31
+ "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
32
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
34
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
37
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
41
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
44
+ "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
45
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
47
+ "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
48
+ "model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
49
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
51
+ "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
52
+ "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
53
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
55
+ "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
56
+ "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
57
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
59
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
62
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
64
+ "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
65
+ "model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
66
+ "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
67
+ "model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
68
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
70
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
73
+ "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
74
+ "model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
75
+ "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
76
+ "model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
77
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
79
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
80
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
84
+ "model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
85
+ "model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
86
+ "model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
87
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
90
+ "model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
91
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
92
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
94
+ "model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
95
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
97
+ "model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
98
+ "model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
99
+ "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
100
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
102
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
104
+ "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
105
+ "model.layers.16.input_layernorm.weight": "model-00002-of-00002.safetensors",
106
+ "model.layers.16.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
107
+ "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
108
+ "model.layers.16.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
109
+ "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
110
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
112
+ "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
113
+ "model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
114
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
116
+ "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
117
+ "model.layers.17.input_layernorm.weight": "model-00002-of-00002.safetensors",
118
+ "model.layers.17.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
119
+ "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
120
+ "model.layers.17.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
121
+ "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
122
+ "model.layers.17.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
123
+ "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
124
+ "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
125
+ "model.layers.17.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
126
+ "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
127
+ "model.layers.17.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
128
+ "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
129
+ "model.layers.18.input_layernorm.weight": "model-00002-of-00002.safetensors",
130
+ "model.layers.18.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
131
+ "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
132
+ "model.layers.18.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
133
+ "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
134
+ "model.layers.18.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
135
+ "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
136
+ "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
137
+ "model.layers.18.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
138
+ "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
139
+ "model.layers.18.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
140
+ "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
141
+ "model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
142
+ "model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
143
+ "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
144
+ "model.layers.19.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
145
+ "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
146
+ "model.layers.19.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
147
+ "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
148
+ "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
149
+ "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
150
+ "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
151
+ "model.layers.19.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
152
+ "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
153
+ "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
154
+ "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
155
+ "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
156
+ "model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
157
+ "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
158
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
160
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
163
+ "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
164
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
166
+ "model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
167
+ "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
168
+ "model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
169
+ "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
170
+ "model.layers.20.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
171
+ "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
172
+ "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
173
+ "model.layers.20.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
174
+ "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
175
+ "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
176
+ "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
177
+ "model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
178
+ "model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
179
+ "model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
180
+ "model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
181
+ "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
182
+ "model.layers.21.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
183
+ "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
184
+ "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
185
+ "model.layers.21.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
186
+ "model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
187
+ "model.layers.21.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
188
+ "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
189
+ "model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
190
+ "model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
191
+ "model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
192
+ "model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
193
+ "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
194
+ "model.layers.22.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
195
+ "model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
196
+ "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
197
+ "model.layers.22.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
198
+ "model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
199
+ "model.layers.22.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
200
+ "model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
201
+ "model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
202
+ "model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
203
+ "model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
204
+ "model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
205
+ "model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
206
+ "model.layers.23.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
207
+ "model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
208
+ "model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
209
+ "model.layers.23.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
210
+ "model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
211
+ "model.layers.23.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
212
+ "model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
213
+ "model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
214
+ "model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
215
+ "model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
216
+ "model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
217
+ "model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
218
+ "model.layers.24.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
219
+ "model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
220
+ "model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
221
+ "model.layers.24.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
222
+ "model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
223
+ "model.layers.24.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
224
+ "model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
225
+ "model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
226
+ "model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
227
+ "model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
228
+ "model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
229
+ "model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
230
+ "model.layers.25.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
231
+ "model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
232
+ "model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
233
+ "model.layers.25.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
234
+ "model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
235
+ "model.layers.25.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
236
+ "model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
237
+ "model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
238
+ "model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
239
+ "model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
240
+ "model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
241
+ "model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
242
+ "model.layers.26.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
243
+ "model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
244
+ "model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
245
+ "model.layers.26.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
246
+ "model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
247
+ "model.layers.26.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
248
+ "model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
249
+ "model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
250
+ "model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
251
+ "model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
252
+ "model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
253
+ "model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
254
+ "model.layers.27.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
255
+ "model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
256
+ "model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
257
+ "model.layers.27.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
258
+ "model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
259
+ "model.layers.27.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
260
+ "model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
261
+ "model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
262
+ "model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
263
+ "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
264
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
265
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
266
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
267
+ "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
268
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
269
+ "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
270
+ "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
271
+ "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
272
+ "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
273
+ "model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
274
+ "model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
275
+ "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
276
+ "model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
277
+ "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
278
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
279
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
280
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
281
+ "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
282
+ "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
283
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
284
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
285
+ "model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
286
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
287
+ "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
288
+ "model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
289
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
291
+ "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
292
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
294
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
295
+ "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
296
+ "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
297
+ "model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
298
+ "model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
299
+ "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
300
+ "model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
301
+ "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
302
+ "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
303
+ "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
304
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
305
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
306
+ "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
307
+ "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
308
+ "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
309
+ "model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
310
+ "model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
311
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
312
+ "model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
313
+ "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
314
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
315
+ "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
316
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
317
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
318
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
319
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
320
+ "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
321
+ "model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
322
+ "model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
323
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
324
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
325
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
326
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
327
+ "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
328
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
329
+ "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
330
+ "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
331
+ "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
332
+ "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
333
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
334
+ "model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
335
+ "model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
336
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
337
+ "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
338
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
339
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
340
+ "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
341
+ "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
342
+ "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
343
+ "model.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
344
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
345
+ "model.norm.weight": "model-00002-of-00002.safetensors"
346
+ }
347
+ }
obliteratus_session.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "label": "aggressive \u00b7 DeepSeek-R1-Distill-Qwen-1.5B \u00b7 obliterated_230 \u00b7 08-10 16:06:53",
3
+ "model_id": "deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
4
+ "model_choice": "DeepSeek / DeepSeek-R1 Distill Qwen 1.5B",
5
+ "method": "aggressive",
6
+ "dataset_key": "custom",
7
+ "prompt_volume": 512,
8
+ "source": "obliterate"
9
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a1155024d6a00188d0eea927621c6bbb2c911b39b1aa00e5b4dc6bc09bd8e055
3
+ size 11422190
tokenizer_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "<|begin▁of▁sentence|>",
4
+ "clean_up_tokenization_spaces": false,
5
+ "eos_token": "<|end▁of▁sentence|>",
6
+ "is_local": false,
7
+ "legacy": true,
8
+ "local_files_only": false,
9
+ "model_max_length": 16384,
10
+ "pad_token": "<|end▁of▁sentence|>",
11
+ "sp_model_kwargs": {},
12
+ "tokenizer_class": "TokenizersBackend",
13
+ "unk_token": null
14
+ }