vinod-anbalagan commited on
Commit
f20ef60
·
verified ·
1 Parent(s): af1c394

Add 13 files

Browse files
.gitattributes CHANGED
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ training-metrics.png filter=lfs diff=lfs merge=lfs -text
37
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,99 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: google/gemma-3-27b-it-VLM
3
+ library_name: peft
4
+ license: other
5
+ tags:
6
+ - lora
7
+ - peft
8
+ - adapter
9
+ - adaption
10
+ ---
11
+
12
+ # adaption_adaption_charts_p2_gold
13
+
14
+ ## Model Training
15
+
16
+ A LORA adapter for `google/gemma-3-27b-it-VLM`. This model was trained with SFT using [Adaption](https://adaptionlabs.ai)'s AutoScientist on the adaption_charts_p2_gold dataset.
17
+
18
+
19
+ ![Training metrics](training-metrics.png)
20
+
21
+ ### AutoScientist Config
22
+
23
+ ```json
24
+ {
25
+ "job_id": "e6577e9a-cd8a-4172-8374-2c1439454b11",
26
+ "training_experiment_id": "f59f3599-ca87-4b85-9801-bd3deaeddf1d",
27
+ "original_model_name": "google/gemma-3-27b-it-VLM",
28
+ "trained_model_name": "adaption_adaption_charts_p2_gold",
29
+ "training_method": "sft",
30
+ "training_type": "lora",
31
+ "data_format": "chat",
32
+ "hyperparams": {
33
+ "lora": "true",
34
+ "lora_r": 64,
35
+ "n_evals": 5,
36
+ "n_epochs": 4,
37
+ "batch_size": "max",
38
+ "lora_alpha": 128,
39
+ "lora_dropout": 0,
40
+ "min_lr_ratio": 0.1,
41
+ "warmup_ratio": 0.05,
42
+ "weight_decay": 0.02,
43
+ "learning_rate": 0.00005,
44
+ "max_grad_norm": 1,
45
+ "base_model_size": "27B",
46
+ "train_on_inputs": "false",
47
+ "training_method": "sft",
48
+ "lr_scheduler_type": "cosine",
49
+ "scheduler_num_cycles": 0.5,
50
+ "lora_trainable_modules": "q_proj,k_proj,v_proj,o_proj"
51
+ }
52
+ }
53
+ ```
54
+
55
+ ## Training Data
56
+
57
+ The model was trained on 888 rows of adapted data with the following domain distribution: data-analysis-visualization (98%), math (1%), market-analysis (0%), corporate-business (0%).
58
+
59
+ ## Model Evaluation
60
+
61
+ The model was evaluated on an in-distribution held-out test set as well as a broader domain-specific test set to measure generalization.
62
+
63
+
64
+ ![Win rates](win-rates.png)
65
+
66
+
67
+ ## How to use
68
+
69
+ ```bash
70
+ pip install torch transformers peft
71
+ ```
72
+
73
+ ```python
74
+ import torch
75
+ from transformers import AutoModelForCausalLM, AutoTokenizer
76
+ from peft import PeftModel
77
+
78
+ BASE = "google/gemma-3-27b-it-VLM"
79
+ ADAPTER = "<this-repo-id>"
80
+
81
+ device = "cuda" if torch.cuda.is_available() else "cpu"
82
+ dtype = torch.float32 if device == "cpu" else torch.bfloat16
83
+
84
+ base = AutoModelForCausalLM.from_pretrained(BASE, dtype=dtype).to(device)
85
+ model = PeftModel.from_pretrained(base, ADAPTER)
86
+ # Optional: merge the LoRA weights into the base for faster inference
87
+ model = model.merge_and_unload()
88
+ model.eval()
89
+
90
+ tokenizer = AutoTokenizer.from_pretrained(BASE)
91
+ messages = [{"role": "user", "content": "Hello!"}]
92
+ text = tokenizer.apply_chat_template(
93
+ messages, tokenize=False, add_generation_prompt=True)
94
+ inputs = tokenizer(text, return_tensors="pt").to(device)
95
+
96
+ with torch.inference_mode():
97
+ out = model.generate(**inputs, max_new_tokens=512)
98
+ print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
99
+ ```
adapter_config.json ADDED
@@ -0,0 +1,371 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alpha_pattern": {},
3
+ "auto_mapping": null,
4
+ "base_model_name_or_path": "togethercomputer/gemma-3-27b-it-VLM",
5
+ "bias": "none",
6
+ "corda_config": null,
7
+ "eva_config": null,
8
+ "exclude_modules": [
9
+ "model.vision_tower.encoder.layers.14.self_attn.out_proj",
10
+ "model.vision_tower.encoder.layers.16.layer_norm1",
11
+ "model.vision_tower.encoder.layers.4.self_attn.out_proj",
12
+ "model.vision_tower.encoder.layers.1.self_attn",
13
+ "model.vision_tower.encoder.layers.19.mlp.fc2",
14
+ "model.vision_tower.encoder.layers.10.self_attn.q_proj",
15
+ "model.vision_tower.encoder.layers.11",
16
+ "model.vision_tower.encoder.layers.23.mlp.activation_fn",
17
+ "model.vision_tower.encoder.layers.24.layer_norm1",
18
+ "model.vision_tower.encoder.layers.12",
19
+ "model.vision_tower.encoder.layers.7.layer_norm1",
20
+ "model.vision_tower.encoder.layers.15.mlp.activation_fn",
21
+ "model.vision_tower.encoder.layers.16.mlp.fc2",
22
+ "model.vision_tower.encoder.layers.20.layer_norm1",
23
+ "model.vision_tower.encoder.layers.24.mlp.activation_fn",
24
+ "model.vision_tower.encoder.layers.19.layer_norm2",
25
+ "model.vision_tower.encoder.layers.17.self_attn.q_proj",
26
+ "model.vision_tower.encoder.layers.0.layer_norm1",
27
+ "model.vision_tower.encoder.layers.21.layer_norm1",
28
+ "model.multi_modal_projector",
29
+ "model.vision_tower.encoder.layers.15.mlp.fc2",
30
+ "model.vision_tower.encoder.layers.24.self_attn.k_proj",
31
+ "model.vision_tower.encoder.layers.24.self_attn.v_proj",
32
+ "model.vision_tower.encoder.layers.2.layer_norm2",
33
+ "model.vision_tower.encoder.layers.17.self_attn.k_proj",
34
+ "model.vision_tower.encoder.layers.20.self_attn.out_proj",
35
+ "model.vision_tower.encoder.layers.9.mlp",
36
+ "model.vision_tower.encoder.layers.9.self_attn.v_proj",
37
+ "model.vision_tower.encoder.layers.15.self_attn.q_proj",
38
+ "model.vision_tower.encoder.layers.13.self_attn.k_proj",
39
+ "model.vision_tower.encoder.layers.19.mlp.activation_fn",
40
+ "model.vision_tower.encoder.layers.6.self_attn.k_proj",
41
+ "model.vision_tower.encoder.layers.20.layer_norm2",
42
+ "model.vision_tower.encoder.layers.23.self_attn.q_proj",
43
+ "model.vision_tower.encoder.layers.7.mlp.fc1",
44
+ "model.vision_tower.encoder.layers.15.self_attn.v_proj",
45
+ "model.vision_tower.encoder.layers.3",
46
+ "model.vision_tower.encoder.layers.4.layer_norm1",
47
+ "model.vision_tower.encoder.layers.13.self_attn.q_proj",
48
+ "model.vision_tower.encoder.layers.7.mlp.fc2",
49
+ "model.vision_tower.encoder.layers.0.mlp",
50
+ "model.vision_tower.encoder.layers.2.mlp",
51
+ "model.vision_tower.encoder.layers.26.self_attn.q_proj",
52
+ "model.vision_tower.encoder.layers.9.mlp.fc1",
53
+ "model.vision_tower.encoder.layers.8.mlp.activation_fn",
54
+ "model.vision_tower.encoder.layers.22.self_attn.q_proj",
55
+ "model.vision_tower.encoder.layers.14.mlp.fc2",
56
+ "model.vision_tower.encoder.layers.18.self_attn.v_proj",
57
+ "model.vision_tower.encoder.layers.18",
58
+ "model.vision_tower.encoder.layers.6.self_attn",
59
+ "model.vision_tower.encoder.layers.8",
60
+ "model.vision_tower.encoder.layers.15.layer_norm2",
61
+ "model.vision_tower.encoder.layers.8.mlp.fc2",
62
+ "model.vision_tower.encoder.layers.16.mlp.activation_fn",
63
+ "model.vision_tower.encoder.layers",
64
+ "model.vision_tower.encoder.layers.24.mlp.fc2",
65
+ "model.vision_tower.encoder.layers.23.mlp",
66
+ "model.vision_tower.encoder.layers.21.self_attn.out_proj",
67
+ "model.vision_tower.encoder.layers.2.self_attn",
68
+ "model.vision_tower.encoder.layers.5.mlp.fc2",
69
+ "model.vision_tower.encoder.layers.8.self_attn",
70
+ "model.vision_tower.encoder.layers.10.self_attn.out_proj",
71
+ "model.vision_tower.encoder.layers.19.self_attn.q_proj",
72
+ "model.vision_tower.encoder.layers.10.self_attn.k_proj",
73
+ "model.vision_tower.encoder.layers.12.mlp.fc2",
74
+ "model.vision_tower.encoder.layers.4.mlp.activation_fn",
75
+ "model.vision_tower.encoder.layers.10",
76
+ "model.vision_tower.encoder.layers.26.self_attn",
77
+ "model.vision_tower.encoder.layers.22.layer_norm1",
78
+ "model.vision_tower.encoder.layers.19.self_attn.out_proj",
79
+ "model.vision_tower.encoder.layers.9.self_attn.out_proj",
80
+ "model.vision_tower.encoder.layers.14.layer_norm2",
81
+ "model.vision_tower.encoder.layers.10.layer_norm1",
82
+ "model.vision_tower.encoder.layers.12.self_attn",
83
+ "model.vision_tower.encoder.layers.18.layer_norm1",
84
+ "model.vision_tower.encoder.layers.26.mlp.activation_fn",
85
+ "model.vision_tower.encoder.layers.16.mlp",
86
+ "model.vision_tower.encoder.layers.5.layer_norm1",
87
+ "model.vision_tower.encoder.layers.1.mlp",
88
+ "model.vision_tower.encoder.layers.17.mlp.fc2",
89
+ "model.vision_tower.encoder.layers.17.layer_norm1",
90
+ "model.vision_tower.encoder.layers.21.self_attn",
91
+ "model.vision_tower.encoder.layers.23.mlp.fc1",
92
+ "model.vision_tower.encoder.layers.5.self_attn.out_proj",
93
+ "model.vision_tower.encoder.layers.11.mlp.fc2",
94
+ "model.vision_tower.encoder.layers.22.self_attn.v_proj",
95
+ "model.vision_tower.encoder.layers.4.layer_norm2",
96
+ "model.vision_tower.encoder.layers.25.self_attn.q_proj",
97
+ "model.vision_tower.encoder.layers.3.self_attn.out_proj",
98
+ "model.vision_tower.encoder.layers.2.self_attn.k_proj",
99
+ "model.vision_tower.encoder.layers.3.mlp.activation_fn",
100
+ "model.vision_tower.embeddings.position_embedding",
101
+ "model.vision_tower.encoder.layers.26.layer_norm2",
102
+ "model.vision_tower.encoder.layers.6",
103
+ "model.vision_tower.encoder.layers.15.layer_norm1",
104
+ "model.vision_tower.encoder.layers.12.mlp.activation_fn",
105
+ "model.vision_tower.encoder.layers.13.self_attn",
106
+ "model.vision_tower.encoder.layers.17",
107
+ "model.vision_tower.encoder.layers.7.self_attn",
108
+ "model.vision_tower.encoder.layers.18.self_attn.q_proj",
109
+ "model.vision_tower.encoder.layers.11.mlp",
110
+ "model.vision_tower.encoder.layers.4.self_attn.k_proj",
111
+ "model.vision_tower.encoder.layers.0.self_attn.q_proj",
112
+ "model.vision_tower.encoder.layers.14.self_attn.q_proj",
113
+ "model.vision_tower.encoder.layers.25.self_attn.k_proj",
114
+ "model.vision_tower.encoder.layers.26.mlp.fc1",
115
+ "model.vision_tower.encoder.layers.25.mlp.fc1",
116
+ "model.vision_tower.encoder.layers.6.mlp.fc2",
117
+ "model.vision_tower.encoder.layers.18.mlp",
118
+ "model.vision_tower.encoder.layers.9.self_attn",
119
+ "model.vision_tower.encoder.layers.21.self_attn.q_proj",
120
+ "model.vision_tower.encoder.layers.9.layer_norm2",
121
+ "model.vision_tower.encoder.layers.2.mlp.fc2",
122
+ "model.vision_tower.encoder.layers.14.mlp",
123
+ "model.vision_tower.encoder.layers.24.mlp.fc1",
124
+ "model.vision_tower.encoder.layers.4.mlp.fc2",
125
+ "model.vision_tower.encoder.layers.3.self_attn",
126
+ "model.vision_tower.encoder.layers.1",
127
+ "model.vision_tower.encoder.layers.1.self_attn.q_proj",
128
+ "model.vision_tower.encoder.layers.5.self_attn.v_proj",
129
+ "model.vision_tower.encoder.layers.8.layer_norm2",
130
+ "model.vision_tower.encoder.layers.8.self_attn.q_proj",
131
+ "model.vision_tower.encoder.layers.2",
132
+ "model.vision_tower.encoder.layers.18.mlp.activation_fn",
133
+ "model.vision_tower.encoder.layers.5.self_attn.q_proj",
134
+ "model.vision_tower.encoder.layers.2.mlp.activation_fn",
135
+ "model.vision_tower.encoder.layers.22.mlp",
136
+ "model.vision_tower.encoder.layers.14.self_attn.k_proj",
137
+ "model.vision_tower.encoder.layers.22.mlp.fc2",
138
+ "model.vision_tower.encoder.layers.7.mlp",
139
+ "model.vision_tower.encoder.layers.11.self_attn.k_proj",
140
+ "model.vision_tower.encoder.layers.7.self_attn.k_proj",
141
+ "model.vision_tower.encoder.layers.14",
142
+ "model.vision_tower.encoder.layers.20.self_attn.k_proj",
143
+ "model.vision_tower.encoder.layers.1.layer_norm2",
144
+ "model.vision_tower.encoder.layers.15.self_attn",
145
+ "model.vision_tower.encoder.layers.8.self_attn.v_proj",
146
+ "model.vision_tower.encoder.layers.16.self_attn.q_proj",
147
+ "model.vision_tower.encoder.layers.23.mlp.fc2",
148
+ "model.vision_tower.encoder.layers.11.self_attn.q_proj",
149
+ "model.vision_tower.encoder.layers.8.self_attn.out_proj",
150
+ "model.vision_tower.encoder.layers.6.self_attn.out_proj",
151
+ "model.vision_tower.encoder.layers.4.mlp.fc1",
152
+ "model.vision_tower.embeddings",
153
+ "model.vision_tower.encoder.layers.22.self_attn.k_proj",
154
+ "model.vision_tower.encoder.layers.23.layer_norm2",
155
+ "model.vision_tower.encoder.layers.19.self_attn.v_proj",
156
+ "model.vision_tower.encoder.layers.20.mlp.fc1",
157
+ "model.vision_tower.encoder.layers.19",
158
+ "model.vision_tower.encoder.layers.11.self_attn",
159
+ "model.vision_tower.encoder.layers.3.layer_norm1",
160
+ "model.vision_tower.encoder.layers.10.mlp.fc2",
161
+ "model.vision_tower.encoder.layers.11.self_attn.out_proj",
162
+ "model.vision_tower.encoder.layers.0",
163
+ "model.vision_tower.encoder.layers.3.mlp.fc1",
164
+ "model.vision_tower.encoder.layers.1.mlp.activation_fn",
165
+ "model.vision_tower.encoder.layers.13.mlp.activation_fn",
166
+ "model.vision_tower.encoder.layers.13.mlp.fc2",
167
+ "model.vision_tower.encoder.layers.18.self_attn.k_proj",
168
+ "model.vision_tower.encoder.layers.8.layer_norm1",
169
+ "model.vision_tower.encoder.layers.22",
170
+ "model.vision_tower.encoder.layers.0.layer_norm2",
171
+ "model.vision_tower.encoder.layers.12.mlp",
172
+ "model.vision_tower.encoder.layers.15",
173
+ "model.vision_tower.encoder.layers.24.self_attn",
174
+ "model.vision_tower.encoder.layers.1.mlp.fc1",
175
+ "model.vision_tower.encoder.layers.12.self_attn.out_proj",
176
+ "model.vision_tower.encoder.layers.26.self_attn.v_proj",
177
+ "model.vision_tower.encoder.layers.10.mlp",
178
+ "model.vision_tower.encoder.layers.1.layer_norm1",
179
+ "model.vision_tower.encoder.layers.6.self_attn.q_proj",
180
+ "model.vision_tower.encoder.layers.6.mlp.activation_fn",
181
+ "model.multi_modal_projector.mm_soft_emb_norm",
182
+ "model.vision_tower.encoder.layers.25.self_attn.out_proj",
183
+ "model.vision_tower.encoder.layers.19.self_attn.k_proj",
184
+ "model.vision_tower.encoder.layers.21.mlp.activation_fn",
185
+ "model.vision_tower.encoder.layers.9.layer_norm1",
186
+ "model.vision_tower.encoder.layers.18.mlp.fc1",
187
+ "model.vision_tower.encoder.layers.22.mlp.activation_fn",
188
+ "model.vision_tower.encoder.layers.12.self_attn.k_proj",
189
+ "model.vision_tower.encoder.layers.6.mlp",
190
+ "model.vision_tower.encoder.layers.6.layer_norm2",
191
+ "model.vision_tower.encoder.layers.9",
192
+ "model.vision_tower.encoder.layers.12.self_attn.v_proj",
193
+ "model.vision_tower.encoder.layers.0.mlp.fc2",
194
+ "model.vision_tower.encoder.layers.5.mlp.fc1",
195
+ "model.vision_tower.encoder.layers.18.mlp.fc2",
196
+ "model.vision_tower",
197
+ "model.vision_tower.encoder.layers.4.self_attn.q_proj",
198
+ "model.vision_tower.encoder.layers.24",
199
+ "model.vision_tower.encoder.layers.24.self_attn.q_proj",
200
+ "model.vision_tower.encoder.layers.17.mlp.fc1",
201
+ "model.vision_tower.encoder.layers.19.mlp.fc1",
202
+ "model.vision_tower.encoder.layers.2.self_attn.out_proj",
203
+ "model.vision_tower.encoder.layers.21",
204
+ "model.vision_tower.encoder.layers.10.mlp.fc1",
205
+ "model.vision_tower.encoder.layers.13.layer_norm2",
206
+ "model.vision_tower.encoder.layers.23.self_attn.k_proj",
207
+ "model.vision_tower.encoder.layers.22.layer_norm2",
208
+ "model.vision_tower.encoder.layers.4.mlp",
209
+ "model.vision_tower.encoder.layers.19.mlp",
210
+ "model.vision_tower.encoder.layers.14.mlp.activation_fn",
211
+ "model.vision_tower.encoder.layers.25.layer_norm1",
212
+ "model.vision_tower.encoder.layers.5.self_attn.k_proj",
213
+ "model.vision_tower.encoder.layers.3.layer_norm2",
214
+ "model.vision_tower.encoder.layers.21.mlp.fc2",
215
+ "model.vision_tower.encoder.layers.21.layer_norm2",
216
+ "model.vision_tower.encoder.layers.4.self_attn",
217
+ "model.vision_tower.encoder.layers.17.self_attn",
218
+ "model.vision_tower.encoder.layers.13.self_attn.v_proj",
219
+ "model.vision_tower.encoder.layers.25.mlp.fc2",
220
+ "model.vision_tower.encoder.layers.3.mlp.fc2",
221
+ "model.vision_tower.encoder.layers.16.self_attn",
222
+ "model.vision_tower.encoder.layers.14.self_attn.v_proj",
223
+ "model.vision_tower.encoder.layers.25",
224
+ "model.vision_tower.encoder.layers.11.self_attn.v_proj",
225
+ "model.vision_tower.encoder.layers.25.self_attn.v_proj",
226
+ "model.vision_tower.encoder.layers.12.self_attn.q_proj",
227
+ "model.vision_tower.encoder.layers.9.self_attn.k_proj",
228
+ "model.vision_tower.encoder.layers.7.self_attn.q_proj",
229
+ "model.vision_tower.encoder.layers.0.self_attn",
230
+ "model.vision_tower.encoder.layers.20.mlp",
231
+ "model.vision_tower.encoder.layers.24.self_attn.out_proj",
232
+ "model.vision_tower.encoder.layers.13",
233
+ "model.vision_tower.encoder.layers.14.self_attn",
234
+ "model.vision_tower.encoder.layers.22.self_attn.out_proj",
235
+ "model.vision_tower.encoder.layers.8.mlp",
236
+ "model.vision_tower.encoder.layers.16.mlp.fc1",
237
+ "model.vision_tower.encoder.layers.14.layer_norm1",
238
+ "model.vision_tower.encoder.layers.3.self_attn.k_proj",
239
+ "model.vision_tower.encoder.layers.16.self_attn.v_proj",
240
+ "model.vision_tower.encoder.layers.10.mlp.activation_fn",
241
+ "model.vision_tower.encoder.layers.15.mlp.fc1",
242
+ "model.vision_tower.encoder.layers.9.self_attn.q_proj",
243
+ "model.vision_tower.encoder.layers.18.self_attn",
244
+ "model.vision_tower.encoder.layers.10.self_attn",
245
+ "model.vision_tower.encoder.layers.22.self_attn",
246
+ "model.vision_tower.encoder.layers.20",
247
+ "model.vision_tower.encoder.layers.8.self_attn.k_proj",
248
+ "model.vision_tower.embeddings.patch_embedding",
249
+ "model.vision_tower.encoder.layers.23",
250
+ "model.vision_tower.encoder.layers.9.mlp.activation_fn",
251
+ "model.vision_tower.encoder.layers.11.mlp.fc1",
252
+ "model.vision_tower.encoder.layers.26.layer_norm1",
253
+ "model.vision_tower.encoder.layers.6.self_attn.v_proj",
254
+ "model.vision_tower.encoder.layers.7.layer_norm2",
255
+ "model.vision_tower.encoder.layers.6.mlp.fc1",
256
+ "model.vision_tower.encoder.layers.19.self_attn",
257
+ "model.vision_tower.encoder.layers.7.mlp.activation_fn",
258
+ "model.vision_tower.post_layernorm",
259
+ "model.vision_tower.encoder.layers.2.self_attn.q_proj",
260
+ "model.vision_tower.encoder.layers.23.self_attn.out_proj",
261
+ "model.vision_tower.encoder.layers.13.mlp.fc1",
262
+ "model.vision_tower.encoder.layers.18.layer_norm2",
263
+ "model.vision_tower.encoder.layers.16.self_attn.out_proj",
264
+ "model.vision_tower.encoder.layers.7.self_attn.v_proj",
265
+ "model.vision_tower.encoder.layers.7.self_attn.out_proj",
266
+ "model.vision_tower.encoder.layers.5.layer_norm2",
267
+ "model.vision_tower.encoder.layers.25.self_attn",
268
+ "model.vision_tower.encoder.layers.16.self_attn.k_proj",
269
+ "model.vision_tower.encoder.layers.25.mlp",
270
+ "model.vision_tower.encoder.layers.16.layer_norm2",
271
+ "model.vision_tower.encoder.layers.5",
272
+ "model.vision_tower.encoder.layers.17.mlp",
273
+ "model.vision_tower.encoder.layers.12.layer_norm1",
274
+ "model.vision_tower.encoder.layers.20.mlp.fc2",
275
+ "model.vision_tower.encoder.layers.1.mlp.fc2",
276
+ "model.vision_tower.encoder.layers.20.self_attn.v_proj",
277
+ "model.vision_tower.encoder.layers.2.self_attn.v_proj",
278
+ "model.vision_tower.encoder.layers.26.self_attn.out_proj",
279
+ "model.vision_tower.encoder.layers.1.self_attn.v_proj",
280
+ "model.vision_tower.encoder.layers.3.self_attn.v_proj",
281
+ "model.vision_tower.encoder.layers.10.self_attn.v_proj",
282
+ "model.vision_tower.encoder.layers.0.self_attn.k_proj",
283
+ "model.vision_tower.encoder.layers.15.self_attn.out_proj",
284
+ "model.vision_tower.encoder.layers.25.mlp.activation_fn",
285
+ "model.vision_tower.encoder.layers.12.mlp.fc1",
286
+ "model.vision_tower.encoder.layers.22.mlp.fc1",
287
+ "model.vision_tower.encoder.layers.1.self_attn.out_proj",
288
+ "model.vision_tower.encoder.layers.4.self_attn.v_proj",
289
+ "model.vision_tower.encoder.layers.24.mlp",
290
+ "model.vision_tower.encoder.layers.21.mlp.fc1",
291
+ "model.multi_modal_projector.avg_pool",
292
+ "model.vision_tower.encoder.layers.26.mlp.fc2",
293
+ "model.vision_tower.encoder.layers.6.layer_norm1",
294
+ "model.vision_tower.encoder.layers.9.mlp.fc2",
295
+ "model.vision_tower.encoder.layers.10.layer_norm2",
296
+ "model.vision_tower.encoder.layers.12.layer_norm2",
297
+ "model.vision_tower.encoder.layers.21.self_attn.v_proj",
298
+ "model.vision_tower.encoder.layers.17.self_attn.v_proj",
299
+ "model.vision_tower.encoder.layers.13.layer_norm1",
300
+ "model.vision_tower.encoder.layers.24.layer_norm2",
301
+ "model.vision_tower.encoder.layers.11.layer_norm1",
302
+ "model.vision_tower.encoder.layers.17.self_attn.out_proj",
303
+ "model.vision_tower.encoder.layers.3.mlp",
304
+ "model.vision_tower.encoder.layers.1.self_attn.k_proj",
305
+ "model.vision_tower.encoder.layers.20.self_attn",
306
+ "model.vision_tower.encoder.layers.23.self_attn.v_proj",
307
+ "model.vision_tower.encoder.layers.20.self_attn.q_proj",
308
+ "model.vision_tower.encoder.layers.26",
309
+ "model.vision_tower.encoder.layers.21.mlp",
310
+ "model.vision_tower.encoder.layers.19.layer_norm1",
311
+ "model.vision_tower.encoder.layers.18.self_attn.out_proj",
312
+ "model.vision_tower.encoder.layers.5.mlp",
313
+ "model.vision_tower.encoder.layers.3.self_attn.q_proj",
314
+ "model.vision_tower.encoder.layers.0.self_attn.v_proj",
315
+ "model.vision_tower.encoder.layers.2.mlp.fc1",
316
+ "model.vision_tower.encoder.layers.15.mlp",
317
+ "model.vision_tower.encoder.layers.0.mlp.fc1",
318
+ "model.vision_tower.encoder.layers.2.layer_norm1",
319
+ "model.vision_tower.encoder.layers.5.mlp.activation_fn",
320
+ "model.vision_tower.encoder.layers.17.mlp.activation_fn",
321
+ "model.vision_tower.encoder.layers.26.self_attn.k_proj",
322
+ "model.vision_tower.encoder.layers.11.layer_norm2",
323
+ "model.vision_tower.encoder.layers.13.mlp",
324
+ "model.vision_tower.encoder.layers.14.mlp.fc1",
325
+ "model.vision_tower.encoder.layers.4",
326
+ "model.vision_tower.encoder.layers.16",
327
+ "model.vision_tower.encoder.layers.25.layer_norm2",
328
+ "model.vision_tower.encoder.layers.0.mlp.activation_fn",
329
+ "model.vision_tower.encoder.layers.23.self_attn",
330
+ "model.vision_tower.encoder.layers.23.layer_norm1",
331
+ "model.vision_tower.encoder.layers.7",
332
+ "model.vision_tower.encoder.layers.8.mlp.fc1",
333
+ "model.vision_tower.encoder.layers.0.self_attn.out_proj",
334
+ "model.vision_tower.encoder.layers.20.mlp.activation_fn",
335
+ "model.vision_tower.encoder.layers.11.mlp.activation_fn",
336
+ "model.vision_tower.encoder.layers.15.self_attn.k_proj",
337
+ "model.vision_tower.encoder.layers.17.layer_norm2",
338
+ "model.vision_tower.encoder.layers.5.self_attn",
339
+ "model.vision_tower.encoder",
340
+ "model.vision_tower.encoder.layers.21.self_attn.k_proj",
341
+ "model.vision_tower.encoder.layers.26.mlp",
342
+ "model.vision_tower.encoder.layers.13.self_attn.out_proj"
343
+ ],
344
+ "fan_in_fan_out": false,
345
+ "inference_mode": true,
346
+ "init_lora_weights": true,
347
+ "layer_replication": null,
348
+ "layers_pattern": null,
349
+ "layers_to_transform": null,
350
+ "loftq_config": {},
351
+ "lora_alpha": 128,
352
+ "lora_bias": false,
353
+ "lora_dropout": 0.0,
354
+ "megatron_config": null,
355
+ "megatron_core": "megatron.core",
356
+ "modules_to_save": null,
357
+ "peft_type": "LORA",
358
+ "r": 64,
359
+ "rank_pattern": {},
360
+ "revision": null,
361
+ "target_modules": [
362
+ "q_proj",
363
+ "o_proj",
364
+ "v_proj",
365
+ "k_proj"
366
+ ],
367
+ "task_type": "CAUSAL_LM",
368
+ "trainable_token_indices": null,
369
+ "use_dora": false,
370
+ "use_rslora": false
371
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5c76d7d7bfc556f4b1c82f601e4217da1bad73603ebe487ee923c64966ca9878
3
+ size 536421768
chat_template.jinja ADDED
@@ -0,0 +1,47 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {{ bos_token }}
2
+ {%- if messages[0]['role'] == 'system' -%}
3
+ {%- if messages[0]['content'] is string -%}
4
+ {%- set first_user_prefix = messages[0]['content'] + '
5
+
6
+ ' -%}
7
+ {%- else -%}
8
+ {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
9
+
10
+ ' -%}
11
+ {%- endif -%}
12
+ {%- set loop_messages = messages[1:] -%}
13
+ {%- else -%}
14
+ {%- set first_user_prefix = "" -%}
15
+ {%- set loop_messages = messages -%}
16
+ {%- endif -%}
17
+ {%- for message in loop_messages -%}
18
+ {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
19
+ {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
20
+ {%- endif -%}
21
+ {%- if (message['role'] == 'assistant') -%}
22
+ {%- set role = "model" -%}
23
+ {%- else -%}
24
+ {%- set role = message['role'] -%}
25
+ {%- endif -%}
26
+ {{ '<start_of_turn>' + role + '
27
+ ' + (first_user_prefix if loop.first else "") }}
28
+ {%- if message['content'] is string -%}
29
+ {{ message['content'] | trim }}
30
+ {%- elif message['content'] is iterable -%}
31
+ {%- for item in message['content'] -%}
32
+ {%- if item['type'] == 'image' -%}
33
+ {{ '<start_of_image>' }}
34
+ {%- elif item['type'] == 'text' -%}
35
+ {{ item['text'] | trim }}
36
+ {%- endif -%}
37
+ {%- endfor -%}
38
+ {%- else -%}
39
+ {{ raise_exception("Invalid content type") }}
40
+ {%- endif -%}
41
+ {{ '<end_of_turn>
42
+ ' }}
43
+ {%- endfor -%}
44
+ {%- if add_generation_prompt -%}
45
+ {{'<start_of_turn>model
46
+ '}}
47
+ {%- endif -%}
config.json ADDED
@@ -0,0 +1,137 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Gemma3ForConditionalGeneration"
4
+ ],
5
+ "boi_token_index": 255999,
6
+ "bos_token_id": 2,
7
+ "dtype": "bfloat16",
8
+ "eoi_token_index": 256000,
9
+ "eos_token_id": 1,
10
+ "image_token_index": 262144,
11
+ "initializer_range": 0.02,
12
+ "mm_tokens_per_image": 256,
13
+ "model_type": "gemma3",
14
+ "pad_token_id": 0,
15
+ "text_config": {
16
+ "_sliding_window_pattern": 6,
17
+ "attention_bias": false,
18
+ "attention_dropout": 0.0,
19
+ "attn_logit_softcapping": null,
20
+ "bos_token_id": 2,
21
+ "dtype": "bfloat16",
22
+ "eos_token_id": 1,
23
+ "final_logit_softcapping": null,
24
+ "head_dim": 128,
25
+ "hidden_activation": "gelu_pytorch_tanh",
26
+ "hidden_size": 5376,
27
+ "initializer_range": 0.02,
28
+ "intermediate_size": 21504,
29
+ "layer_types": [
30
+ "sliding_attention",
31
+ "sliding_attention",
32
+ "sliding_attention",
33
+ "sliding_attention",
34
+ "sliding_attention",
35
+ "full_attention",
36
+ "sliding_attention",
37
+ "sliding_attention",
38
+ "sliding_attention",
39
+ "sliding_attention",
40
+ "sliding_attention",
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "sliding_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "sliding_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "sliding_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "sliding_attention",
63
+ "sliding_attention",
64
+ "sliding_attention",
65
+ "full_attention",
66
+ "sliding_attention",
67
+ "sliding_attention",
68
+ "sliding_attention",
69
+ "sliding_attention",
70
+ "sliding_attention",
71
+ "full_attention",
72
+ "sliding_attention",
73
+ "sliding_attention",
74
+ "sliding_attention",
75
+ "sliding_attention",
76
+ "sliding_attention",
77
+ "full_attention",
78
+ "sliding_attention",
79
+ "sliding_attention",
80
+ "sliding_attention",
81
+ "sliding_attention",
82
+ "sliding_attention",
83
+ "full_attention",
84
+ "sliding_attention",
85
+ "sliding_attention",
86
+ "sliding_attention",
87
+ "sliding_attention",
88
+ "sliding_attention",
89
+ "full_attention",
90
+ "sliding_attention",
91
+ "sliding_attention"
92
+ ],
93
+ "max_position_embeddings": 131072,
94
+ "model_type": "gemma3_text",
95
+ "num_attention_heads": 32,
96
+ "num_hidden_layers": 62,
97
+ "num_key_value_heads": 16,
98
+ "pad_token_id": 0,
99
+ "query_pre_attn_scalar": 168,
100
+ "rms_norm_eps": 1e-06,
101
+ "rope_parameters": {
102
+ "full_attention": {
103
+ "factor": 8.0,
104
+ "rope_theta": 1000000.0,
105
+ "rope_type": "linear"
106
+ },
107
+ "sliding_attention": {
108
+ "rope_theta": 10000.0,
109
+ "rope_type": "default"
110
+ }
111
+ },
112
+ "sliding_window": 1024,
113
+ "tie_word_embeddings": true,
114
+ "use_bidirectional_attention": false,
115
+ "use_cache": false,
116
+ "vocab_size": 262208,
117
+ "torch_dtype": "bfloat16"
118
+ },
119
+ "tie_word_embeddings": true,
120
+ "transformers_version": "5.10.1",
121
+ "use_cache": false,
122
+ "vision_config": {
123
+ "attention_dropout": 0.0,
124
+ "hidden_act": "gelu_pytorch_tanh",
125
+ "hidden_size": 1152,
126
+ "image_size": 896,
127
+ "intermediate_size": 4304,
128
+ "layer_norm_eps": 1e-06,
129
+ "model_type": "siglip_vision_model",
130
+ "num_attention_heads": 16,
131
+ "num_channels": 3,
132
+ "num_hidden_layers": 27,
133
+ "patch_size": 14,
134
+ "vision_use_head": false
135
+ },
136
+ "torch_dtype": "bfloat16"
137
+ }
preprocessor_config.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "do_convert_rgb": null,
3
+ "do_normalize": true,
4
+ "do_rescale": true,
5
+ "do_resize": true,
6
+ "image_mean": [
7
+ 0.5,
8
+ 0.5,
9
+ 0.5
10
+ ],
11
+ "image_processor_type": "Gemma3ImageProcessor",
12
+ "image_seq_length": 256,
13
+ "image_std": [
14
+ 0.5,
15
+ 0.5,
16
+ 0.5
17
+ ],
18
+ "resample": 2,
19
+ "rescale_factor": 0.00392156862745098,
20
+ "size": {
21
+ "height": 896,
22
+ "width": 896
23
+ }
24
+ }
processor_config.json ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": null,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "do_resize": true,
7
+ "image_mean": [
8
+ 0.5,
9
+ 0.5,
10
+ 0.5
11
+ ],
12
+ "image_processor_type": "Gemma3ImageProcessor",
13
+ "image_seq_length": 256,
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "resample": 2,
20
+ "rescale_factor": 0.00392156862745098,
21
+ "size": {
22
+ "height": 896,
23
+ "width": 896
24
+ }
25
+ },
26
+ "image_seq_length": 256,
27
+ "processor_class": "Gemma3Processor"
28
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "boi_token": "<start_of_image>",
3
+ "bos_token": "<bos>",
4
+ "eoi_token": "<end_of_image>",
5
+ "eos_token": "<eos>",
6
+ "image_token": "<image_soft_token>",
7
+ "mask_token": "<mask>",
8
+ "pad_token": "<pad>",
9
+ "unk_token": "<unk>"
10
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:daab2354f8a74e70d70b4d1f804939b68a8c9624dd06cb7858e52dd8970e9726
3
+ size 33384567
tokenizer_config.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "boi_token": "<start_of_image>",
4
+ "bos_token": "<bos>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eoi_token": "<end_of_image>",
7
+ "eos_token": "<eos>",
8
+ "image_token": "<image_soft_token>",
9
+ "is_local": false,
10
+ "local_files_only": true,
11
+ "mask_token": "<mask>",
12
+ "model_max_length": 32768,
13
+ "model_specific_special_tokens": {
14
+ "boi_token": "<start_of_image>",
15
+ "eoi_token": "<end_of_image>",
16
+ "image_token": "<image_soft_token>"
17
+ },
18
+ "pad_token": "<pad>",
19
+ "padding_side": "right",
20
+ "processor_class": "Gemma3Processor",
21
+ "sp_model_kwargs": null,
22
+ "spaces_between_special_tokens": false,
23
+ "tokenizer_class": "GemmaTokenizer",
24
+ "unk_token": "<unk>",
25
+ "use_default_system_prompt": false
26
+ }
trainer_state.json ADDED
@@ -0,0 +1,718 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 4.0,
6
+ "eval_steps": 18,
7
+ "global_step": 92,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.043478260869565216,
14
+ "grad_norm": 39.07209396362305,
15
+ "learning_rate": 0.0,
16
+ "loss": 12.15625,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.08695652173913043,
21
+ "grad_norm": 37.47832107543945,
22
+ "learning_rate": 1e-05,
23
+ "loss": 11.5390625,
24
+ "step": 2
25
+ },
26
+ {
27
+ "epoch": 0.13043478260869565,
28
+ "grad_norm": 34.37069320678711,
29
+ "learning_rate": 2e-05,
30
+ "loss": 10.71875,
31
+ "step": 3
32
+ },
33
+ {
34
+ "epoch": 0.17391304347826086,
35
+ "grad_norm": 24.194438934326172,
36
+ "learning_rate": 3e-05,
37
+ "loss": 7.98046875,
38
+ "step": 4
39
+ },
40
+ {
41
+ "epoch": 0.21739130434782608,
42
+ "grad_norm": 14.068402290344238,
43
+ "learning_rate": 4e-05,
44
+ "loss": 3.958984375,
45
+ "step": 5
46
+ },
47
+ {
48
+ "epoch": 0.2608695652173913,
49
+ "grad_norm": 9.06344223022461,
50
+ "learning_rate": 5e-05,
51
+ "loss": 2.19873046875,
52
+ "step": 6
53
+ },
54
+ {
55
+ "epoch": 0.30434782608695654,
56
+ "grad_norm": 3.2053747177124023,
57
+ "learning_rate": 4.9985332146267735e-05,
58
+ "loss": 0.994873046875,
59
+ "step": 7
60
+ },
61
+ {
62
+ "epoch": 0.34782608695652173,
63
+ "grad_norm": 3.3570635318756104,
64
+ "learning_rate": 4.994134770915388e-05,
65
+ "loss": 0.752288818359375,
66
+ "step": 8
67
+ },
68
+ {
69
+ "epoch": 0.391304347826087,
70
+ "grad_norm": 2.7033090591430664,
71
+ "learning_rate": 4.98681040359731e-05,
72
+ "loss": 0.448974609375,
73
+ "step": 9
74
+ },
75
+ {
76
+ "epoch": 0.43478260869565216,
77
+ "grad_norm": 1.9760388135910034,
78
+ "learning_rate": 4.9765696622501846e-05,
79
+ "loss": 0.547119140625,
80
+ "step": 10
81
+ },
82
+ {
83
+ "epoch": 0.4782608695652174,
84
+ "grad_norm": 1.2799606323242188,
85
+ "learning_rate": 4.963425898847006e-05,
86
+ "loss": 0.3215370178222656,
87
+ "step": 11
88
+ },
89
+ {
90
+ "epoch": 0.5217391304347826,
91
+ "grad_norm": 1.4340665340423584,
92
+ "learning_rate": 4.947396250347695e-05,
93
+ "loss": 0.594482421875,
94
+ "step": 12
95
+ },
96
+ {
97
+ "epoch": 0.5652173913043478,
98
+ "grad_norm": 1.2824798822402954,
99
+ "learning_rate": 4.928501616355768e-05,
100
+ "loss": 0.3077392578125,
101
+ "step": 13
102
+ },
103
+ {
104
+ "epoch": 0.6086956521739131,
105
+ "grad_norm": 0.7614466547966003,
106
+ "learning_rate": 4.906766631869243e-05,
107
+ "loss": 0.244140625,
108
+ "step": 14
109
+ },
110
+ {
111
+ "epoch": 0.6521739130434783,
112
+ "grad_norm": 0.7498453855514526,
113
+ "learning_rate": 4.882219635161306e-05,
114
+ "loss": 0.2913818359375,
115
+ "step": 15
116
+ },
117
+ {
118
+ "epoch": 0.6956521739130435,
119
+ "grad_norm": 0.5524697303771973,
120
+ "learning_rate": 4.854892630832603e-05,
121
+ "loss": 0.28388214111328125,
122
+ "step": 16
123
+ },
124
+ {
125
+ "epoch": 0.7391304347826086,
126
+ "grad_norm": 0.7023299932479858,
127
+ "learning_rate": 4.82482124808335e-05,
128
+ "loss": 0.28436279296875,
129
+ "step": 17
130
+ },
131
+ {
132
+ "epoch": 0.782608695652174,
133
+ "grad_norm": 0.4874381721019745,
134
+ "learning_rate": 4.7920446942596535e-05,
135
+ "loss": 0.32769775390625,
136
+ "step": 18
137
+ },
138
+ {
139
+ "epoch": 0.8260869565217391,
140
+ "grad_norm": 0.5234342813491821,
141
+ "learning_rate": 4.7566057037346104e-05,
142
+ "loss": 0.2855224609375,
143
+ "step": 19
144
+ },
145
+ {
146
+ "epoch": 0.8695652173913043,
147
+ "grad_norm": 0.5836489796638489,
148
+ "learning_rate": 4.718550482190837e-05,
149
+ "loss": 0.231414794921875,
150
+ "step": 20
151
+ },
152
+ {
153
+ "epoch": 0.8695652173913043,
154
+ "eval_loss": 0.2960205078125,
155
+ "eval_runtime": 5.8443,
156
+ "eval_samples_per_second": 0.513,
157
+ "eval_steps_per_second": 0.171,
158
+ "step": 20
159
+ },
160
+ {
161
+ "epoch": 0.9130434782608695,
162
+ "grad_norm": 0.520865797996521,
163
+ "learning_rate": 4.677928646377076e-05,
164
+ "loss": 0.2606201171875,
165
+ "step": 21
166
+ },
167
+ {
168
+ "epoch": 0.9565217391304348,
169
+ "grad_norm": 0.5242786407470703,
170
+ "learning_rate": 4.634793159417421e-05,
171
+ "loss": 0.314208984375,
172
+ "step": 22
173
+ },
174
+ {
175
+ "epoch": 1.0,
176
+ "grad_norm": 0.4516263008117676,
177
+ "learning_rate": 4.589200261757506e-05,
178
+ "loss": 0.267333984375,
179
+ "step": 23
180
+ },
181
+ {
182
+ "epoch": 1.0434782608695652,
183
+ "grad_norm": 0.42359301447868347,
184
+ "learning_rate": 4.5412093978376986e-05,
185
+ "loss": 0.224639892578125,
186
+ "step": 24
187
+ },
188
+ {
189
+ "epoch": 1.0869565217391304,
190
+ "grad_norm": 0.36964306235313416,
191
+ "learning_rate": 4.490883138588882e-05,
192
+ "loss": 0.26383209228515625,
193
+ "step": 25
194
+ },
195
+ {
196
+ "epoch": 1.1304347826086956,
197
+ "grad_norm": 0.6183728575706482,
198
+ "learning_rate": 4.438287099851905e-05,
199
+ "loss": 0.228271484375,
200
+ "step": 26
201
+ },
202
+ {
203
+ "epoch": 1.1739130434782608,
204
+ "grad_norm": 0.7323199510574341,
205
+ "learning_rate": 4.3834898568270444e-05,
206
+ "loss": 0.22613072395324707,
207
+ "step": 27
208
+ },
209
+ {
210
+ "epoch": 1.2173913043478262,
211
+ "grad_norm": 0.5516233444213867,
212
+ "learning_rate": 4.326562854665021e-05,
213
+ "loss": 0.14371299743652344,
214
+ "step": 28
215
+ },
216
+ {
217
+ "epoch": 1.2608695652173914,
218
+ "grad_norm": 0.90989750623703,
219
+ "learning_rate": 4.2675803153161565e-05,
220
+ "loss": 0.373046875,
221
+ "step": 29
222
+ },
223
+ {
224
+ "epoch": 1.3043478260869565,
225
+ "grad_norm": 0.7089672088623047,
226
+ "learning_rate": 4.2066191407591125e-05,
227
+ "loss": 0.20618438720703125,
228
+ "step": 30
229
+ },
230
+ {
231
+ "epoch": 1.3478260869565217,
232
+ "grad_norm": 0.9005956649780273,
233
+ "learning_rate": 4.1437588127353774e-05,
234
+ "loss": 0.22583389282226562,
235
+ "step": 31
236
+ },
237
+ {
238
+ "epoch": 1.391304347826087,
239
+ "grad_norm": 0.7037151455879211,
240
+ "learning_rate": 4.07908128912024e-05,
241
+ "loss": 0.2068347930908203,
242
+ "step": 32
243
+ },
244
+ {
245
+ "epoch": 1.434782608695652,
246
+ "grad_norm": 0.5921205282211304,
247
+ "learning_rate": 4.012670897065361e-05,
248
+ "loss": 0.18936920166015625,
249
+ "step": 33
250
+ },
251
+ {
252
+ "epoch": 1.4782608695652173,
253
+ "grad_norm": 0.31155166029930115,
254
+ "learning_rate": 3.944614223052245e-05,
255
+ "loss": 0.1267108917236328,
256
+ "step": 34
257
+ },
258
+ {
259
+ "epoch": 1.5217391304347827,
260
+ "grad_norm": 0.7871601581573486,
261
+ "learning_rate": 3.875e-05,
262
+ "loss": 0.25548815727233887,
263
+ "step": 35
264
+ },
265
+ {
266
+ "epoch": 1.5652173913043477,
267
+ "grad_norm": 1.0059878826141357,
268
+ "learning_rate": 3.803918991574528e-05,
269
+ "loss": 0.16361236572265625,
270
+ "step": 36
271
+ },
272
+ {
273
+ "epoch": 1.608695652173913,
274
+ "grad_norm": 0.8261852860450745,
275
+ "learning_rate": 3.7314638738500265e-05,
276
+ "loss": 0.11863207817077637,
277
+ "step": 37
278
+ },
279
+ {
280
+ "epoch": 1.6521739130434783,
281
+ "grad_norm": 0.5391600728034973,
282
+ "learning_rate": 3.65772911447707e-05,
283
+ "loss": 0.172882080078125,
284
+ "step": 38
285
+ },
286
+ {
287
+ "epoch": 1.6521739130434783,
288
+ "eval_loss": 0.21588134765625,
289
+ "eval_runtime": 4.9269,
290
+ "eval_samples_per_second": 0.609,
291
+ "eval_steps_per_second": 0.203,
292
+ "step": 38
293
+ },
294
+ {
295
+ "epoch": 1.6956521739130435,
296
+ "grad_norm": 0.7111477851867676,
297
+ "learning_rate": 3.582810849514808e-05,
298
+ "loss": 0.16753196716308594,
299
+ "step": 39
300
+ },
301
+ {
302
+ "epoch": 1.7391304347826086,
303
+ "grad_norm": 0.4621718227863312,
304
+ "learning_rate": 3.506806758087894e-05,
305
+ "loss": 0.14367055892944336,
306
+ "step": 40
307
+ },
308
+ {
309
+ "epoch": 1.7826086956521738,
310
+ "grad_norm": 0.8741061091423035,
311
+ "learning_rate": 3.429815935031538e-05,
312
+ "loss": 0.16303253173828125,
313
+ "step": 41
314
+ },
315
+ {
316
+ "epoch": 1.8260869565217392,
317
+ "grad_norm": 1.102018117904663,
318
+ "learning_rate": 3.351938761690748e-05,
319
+ "loss": 0.205902099609375,
320
+ "step": 42
321
+ },
322
+ {
323
+ "epoch": 1.8695652173913042,
324
+ "grad_norm": 0.7496725916862488,
325
+ "learning_rate": 3.273276775042199e-05,
326
+ "loss": 0.14171886444091797,
327
+ "step": 43
328
+ },
329
+ {
330
+ "epoch": 1.9130434782608696,
331
+ "grad_norm": 0.7663282155990601,
332
+ "learning_rate": 3.1939325353094e-05,
333
+ "loss": 0.14968395233154297,
334
+ "step": 44
335
+ },
336
+ {
337
+ "epoch": 1.9565217391304348,
338
+ "grad_norm": 0.3884790241718292,
339
+ "learning_rate": 3.114009492243721e-05,
340
+ "loss": 0.15384674072265625,
341
+ "step": 45
342
+ },
343
+ {
344
+ "epoch": 2.0,
345
+ "grad_norm": 0.5156270861625671,
346
+ "learning_rate": 3.033611850245651e-05,
347
+ "loss": 0.1345977783203125,
348
+ "step": 46
349
+ },
350
+ {
351
+ "epoch": 2.0434782608695654,
352
+ "grad_norm": 0.5794659852981567,
353
+ "learning_rate": 2.9528444325021477e-05,
354
+ "loss": 0.12321662902832031,
355
+ "step": 47
356
+ },
357
+ {
358
+ "epoch": 2.0869565217391304,
359
+ "grad_norm": 0.36416205763816833,
360
+ "learning_rate": 2.87181254431719e-05,
361
+ "loss": 0.14786148071289062,
362
+ "step": 48
363
+ },
364
+ {
365
+ "epoch": 2.130434782608696,
366
+ "grad_norm": 0.5249211192131042,
367
+ "learning_rate": 2.790621835813761e-05,
368
+ "loss": 0.1492919921875,
369
+ "step": 49
370
+ },
371
+ {
372
+ "epoch": 2.1739130434782608,
373
+ "grad_norm": 0.4051743745803833,
374
+ "learning_rate": 2.7093781641862387e-05,
375
+ "loss": 0.0952908992767334,
376
+ "step": 50
377
+ },
378
+ {
379
+ "epoch": 2.217391304347826,
380
+ "grad_norm": 0.26149407029151917,
381
+ "learning_rate": 2.6281874556828108e-05,
382
+ "loss": 0.08324813842773438,
383
+ "step": 51
384
+ },
385
+ {
386
+ "epoch": 2.260869565217391,
387
+ "grad_norm": 0.5549029111862183,
388
+ "learning_rate": 2.547155567497854e-05,
389
+ "loss": 0.2025146484375,
390
+ "step": 52
391
+ },
392
+ {
393
+ "epoch": 2.3043478260869565,
394
+ "grad_norm": 0.3528760075569153,
395
+ "learning_rate": 2.4663881497543495e-05,
396
+ "loss": 0.14881134033203125,
397
+ "step": 53
398
+ },
399
+ {
400
+ "epoch": 2.3478260869565215,
401
+ "grad_norm": 0.5280032753944397,
402
+ "learning_rate": 2.3859905077562796e-05,
403
+ "loss": 0.176971435546875,
404
+ "step": 54
405
+ },
406
+ {
407
+ "epoch": 2.391304347826087,
408
+ "grad_norm": 0.2940866947174072,
409
+ "learning_rate": 2.3060674646906004e-05,
410
+ "loss": 0.11214065551757812,
411
+ "step": 55
412
+ },
413
+ {
414
+ "epoch": 2.4347826086956523,
415
+ "grad_norm": 0.46992143988609314,
416
+ "learning_rate": 2.2267232249578024e-05,
417
+ "loss": 0.1177825927734375,
418
+ "step": 56
419
+ },
420
+ {
421
+ "epoch": 2.4347826086956523,
422
+ "eval_loss": 0.20440673828125,
423
+ "eval_runtime": 4.915,
424
+ "eval_samples_per_second": 0.61,
425
+ "eval_steps_per_second": 0.203,
426
+ "step": 56
427
+ },
428
+ {
429
+ "epoch": 2.4782608695652173,
430
+ "grad_norm": 0.3323771357536316,
431
+ "learning_rate": 2.1480612383092536e-05,
432
+ "loss": 0.09143924713134766,
433
+ "step": 57
434
+ },
435
+ {
436
+ "epoch": 2.5217391304347827,
437
+ "grad_norm": 0.46137872338294983,
438
+ "learning_rate": 2.0701840649684613e-05,
439
+ "loss": 0.15516090393066406,
440
+ "step": 58
441
+ },
442
+ {
443
+ "epoch": 2.5652173913043477,
444
+ "grad_norm": 0.26286780834198,
445
+ "learning_rate": 1.993193241912106e-05,
446
+ "loss": 0.06685352325439453,
447
+ "step": 59
448
+ },
449
+ {
450
+ "epoch": 2.608695652173913,
451
+ "grad_norm": 0.2798925042152405,
452
+ "learning_rate": 1.9171891504851925e-05,
453
+ "loss": 0.0812065601348877,
454
+ "step": 60
455
+ },
456
+ {
457
+ "epoch": 2.6521739130434785,
458
+ "grad_norm": 0.40160560607910156,
459
+ "learning_rate": 1.842270885522931e-05,
460
+ "loss": 0.07373046875,
461
+ "step": 61
462
+ },
463
+ {
464
+ "epoch": 2.6956521739130435,
465
+ "grad_norm": 0.4648759067058563,
466
+ "learning_rate": 1.7685361261499733e-05,
467
+ "loss": 0.08234977722167969,
468
+ "step": 62
469
+ },
470
+ {
471
+ "epoch": 2.7391304347826084,
472
+ "grad_norm": 0.22807049751281738,
473
+ "learning_rate": 1.6960810084254726e-05,
474
+ "loss": 0.0868840217590332,
475
+ "step": 63
476
+ },
477
+ {
478
+ "epoch": 2.782608695652174,
479
+ "grad_norm": 0.3399467468261719,
480
+ "learning_rate": 1.6250000000000005e-05,
481
+ "loss": 0.083984375,
482
+ "step": 64
483
+ },
484
+ {
485
+ "epoch": 2.8260869565217392,
486
+ "grad_norm": 0.5082715153694153,
487
+ "learning_rate": 1.5553857769477553e-05,
488
+ "loss": 0.10441970825195312,
489
+ "step": 65
490
+ },
491
+ {
492
+ "epoch": 2.869565217391304,
493
+ "grad_norm": 0.47074776887893677,
494
+ "learning_rate": 1.48732910293464e-05,
495
+ "loss": 0.07005095481872559,
496
+ "step": 66
497
+ },
498
+ {
499
+ "epoch": 2.9130434782608696,
500
+ "grad_norm": 0.7794228196144104,
501
+ "learning_rate": 1.4209187108797607e-05,
502
+ "loss": 0.10682344436645508,
503
+ "step": 67
504
+ },
505
+ {
506
+ "epoch": 2.9565217391304346,
507
+ "grad_norm": 0.260376900434494,
508
+ "learning_rate": 1.3562411872646235e-05,
509
+ "loss": 0.09476900100708008,
510
+ "step": 68
511
+ },
512
+ {
513
+ "epoch": 3.0,
514
+ "grad_norm": 0.21531462669372559,
515
+ "learning_rate": 1.293380859240888e-05,
516
+ "loss": 0.047382354736328125,
517
+ "step": 69
518
+ },
519
+ {
520
+ "epoch": 3.0434782608695654,
521
+ "grad_norm": 0.2740839123725891,
522
+ "learning_rate": 1.232419684683844e-05,
523
+ "loss": 0.0454249382019043,
524
+ "step": 70
525
+ },
526
+ {
527
+ "epoch": 3.0869565217391304,
528
+ "grad_norm": 0.37194937467575073,
529
+ "learning_rate": 1.1734371453349799e-05,
530
+ "loss": 0.0704050064086914,
531
+ "step": 71
532
+ },
533
+ {
534
+ "epoch": 3.130434782608696,
535
+ "grad_norm": 0.3591350317001343,
536
+ "learning_rate": 1.1165101431729561e-05,
537
+ "loss": 0.08895111083984375,
538
+ "step": 72
539
+ },
540
+ {
541
+ "epoch": 3.1739130434782608,
542
+ "grad_norm": 0.21049781143665314,
543
+ "learning_rate": 1.0617129001480949e-05,
544
+ "loss": 0.044961631298065186,
545
+ "step": 73
546
+ },
547
+ {
548
+ "epoch": 3.217391304347826,
549
+ "grad_norm": 0.11901774257421494,
550
+ "learning_rate": 1.0091168614111182e-05,
551
+ "loss": 0.01461946964263916,
552
+ "step": 74
553
+ },
554
+ {
555
+ "epoch": 3.217391304347826,
556
+ "eval_loss": 0.19732666015625,
557
+ "eval_runtime": 4.9262,
558
+ "eval_samples_per_second": 0.609,
559
+ "eval_steps_per_second": 0.203,
560
+ "step": 74
561
+ },
562
+ {
563
+ "epoch": 3.260869565217391,
564
+ "grad_norm": 0.5734399557113647,
565
+ "learning_rate": 9.587906021623016e-06,
566
+ "loss": 0.12098979949951172,
567
+ "step": 75
568
+ },
569
+ {
570
+ "epoch": 3.3043478260869565,
571
+ "grad_norm": 0.5726773738861084,
572
+ "learning_rate": 9.107997382424935e-06,
573
+ "loss": 0.06650257110595703,
574
+ "step": 76
575
+ },
576
+ {
577
+ "epoch": 3.3478260869565215,
578
+ "grad_norm": 0.5507848858833313,
579
+ "learning_rate": 8.652068405825798e-06,
580
+ "loss": 0.11254596710205078,
581
+ "step": 77
582
+ },
583
+ {
584
+ "epoch": 3.391304347826087,
585
+ "grad_norm": 0.23698930442333221,
586
+ "learning_rate": 8.220713536229247e-06,
587
+ "loss": 0.07490479946136475,
588
+ "step": 78
589
+ },
590
+ {
591
+ "epoch": 3.4347826086956523,
592
+ "grad_norm": 0.3934122622013092,
593
+ "learning_rate": 7.814495178091634e-06,
594
+ "loss": 0.05574750900268555,
595
+ "step": 79
596
+ },
597
+ {
598
+ "epoch": 3.4782608695652173,
599
+ "grad_norm": 0.19300000369548798,
600
+ "learning_rate": 7.4339429626539e-06,
601
+ "loss": 0.06278634071350098,
602
+ "step": 80
603
+ },
604
+ {
605
+ "epoch": 3.5217391304347827,
606
+ "grad_norm": 0.3946453332901001,
607
+ "learning_rate": 7.079553057403471e-06,
608
+ "loss": 0.09804105758666992,
609
+ "step": 81
610
+ },
611
+ {
612
+ "epoch": 3.5652173913043477,
613
+ "grad_norm": 0.2676098644733429,
614
+ "learning_rate": 6.751787519166505e-06,
615
+ "loss": 0.045120954513549805,
616
+ "step": 82
617
+ },
618
+ {
619
+ "epoch": 3.608695652173913,
620
+ "grad_norm": 0.25669530034065247,
621
+ "learning_rate": 6.451073691673979e-06,
622
+ "loss": 0.04766273498535156,
623
+ "step": 83
624
+ },
625
+ {
626
+ "epoch": 3.6521739130434785,
627
+ "grad_norm": 0.1960737109184265,
628
+ "learning_rate": 6.177803648386948e-06,
629
+ "loss": 0.030242919921875,
630
+ "step": 84
631
+ },
632
+ {
633
+ "epoch": 3.6956521739130435,
634
+ "grad_norm": 0.35025930404663086,
635
+ "learning_rate": 5.932333681307571e-06,
636
+ "loss": 0.04735755920410156,
637
+ "step": 85
638
+ },
639
+ {
640
+ "epoch": 3.7391304347826084,
641
+ "grad_norm": 0.2209789752960205,
642
+ "learning_rate": 5.714983836442326e-06,
643
+ "loss": 0.061261892318725586,
644
+ "step": 86
645
+ },
646
+ {
647
+ "epoch": 3.782608695652174,
648
+ "grad_norm": 0.24673958122730255,
649
+ "learning_rate": 5.526037496523051e-06,
650
+ "loss": 0.05185413360595703,
651
+ "step": 87
652
+ },
653
+ {
654
+ "epoch": 3.8260869565217392,
655
+ "grad_norm": 0.28059279918670654,
656
+ "learning_rate": 5.36574101152994e-06,
657
+ "loss": 0.0604095458984375,
658
+ "step": 88
659
+ },
660
+ {
661
+ "epoch": 3.869565217391304,
662
+ "grad_norm": 0.6097232103347778,
663
+ "learning_rate": 5.234303377498163e-06,
664
+ "loss": 0.0322948694229126,
665
+ "step": 89
666
+ },
667
+ {
668
+ "epoch": 3.9130434782608696,
669
+ "grad_norm": 0.42037317156791687,
670
+ "learning_rate": 5.1318959640269095e-06,
671
+ "loss": 0.0640861988067627,
672
+ "step": 90
673
+ },
674
+ {
675
+ "epoch": 3.9565217391304346,
676
+ "grad_norm": 0.22852636873722076,
677
+ "learning_rate": 5.058652290846131e-06,
678
+ "loss": 0.07720410823822021,
679
+ "step": 91
680
+ },
681
+ {
682
+ "epoch": 4.0,
683
+ "grad_norm": 0.13465619087219238,
684
+ "learning_rate": 5.014667853732269e-06,
685
+ "loss": 0.02185821533203125,
686
+ "step": 92
687
+ },
688
+ {
689
+ "epoch": 4.0,
690
+ "eval_loss": 0.2081298828125,
691
+ "eval_runtime": 4.9238,
692
+ "eval_samples_per_second": 0.609,
693
+ "eval_steps_per_second": 0.203,
694
+ "step": 92
695
+ }
696
+ ],
697
+ "logging_steps": 1.0,
698
+ "max_steps": 92,
699
+ "num_input_tokens_seen": 0,
700
+ "num_train_epochs": 4,
701
+ "save_steps": 0,
702
+ "stateful_callbacks": {
703
+ "TrainerControl": {
704
+ "args": {
705
+ "should_epoch_stop": false,
706
+ "should_evaluate": false,
707
+ "should_log": false,
708
+ "should_save": true,
709
+ "should_training_stop": true
710
+ },
711
+ "attributes": {}
712
+ }
713
+ },
714
+ "total_flos": 5.0147843800825856e+17,
715
+ "train_batch_size": 1,
716
+ "trial_name": null,
717
+ "trial_params": null
718
+ }
training-metrics.png ADDED

Git LFS Details

  • SHA256: 28fe7294c70a4a24154a99ede854160f607dd79f09854e7353fadfa891e41031
  • Pointer size: 131 Bytes
  • Size of remote file: 124 kB
win-rates.png ADDED