arielcerdap commited on
Commit
23191c1
·
verified ·
1 Parent(s): 5c705ea

Upload expA_realonly — Macro F1=0.7497

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +1 -0
  2. README.md +44 -0
  3. checkpoint-1150/config.json +93 -0
  4. checkpoint-1150/model.safetensors +3 -0
  5. checkpoint-1150/optimizer.pt +3 -0
  6. checkpoint-1150/rng_state.pth +3 -0
  7. checkpoint-1150/scheduler.pt +3 -0
  8. checkpoint-1150/tokenizer.json +0 -0
  9. checkpoint-1150/tokenizer_config.json +16 -0
  10. checkpoint-1150/trainer_state.json +648 -0
  11. checkpoint-1150/training_args.bin +3 -0
  12. checkpoint-1200/config.json +93 -0
  13. checkpoint-1200/model.safetensors +3 -0
  14. checkpoint-1200/optimizer.pt +3 -0
  15. checkpoint-1200/rng_state.pth +3 -0
  16. checkpoint-1200/scheduler.pt +3 -0
  17. checkpoint-1200/tokenizer.json +0 -0
  18. checkpoint-1200/tokenizer_config.json +16 -0
  19. checkpoint-1200/trainer_state.json +674 -0
  20. checkpoint-1200/training_args.bin +3 -0
  21. checkpoint-1250/config.json +93 -0
  22. checkpoint-1250/model.safetensors +3 -0
  23. checkpoint-1250/optimizer.pt +3 -0
  24. checkpoint-1250/rng_state.pth +3 -0
  25. checkpoint-1250/scheduler.pt +3 -0
  26. checkpoint-1250/tokenizer.json +0 -0
  27. checkpoint-1250/tokenizer_config.json +16 -0
  28. checkpoint-1250/trainer_state.json +700 -0
  29. checkpoint-1250/training_args.bin +3 -0
  30. checkpoint-1290/config.json +93 -0
  31. checkpoint-1290/model.safetensors +3 -0
  32. checkpoint-1290/optimizer.pt +3 -0
  33. checkpoint-1290/rng_state.pth +3 -0
  34. checkpoint-1290/scheduler.pt +3 -0
  35. checkpoint-1290/tokenizer.json +0 -0
  36. checkpoint-1290/tokenizer_config.json +16 -0
  37. checkpoint-1290/trainer_state.json +707 -0
  38. checkpoint-1290/training_args.bin +3 -0
  39. checkpoint-900/config.json +93 -0
  40. checkpoint-900/model.safetensors +3 -0
  41. checkpoint-900/optimizer.pt +3 -0
  42. checkpoint-900/rng_state.pth +3 -0
  43. checkpoint-900/scheduler.pt +3 -0
  44. checkpoint-900/tokenizer.json +0 -0
  45. checkpoint-900/tokenizer_config.json +16 -0
  46. checkpoint-900/trainer_state.json +518 -0
  47. checkpoint-900/training_args.bin +3 -0
  48. config.json +93 -0
  49. confusion_matrix.png +3 -0
  50. model.safetensors +3 -0
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ confusion_matrix.png filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language: en
3
+ tags:
4
+ - disfluency-detection
5
+ - token-classification
6
+ - modernbert
7
+ - speech-pathology
8
+ datasets:
9
+ - arielcerdap/disfluency-fluencybank
10
+ ---
11
+
12
+ # ModernBERT Disfluency Detection — Exp A (Real Only)
13
+
14
+ Fine-tuned from [answerdotai/ModernBERT-base](https://huggingface.co/answerdotai/ModernBERT-base) on **real-only** FluencyBank Timestamped data.
15
+
16
+ ## Dataset
17
+ - Config: `real_only` de `arielcerdap/disfluency-fluencybank`
18
+ - Train: 2737 segmentos (100% reales)
19
+ - Val/Test: idénticos a Exp B para comparación directa
20
+
21
+ ## Labels
22
+ O · FP (filled pause) · RP (repetition) · RV (revision) · PW (partial word)
23
+
24
+ ## Test Results
25
+ | Label | P | R | F1 | Support |
26
+ |---|---|---|---|---|
27
+ | Label | P | R | F1 | Support |
28
+ |---|---|---|---|---|
29
+ | O | 0.9783 | 0.9860 | 0.9821 | 3704 |
30
+ | FP | 0.9888 | 1.0000 | 0.9944 | 176 |
31
+ | RP | 0.7784 | 0.8276 | 0.8022 | 174 |
32
+ | RV | 0.3425 | 0.2907 | 0.3145 | 86 |
33
+ | PW | 0.9510 | 0.8326 | 0.8879 | 233 |
34
+
35
+ **Macro F1 (4 disfluencias):** 0.7497
36
+ **Binary F1:** 0.8902
37
+
38
+ ## Hyperparameters
39
+ - learning_rate: 5e-05
40
+ - epochs: 15
41
+ - warmup_steps: 191
42
+ - weight_decay: 0.1
43
+ - focal_loss_gamma: 3.0 (adaptive)
44
+ - class_weights: O=1.0, FP=3.0, RP=6.0, RV=20.0, PW=5.0
checkpoint-1150/config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
checkpoint-1150/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9fe599a9062d1719b36d7d693acb165b9ceafb108745f3aaa96e7c3fbd6d80df
3
+ size 598449012
checkpoint-1150/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:58e2e22c08d1f829c9d785c3007330b102ec531b9b4e3820da84947c055d7a6e
3
+ size 535150859
checkpoint-1150/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b460537a835f7b49654e8de244b9d79b4b0a060dfef532490dc117a2d7554dc2
3
+ size 14709
checkpoint-1150/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8ca20107812a9e91be5d7494a624d5425b7eb5a4c316b6395d44eeb4545bb878
3
+ size 1465
checkpoint-1150/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1150/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "is_local": false,
6
+ "mask_token": "[MASK]",
7
+ "model_input_names": [
8
+ "input_ids",
9
+ "attention_mask"
10
+ ],
11
+ "model_max_length": 8192,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-1150/trainer_state.json ADDED
@@ -0,0 +1,648 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 900,
3
+ "best_metric": 0.8228043143297381,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900",
5
+ "epoch": 13.372093023255815,
6
+ "eval_steps": 50,
7
+ "global_step": 1150,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011627906976744186,
14
+ "grad_norm": 4.9740142822265625,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.317932665348053,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.29069767441860467,
21
+ "grad_norm": 1.5566426515579224,
22
+ "learning_rate": 6.282722513089005e-06,
23
+ "loss": 0.3199571371078491,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.5813953488372093,
28
+ "grad_norm": 1.6379677057266235,
29
+ "learning_rate": 1.2827225130890053e-05,
30
+ "loss": 0.24125898361206055,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.5813953488372093,
35
+ "eval_accuracy": 0.8287126584998925,
36
+ "eval_f1": 0.08611410118406888,
37
+ "eval_loss": 0.10772959887981415,
38
+ "eval_precision": 0.15810276679841898,
39
+ "eval_recall": 0.05917159763313609,
40
+ "eval_runtime": 4.2273,
41
+ "eval_samples_per_second": 80.667,
42
+ "eval_steps_per_second": 1.419,
43
+ "step": 50
44
+ },
45
+ {
46
+ "epoch": 0.872093023255814,
47
+ "grad_norm": 8.703161239624023,
48
+ "learning_rate": 1.93717277486911e-05,
49
+ "loss": 0.20946041107177735,
50
+ "step": 75
51
+ },
52
+ {
53
+ "epoch": 1.1627906976744187,
54
+ "grad_norm": 0.9212121963500977,
55
+ "learning_rate": 2.591623036649215e-05,
56
+ "loss": 0.19275867462158203,
57
+ "step": 100
58
+ },
59
+ {
60
+ "epoch": 1.1627906976744187,
61
+ "eval_accuracy": 0.7635933806146572,
62
+ "eval_f1": 0.3981945837512538,
63
+ "eval_loss": 0.07719173282384872,
64
+ "eval_precision": 0.30121396054628224,
65
+ "eval_recall": 0.5872781065088757,
66
+ "eval_runtime": 1.6016,
67
+ "eval_samples_per_second": 212.909,
68
+ "eval_steps_per_second": 3.746,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 1.4534883720930232,
73
+ "grad_norm": 1.46477210521698,
74
+ "learning_rate": 3.246073298429319e-05,
75
+ "loss": 0.14603865623474122,
76
+ "step": 125
77
+ },
78
+ {
79
+ "epoch": 1.744186046511628,
80
+ "grad_norm": 3.729416608810425,
81
+ "learning_rate": 3.900523560209424e-05,
82
+ "loss": 0.13855588912963868,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 1.744186046511628,
87
+ "eval_accuracy": 0.81130453470879,
88
+ "eval_f1": 0.46785521339816316,
89
+ "eval_loss": 0.06223325803875923,
90
+ "eval_precision": 0.36851063829787234,
91
+ "eval_recall": 0.6405325443786982,
92
+ "eval_runtime": 1.5906,
93
+ "eval_samples_per_second": 214.385,
94
+ "eval_steps_per_second": 3.772,
95
+ "step": 150
96
+ },
97
+ {
98
+ "epoch": 2.0348837209302326,
99
+ "grad_norm": 1.2140589952468872,
100
+ "learning_rate": 4.554973821989529e-05,
101
+ "loss": 0.09624839782714843,
102
+ "step": 175
103
+ },
104
+ {
105
+ "epoch": 2.3255813953488373,
106
+ "grad_norm": 0.875888466835022,
107
+ "learning_rate": 4.999346304613061e-05,
108
+ "loss": 0.0821054744720459,
109
+ "step": 200
110
+ },
111
+ {
112
+ "epoch": 2.3255813953488373,
113
+ "eval_accuracy": 0.7872340425531915,
114
+ "eval_f1": 0.4847619047619048,
115
+ "eval_loss": 0.04723217338323593,
116
+ "eval_precision": 0.3574438202247191,
117
+ "eval_recall": 0.7529585798816568,
118
+ "eval_runtime": 1.6255,
119
+ "eval_samples_per_second": 209.777,
120
+ "eval_steps_per_second": 3.691,
121
+ "step": 200
122
+ },
123
+ {
124
+ "epoch": 2.616279069767442,
125
+ "grad_norm": 1.0979472398757935,
126
+ "learning_rate": 4.98888472605987e-05,
127
+ "loss": 0.08414460182189941,
128
+ "step": 225
129
+ },
130
+ {
131
+ "epoch": 2.9069767441860463,
132
+ "grad_norm": 0.49558770656585693,
133
+ "learning_rate": 4.965717280180432e-05,
134
+ "loss": 0.08369583129882813,
135
+ "step": 250
136
+ },
137
+ {
138
+ "epoch": 2.9069767441860463,
139
+ "eval_accuracy": 0.6211046636578551,
140
+ "eval_f1": 0.3483915126625599,
141
+ "eval_loss": 0.045315902680158615,
142
+ "eval_precision": 0.22662511130899377,
143
+ "eval_recall": 0.7529585798816568,
144
+ "eval_runtime": 1.6274,
145
+ "eval_samples_per_second": 209.539,
146
+ "eval_steps_per_second": 3.687,
147
+ "step": 250
148
+ },
149
+ {
150
+ "epoch": 3.197674418604651,
151
+ "grad_norm": 0.8114362955093384,
152
+ "learning_rate": 4.9299622378173246e-05,
153
+ "loss": 0.05607881069183349,
154
+ "step": 275
155
+ },
156
+ {
157
+ "epoch": 3.488372093023256,
158
+ "grad_norm": 0.6278374195098877,
159
+ "learning_rate": 4.881802130053548e-05,
160
+ "loss": 0.043469696044921874,
161
+ "step": 300
162
+ },
163
+ {
164
+ "epoch": 3.488372093023256,
165
+ "eval_accuracy": 0.8082957231893402,
166
+ "eval_f1": 0.5285784074255008,
167
+ "eval_loss": 0.04308881610631943,
168
+ "eval_precision": 0.39460247994164843,
169
+ "eval_recall": 0.8002958579881657,
170
+ "eval_runtime": 1.6193,
171
+ "eval_samples_per_second": 210.585,
172
+ "eval_steps_per_second": 3.705,
173
+ "step": 300
174
+ },
175
+ {
176
+ "epoch": 3.7790697674418605,
177
+ "grad_norm": 1.0219486951828003,
178
+ "learning_rate": 4.821482816383218e-05,
179
+ "loss": 0.047760300636291504,
180
+ "step": 325
181
+ },
182
+ {
183
+ "epoch": 4.069767441860465,
184
+ "grad_norm": 0.509274959564209,
185
+ "learning_rate": 4.749312229587908e-05,
186
+ "loss": 0.03177810907363891,
187
+ "step": 350
188
+ },
189
+ {
190
+ "epoch": 4.069767441860465,
191
+ "eval_accuracy": 0.9196217494089834,
192
+ "eval_f1": 0.7152317880794702,
193
+ "eval_loss": 0.04378104954957962,
194
+ "eval_precision": 0.6474820143884892,
195
+ "eval_recall": 0.7988165680473372,
196
+ "eval_runtime": 1.6177,
197
+ "eval_samples_per_second": 210.792,
198
+ "eval_steps_per_second": 3.709,
199
+ "step": 350
200
+ },
201
+ {
202
+ "epoch": 4.3604651162790695,
203
+ "grad_norm": 0.47098585963249207,
204
+ "learning_rate": 4.6656588037260834e-05,
205
+ "loss": 0.020146708488464355,
206
+ "step": 375
207
+ },
208
+ {
209
+ "epoch": 4.651162790697675,
210
+ "grad_norm": 0.7534321546554565,
211
+ "learning_rate": 4.570949593260837e-05,
212
+ "loss": 0.018921481370925905,
213
+ "step": 400
214
+ },
215
+ {
216
+ "epoch": 4.651162790697675,
217
+ "eval_accuracy": 0.9097356544165055,
218
+ "eval_f1": 0.6987341772151898,
219
+ "eval_loss": 0.05498046055436134,
220
+ "eval_precision": 0.6106194690265486,
221
+ "eval_recall": 0.8165680473372781,
222
+ "eval_runtime": 1.6157,
223
+ "eval_samples_per_second": 211.05,
224
+ "eval_steps_per_second": 3.713,
225
+ "step": 400
226
+ },
227
+ {
228
+ "epoch": 4.941860465116279,
229
+ "grad_norm": 0.7499828934669495,
230
+ "learning_rate": 4.465668092927841e-05,
231
+ "loss": 0.01998784065246582,
232
+ "step": 425
233
+ },
234
+ {
235
+ "epoch": 5.232558139534884,
236
+ "grad_norm": 0.24809418618679047,
237
+ "learning_rate": 4.350351769473198e-05,
238
+ "loss": 0.01218403697013855,
239
+ "step": 450
240
+ },
241
+ {
242
+ "epoch": 5.232558139534884,
243
+ "eval_accuracy": 0.9084461637653127,
244
+ "eval_f1": 0.6831746031746032,
245
+ "eval_loss": 0.05535344406962395,
246
+ "eval_precision": 0.5984427141268076,
247
+ "eval_recall": 0.7958579881656804,
248
+ "eval_runtime": 1.6123,
249
+ "eval_samples_per_second": 211.498,
250
+ "eval_steps_per_second": 3.721,
251
+ "step": 450
252
+ },
253
+ {
254
+ "epoch": 5.523255813953488,
255
+ "grad_norm": 0.3144132196903229,
256
+ "learning_rate": 4.2255893178617745e-05,
257
+ "loss": 0.012306832075119019,
258
+ "step": 475
259
+ },
260
+ {
261
+ "epoch": 5.813953488372093,
262
+ "grad_norm": 0.1607646942138672,
263
+ "learning_rate": 4.092017655963198e-05,
264
+ "loss": 0.010539753437042236,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 5.813953488372093,
269
+ "eval_accuracy": 0.9527186761229315,
270
+ "eval_f1": 0.8059040590405904,
271
+ "eval_loss": 0.07191809266805649,
272
+ "eval_precision": 0.8041237113402062,
273
+ "eval_recall": 0.8076923076923077,
274
+ "eval_runtime": 1.6569,
275
+ "eval_samples_per_second": 205.806,
276
+ "eval_steps_per_second": 3.621,
277
+ "step": 500
278
+ },
279
+ {
280
+ "epoch": 6.104651162790698,
281
+ "grad_norm": 0.19801200926303864,
282
+ "learning_rate": 3.9503186730577816e-05,
283
+ "loss": 0.008691226243972778,
284
+ "step": 525
285
+ },
286
+ {
287
+ "epoch": 6.395348837209302,
288
+ "grad_norm": 0.4177681505680084,
289
+ "learning_rate": 3.801215748761385e-05,
290
+ "loss": 0.004750225245952606,
291
+ "step": 550
292
+ },
293
+ {
294
+ "epoch": 6.395348837209302,
295
+ "eval_accuracy": 0.9458413926499033,
296
+ "eval_f1": 0.7863866763215062,
297
+ "eval_loss": 0.07378304749727249,
298
+ "eval_precision": 0.7702127659574468,
299
+ "eval_recall": 0.8032544378698225,
300
+ "eval_runtime": 1.6214,
301
+ "eval_samples_per_second": 210.313,
302
+ "eval_steps_per_second": 3.701,
303
+ "step": 550
304
+ },
305
+ {
306
+ "epoch": 6.686046511627907,
307
+ "grad_norm": 0.30753573775291443,
308
+ "learning_rate": 3.645470060140278e-05,
309
+ "loss": 0.005743271708488464,
310
+ "step": 575
311
+ },
312
+ {
313
+ "epoch": 6.976744186046512,
314
+ "grad_norm": 0.13237181305885315,
315
+ "learning_rate": 3.4838766958683304e-05,
316
+ "loss": 0.006215065121650696,
317
+ "step": 600
318
+ },
319
+ {
320
+ "epoch": 6.976744186046512,
321
+ "eval_accuracy": 0.9447668171072426,
322
+ "eval_f1": 0.7789934354485777,
323
+ "eval_loss": 0.062308527529239655,
324
+ "eval_precision": 0.7683453237410072,
325
+ "eval_recall": 0.7899408284023669,
326
+ "eval_runtime": 1.6197,
327
+ "eval_samples_per_second": 210.528,
328
+ "eval_steps_per_second": 3.704,
329
+ "step": 600
330
+ },
331
+ {
332
+ "epoch": 7.267441860465116,
333
+ "grad_norm": 0.023809686303138733,
334
+ "learning_rate": 3.317260597263932e-05,
335
+ "loss": 0.002318141460418701,
336
+ "step": 625
337
+ },
338
+ {
339
+ "epoch": 7.558139534883721,
340
+ "grad_norm": 0.03782212734222412,
341
+ "learning_rate": 3.146472346927845e-05,
342
+ "loss": 0.003790220320224762,
343
+ "step": 650
344
+ },
345
+ {
346
+ "epoch": 7.558139534883721,
347
+ "eval_accuracy": 0.9529335912314636,
348
+ "eval_f1": 0.8062827225130891,
349
+ "eval_loss": 0.07683796435594559,
350
+ "eval_precision": 0.8154311649016641,
351
+ "eval_recall": 0.7973372781065089,
352
+ "eval_runtime": 1.6235,
353
+ "eval_samples_per_second": 210.043,
354
+ "eval_steps_per_second": 3.696,
355
+ "step": 650
356
+ },
357
+ {
358
+ "epoch": 7.848837209302325,
359
+ "grad_norm": 0.037971507757902145,
360
+ "learning_rate": 2.9723838264811545e-05,
361
+ "loss": 0.0018679146468639374,
362
+ "step": 675
363
+ },
364
+ {
365
+ "epoch": 8.13953488372093,
366
+ "grad_norm": 0.6083823442459106,
367
+ "learning_rate": 2.7958837655707814e-05,
368
+ "loss": 0.0019237904250621796,
369
+ "step": 700
370
+ },
371
+ {
372
+ "epoch": 8.13953488372093,
373
+ "eval_accuracy": 0.9565871480765098,
374
+ "eval_f1": 0.8152091254752851,
375
+ "eval_loss": 0.08732757717370987,
376
+ "eval_precision": 0.838810641627543,
377
+ "eval_recall": 0.7928994082840237,
378
+ "eval_runtime": 1.6124,
379
+ "eval_samples_per_second": 211.484,
380
+ "eval_steps_per_second": 3.721,
381
+ "step": 700
382
+ },
383
+ {
384
+ "epoch": 8.430232558139535,
385
+ "grad_norm": 0.022007286548614502,
386
+ "learning_rate": 2.6178732048650694e-05,
387
+ "loss": 0.0010710173845291137,
388
+ "step": 725
389
+ },
390
+ {
391
+ "epoch": 8.720930232558139,
392
+ "grad_norm": 0.09439104795455933,
393
+ "learning_rate": 2.4392608962010652e-05,
394
+ "loss": 0.0006907544285058976,
395
+ "step": 750
396
+ },
397
+ {
398
+ "epoch": 8.720930232558139,
399
+ "eval_accuracy": 0.9449817322157748,
400
+ "eval_f1": 0.7829848594087959,
401
+ "eval_loss": 0.08308640867471695,
402
+ "eval_precision": 0.7637130801687764,
403
+ "eval_recall": 0.8032544378698225,
404
+ "eval_runtime": 1.6359,
405
+ "eval_samples_per_second": 208.445,
406
+ "eval_steps_per_second": 3.668,
407
+ "step": 750
408
+ },
409
+ {
410
+ "epoch": 9.011627906976743,
411
+ "grad_norm": 0.018290311098098755,
412
+ "learning_rate": 2.2609586633659256e-05,
413
+ "loss": 0.0005397907271981239,
414
+ "step": 775
415
+ },
416
+ {
417
+ "epoch": 9.30232558139535,
418
+ "grad_norm": 0.002839206252247095,
419
+ "learning_rate": 2.0838767471959014e-05,
420
+ "loss": 0.0002632186934351921,
421
+ "step": 800
422
+ },
423
+ {
424
+ "epoch": 9.30232558139535,
425
+ "eval_accuracy": 0.9544379969911885,
426
+ "eval_f1": 0.8081880212282032,
427
+ "eval_loss": 0.09754534065723419,
428
+ "eval_precision": 0.8289269051321928,
429
+ "eval_recall": 0.7884615384615384,
430
+ "eval_runtime": 1.6188,
431
+ "eval_samples_per_second": 210.653,
432
+ "eval_steps_per_second": 3.706,
433
+ "step": 800
434
+ },
435
+ {
436
+ "epoch": 9.593023255813954,
437
+ "grad_norm": 0.04134448245167732,
438
+ "learning_rate": 1.9089191587563417e-05,
439
+ "loss": 0.0005076020956039428,
440
+ "step": 825
441
+ },
442
+ {
443
+ "epoch": 9.883720930232558,
444
+ "grad_norm": 0.08968573063611984,
445
+ "learning_rate": 1.7369790643249573e-05,
446
+ "loss": 0.0005874237418174743,
447
+ "step": 850
448
+ },
449
+ {
450
+ "epoch": 9.883720930232558,
451
+ "eval_accuracy": 0.9548678272082527,
452
+ "eval_f1": 0.8093797276853252,
453
+ "eval_loss": 0.09803693741559982,
454
+ "eval_precision": 0.8281733746130031,
455
+ "eval_recall": 0.7914201183431953,
456
+ "eval_runtime": 1.6209,
457
+ "eval_samples_per_second": 210.379,
458
+ "eval_steps_per_second": 3.702,
459
+ "step": 850
460
+ },
461
+ {
462
+ "epoch": 10.174418604651162,
463
+ "grad_norm": 0.02889181859791279,
464
+ "learning_rate": 1.5689342257382207e-05,
465
+ "loss": 0.0004838050529360771,
466
+ "step": 875
467
+ },
468
+ {
469
+ "epoch": 10.465116279069768,
470
+ "grad_norm": 0.020970497280359268,
471
+ "learning_rate": 1.4056425193781048e-05,
472
+ "loss": 0.0001906752586364746,
473
+ "step": 900
474
+ },
475
+ {
476
+ "epoch": 10.465116279069768,
477
+ "eval_accuracy": 0.9587362991618311,
478
+ "eval_f1": 0.8228043143297381,
479
+ "eval_loss": 0.10382715612649918,
480
+ "eval_precision": 0.8585209003215434,
481
+ "eval_recall": 0.7899408284023669,
482
+ "eval_runtime": 1.6341,
483
+ "eval_samples_per_second": 208.675,
484
+ "eval_steps_per_second": 3.672,
485
+ "step": 900
486
+ },
487
+ {
488
+ "epoch": 10.755813953488373,
489
+ "grad_norm": 0.028520096093416214,
490
+ "learning_rate": 1.2479375566749694e-05,
491
+ "loss": 0.00012492083944380284,
492
+ "step": 925
493
+ },
494
+ {
495
+ "epoch": 11.046511627906977,
496
+ "grad_norm": 0.03838531672954559,
497
+ "learning_rate": 1.0966244284840926e-05,
498
+ "loss": 0.00028255857527256014,
499
+ "step": 950
500
+ },
501
+ {
502
+ "epoch": 11.046511627906977,
503
+ "eval_accuracy": 0.9580915538362347,
504
+ "eval_f1": 0.819369715603382,
505
+ "eval_loss": 0.10540532320737839,
506
+ "eval_precision": 0.8528,
507
+ "eval_recall": 0.7884615384615384,
508
+ "eval_runtime": 1.6495,
509
+ "eval_samples_per_second": 206.73,
510
+ "eval_steps_per_second": 3.637,
511
+ "step": 950
512
+ },
513
+ {
514
+ "epoch": 11.337209302325581,
515
+ "grad_norm": 0.05398673936724663,
516
+ "learning_rate": 9.524755950610204e-06,
517
+ "loss": 0.00014415644109249114,
518
+ "step": 975
519
+ },
520
+ {
521
+ "epoch": 11.627906976744185,
522
+ "grad_norm": 0.026561638340353966,
523
+ "learning_rate": 8.162269426175681e-06,
524
+ "loss": 9.150288999080658e-05,
525
+ "step": 1000
526
+ },
527
+ {
528
+ "epoch": 11.627906976744185,
529
+ "eval_accuracy": 0.9574468085106383,
530
+ "eval_f1": 0.8180428134556575,
531
+ "eval_loss": 0.10544126480817795,
532
+ "eval_precision": 0.8465189873417721,
533
+ "eval_recall": 0.7914201183431953,
534
+ "eval_runtime": 1.6274,
535
+ "eval_samples_per_second": 209.539,
536
+ "eval_steps_per_second": 3.687,
537
+ "step": 1000
538
+ },
539
+ {
540
+ "epoch": 11.918604651162791,
541
+ "grad_norm": 0.010734460316598415,
542
+ "learning_rate": 6.885740265899526e-06,
543
+ "loss": 4.033456556499005e-05,
544
+ "step": 1025
545
+ },
546
+ {
547
+ "epoch": 12.209302325581396,
548
+ "grad_norm": 0.02024712599813938,
549
+ "learning_rate": 5.701685207973243e-06,
550
+ "loss": 6.52561942115426e-05,
551
+ "step": 1050
552
+ },
553
+ {
554
+ "epoch": 12.209302325581396,
555
+ "eval_accuracy": 0.9576617236191705,
556
+ "eval_f1": 0.8190184049079755,
557
+ "eval_loss": 0.10666228085756302,
558
+ "eval_precision": 0.8503184713375797,
559
+ "eval_recall": 0.7899408284023669,
560
+ "eval_runtime": 1.6269,
561
+ "eval_samples_per_second": 209.598,
562
+ "eval_steps_per_second": 3.688,
563
+ "step": 1050
564
+ },
565
+ {
566
+ "epoch": 12.5,
567
+ "grad_norm": 0.034469809383153915,
568
+ "learning_rate": 4.616148906179082e-06,
569
+ "loss": 7.551711052656174e-05,
570
+ "step": 1075
571
+ },
572
+ {
573
+ "epoch": 12.790697674418604,
574
+ "grad_norm": 0.004050907213240862,
575
+ "learning_rate": 3.6346730716634025e-06,
576
+ "loss": 7.49318953603506e-05,
577
+ "step": 1100
578
+ },
579
+ {
580
+ "epoch": 12.790697674418604,
581
+ "eval_accuracy": 0.9565871480765098,
582
+ "eval_f1": 0.8146453089244853,
583
+ "eval_loss": 0.10619472712278366,
584
+ "eval_precision": 0.8409448818897638,
585
+ "eval_recall": 0.7899408284023669,
586
+ "eval_runtime": 1.6196,
587
+ "eval_samples_per_second": 210.546,
588
+ "eval_steps_per_second": 3.705,
589
+ "step": 1100
590
+ },
591
+ {
592
+ "epoch": 13.081395348837209,
593
+ "grad_norm": 0.11917345970869064,
594
+ "learning_rate": 2.7622681822545764e-06,
595
+ "loss": 8.815748617053032e-05,
596
+ "step": 1125
597
+ },
598
+ {
599
+ "epoch": 13.372093023255815,
600
+ "grad_norm": 0.02682509273290634,
601
+ "learning_rate": 2.0033879037506004e-06,
602
+ "loss": 6.015756167471409e-05,
603
+ "step": 1150
604
+ },
605
+ {
606
+ "epoch": 13.372093023255815,
607
+ "eval_accuracy": 0.9583064689447668,
608
+ "eval_f1": 0.8205521472392638,
609
+ "eval_loss": 0.10740578919649124,
610
+ "eval_precision": 0.8519108280254777,
611
+ "eval_recall": 0.7914201183431953,
612
+ "eval_runtime": 1.6217,
613
+ "eval_samples_per_second": 210.273,
614
+ "eval_steps_per_second": 3.7,
615
+ "step": 1150
616
+ }
617
+ ],
618
+ "logging_steps": 25,
619
+ "max_steps": 1290,
620
+ "num_input_tokens_seen": 0,
621
+ "num_train_epochs": 15,
622
+ "save_steps": 50,
623
+ "stateful_callbacks": {
624
+ "EarlyStoppingCallback": {
625
+ "args": {
626
+ "early_stopping_patience": 10,
627
+ "early_stopping_threshold": 0.0
628
+ },
629
+ "attributes": {
630
+ "early_stopping_patience_counter": 5
631
+ }
632
+ },
633
+ "TrainerControl": {
634
+ "args": {
635
+ "should_epoch_stop": false,
636
+ "should_evaluate": false,
637
+ "should_log": false,
638
+ "should_save": true,
639
+ "should_training_stop": false
640
+ },
641
+ "attributes": {}
642
+ }
643
+ },
644
+ "total_flos": 6236850188428800.0,
645
+ "train_batch_size": 16,
646
+ "trial_name": null,
647
+ "trial_params": null
648
+ }
checkpoint-1150/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5071855a54d36018bc5c30ca34d9fef42b69fb3deda057af4ffc70193237d5c4
3
+ size 5201
checkpoint-1200/config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
checkpoint-1200/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:192d234fce88e3c0a53584d9886186f0bc98018d8baab24a7589d863a55e18bf
3
+ size 598449012
checkpoint-1200/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c1632f2d45550d119f075f652bd63b324e7023adc6af0ab5f7309173a376c872
3
+ size 535150859
checkpoint-1200/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3346e012b94a0e3b8710b5afadeb0801fec62951ffc4a696ed752d55bf580c93
3
+ size 14709
checkpoint-1200/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:875cbc43a94946c9471d4378d3a7262ff116a77879c41bf7197e6426eff5ed7d
3
+ size 1465
checkpoint-1200/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1200/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "is_local": false,
6
+ "mask_token": "[MASK]",
7
+ "model_input_names": [
8
+ "input_ids",
9
+ "attention_mask"
10
+ ],
11
+ "model_max_length": 8192,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-1200/trainer_state.json ADDED
@@ -0,0 +1,674 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 900,
3
+ "best_metric": 0.8228043143297381,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900",
5
+ "epoch": 13.953488372093023,
6
+ "eval_steps": 50,
7
+ "global_step": 1200,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011627906976744186,
14
+ "grad_norm": 4.9740142822265625,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.317932665348053,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.29069767441860467,
21
+ "grad_norm": 1.5566426515579224,
22
+ "learning_rate": 6.282722513089005e-06,
23
+ "loss": 0.3199571371078491,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.5813953488372093,
28
+ "grad_norm": 1.6379677057266235,
29
+ "learning_rate": 1.2827225130890053e-05,
30
+ "loss": 0.24125898361206055,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.5813953488372093,
35
+ "eval_accuracy": 0.8287126584998925,
36
+ "eval_f1": 0.08611410118406888,
37
+ "eval_loss": 0.10772959887981415,
38
+ "eval_precision": 0.15810276679841898,
39
+ "eval_recall": 0.05917159763313609,
40
+ "eval_runtime": 4.2273,
41
+ "eval_samples_per_second": 80.667,
42
+ "eval_steps_per_second": 1.419,
43
+ "step": 50
44
+ },
45
+ {
46
+ "epoch": 0.872093023255814,
47
+ "grad_norm": 8.703161239624023,
48
+ "learning_rate": 1.93717277486911e-05,
49
+ "loss": 0.20946041107177735,
50
+ "step": 75
51
+ },
52
+ {
53
+ "epoch": 1.1627906976744187,
54
+ "grad_norm": 0.9212121963500977,
55
+ "learning_rate": 2.591623036649215e-05,
56
+ "loss": 0.19275867462158203,
57
+ "step": 100
58
+ },
59
+ {
60
+ "epoch": 1.1627906976744187,
61
+ "eval_accuracy": 0.7635933806146572,
62
+ "eval_f1": 0.3981945837512538,
63
+ "eval_loss": 0.07719173282384872,
64
+ "eval_precision": 0.30121396054628224,
65
+ "eval_recall": 0.5872781065088757,
66
+ "eval_runtime": 1.6016,
67
+ "eval_samples_per_second": 212.909,
68
+ "eval_steps_per_second": 3.746,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 1.4534883720930232,
73
+ "grad_norm": 1.46477210521698,
74
+ "learning_rate": 3.246073298429319e-05,
75
+ "loss": 0.14603865623474122,
76
+ "step": 125
77
+ },
78
+ {
79
+ "epoch": 1.744186046511628,
80
+ "grad_norm": 3.729416608810425,
81
+ "learning_rate": 3.900523560209424e-05,
82
+ "loss": 0.13855588912963868,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 1.744186046511628,
87
+ "eval_accuracy": 0.81130453470879,
88
+ "eval_f1": 0.46785521339816316,
89
+ "eval_loss": 0.06223325803875923,
90
+ "eval_precision": 0.36851063829787234,
91
+ "eval_recall": 0.6405325443786982,
92
+ "eval_runtime": 1.5906,
93
+ "eval_samples_per_second": 214.385,
94
+ "eval_steps_per_second": 3.772,
95
+ "step": 150
96
+ },
97
+ {
98
+ "epoch": 2.0348837209302326,
99
+ "grad_norm": 1.2140589952468872,
100
+ "learning_rate": 4.554973821989529e-05,
101
+ "loss": 0.09624839782714843,
102
+ "step": 175
103
+ },
104
+ {
105
+ "epoch": 2.3255813953488373,
106
+ "grad_norm": 0.875888466835022,
107
+ "learning_rate": 4.999346304613061e-05,
108
+ "loss": 0.0821054744720459,
109
+ "step": 200
110
+ },
111
+ {
112
+ "epoch": 2.3255813953488373,
113
+ "eval_accuracy": 0.7872340425531915,
114
+ "eval_f1": 0.4847619047619048,
115
+ "eval_loss": 0.04723217338323593,
116
+ "eval_precision": 0.3574438202247191,
117
+ "eval_recall": 0.7529585798816568,
118
+ "eval_runtime": 1.6255,
119
+ "eval_samples_per_second": 209.777,
120
+ "eval_steps_per_second": 3.691,
121
+ "step": 200
122
+ },
123
+ {
124
+ "epoch": 2.616279069767442,
125
+ "grad_norm": 1.0979472398757935,
126
+ "learning_rate": 4.98888472605987e-05,
127
+ "loss": 0.08414460182189941,
128
+ "step": 225
129
+ },
130
+ {
131
+ "epoch": 2.9069767441860463,
132
+ "grad_norm": 0.49558770656585693,
133
+ "learning_rate": 4.965717280180432e-05,
134
+ "loss": 0.08369583129882813,
135
+ "step": 250
136
+ },
137
+ {
138
+ "epoch": 2.9069767441860463,
139
+ "eval_accuracy": 0.6211046636578551,
140
+ "eval_f1": 0.3483915126625599,
141
+ "eval_loss": 0.045315902680158615,
142
+ "eval_precision": 0.22662511130899377,
143
+ "eval_recall": 0.7529585798816568,
144
+ "eval_runtime": 1.6274,
145
+ "eval_samples_per_second": 209.539,
146
+ "eval_steps_per_second": 3.687,
147
+ "step": 250
148
+ },
149
+ {
150
+ "epoch": 3.197674418604651,
151
+ "grad_norm": 0.8114362955093384,
152
+ "learning_rate": 4.9299622378173246e-05,
153
+ "loss": 0.05607881069183349,
154
+ "step": 275
155
+ },
156
+ {
157
+ "epoch": 3.488372093023256,
158
+ "grad_norm": 0.6278374195098877,
159
+ "learning_rate": 4.881802130053548e-05,
160
+ "loss": 0.043469696044921874,
161
+ "step": 300
162
+ },
163
+ {
164
+ "epoch": 3.488372093023256,
165
+ "eval_accuracy": 0.8082957231893402,
166
+ "eval_f1": 0.5285784074255008,
167
+ "eval_loss": 0.04308881610631943,
168
+ "eval_precision": 0.39460247994164843,
169
+ "eval_recall": 0.8002958579881657,
170
+ "eval_runtime": 1.6193,
171
+ "eval_samples_per_second": 210.585,
172
+ "eval_steps_per_second": 3.705,
173
+ "step": 300
174
+ },
175
+ {
176
+ "epoch": 3.7790697674418605,
177
+ "grad_norm": 1.0219486951828003,
178
+ "learning_rate": 4.821482816383218e-05,
179
+ "loss": 0.047760300636291504,
180
+ "step": 325
181
+ },
182
+ {
183
+ "epoch": 4.069767441860465,
184
+ "grad_norm": 0.509274959564209,
185
+ "learning_rate": 4.749312229587908e-05,
186
+ "loss": 0.03177810907363891,
187
+ "step": 350
188
+ },
189
+ {
190
+ "epoch": 4.069767441860465,
191
+ "eval_accuracy": 0.9196217494089834,
192
+ "eval_f1": 0.7152317880794702,
193
+ "eval_loss": 0.04378104954957962,
194
+ "eval_precision": 0.6474820143884892,
195
+ "eval_recall": 0.7988165680473372,
196
+ "eval_runtime": 1.6177,
197
+ "eval_samples_per_second": 210.792,
198
+ "eval_steps_per_second": 3.709,
199
+ "step": 350
200
+ },
201
+ {
202
+ "epoch": 4.3604651162790695,
203
+ "grad_norm": 0.47098585963249207,
204
+ "learning_rate": 4.6656588037260834e-05,
205
+ "loss": 0.020146708488464355,
206
+ "step": 375
207
+ },
208
+ {
209
+ "epoch": 4.651162790697675,
210
+ "grad_norm": 0.7534321546554565,
211
+ "learning_rate": 4.570949593260837e-05,
212
+ "loss": 0.018921481370925905,
213
+ "step": 400
214
+ },
215
+ {
216
+ "epoch": 4.651162790697675,
217
+ "eval_accuracy": 0.9097356544165055,
218
+ "eval_f1": 0.6987341772151898,
219
+ "eval_loss": 0.05498046055436134,
220
+ "eval_precision": 0.6106194690265486,
221
+ "eval_recall": 0.8165680473372781,
222
+ "eval_runtime": 1.6157,
223
+ "eval_samples_per_second": 211.05,
224
+ "eval_steps_per_second": 3.713,
225
+ "step": 400
226
+ },
227
+ {
228
+ "epoch": 4.941860465116279,
229
+ "grad_norm": 0.7499828934669495,
230
+ "learning_rate": 4.465668092927841e-05,
231
+ "loss": 0.01998784065246582,
232
+ "step": 425
233
+ },
234
+ {
235
+ "epoch": 5.232558139534884,
236
+ "grad_norm": 0.24809418618679047,
237
+ "learning_rate": 4.350351769473198e-05,
238
+ "loss": 0.01218403697013855,
239
+ "step": 450
240
+ },
241
+ {
242
+ "epoch": 5.232558139534884,
243
+ "eval_accuracy": 0.9084461637653127,
244
+ "eval_f1": 0.6831746031746032,
245
+ "eval_loss": 0.05535344406962395,
246
+ "eval_precision": 0.5984427141268076,
247
+ "eval_recall": 0.7958579881656804,
248
+ "eval_runtime": 1.6123,
249
+ "eval_samples_per_second": 211.498,
250
+ "eval_steps_per_second": 3.721,
251
+ "step": 450
252
+ },
253
+ {
254
+ "epoch": 5.523255813953488,
255
+ "grad_norm": 0.3144132196903229,
256
+ "learning_rate": 4.2255893178617745e-05,
257
+ "loss": 0.012306832075119019,
258
+ "step": 475
259
+ },
260
+ {
261
+ "epoch": 5.813953488372093,
262
+ "grad_norm": 0.1607646942138672,
263
+ "learning_rate": 4.092017655963198e-05,
264
+ "loss": 0.010539753437042236,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 5.813953488372093,
269
+ "eval_accuracy": 0.9527186761229315,
270
+ "eval_f1": 0.8059040590405904,
271
+ "eval_loss": 0.07191809266805649,
272
+ "eval_precision": 0.8041237113402062,
273
+ "eval_recall": 0.8076923076923077,
274
+ "eval_runtime": 1.6569,
275
+ "eval_samples_per_second": 205.806,
276
+ "eval_steps_per_second": 3.621,
277
+ "step": 500
278
+ },
279
+ {
280
+ "epoch": 6.104651162790698,
281
+ "grad_norm": 0.19801200926303864,
282
+ "learning_rate": 3.9503186730577816e-05,
283
+ "loss": 0.008691226243972778,
284
+ "step": 525
285
+ },
286
+ {
287
+ "epoch": 6.395348837209302,
288
+ "grad_norm": 0.4177681505680084,
289
+ "learning_rate": 3.801215748761385e-05,
290
+ "loss": 0.004750225245952606,
291
+ "step": 550
292
+ },
293
+ {
294
+ "epoch": 6.395348837209302,
295
+ "eval_accuracy": 0.9458413926499033,
296
+ "eval_f1": 0.7863866763215062,
297
+ "eval_loss": 0.07378304749727249,
298
+ "eval_precision": 0.7702127659574468,
299
+ "eval_recall": 0.8032544378698225,
300
+ "eval_runtime": 1.6214,
301
+ "eval_samples_per_second": 210.313,
302
+ "eval_steps_per_second": 3.701,
303
+ "step": 550
304
+ },
305
+ {
306
+ "epoch": 6.686046511627907,
307
+ "grad_norm": 0.30753573775291443,
308
+ "learning_rate": 3.645470060140278e-05,
309
+ "loss": 0.005743271708488464,
310
+ "step": 575
311
+ },
312
+ {
313
+ "epoch": 6.976744186046512,
314
+ "grad_norm": 0.13237181305885315,
315
+ "learning_rate": 3.4838766958683304e-05,
316
+ "loss": 0.006215065121650696,
317
+ "step": 600
318
+ },
319
+ {
320
+ "epoch": 6.976744186046512,
321
+ "eval_accuracy": 0.9447668171072426,
322
+ "eval_f1": 0.7789934354485777,
323
+ "eval_loss": 0.062308527529239655,
324
+ "eval_precision": 0.7683453237410072,
325
+ "eval_recall": 0.7899408284023669,
326
+ "eval_runtime": 1.6197,
327
+ "eval_samples_per_second": 210.528,
328
+ "eval_steps_per_second": 3.704,
329
+ "step": 600
330
+ },
331
+ {
332
+ "epoch": 7.267441860465116,
333
+ "grad_norm": 0.023809686303138733,
334
+ "learning_rate": 3.317260597263932e-05,
335
+ "loss": 0.002318141460418701,
336
+ "step": 625
337
+ },
338
+ {
339
+ "epoch": 7.558139534883721,
340
+ "grad_norm": 0.03782212734222412,
341
+ "learning_rate": 3.146472346927845e-05,
342
+ "loss": 0.003790220320224762,
343
+ "step": 650
344
+ },
345
+ {
346
+ "epoch": 7.558139534883721,
347
+ "eval_accuracy": 0.9529335912314636,
348
+ "eval_f1": 0.8062827225130891,
349
+ "eval_loss": 0.07683796435594559,
350
+ "eval_precision": 0.8154311649016641,
351
+ "eval_recall": 0.7973372781065089,
352
+ "eval_runtime": 1.6235,
353
+ "eval_samples_per_second": 210.043,
354
+ "eval_steps_per_second": 3.696,
355
+ "step": 650
356
+ },
357
+ {
358
+ "epoch": 7.848837209302325,
359
+ "grad_norm": 0.037971507757902145,
360
+ "learning_rate": 2.9723838264811545e-05,
361
+ "loss": 0.0018679146468639374,
362
+ "step": 675
363
+ },
364
+ {
365
+ "epoch": 8.13953488372093,
366
+ "grad_norm": 0.6083823442459106,
367
+ "learning_rate": 2.7958837655707814e-05,
368
+ "loss": 0.0019237904250621796,
369
+ "step": 700
370
+ },
371
+ {
372
+ "epoch": 8.13953488372093,
373
+ "eval_accuracy": 0.9565871480765098,
374
+ "eval_f1": 0.8152091254752851,
375
+ "eval_loss": 0.08732757717370987,
376
+ "eval_precision": 0.838810641627543,
377
+ "eval_recall": 0.7928994082840237,
378
+ "eval_runtime": 1.6124,
379
+ "eval_samples_per_second": 211.484,
380
+ "eval_steps_per_second": 3.721,
381
+ "step": 700
382
+ },
383
+ {
384
+ "epoch": 8.430232558139535,
385
+ "grad_norm": 0.022007286548614502,
386
+ "learning_rate": 2.6178732048650694e-05,
387
+ "loss": 0.0010710173845291137,
388
+ "step": 725
389
+ },
390
+ {
391
+ "epoch": 8.720930232558139,
392
+ "grad_norm": 0.09439104795455933,
393
+ "learning_rate": 2.4392608962010652e-05,
394
+ "loss": 0.0006907544285058976,
395
+ "step": 750
396
+ },
397
+ {
398
+ "epoch": 8.720930232558139,
399
+ "eval_accuracy": 0.9449817322157748,
400
+ "eval_f1": 0.7829848594087959,
401
+ "eval_loss": 0.08308640867471695,
402
+ "eval_precision": 0.7637130801687764,
403
+ "eval_recall": 0.8032544378698225,
404
+ "eval_runtime": 1.6359,
405
+ "eval_samples_per_second": 208.445,
406
+ "eval_steps_per_second": 3.668,
407
+ "step": 750
408
+ },
409
+ {
410
+ "epoch": 9.011627906976743,
411
+ "grad_norm": 0.018290311098098755,
412
+ "learning_rate": 2.2609586633659256e-05,
413
+ "loss": 0.0005397907271981239,
414
+ "step": 775
415
+ },
416
+ {
417
+ "epoch": 9.30232558139535,
418
+ "grad_norm": 0.002839206252247095,
419
+ "learning_rate": 2.0838767471959014e-05,
420
+ "loss": 0.0002632186934351921,
421
+ "step": 800
422
+ },
423
+ {
424
+ "epoch": 9.30232558139535,
425
+ "eval_accuracy": 0.9544379969911885,
426
+ "eval_f1": 0.8081880212282032,
427
+ "eval_loss": 0.09754534065723419,
428
+ "eval_precision": 0.8289269051321928,
429
+ "eval_recall": 0.7884615384615384,
430
+ "eval_runtime": 1.6188,
431
+ "eval_samples_per_second": 210.653,
432
+ "eval_steps_per_second": 3.706,
433
+ "step": 800
434
+ },
435
+ {
436
+ "epoch": 9.593023255813954,
437
+ "grad_norm": 0.04134448245167732,
438
+ "learning_rate": 1.9089191587563417e-05,
439
+ "loss": 0.0005076020956039428,
440
+ "step": 825
441
+ },
442
+ {
443
+ "epoch": 9.883720930232558,
444
+ "grad_norm": 0.08968573063611984,
445
+ "learning_rate": 1.7369790643249573e-05,
446
+ "loss": 0.0005874237418174743,
447
+ "step": 850
448
+ },
449
+ {
450
+ "epoch": 9.883720930232558,
451
+ "eval_accuracy": 0.9548678272082527,
452
+ "eval_f1": 0.8093797276853252,
453
+ "eval_loss": 0.09803693741559982,
454
+ "eval_precision": 0.8281733746130031,
455
+ "eval_recall": 0.7914201183431953,
456
+ "eval_runtime": 1.6209,
457
+ "eval_samples_per_second": 210.379,
458
+ "eval_steps_per_second": 3.702,
459
+ "step": 850
460
+ },
461
+ {
462
+ "epoch": 10.174418604651162,
463
+ "grad_norm": 0.02889181859791279,
464
+ "learning_rate": 1.5689342257382207e-05,
465
+ "loss": 0.0004838050529360771,
466
+ "step": 875
467
+ },
468
+ {
469
+ "epoch": 10.465116279069768,
470
+ "grad_norm": 0.020970497280359268,
471
+ "learning_rate": 1.4056425193781048e-05,
472
+ "loss": 0.0001906752586364746,
473
+ "step": 900
474
+ },
475
+ {
476
+ "epoch": 10.465116279069768,
477
+ "eval_accuracy": 0.9587362991618311,
478
+ "eval_f1": 0.8228043143297381,
479
+ "eval_loss": 0.10382715612649918,
480
+ "eval_precision": 0.8585209003215434,
481
+ "eval_recall": 0.7899408284023669,
482
+ "eval_runtime": 1.6341,
483
+ "eval_samples_per_second": 208.675,
484
+ "eval_steps_per_second": 3.672,
485
+ "step": 900
486
+ },
487
+ {
488
+ "epoch": 10.755813953488373,
489
+ "grad_norm": 0.028520096093416214,
490
+ "learning_rate": 1.2479375566749694e-05,
491
+ "loss": 0.00012492083944380284,
492
+ "step": 925
493
+ },
494
+ {
495
+ "epoch": 11.046511627906977,
496
+ "grad_norm": 0.03838531672954559,
497
+ "learning_rate": 1.0966244284840926e-05,
498
+ "loss": 0.00028255857527256014,
499
+ "step": 950
500
+ },
501
+ {
502
+ "epoch": 11.046511627906977,
503
+ "eval_accuracy": 0.9580915538362347,
504
+ "eval_f1": 0.819369715603382,
505
+ "eval_loss": 0.10540532320737839,
506
+ "eval_precision": 0.8528,
507
+ "eval_recall": 0.7884615384615384,
508
+ "eval_runtime": 1.6495,
509
+ "eval_samples_per_second": 206.73,
510
+ "eval_steps_per_second": 3.637,
511
+ "step": 950
512
+ },
513
+ {
514
+ "epoch": 11.337209302325581,
515
+ "grad_norm": 0.05398673936724663,
516
+ "learning_rate": 9.524755950610204e-06,
517
+ "loss": 0.00014415644109249114,
518
+ "step": 975
519
+ },
520
+ {
521
+ "epoch": 11.627906976744185,
522
+ "grad_norm": 0.026561638340353966,
523
+ "learning_rate": 8.162269426175681e-06,
524
+ "loss": 9.150288999080658e-05,
525
+ "step": 1000
526
+ },
527
+ {
528
+ "epoch": 11.627906976744185,
529
+ "eval_accuracy": 0.9574468085106383,
530
+ "eval_f1": 0.8180428134556575,
531
+ "eval_loss": 0.10544126480817795,
532
+ "eval_precision": 0.8465189873417721,
533
+ "eval_recall": 0.7914201183431953,
534
+ "eval_runtime": 1.6274,
535
+ "eval_samples_per_second": 209.539,
536
+ "eval_steps_per_second": 3.687,
537
+ "step": 1000
538
+ },
539
+ {
540
+ "epoch": 11.918604651162791,
541
+ "grad_norm": 0.010734460316598415,
542
+ "learning_rate": 6.885740265899526e-06,
543
+ "loss": 4.033456556499005e-05,
544
+ "step": 1025
545
+ },
546
+ {
547
+ "epoch": 12.209302325581396,
548
+ "grad_norm": 0.02024712599813938,
549
+ "learning_rate": 5.701685207973243e-06,
550
+ "loss": 6.52561942115426e-05,
551
+ "step": 1050
552
+ },
553
+ {
554
+ "epoch": 12.209302325581396,
555
+ "eval_accuracy": 0.9576617236191705,
556
+ "eval_f1": 0.8190184049079755,
557
+ "eval_loss": 0.10666228085756302,
558
+ "eval_precision": 0.8503184713375797,
559
+ "eval_recall": 0.7899408284023669,
560
+ "eval_runtime": 1.6269,
561
+ "eval_samples_per_second": 209.598,
562
+ "eval_steps_per_second": 3.688,
563
+ "step": 1050
564
+ },
565
+ {
566
+ "epoch": 12.5,
567
+ "grad_norm": 0.034469809383153915,
568
+ "learning_rate": 4.616148906179082e-06,
569
+ "loss": 7.551711052656174e-05,
570
+ "step": 1075
571
+ },
572
+ {
573
+ "epoch": 12.790697674418604,
574
+ "grad_norm": 0.004050907213240862,
575
+ "learning_rate": 3.6346730716634025e-06,
576
+ "loss": 7.49318953603506e-05,
577
+ "step": 1100
578
+ },
579
+ {
580
+ "epoch": 12.790697674418604,
581
+ "eval_accuracy": 0.9565871480765098,
582
+ "eval_f1": 0.8146453089244853,
583
+ "eval_loss": 0.10619472712278366,
584
+ "eval_precision": 0.8409448818897638,
585
+ "eval_recall": 0.7899408284023669,
586
+ "eval_runtime": 1.6196,
587
+ "eval_samples_per_second": 210.546,
588
+ "eval_steps_per_second": 3.705,
589
+ "step": 1100
590
+ },
591
+ {
592
+ "epoch": 13.081395348837209,
593
+ "grad_norm": 0.11917345970869064,
594
+ "learning_rate": 2.7622681822545764e-06,
595
+ "loss": 8.815748617053032e-05,
596
+ "step": 1125
597
+ },
598
+ {
599
+ "epoch": 13.372093023255815,
600
+ "grad_norm": 0.02682509273290634,
601
+ "learning_rate": 2.0033879037506004e-06,
602
+ "loss": 6.015756167471409e-05,
603
+ "step": 1150
604
+ },
605
+ {
606
+ "epoch": 13.372093023255815,
607
+ "eval_accuracy": 0.9583064689447668,
608
+ "eval_f1": 0.8205521472392638,
609
+ "eval_loss": 0.10740578919649124,
610
+ "eval_precision": 0.8519108280254777,
611
+ "eval_recall": 0.7914201183431953,
612
+ "eval_runtime": 1.6217,
613
+ "eval_samples_per_second": 210.273,
614
+ "eval_steps_per_second": 3.7,
615
+ "step": 1150
616
+ },
617
+ {
618
+ "epoch": 13.662790697674419,
619
+ "grad_norm": 0.004100531339645386,
620
+ "learning_rate": 1.361906353756917e-06,
621
+ "loss": 4.690625239163637e-05,
622
+ "step": 1175
623
+ },
624
+ {
625
+ "epoch": 13.953488372093023,
626
+ "grad_norm": 0.008385015651583672,
627
+ "learning_rate": 8.410983241436132e-07,
628
+ "loss": 6.560925394296646e-05,
629
+ "step": 1200
630
+ },
631
+ {
632
+ "epoch": 13.953488372093023,
633
+ "eval_accuracy": 0.9578766387277026,
634
+ "eval_f1": 0.8181120491174213,
635
+ "eval_loss": 0.10830119252204895,
636
+ "eval_precision": 0.8500797448165869,
637
+ "eval_recall": 0.7884615384615384,
638
+ "eval_runtime": 1.6315,
639
+ "eval_samples_per_second": 209.012,
640
+ "eval_steps_per_second": 3.678,
641
+ "step": 1200
642
+ }
643
+ ],
644
+ "logging_steps": 25,
645
+ "max_steps": 1290,
646
+ "num_input_tokens_seen": 0,
647
+ "num_train_epochs": 15,
648
+ "save_steps": 50,
649
+ "stateful_callbacks": {
650
+ "EarlyStoppingCallback": {
651
+ "args": {
652
+ "early_stopping_patience": 10,
653
+ "early_stopping_threshold": 0.0
654
+ },
655
+ "attributes": {
656
+ "early_stopping_patience_counter": 6
657
+ }
658
+ },
659
+ "TrainerControl": {
660
+ "args": {
661
+ "should_epoch_stop": false,
662
+ "should_evaluate": false,
663
+ "should_log": false,
664
+ "should_save": true,
665
+ "should_training_stop": false
666
+ },
667
+ "attributes": {}
668
+ }
669
+ },
670
+ "total_flos": 6509462134924800.0,
671
+ "train_batch_size": 16,
672
+ "trial_name": null,
673
+ "trial_params": null
674
+ }
checkpoint-1200/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5071855a54d36018bc5c30ca34d9fef42b69fb3deda057af4ffc70193237d5c4
3
+ size 5201
checkpoint-1250/config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
checkpoint-1250/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09581240c6dc5c8b58b4e5b94a41c7a53e1528bc5fc0ab3742bd8869048b558e
3
+ size 598449012
checkpoint-1250/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8c65641ba7ee7c24fbb634d7c2c686e52088e8ad3271ab615835e9b5ec7f3aa2
3
+ size 535150859
checkpoint-1250/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7bdaec2d9eed960550d0e19b70cb2eea8832b93c6127669a2a582c2090899806
3
+ size 14709
checkpoint-1250/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8f7ba0c5f31bfcb1b4183cfd6b9b630ac6985851ed8d739f00668a5d279cbf6a
3
+ size 1465
checkpoint-1250/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1250/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "is_local": false,
6
+ "mask_token": "[MASK]",
7
+ "model_input_names": [
8
+ "input_ids",
9
+ "attention_mask"
10
+ ],
11
+ "model_max_length": 8192,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-1250/trainer_state.json ADDED
@@ -0,0 +1,700 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 900,
3
+ "best_metric": 0.8228043143297381,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900",
5
+ "epoch": 14.534883720930232,
6
+ "eval_steps": 50,
7
+ "global_step": 1250,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011627906976744186,
14
+ "grad_norm": 4.9740142822265625,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.317932665348053,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.29069767441860467,
21
+ "grad_norm": 1.5566426515579224,
22
+ "learning_rate": 6.282722513089005e-06,
23
+ "loss": 0.3199571371078491,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.5813953488372093,
28
+ "grad_norm": 1.6379677057266235,
29
+ "learning_rate": 1.2827225130890053e-05,
30
+ "loss": 0.24125898361206055,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.5813953488372093,
35
+ "eval_accuracy": 0.8287126584998925,
36
+ "eval_f1": 0.08611410118406888,
37
+ "eval_loss": 0.10772959887981415,
38
+ "eval_precision": 0.15810276679841898,
39
+ "eval_recall": 0.05917159763313609,
40
+ "eval_runtime": 4.2273,
41
+ "eval_samples_per_second": 80.667,
42
+ "eval_steps_per_second": 1.419,
43
+ "step": 50
44
+ },
45
+ {
46
+ "epoch": 0.872093023255814,
47
+ "grad_norm": 8.703161239624023,
48
+ "learning_rate": 1.93717277486911e-05,
49
+ "loss": 0.20946041107177735,
50
+ "step": 75
51
+ },
52
+ {
53
+ "epoch": 1.1627906976744187,
54
+ "grad_norm": 0.9212121963500977,
55
+ "learning_rate": 2.591623036649215e-05,
56
+ "loss": 0.19275867462158203,
57
+ "step": 100
58
+ },
59
+ {
60
+ "epoch": 1.1627906976744187,
61
+ "eval_accuracy": 0.7635933806146572,
62
+ "eval_f1": 0.3981945837512538,
63
+ "eval_loss": 0.07719173282384872,
64
+ "eval_precision": 0.30121396054628224,
65
+ "eval_recall": 0.5872781065088757,
66
+ "eval_runtime": 1.6016,
67
+ "eval_samples_per_second": 212.909,
68
+ "eval_steps_per_second": 3.746,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 1.4534883720930232,
73
+ "grad_norm": 1.46477210521698,
74
+ "learning_rate": 3.246073298429319e-05,
75
+ "loss": 0.14603865623474122,
76
+ "step": 125
77
+ },
78
+ {
79
+ "epoch": 1.744186046511628,
80
+ "grad_norm": 3.729416608810425,
81
+ "learning_rate": 3.900523560209424e-05,
82
+ "loss": 0.13855588912963868,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 1.744186046511628,
87
+ "eval_accuracy": 0.81130453470879,
88
+ "eval_f1": 0.46785521339816316,
89
+ "eval_loss": 0.06223325803875923,
90
+ "eval_precision": 0.36851063829787234,
91
+ "eval_recall": 0.6405325443786982,
92
+ "eval_runtime": 1.5906,
93
+ "eval_samples_per_second": 214.385,
94
+ "eval_steps_per_second": 3.772,
95
+ "step": 150
96
+ },
97
+ {
98
+ "epoch": 2.0348837209302326,
99
+ "grad_norm": 1.2140589952468872,
100
+ "learning_rate": 4.554973821989529e-05,
101
+ "loss": 0.09624839782714843,
102
+ "step": 175
103
+ },
104
+ {
105
+ "epoch": 2.3255813953488373,
106
+ "grad_norm": 0.875888466835022,
107
+ "learning_rate": 4.999346304613061e-05,
108
+ "loss": 0.0821054744720459,
109
+ "step": 200
110
+ },
111
+ {
112
+ "epoch": 2.3255813953488373,
113
+ "eval_accuracy": 0.7872340425531915,
114
+ "eval_f1": 0.4847619047619048,
115
+ "eval_loss": 0.04723217338323593,
116
+ "eval_precision": 0.3574438202247191,
117
+ "eval_recall": 0.7529585798816568,
118
+ "eval_runtime": 1.6255,
119
+ "eval_samples_per_second": 209.777,
120
+ "eval_steps_per_second": 3.691,
121
+ "step": 200
122
+ },
123
+ {
124
+ "epoch": 2.616279069767442,
125
+ "grad_norm": 1.0979472398757935,
126
+ "learning_rate": 4.98888472605987e-05,
127
+ "loss": 0.08414460182189941,
128
+ "step": 225
129
+ },
130
+ {
131
+ "epoch": 2.9069767441860463,
132
+ "grad_norm": 0.49558770656585693,
133
+ "learning_rate": 4.965717280180432e-05,
134
+ "loss": 0.08369583129882813,
135
+ "step": 250
136
+ },
137
+ {
138
+ "epoch": 2.9069767441860463,
139
+ "eval_accuracy": 0.6211046636578551,
140
+ "eval_f1": 0.3483915126625599,
141
+ "eval_loss": 0.045315902680158615,
142
+ "eval_precision": 0.22662511130899377,
143
+ "eval_recall": 0.7529585798816568,
144
+ "eval_runtime": 1.6274,
145
+ "eval_samples_per_second": 209.539,
146
+ "eval_steps_per_second": 3.687,
147
+ "step": 250
148
+ },
149
+ {
150
+ "epoch": 3.197674418604651,
151
+ "grad_norm": 0.8114362955093384,
152
+ "learning_rate": 4.9299622378173246e-05,
153
+ "loss": 0.05607881069183349,
154
+ "step": 275
155
+ },
156
+ {
157
+ "epoch": 3.488372093023256,
158
+ "grad_norm": 0.6278374195098877,
159
+ "learning_rate": 4.881802130053548e-05,
160
+ "loss": 0.043469696044921874,
161
+ "step": 300
162
+ },
163
+ {
164
+ "epoch": 3.488372093023256,
165
+ "eval_accuracy": 0.8082957231893402,
166
+ "eval_f1": 0.5285784074255008,
167
+ "eval_loss": 0.04308881610631943,
168
+ "eval_precision": 0.39460247994164843,
169
+ "eval_recall": 0.8002958579881657,
170
+ "eval_runtime": 1.6193,
171
+ "eval_samples_per_second": 210.585,
172
+ "eval_steps_per_second": 3.705,
173
+ "step": 300
174
+ },
175
+ {
176
+ "epoch": 3.7790697674418605,
177
+ "grad_norm": 1.0219486951828003,
178
+ "learning_rate": 4.821482816383218e-05,
179
+ "loss": 0.047760300636291504,
180
+ "step": 325
181
+ },
182
+ {
183
+ "epoch": 4.069767441860465,
184
+ "grad_norm": 0.509274959564209,
185
+ "learning_rate": 4.749312229587908e-05,
186
+ "loss": 0.03177810907363891,
187
+ "step": 350
188
+ },
189
+ {
190
+ "epoch": 4.069767441860465,
191
+ "eval_accuracy": 0.9196217494089834,
192
+ "eval_f1": 0.7152317880794702,
193
+ "eval_loss": 0.04378104954957962,
194
+ "eval_precision": 0.6474820143884892,
195
+ "eval_recall": 0.7988165680473372,
196
+ "eval_runtime": 1.6177,
197
+ "eval_samples_per_second": 210.792,
198
+ "eval_steps_per_second": 3.709,
199
+ "step": 350
200
+ },
201
+ {
202
+ "epoch": 4.3604651162790695,
203
+ "grad_norm": 0.47098585963249207,
204
+ "learning_rate": 4.6656588037260834e-05,
205
+ "loss": 0.020146708488464355,
206
+ "step": 375
207
+ },
208
+ {
209
+ "epoch": 4.651162790697675,
210
+ "grad_norm": 0.7534321546554565,
211
+ "learning_rate": 4.570949593260837e-05,
212
+ "loss": 0.018921481370925905,
213
+ "step": 400
214
+ },
215
+ {
216
+ "epoch": 4.651162790697675,
217
+ "eval_accuracy": 0.9097356544165055,
218
+ "eval_f1": 0.6987341772151898,
219
+ "eval_loss": 0.05498046055436134,
220
+ "eval_precision": 0.6106194690265486,
221
+ "eval_recall": 0.8165680473372781,
222
+ "eval_runtime": 1.6157,
223
+ "eval_samples_per_second": 211.05,
224
+ "eval_steps_per_second": 3.713,
225
+ "step": 400
226
+ },
227
+ {
228
+ "epoch": 4.941860465116279,
229
+ "grad_norm": 0.7499828934669495,
230
+ "learning_rate": 4.465668092927841e-05,
231
+ "loss": 0.01998784065246582,
232
+ "step": 425
233
+ },
234
+ {
235
+ "epoch": 5.232558139534884,
236
+ "grad_norm": 0.24809418618679047,
237
+ "learning_rate": 4.350351769473198e-05,
238
+ "loss": 0.01218403697013855,
239
+ "step": 450
240
+ },
241
+ {
242
+ "epoch": 5.232558139534884,
243
+ "eval_accuracy": 0.9084461637653127,
244
+ "eval_f1": 0.6831746031746032,
245
+ "eval_loss": 0.05535344406962395,
246
+ "eval_precision": 0.5984427141268076,
247
+ "eval_recall": 0.7958579881656804,
248
+ "eval_runtime": 1.6123,
249
+ "eval_samples_per_second": 211.498,
250
+ "eval_steps_per_second": 3.721,
251
+ "step": 450
252
+ },
253
+ {
254
+ "epoch": 5.523255813953488,
255
+ "grad_norm": 0.3144132196903229,
256
+ "learning_rate": 4.2255893178617745e-05,
257
+ "loss": 0.012306832075119019,
258
+ "step": 475
259
+ },
260
+ {
261
+ "epoch": 5.813953488372093,
262
+ "grad_norm": 0.1607646942138672,
263
+ "learning_rate": 4.092017655963198e-05,
264
+ "loss": 0.010539753437042236,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 5.813953488372093,
269
+ "eval_accuracy": 0.9527186761229315,
270
+ "eval_f1": 0.8059040590405904,
271
+ "eval_loss": 0.07191809266805649,
272
+ "eval_precision": 0.8041237113402062,
273
+ "eval_recall": 0.8076923076923077,
274
+ "eval_runtime": 1.6569,
275
+ "eval_samples_per_second": 205.806,
276
+ "eval_steps_per_second": 3.621,
277
+ "step": 500
278
+ },
279
+ {
280
+ "epoch": 6.104651162790698,
281
+ "grad_norm": 0.19801200926303864,
282
+ "learning_rate": 3.9503186730577816e-05,
283
+ "loss": 0.008691226243972778,
284
+ "step": 525
285
+ },
286
+ {
287
+ "epoch": 6.395348837209302,
288
+ "grad_norm": 0.4177681505680084,
289
+ "learning_rate": 3.801215748761385e-05,
290
+ "loss": 0.004750225245952606,
291
+ "step": 550
292
+ },
293
+ {
294
+ "epoch": 6.395348837209302,
295
+ "eval_accuracy": 0.9458413926499033,
296
+ "eval_f1": 0.7863866763215062,
297
+ "eval_loss": 0.07378304749727249,
298
+ "eval_precision": 0.7702127659574468,
299
+ "eval_recall": 0.8032544378698225,
300
+ "eval_runtime": 1.6214,
301
+ "eval_samples_per_second": 210.313,
302
+ "eval_steps_per_second": 3.701,
303
+ "step": 550
304
+ },
305
+ {
306
+ "epoch": 6.686046511627907,
307
+ "grad_norm": 0.30753573775291443,
308
+ "learning_rate": 3.645470060140278e-05,
309
+ "loss": 0.005743271708488464,
310
+ "step": 575
311
+ },
312
+ {
313
+ "epoch": 6.976744186046512,
314
+ "grad_norm": 0.13237181305885315,
315
+ "learning_rate": 3.4838766958683304e-05,
316
+ "loss": 0.006215065121650696,
317
+ "step": 600
318
+ },
319
+ {
320
+ "epoch": 6.976744186046512,
321
+ "eval_accuracy": 0.9447668171072426,
322
+ "eval_f1": 0.7789934354485777,
323
+ "eval_loss": 0.062308527529239655,
324
+ "eval_precision": 0.7683453237410072,
325
+ "eval_recall": 0.7899408284023669,
326
+ "eval_runtime": 1.6197,
327
+ "eval_samples_per_second": 210.528,
328
+ "eval_steps_per_second": 3.704,
329
+ "step": 600
330
+ },
331
+ {
332
+ "epoch": 7.267441860465116,
333
+ "grad_norm": 0.023809686303138733,
334
+ "learning_rate": 3.317260597263932e-05,
335
+ "loss": 0.002318141460418701,
336
+ "step": 625
337
+ },
338
+ {
339
+ "epoch": 7.558139534883721,
340
+ "grad_norm": 0.03782212734222412,
341
+ "learning_rate": 3.146472346927845e-05,
342
+ "loss": 0.003790220320224762,
343
+ "step": 650
344
+ },
345
+ {
346
+ "epoch": 7.558139534883721,
347
+ "eval_accuracy": 0.9529335912314636,
348
+ "eval_f1": 0.8062827225130891,
349
+ "eval_loss": 0.07683796435594559,
350
+ "eval_precision": 0.8154311649016641,
351
+ "eval_recall": 0.7973372781065089,
352
+ "eval_runtime": 1.6235,
353
+ "eval_samples_per_second": 210.043,
354
+ "eval_steps_per_second": 3.696,
355
+ "step": 650
356
+ },
357
+ {
358
+ "epoch": 7.848837209302325,
359
+ "grad_norm": 0.037971507757902145,
360
+ "learning_rate": 2.9723838264811545e-05,
361
+ "loss": 0.0018679146468639374,
362
+ "step": 675
363
+ },
364
+ {
365
+ "epoch": 8.13953488372093,
366
+ "grad_norm": 0.6083823442459106,
367
+ "learning_rate": 2.7958837655707814e-05,
368
+ "loss": 0.0019237904250621796,
369
+ "step": 700
370
+ },
371
+ {
372
+ "epoch": 8.13953488372093,
373
+ "eval_accuracy": 0.9565871480765098,
374
+ "eval_f1": 0.8152091254752851,
375
+ "eval_loss": 0.08732757717370987,
376
+ "eval_precision": 0.838810641627543,
377
+ "eval_recall": 0.7928994082840237,
378
+ "eval_runtime": 1.6124,
379
+ "eval_samples_per_second": 211.484,
380
+ "eval_steps_per_second": 3.721,
381
+ "step": 700
382
+ },
383
+ {
384
+ "epoch": 8.430232558139535,
385
+ "grad_norm": 0.022007286548614502,
386
+ "learning_rate": 2.6178732048650694e-05,
387
+ "loss": 0.0010710173845291137,
388
+ "step": 725
389
+ },
390
+ {
391
+ "epoch": 8.720930232558139,
392
+ "grad_norm": 0.09439104795455933,
393
+ "learning_rate": 2.4392608962010652e-05,
394
+ "loss": 0.0006907544285058976,
395
+ "step": 750
396
+ },
397
+ {
398
+ "epoch": 8.720930232558139,
399
+ "eval_accuracy": 0.9449817322157748,
400
+ "eval_f1": 0.7829848594087959,
401
+ "eval_loss": 0.08308640867471695,
402
+ "eval_precision": 0.7637130801687764,
403
+ "eval_recall": 0.8032544378698225,
404
+ "eval_runtime": 1.6359,
405
+ "eval_samples_per_second": 208.445,
406
+ "eval_steps_per_second": 3.668,
407
+ "step": 750
408
+ },
409
+ {
410
+ "epoch": 9.011627906976743,
411
+ "grad_norm": 0.018290311098098755,
412
+ "learning_rate": 2.2609586633659256e-05,
413
+ "loss": 0.0005397907271981239,
414
+ "step": 775
415
+ },
416
+ {
417
+ "epoch": 9.30232558139535,
418
+ "grad_norm": 0.002839206252247095,
419
+ "learning_rate": 2.0838767471959014e-05,
420
+ "loss": 0.0002632186934351921,
421
+ "step": 800
422
+ },
423
+ {
424
+ "epoch": 9.30232558139535,
425
+ "eval_accuracy": 0.9544379969911885,
426
+ "eval_f1": 0.8081880212282032,
427
+ "eval_loss": 0.09754534065723419,
428
+ "eval_precision": 0.8289269051321928,
429
+ "eval_recall": 0.7884615384615384,
430
+ "eval_runtime": 1.6188,
431
+ "eval_samples_per_second": 210.653,
432
+ "eval_steps_per_second": 3.706,
433
+ "step": 800
434
+ },
435
+ {
436
+ "epoch": 9.593023255813954,
437
+ "grad_norm": 0.04134448245167732,
438
+ "learning_rate": 1.9089191587563417e-05,
439
+ "loss": 0.0005076020956039428,
440
+ "step": 825
441
+ },
442
+ {
443
+ "epoch": 9.883720930232558,
444
+ "grad_norm": 0.08968573063611984,
445
+ "learning_rate": 1.7369790643249573e-05,
446
+ "loss": 0.0005874237418174743,
447
+ "step": 850
448
+ },
449
+ {
450
+ "epoch": 9.883720930232558,
451
+ "eval_accuracy": 0.9548678272082527,
452
+ "eval_f1": 0.8093797276853252,
453
+ "eval_loss": 0.09803693741559982,
454
+ "eval_precision": 0.8281733746130031,
455
+ "eval_recall": 0.7914201183431953,
456
+ "eval_runtime": 1.6209,
457
+ "eval_samples_per_second": 210.379,
458
+ "eval_steps_per_second": 3.702,
459
+ "step": 850
460
+ },
461
+ {
462
+ "epoch": 10.174418604651162,
463
+ "grad_norm": 0.02889181859791279,
464
+ "learning_rate": 1.5689342257382207e-05,
465
+ "loss": 0.0004838050529360771,
466
+ "step": 875
467
+ },
468
+ {
469
+ "epoch": 10.465116279069768,
470
+ "grad_norm": 0.020970497280359268,
471
+ "learning_rate": 1.4056425193781048e-05,
472
+ "loss": 0.0001906752586364746,
473
+ "step": 900
474
+ },
475
+ {
476
+ "epoch": 10.465116279069768,
477
+ "eval_accuracy": 0.9587362991618311,
478
+ "eval_f1": 0.8228043143297381,
479
+ "eval_loss": 0.10382715612649918,
480
+ "eval_precision": 0.8585209003215434,
481
+ "eval_recall": 0.7899408284023669,
482
+ "eval_runtime": 1.6341,
483
+ "eval_samples_per_second": 208.675,
484
+ "eval_steps_per_second": 3.672,
485
+ "step": 900
486
+ },
487
+ {
488
+ "epoch": 10.755813953488373,
489
+ "grad_norm": 0.028520096093416214,
490
+ "learning_rate": 1.2479375566749694e-05,
491
+ "loss": 0.00012492083944380284,
492
+ "step": 925
493
+ },
494
+ {
495
+ "epoch": 11.046511627906977,
496
+ "grad_norm": 0.03838531672954559,
497
+ "learning_rate": 1.0966244284840926e-05,
498
+ "loss": 0.00028255857527256014,
499
+ "step": 950
500
+ },
501
+ {
502
+ "epoch": 11.046511627906977,
503
+ "eval_accuracy": 0.9580915538362347,
504
+ "eval_f1": 0.819369715603382,
505
+ "eval_loss": 0.10540532320737839,
506
+ "eval_precision": 0.8528,
507
+ "eval_recall": 0.7884615384615384,
508
+ "eval_runtime": 1.6495,
509
+ "eval_samples_per_second": 206.73,
510
+ "eval_steps_per_second": 3.637,
511
+ "step": 950
512
+ },
513
+ {
514
+ "epoch": 11.337209302325581,
515
+ "grad_norm": 0.05398673936724663,
516
+ "learning_rate": 9.524755950610204e-06,
517
+ "loss": 0.00014415644109249114,
518
+ "step": 975
519
+ },
520
+ {
521
+ "epoch": 11.627906976744185,
522
+ "grad_norm": 0.026561638340353966,
523
+ "learning_rate": 8.162269426175681e-06,
524
+ "loss": 9.150288999080658e-05,
525
+ "step": 1000
526
+ },
527
+ {
528
+ "epoch": 11.627906976744185,
529
+ "eval_accuracy": 0.9574468085106383,
530
+ "eval_f1": 0.8180428134556575,
531
+ "eval_loss": 0.10544126480817795,
532
+ "eval_precision": 0.8465189873417721,
533
+ "eval_recall": 0.7914201183431953,
534
+ "eval_runtime": 1.6274,
535
+ "eval_samples_per_second": 209.539,
536
+ "eval_steps_per_second": 3.687,
537
+ "step": 1000
538
+ },
539
+ {
540
+ "epoch": 11.918604651162791,
541
+ "grad_norm": 0.010734460316598415,
542
+ "learning_rate": 6.885740265899526e-06,
543
+ "loss": 4.033456556499005e-05,
544
+ "step": 1025
545
+ },
546
+ {
547
+ "epoch": 12.209302325581396,
548
+ "grad_norm": 0.02024712599813938,
549
+ "learning_rate": 5.701685207973243e-06,
550
+ "loss": 6.52561942115426e-05,
551
+ "step": 1050
552
+ },
553
+ {
554
+ "epoch": 12.209302325581396,
555
+ "eval_accuracy": 0.9576617236191705,
556
+ "eval_f1": 0.8190184049079755,
557
+ "eval_loss": 0.10666228085756302,
558
+ "eval_precision": 0.8503184713375797,
559
+ "eval_recall": 0.7899408284023669,
560
+ "eval_runtime": 1.6269,
561
+ "eval_samples_per_second": 209.598,
562
+ "eval_steps_per_second": 3.688,
563
+ "step": 1050
564
+ },
565
+ {
566
+ "epoch": 12.5,
567
+ "grad_norm": 0.034469809383153915,
568
+ "learning_rate": 4.616148906179082e-06,
569
+ "loss": 7.551711052656174e-05,
570
+ "step": 1075
571
+ },
572
+ {
573
+ "epoch": 12.790697674418604,
574
+ "grad_norm": 0.004050907213240862,
575
+ "learning_rate": 3.6346730716634025e-06,
576
+ "loss": 7.49318953603506e-05,
577
+ "step": 1100
578
+ },
579
+ {
580
+ "epoch": 12.790697674418604,
581
+ "eval_accuracy": 0.9565871480765098,
582
+ "eval_f1": 0.8146453089244853,
583
+ "eval_loss": 0.10619472712278366,
584
+ "eval_precision": 0.8409448818897638,
585
+ "eval_recall": 0.7899408284023669,
586
+ "eval_runtime": 1.6196,
587
+ "eval_samples_per_second": 210.546,
588
+ "eval_steps_per_second": 3.705,
589
+ "step": 1100
590
+ },
591
+ {
592
+ "epoch": 13.081395348837209,
593
+ "grad_norm": 0.11917345970869064,
594
+ "learning_rate": 2.7622681822545764e-06,
595
+ "loss": 8.815748617053032e-05,
596
+ "step": 1125
597
+ },
598
+ {
599
+ "epoch": 13.372093023255815,
600
+ "grad_norm": 0.02682509273290634,
601
+ "learning_rate": 2.0033879037506004e-06,
602
+ "loss": 6.015756167471409e-05,
603
+ "step": 1150
604
+ },
605
+ {
606
+ "epoch": 13.372093023255815,
607
+ "eval_accuracy": 0.9583064689447668,
608
+ "eval_f1": 0.8205521472392638,
609
+ "eval_loss": 0.10740578919649124,
610
+ "eval_precision": 0.8519108280254777,
611
+ "eval_recall": 0.7914201183431953,
612
+ "eval_runtime": 1.6217,
613
+ "eval_samples_per_second": 210.273,
614
+ "eval_steps_per_second": 3.7,
615
+ "step": 1150
616
+ },
617
+ {
618
+ "epoch": 13.662790697674419,
619
+ "grad_norm": 0.004100531339645386,
620
+ "learning_rate": 1.361906353756917e-06,
621
+ "loss": 4.690625239163637e-05,
622
+ "step": 1175
623
+ },
624
+ {
625
+ "epoch": 13.953488372093023,
626
+ "grad_norm": 0.008385015651583672,
627
+ "learning_rate": 8.410983241436132e-07,
628
+ "loss": 6.560925394296646e-05,
629
+ "step": 1200
630
+ },
631
+ {
632
+ "epoch": 13.953488372093023,
633
+ "eval_accuracy": 0.9578766387277026,
634
+ "eval_f1": 0.8181120491174213,
635
+ "eval_loss": 0.10830119252204895,
636
+ "eval_precision": 0.8500797448165869,
637
+ "eval_recall": 0.7884615384615384,
638
+ "eval_runtime": 1.6315,
639
+ "eval_samples_per_second": 209.012,
640
+ "eval_steps_per_second": 3.678,
641
+ "step": 1200
642
+ },
643
+ {
644
+ "epoch": 14.244186046511627,
645
+ "grad_norm": 0.003520221682265401,
646
+ "learning_rate": 4.436225630870927e-07,
647
+ "loss": 0.00012058223597705364,
648
+ "step": 1225
649
+ },
650
+ {
651
+ "epoch": 14.534883720930232,
652
+ "grad_norm": 0.00905795767903328,
653
+ "learning_rate": 1.7150820204230865e-07,
654
+ "loss": 8.818465285003186e-05,
655
+ "step": 1250
656
+ },
657
+ {
658
+ "epoch": 14.534883720930232,
659
+ "eval_accuracy": 0.9578766387277026,
660
+ "eval_f1": 0.8187403993855606,
661
+ "eval_loss": 0.10815286636352539,
662
+ "eval_precision": 0.8514376996805112,
663
+ "eval_recall": 0.7884615384615384,
664
+ "eval_runtime": 1.6307,
665
+ "eval_samples_per_second": 209.118,
666
+ "eval_steps_per_second": 3.68,
667
+ "step": 1250
668
+ }
669
+ ],
670
+ "logging_steps": 25,
671
+ "max_steps": 1290,
672
+ "num_input_tokens_seen": 0,
673
+ "num_train_epochs": 15,
674
+ "save_steps": 50,
675
+ "stateful_callbacks": {
676
+ "EarlyStoppingCallback": {
677
+ "args": {
678
+ "early_stopping_patience": 10,
679
+ "early_stopping_threshold": 0.0
680
+ },
681
+ "attributes": {
682
+ "early_stopping_patience_counter": 7
683
+ }
684
+ },
685
+ "TrainerControl": {
686
+ "args": {
687
+ "should_epoch_stop": false,
688
+ "should_evaluate": false,
689
+ "should_log": false,
690
+ "should_save": true,
691
+ "should_training_stop": false
692
+ },
693
+ "attributes": {}
694
+ }
695
+ },
696
+ "total_flos": 6779518344422400.0,
697
+ "train_batch_size": 16,
698
+ "trial_name": null,
699
+ "trial_params": null
700
+ }
checkpoint-1250/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5071855a54d36018bc5c30ca34d9fef42b69fb3deda057af4ffc70193237d5c4
3
+ size 5201
checkpoint-1290/config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
checkpoint-1290/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bcf0010171b4f8ae74bc0a9404acd43c43af4d80dddb7e09b0c0b6869ef892b4
3
+ size 598449012
checkpoint-1290/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2bc640cb921976850ac3b758c0e4e59bbdcd79d21ee8a30628d399276e70f72b
3
+ size 535150859
checkpoint-1290/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6cf1a66cc75ea89e6d13a532e3309a73f39df97be9642d5bb258af4a75b423c6
3
+ size 14709
checkpoint-1290/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a746d7e4a1d22729f55d871883d7524e4414d4d2354d4dc07d961fc5518e6046
3
+ size 1465
checkpoint-1290/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1290/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "is_local": false,
6
+ "mask_token": "[MASK]",
7
+ "model_input_names": [
8
+ "input_ids",
9
+ "attention_mask"
10
+ ],
11
+ "model_max_length": 8192,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-1290/trainer_state.json ADDED
@@ -0,0 +1,707 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 900,
3
+ "best_metric": 0.8228043143297381,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900",
5
+ "epoch": 15.0,
6
+ "eval_steps": 50,
7
+ "global_step": 1290,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011627906976744186,
14
+ "grad_norm": 4.9740142822265625,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.317932665348053,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.29069767441860467,
21
+ "grad_norm": 1.5566426515579224,
22
+ "learning_rate": 6.282722513089005e-06,
23
+ "loss": 0.3199571371078491,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.5813953488372093,
28
+ "grad_norm": 1.6379677057266235,
29
+ "learning_rate": 1.2827225130890053e-05,
30
+ "loss": 0.24125898361206055,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.5813953488372093,
35
+ "eval_accuracy": 0.8287126584998925,
36
+ "eval_f1": 0.08611410118406888,
37
+ "eval_loss": 0.10772959887981415,
38
+ "eval_precision": 0.15810276679841898,
39
+ "eval_recall": 0.05917159763313609,
40
+ "eval_runtime": 4.2273,
41
+ "eval_samples_per_second": 80.667,
42
+ "eval_steps_per_second": 1.419,
43
+ "step": 50
44
+ },
45
+ {
46
+ "epoch": 0.872093023255814,
47
+ "grad_norm": 8.703161239624023,
48
+ "learning_rate": 1.93717277486911e-05,
49
+ "loss": 0.20946041107177735,
50
+ "step": 75
51
+ },
52
+ {
53
+ "epoch": 1.1627906976744187,
54
+ "grad_norm": 0.9212121963500977,
55
+ "learning_rate": 2.591623036649215e-05,
56
+ "loss": 0.19275867462158203,
57
+ "step": 100
58
+ },
59
+ {
60
+ "epoch": 1.1627906976744187,
61
+ "eval_accuracy": 0.7635933806146572,
62
+ "eval_f1": 0.3981945837512538,
63
+ "eval_loss": 0.07719173282384872,
64
+ "eval_precision": 0.30121396054628224,
65
+ "eval_recall": 0.5872781065088757,
66
+ "eval_runtime": 1.6016,
67
+ "eval_samples_per_second": 212.909,
68
+ "eval_steps_per_second": 3.746,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 1.4534883720930232,
73
+ "grad_norm": 1.46477210521698,
74
+ "learning_rate": 3.246073298429319e-05,
75
+ "loss": 0.14603865623474122,
76
+ "step": 125
77
+ },
78
+ {
79
+ "epoch": 1.744186046511628,
80
+ "grad_norm": 3.729416608810425,
81
+ "learning_rate": 3.900523560209424e-05,
82
+ "loss": 0.13855588912963868,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 1.744186046511628,
87
+ "eval_accuracy": 0.81130453470879,
88
+ "eval_f1": 0.46785521339816316,
89
+ "eval_loss": 0.06223325803875923,
90
+ "eval_precision": 0.36851063829787234,
91
+ "eval_recall": 0.6405325443786982,
92
+ "eval_runtime": 1.5906,
93
+ "eval_samples_per_second": 214.385,
94
+ "eval_steps_per_second": 3.772,
95
+ "step": 150
96
+ },
97
+ {
98
+ "epoch": 2.0348837209302326,
99
+ "grad_norm": 1.2140589952468872,
100
+ "learning_rate": 4.554973821989529e-05,
101
+ "loss": 0.09624839782714843,
102
+ "step": 175
103
+ },
104
+ {
105
+ "epoch": 2.3255813953488373,
106
+ "grad_norm": 0.875888466835022,
107
+ "learning_rate": 4.999346304613061e-05,
108
+ "loss": 0.0821054744720459,
109
+ "step": 200
110
+ },
111
+ {
112
+ "epoch": 2.3255813953488373,
113
+ "eval_accuracy": 0.7872340425531915,
114
+ "eval_f1": 0.4847619047619048,
115
+ "eval_loss": 0.04723217338323593,
116
+ "eval_precision": 0.3574438202247191,
117
+ "eval_recall": 0.7529585798816568,
118
+ "eval_runtime": 1.6255,
119
+ "eval_samples_per_second": 209.777,
120
+ "eval_steps_per_second": 3.691,
121
+ "step": 200
122
+ },
123
+ {
124
+ "epoch": 2.616279069767442,
125
+ "grad_norm": 1.0979472398757935,
126
+ "learning_rate": 4.98888472605987e-05,
127
+ "loss": 0.08414460182189941,
128
+ "step": 225
129
+ },
130
+ {
131
+ "epoch": 2.9069767441860463,
132
+ "grad_norm": 0.49558770656585693,
133
+ "learning_rate": 4.965717280180432e-05,
134
+ "loss": 0.08369583129882813,
135
+ "step": 250
136
+ },
137
+ {
138
+ "epoch": 2.9069767441860463,
139
+ "eval_accuracy": 0.6211046636578551,
140
+ "eval_f1": 0.3483915126625599,
141
+ "eval_loss": 0.045315902680158615,
142
+ "eval_precision": 0.22662511130899377,
143
+ "eval_recall": 0.7529585798816568,
144
+ "eval_runtime": 1.6274,
145
+ "eval_samples_per_second": 209.539,
146
+ "eval_steps_per_second": 3.687,
147
+ "step": 250
148
+ },
149
+ {
150
+ "epoch": 3.197674418604651,
151
+ "grad_norm": 0.8114362955093384,
152
+ "learning_rate": 4.9299622378173246e-05,
153
+ "loss": 0.05607881069183349,
154
+ "step": 275
155
+ },
156
+ {
157
+ "epoch": 3.488372093023256,
158
+ "grad_norm": 0.6278374195098877,
159
+ "learning_rate": 4.881802130053548e-05,
160
+ "loss": 0.043469696044921874,
161
+ "step": 300
162
+ },
163
+ {
164
+ "epoch": 3.488372093023256,
165
+ "eval_accuracy": 0.8082957231893402,
166
+ "eval_f1": 0.5285784074255008,
167
+ "eval_loss": 0.04308881610631943,
168
+ "eval_precision": 0.39460247994164843,
169
+ "eval_recall": 0.8002958579881657,
170
+ "eval_runtime": 1.6193,
171
+ "eval_samples_per_second": 210.585,
172
+ "eval_steps_per_second": 3.705,
173
+ "step": 300
174
+ },
175
+ {
176
+ "epoch": 3.7790697674418605,
177
+ "grad_norm": 1.0219486951828003,
178
+ "learning_rate": 4.821482816383218e-05,
179
+ "loss": 0.047760300636291504,
180
+ "step": 325
181
+ },
182
+ {
183
+ "epoch": 4.069767441860465,
184
+ "grad_norm": 0.509274959564209,
185
+ "learning_rate": 4.749312229587908e-05,
186
+ "loss": 0.03177810907363891,
187
+ "step": 350
188
+ },
189
+ {
190
+ "epoch": 4.069767441860465,
191
+ "eval_accuracy": 0.9196217494089834,
192
+ "eval_f1": 0.7152317880794702,
193
+ "eval_loss": 0.04378104954957962,
194
+ "eval_precision": 0.6474820143884892,
195
+ "eval_recall": 0.7988165680473372,
196
+ "eval_runtime": 1.6177,
197
+ "eval_samples_per_second": 210.792,
198
+ "eval_steps_per_second": 3.709,
199
+ "step": 350
200
+ },
201
+ {
202
+ "epoch": 4.3604651162790695,
203
+ "grad_norm": 0.47098585963249207,
204
+ "learning_rate": 4.6656588037260834e-05,
205
+ "loss": 0.020146708488464355,
206
+ "step": 375
207
+ },
208
+ {
209
+ "epoch": 4.651162790697675,
210
+ "grad_norm": 0.7534321546554565,
211
+ "learning_rate": 4.570949593260837e-05,
212
+ "loss": 0.018921481370925905,
213
+ "step": 400
214
+ },
215
+ {
216
+ "epoch": 4.651162790697675,
217
+ "eval_accuracy": 0.9097356544165055,
218
+ "eval_f1": 0.6987341772151898,
219
+ "eval_loss": 0.05498046055436134,
220
+ "eval_precision": 0.6106194690265486,
221
+ "eval_recall": 0.8165680473372781,
222
+ "eval_runtime": 1.6157,
223
+ "eval_samples_per_second": 211.05,
224
+ "eval_steps_per_second": 3.713,
225
+ "step": 400
226
+ },
227
+ {
228
+ "epoch": 4.941860465116279,
229
+ "grad_norm": 0.7499828934669495,
230
+ "learning_rate": 4.465668092927841e-05,
231
+ "loss": 0.01998784065246582,
232
+ "step": 425
233
+ },
234
+ {
235
+ "epoch": 5.232558139534884,
236
+ "grad_norm": 0.24809418618679047,
237
+ "learning_rate": 4.350351769473198e-05,
238
+ "loss": 0.01218403697013855,
239
+ "step": 450
240
+ },
241
+ {
242
+ "epoch": 5.232558139534884,
243
+ "eval_accuracy": 0.9084461637653127,
244
+ "eval_f1": 0.6831746031746032,
245
+ "eval_loss": 0.05535344406962395,
246
+ "eval_precision": 0.5984427141268076,
247
+ "eval_recall": 0.7958579881656804,
248
+ "eval_runtime": 1.6123,
249
+ "eval_samples_per_second": 211.498,
250
+ "eval_steps_per_second": 3.721,
251
+ "step": 450
252
+ },
253
+ {
254
+ "epoch": 5.523255813953488,
255
+ "grad_norm": 0.3144132196903229,
256
+ "learning_rate": 4.2255893178617745e-05,
257
+ "loss": 0.012306832075119019,
258
+ "step": 475
259
+ },
260
+ {
261
+ "epoch": 5.813953488372093,
262
+ "grad_norm": 0.1607646942138672,
263
+ "learning_rate": 4.092017655963198e-05,
264
+ "loss": 0.010539753437042236,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 5.813953488372093,
269
+ "eval_accuracy": 0.9527186761229315,
270
+ "eval_f1": 0.8059040590405904,
271
+ "eval_loss": 0.07191809266805649,
272
+ "eval_precision": 0.8041237113402062,
273
+ "eval_recall": 0.8076923076923077,
274
+ "eval_runtime": 1.6569,
275
+ "eval_samples_per_second": 205.806,
276
+ "eval_steps_per_second": 3.621,
277
+ "step": 500
278
+ },
279
+ {
280
+ "epoch": 6.104651162790698,
281
+ "grad_norm": 0.19801200926303864,
282
+ "learning_rate": 3.9503186730577816e-05,
283
+ "loss": 0.008691226243972778,
284
+ "step": 525
285
+ },
286
+ {
287
+ "epoch": 6.395348837209302,
288
+ "grad_norm": 0.4177681505680084,
289
+ "learning_rate": 3.801215748761385e-05,
290
+ "loss": 0.004750225245952606,
291
+ "step": 550
292
+ },
293
+ {
294
+ "epoch": 6.395348837209302,
295
+ "eval_accuracy": 0.9458413926499033,
296
+ "eval_f1": 0.7863866763215062,
297
+ "eval_loss": 0.07378304749727249,
298
+ "eval_precision": 0.7702127659574468,
299
+ "eval_recall": 0.8032544378698225,
300
+ "eval_runtime": 1.6214,
301
+ "eval_samples_per_second": 210.313,
302
+ "eval_steps_per_second": 3.701,
303
+ "step": 550
304
+ },
305
+ {
306
+ "epoch": 6.686046511627907,
307
+ "grad_norm": 0.30753573775291443,
308
+ "learning_rate": 3.645470060140278e-05,
309
+ "loss": 0.005743271708488464,
310
+ "step": 575
311
+ },
312
+ {
313
+ "epoch": 6.976744186046512,
314
+ "grad_norm": 0.13237181305885315,
315
+ "learning_rate": 3.4838766958683304e-05,
316
+ "loss": 0.006215065121650696,
317
+ "step": 600
318
+ },
319
+ {
320
+ "epoch": 6.976744186046512,
321
+ "eval_accuracy": 0.9447668171072426,
322
+ "eval_f1": 0.7789934354485777,
323
+ "eval_loss": 0.062308527529239655,
324
+ "eval_precision": 0.7683453237410072,
325
+ "eval_recall": 0.7899408284023669,
326
+ "eval_runtime": 1.6197,
327
+ "eval_samples_per_second": 210.528,
328
+ "eval_steps_per_second": 3.704,
329
+ "step": 600
330
+ },
331
+ {
332
+ "epoch": 7.267441860465116,
333
+ "grad_norm": 0.023809686303138733,
334
+ "learning_rate": 3.317260597263932e-05,
335
+ "loss": 0.002318141460418701,
336
+ "step": 625
337
+ },
338
+ {
339
+ "epoch": 7.558139534883721,
340
+ "grad_norm": 0.03782212734222412,
341
+ "learning_rate": 3.146472346927845e-05,
342
+ "loss": 0.003790220320224762,
343
+ "step": 650
344
+ },
345
+ {
346
+ "epoch": 7.558139534883721,
347
+ "eval_accuracy": 0.9529335912314636,
348
+ "eval_f1": 0.8062827225130891,
349
+ "eval_loss": 0.07683796435594559,
350
+ "eval_precision": 0.8154311649016641,
351
+ "eval_recall": 0.7973372781065089,
352
+ "eval_runtime": 1.6235,
353
+ "eval_samples_per_second": 210.043,
354
+ "eval_steps_per_second": 3.696,
355
+ "step": 650
356
+ },
357
+ {
358
+ "epoch": 7.848837209302325,
359
+ "grad_norm": 0.037971507757902145,
360
+ "learning_rate": 2.9723838264811545e-05,
361
+ "loss": 0.0018679146468639374,
362
+ "step": 675
363
+ },
364
+ {
365
+ "epoch": 8.13953488372093,
366
+ "grad_norm": 0.6083823442459106,
367
+ "learning_rate": 2.7958837655707814e-05,
368
+ "loss": 0.0019237904250621796,
369
+ "step": 700
370
+ },
371
+ {
372
+ "epoch": 8.13953488372093,
373
+ "eval_accuracy": 0.9565871480765098,
374
+ "eval_f1": 0.8152091254752851,
375
+ "eval_loss": 0.08732757717370987,
376
+ "eval_precision": 0.838810641627543,
377
+ "eval_recall": 0.7928994082840237,
378
+ "eval_runtime": 1.6124,
379
+ "eval_samples_per_second": 211.484,
380
+ "eval_steps_per_second": 3.721,
381
+ "step": 700
382
+ },
383
+ {
384
+ "epoch": 8.430232558139535,
385
+ "grad_norm": 0.022007286548614502,
386
+ "learning_rate": 2.6178732048650694e-05,
387
+ "loss": 0.0010710173845291137,
388
+ "step": 725
389
+ },
390
+ {
391
+ "epoch": 8.720930232558139,
392
+ "grad_norm": 0.09439104795455933,
393
+ "learning_rate": 2.4392608962010652e-05,
394
+ "loss": 0.0006907544285058976,
395
+ "step": 750
396
+ },
397
+ {
398
+ "epoch": 8.720930232558139,
399
+ "eval_accuracy": 0.9449817322157748,
400
+ "eval_f1": 0.7829848594087959,
401
+ "eval_loss": 0.08308640867471695,
402
+ "eval_precision": 0.7637130801687764,
403
+ "eval_recall": 0.8032544378698225,
404
+ "eval_runtime": 1.6359,
405
+ "eval_samples_per_second": 208.445,
406
+ "eval_steps_per_second": 3.668,
407
+ "step": 750
408
+ },
409
+ {
410
+ "epoch": 9.011627906976743,
411
+ "grad_norm": 0.018290311098098755,
412
+ "learning_rate": 2.2609586633659256e-05,
413
+ "loss": 0.0005397907271981239,
414
+ "step": 775
415
+ },
416
+ {
417
+ "epoch": 9.30232558139535,
418
+ "grad_norm": 0.002839206252247095,
419
+ "learning_rate": 2.0838767471959014e-05,
420
+ "loss": 0.0002632186934351921,
421
+ "step": 800
422
+ },
423
+ {
424
+ "epoch": 9.30232558139535,
425
+ "eval_accuracy": 0.9544379969911885,
426
+ "eval_f1": 0.8081880212282032,
427
+ "eval_loss": 0.09754534065723419,
428
+ "eval_precision": 0.8289269051321928,
429
+ "eval_recall": 0.7884615384615384,
430
+ "eval_runtime": 1.6188,
431
+ "eval_samples_per_second": 210.653,
432
+ "eval_steps_per_second": 3.706,
433
+ "step": 800
434
+ },
435
+ {
436
+ "epoch": 9.593023255813954,
437
+ "grad_norm": 0.04134448245167732,
438
+ "learning_rate": 1.9089191587563417e-05,
439
+ "loss": 0.0005076020956039428,
440
+ "step": 825
441
+ },
442
+ {
443
+ "epoch": 9.883720930232558,
444
+ "grad_norm": 0.08968573063611984,
445
+ "learning_rate": 1.7369790643249573e-05,
446
+ "loss": 0.0005874237418174743,
447
+ "step": 850
448
+ },
449
+ {
450
+ "epoch": 9.883720930232558,
451
+ "eval_accuracy": 0.9548678272082527,
452
+ "eval_f1": 0.8093797276853252,
453
+ "eval_loss": 0.09803693741559982,
454
+ "eval_precision": 0.8281733746130031,
455
+ "eval_recall": 0.7914201183431953,
456
+ "eval_runtime": 1.6209,
457
+ "eval_samples_per_second": 210.379,
458
+ "eval_steps_per_second": 3.702,
459
+ "step": 850
460
+ },
461
+ {
462
+ "epoch": 10.174418604651162,
463
+ "grad_norm": 0.02889181859791279,
464
+ "learning_rate": 1.5689342257382207e-05,
465
+ "loss": 0.0004838050529360771,
466
+ "step": 875
467
+ },
468
+ {
469
+ "epoch": 10.465116279069768,
470
+ "grad_norm": 0.020970497280359268,
471
+ "learning_rate": 1.4056425193781048e-05,
472
+ "loss": 0.0001906752586364746,
473
+ "step": 900
474
+ },
475
+ {
476
+ "epoch": 10.465116279069768,
477
+ "eval_accuracy": 0.9587362991618311,
478
+ "eval_f1": 0.8228043143297381,
479
+ "eval_loss": 0.10382715612649918,
480
+ "eval_precision": 0.8585209003215434,
481
+ "eval_recall": 0.7899408284023669,
482
+ "eval_runtime": 1.6341,
483
+ "eval_samples_per_second": 208.675,
484
+ "eval_steps_per_second": 3.672,
485
+ "step": 900
486
+ },
487
+ {
488
+ "epoch": 10.755813953488373,
489
+ "grad_norm": 0.028520096093416214,
490
+ "learning_rate": 1.2479375566749694e-05,
491
+ "loss": 0.00012492083944380284,
492
+ "step": 925
493
+ },
494
+ {
495
+ "epoch": 11.046511627906977,
496
+ "grad_norm": 0.03838531672954559,
497
+ "learning_rate": 1.0966244284840926e-05,
498
+ "loss": 0.00028255857527256014,
499
+ "step": 950
500
+ },
501
+ {
502
+ "epoch": 11.046511627906977,
503
+ "eval_accuracy": 0.9580915538362347,
504
+ "eval_f1": 0.819369715603382,
505
+ "eval_loss": 0.10540532320737839,
506
+ "eval_precision": 0.8528,
507
+ "eval_recall": 0.7884615384615384,
508
+ "eval_runtime": 1.6495,
509
+ "eval_samples_per_second": 206.73,
510
+ "eval_steps_per_second": 3.637,
511
+ "step": 950
512
+ },
513
+ {
514
+ "epoch": 11.337209302325581,
515
+ "grad_norm": 0.05398673936724663,
516
+ "learning_rate": 9.524755950610204e-06,
517
+ "loss": 0.00014415644109249114,
518
+ "step": 975
519
+ },
520
+ {
521
+ "epoch": 11.627906976744185,
522
+ "grad_norm": 0.026561638340353966,
523
+ "learning_rate": 8.162269426175681e-06,
524
+ "loss": 9.150288999080658e-05,
525
+ "step": 1000
526
+ },
527
+ {
528
+ "epoch": 11.627906976744185,
529
+ "eval_accuracy": 0.9574468085106383,
530
+ "eval_f1": 0.8180428134556575,
531
+ "eval_loss": 0.10544126480817795,
532
+ "eval_precision": 0.8465189873417721,
533
+ "eval_recall": 0.7914201183431953,
534
+ "eval_runtime": 1.6274,
535
+ "eval_samples_per_second": 209.539,
536
+ "eval_steps_per_second": 3.687,
537
+ "step": 1000
538
+ },
539
+ {
540
+ "epoch": 11.918604651162791,
541
+ "grad_norm": 0.010734460316598415,
542
+ "learning_rate": 6.885740265899526e-06,
543
+ "loss": 4.033456556499005e-05,
544
+ "step": 1025
545
+ },
546
+ {
547
+ "epoch": 12.209302325581396,
548
+ "grad_norm": 0.02024712599813938,
549
+ "learning_rate": 5.701685207973243e-06,
550
+ "loss": 6.52561942115426e-05,
551
+ "step": 1050
552
+ },
553
+ {
554
+ "epoch": 12.209302325581396,
555
+ "eval_accuracy": 0.9576617236191705,
556
+ "eval_f1": 0.8190184049079755,
557
+ "eval_loss": 0.10666228085756302,
558
+ "eval_precision": 0.8503184713375797,
559
+ "eval_recall": 0.7899408284023669,
560
+ "eval_runtime": 1.6269,
561
+ "eval_samples_per_second": 209.598,
562
+ "eval_steps_per_second": 3.688,
563
+ "step": 1050
564
+ },
565
+ {
566
+ "epoch": 12.5,
567
+ "grad_norm": 0.034469809383153915,
568
+ "learning_rate": 4.616148906179082e-06,
569
+ "loss": 7.551711052656174e-05,
570
+ "step": 1075
571
+ },
572
+ {
573
+ "epoch": 12.790697674418604,
574
+ "grad_norm": 0.004050907213240862,
575
+ "learning_rate": 3.6346730716634025e-06,
576
+ "loss": 7.49318953603506e-05,
577
+ "step": 1100
578
+ },
579
+ {
580
+ "epoch": 12.790697674418604,
581
+ "eval_accuracy": 0.9565871480765098,
582
+ "eval_f1": 0.8146453089244853,
583
+ "eval_loss": 0.10619472712278366,
584
+ "eval_precision": 0.8409448818897638,
585
+ "eval_recall": 0.7899408284023669,
586
+ "eval_runtime": 1.6196,
587
+ "eval_samples_per_second": 210.546,
588
+ "eval_steps_per_second": 3.705,
589
+ "step": 1100
590
+ },
591
+ {
592
+ "epoch": 13.081395348837209,
593
+ "grad_norm": 0.11917345970869064,
594
+ "learning_rate": 2.7622681822545764e-06,
595
+ "loss": 8.815748617053032e-05,
596
+ "step": 1125
597
+ },
598
+ {
599
+ "epoch": 13.372093023255815,
600
+ "grad_norm": 0.02682509273290634,
601
+ "learning_rate": 2.0033879037506004e-06,
602
+ "loss": 6.015756167471409e-05,
603
+ "step": 1150
604
+ },
605
+ {
606
+ "epoch": 13.372093023255815,
607
+ "eval_accuracy": 0.9583064689447668,
608
+ "eval_f1": 0.8205521472392638,
609
+ "eval_loss": 0.10740578919649124,
610
+ "eval_precision": 0.8519108280254777,
611
+ "eval_recall": 0.7914201183431953,
612
+ "eval_runtime": 1.6217,
613
+ "eval_samples_per_second": 210.273,
614
+ "eval_steps_per_second": 3.7,
615
+ "step": 1150
616
+ },
617
+ {
618
+ "epoch": 13.662790697674419,
619
+ "grad_norm": 0.004100531339645386,
620
+ "learning_rate": 1.361906353756917e-06,
621
+ "loss": 4.690625239163637e-05,
622
+ "step": 1175
623
+ },
624
+ {
625
+ "epoch": 13.953488372093023,
626
+ "grad_norm": 0.008385015651583672,
627
+ "learning_rate": 8.410983241436132e-07,
628
+ "loss": 6.560925394296646e-05,
629
+ "step": 1200
630
+ },
631
+ {
632
+ "epoch": 13.953488372093023,
633
+ "eval_accuracy": 0.9578766387277026,
634
+ "eval_f1": 0.8181120491174213,
635
+ "eval_loss": 0.10830119252204895,
636
+ "eval_precision": 0.8500797448165869,
637
+ "eval_recall": 0.7884615384615384,
638
+ "eval_runtime": 1.6315,
639
+ "eval_samples_per_second": 209.012,
640
+ "eval_steps_per_second": 3.678,
641
+ "step": 1200
642
+ },
643
+ {
644
+ "epoch": 14.244186046511627,
645
+ "grad_norm": 0.003520221682265401,
646
+ "learning_rate": 4.436225630870927e-07,
647
+ "loss": 0.00012058223597705364,
648
+ "step": 1225
649
+ },
650
+ {
651
+ "epoch": 14.534883720930232,
652
+ "grad_norm": 0.00905795767903328,
653
+ "learning_rate": 1.7150820204230865e-07,
654
+ "loss": 8.818465285003186e-05,
655
+ "step": 1250
656
+ },
657
+ {
658
+ "epoch": 14.534883720930232,
659
+ "eval_accuracy": 0.9578766387277026,
660
+ "eval_f1": 0.8187403993855606,
661
+ "eval_loss": 0.10815286636352539,
662
+ "eval_precision": 0.8514376996805112,
663
+ "eval_recall": 0.7884615384615384,
664
+ "eval_runtime": 1.6307,
665
+ "eval_samples_per_second": 209.118,
666
+ "eval_steps_per_second": 3.68,
667
+ "step": 1250
668
+ },
669
+ {
670
+ "epoch": 14.825581395348838,
671
+ "grad_norm": 0.006475365720689297,
672
+ "learning_rate": 2.6144396936325645e-08,
673
+ "loss": 4.936248995363712e-05,
674
+ "step": 1275
675
+ }
676
+ ],
677
+ "logging_steps": 25,
678
+ "max_steps": 1290,
679
+ "num_input_tokens_seen": 0,
680
+ "num_train_epochs": 15,
681
+ "save_steps": 50,
682
+ "stateful_callbacks": {
683
+ "EarlyStoppingCallback": {
684
+ "args": {
685
+ "early_stopping_patience": 10,
686
+ "early_stopping_threshold": 0.0
687
+ },
688
+ "attributes": {
689
+ "early_stopping_patience_counter": 7
690
+ }
691
+ },
692
+ "TrainerControl": {
693
+ "args": {
694
+ "should_epoch_stop": false,
695
+ "should_evaluate": false,
696
+ "should_log": false,
697
+ "should_save": true,
698
+ "should_training_stop": true
699
+ },
700
+ "attributes": {}
701
+ }
702
+ },
703
+ "total_flos": 6995052164620800.0,
704
+ "train_batch_size": 16,
705
+ "trial_name": null,
706
+ "trial_params": null
707
+ }
checkpoint-1290/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5071855a54d36018bc5c30ca34d9fef42b69fb3deda057af4ffc70193237d5c4
3
+ size 5201
checkpoint-900/config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
checkpoint-900/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:21c65b89ca04d84973d10cf676f8e009915c6acb1626e669150301db7180e8ea
3
+ size 598449012
checkpoint-900/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e4a4f864256c83543f011ceb16a229dd53801f1880b99a72d8c3fe2bcc91b0d
3
+ size 535150859
checkpoint-900/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecd50dbc2959bbba3f714fc9997c16fc15e2f3441b4818a8e36d461bd20caea8
3
+ size 14709
checkpoint-900/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:69966330a69f7b6a2710b6064c2261635cce76869812d3e21fb60dd080336f56
3
+ size 1465
checkpoint-900/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-900/tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "is_local": false,
6
+ "mask_token": "[MASK]",
7
+ "model_input_names": [
8
+ "input_ids",
9
+ "attention_mask"
10
+ ],
11
+ "model_max_length": 8192,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "[UNK]"
16
+ }
checkpoint-900/trainer_state.json ADDED
@@ -0,0 +1,518 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 900,
3
+ "best_metric": 0.8228043143297381,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900",
5
+ "epoch": 10.465116279069768,
6
+ "eval_steps": 50,
7
+ "global_step": 900,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.011627906976744186,
14
+ "grad_norm": 4.9740142822265625,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.317932665348053,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.29069767441860467,
21
+ "grad_norm": 1.5566426515579224,
22
+ "learning_rate": 6.282722513089005e-06,
23
+ "loss": 0.3199571371078491,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.5813953488372093,
28
+ "grad_norm": 1.6379677057266235,
29
+ "learning_rate": 1.2827225130890053e-05,
30
+ "loss": 0.24125898361206055,
31
+ "step": 50
32
+ },
33
+ {
34
+ "epoch": 0.5813953488372093,
35
+ "eval_accuracy": 0.8287126584998925,
36
+ "eval_f1": 0.08611410118406888,
37
+ "eval_loss": 0.10772959887981415,
38
+ "eval_precision": 0.15810276679841898,
39
+ "eval_recall": 0.05917159763313609,
40
+ "eval_runtime": 4.2273,
41
+ "eval_samples_per_second": 80.667,
42
+ "eval_steps_per_second": 1.419,
43
+ "step": 50
44
+ },
45
+ {
46
+ "epoch": 0.872093023255814,
47
+ "grad_norm": 8.703161239624023,
48
+ "learning_rate": 1.93717277486911e-05,
49
+ "loss": 0.20946041107177735,
50
+ "step": 75
51
+ },
52
+ {
53
+ "epoch": 1.1627906976744187,
54
+ "grad_norm": 0.9212121963500977,
55
+ "learning_rate": 2.591623036649215e-05,
56
+ "loss": 0.19275867462158203,
57
+ "step": 100
58
+ },
59
+ {
60
+ "epoch": 1.1627906976744187,
61
+ "eval_accuracy": 0.7635933806146572,
62
+ "eval_f1": 0.3981945837512538,
63
+ "eval_loss": 0.07719173282384872,
64
+ "eval_precision": 0.30121396054628224,
65
+ "eval_recall": 0.5872781065088757,
66
+ "eval_runtime": 1.6016,
67
+ "eval_samples_per_second": 212.909,
68
+ "eval_steps_per_second": 3.746,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 1.4534883720930232,
73
+ "grad_norm": 1.46477210521698,
74
+ "learning_rate": 3.246073298429319e-05,
75
+ "loss": 0.14603865623474122,
76
+ "step": 125
77
+ },
78
+ {
79
+ "epoch": 1.744186046511628,
80
+ "grad_norm": 3.729416608810425,
81
+ "learning_rate": 3.900523560209424e-05,
82
+ "loss": 0.13855588912963868,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 1.744186046511628,
87
+ "eval_accuracy": 0.81130453470879,
88
+ "eval_f1": 0.46785521339816316,
89
+ "eval_loss": 0.06223325803875923,
90
+ "eval_precision": 0.36851063829787234,
91
+ "eval_recall": 0.6405325443786982,
92
+ "eval_runtime": 1.5906,
93
+ "eval_samples_per_second": 214.385,
94
+ "eval_steps_per_second": 3.772,
95
+ "step": 150
96
+ },
97
+ {
98
+ "epoch": 2.0348837209302326,
99
+ "grad_norm": 1.2140589952468872,
100
+ "learning_rate": 4.554973821989529e-05,
101
+ "loss": 0.09624839782714843,
102
+ "step": 175
103
+ },
104
+ {
105
+ "epoch": 2.3255813953488373,
106
+ "grad_norm": 0.875888466835022,
107
+ "learning_rate": 4.999346304613061e-05,
108
+ "loss": 0.0821054744720459,
109
+ "step": 200
110
+ },
111
+ {
112
+ "epoch": 2.3255813953488373,
113
+ "eval_accuracy": 0.7872340425531915,
114
+ "eval_f1": 0.4847619047619048,
115
+ "eval_loss": 0.04723217338323593,
116
+ "eval_precision": 0.3574438202247191,
117
+ "eval_recall": 0.7529585798816568,
118
+ "eval_runtime": 1.6255,
119
+ "eval_samples_per_second": 209.777,
120
+ "eval_steps_per_second": 3.691,
121
+ "step": 200
122
+ },
123
+ {
124
+ "epoch": 2.616279069767442,
125
+ "grad_norm": 1.0979472398757935,
126
+ "learning_rate": 4.98888472605987e-05,
127
+ "loss": 0.08414460182189941,
128
+ "step": 225
129
+ },
130
+ {
131
+ "epoch": 2.9069767441860463,
132
+ "grad_norm": 0.49558770656585693,
133
+ "learning_rate": 4.965717280180432e-05,
134
+ "loss": 0.08369583129882813,
135
+ "step": 250
136
+ },
137
+ {
138
+ "epoch": 2.9069767441860463,
139
+ "eval_accuracy": 0.6211046636578551,
140
+ "eval_f1": 0.3483915126625599,
141
+ "eval_loss": 0.045315902680158615,
142
+ "eval_precision": 0.22662511130899377,
143
+ "eval_recall": 0.7529585798816568,
144
+ "eval_runtime": 1.6274,
145
+ "eval_samples_per_second": 209.539,
146
+ "eval_steps_per_second": 3.687,
147
+ "step": 250
148
+ },
149
+ {
150
+ "epoch": 3.197674418604651,
151
+ "grad_norm": 0.8114362955093384,
152
+ "learning_rate": 4.9299622378173246e-05,
153
+ "loss": 0.05607881069183349,
154
+ "step": 275
155
+ },
156
+ {
157
+ "epoch": 3.488372093023256,
158
+ "grad_norm": 0.6278374195098877,
159
+ "learning_rate": 4.881802130053548e-05,
160
+ "loss": 0.043469696044921874,
161
+ "step": 300
162
+ },
163
+ {
164
+ "epoch": 3.488372093023256,
165
+ "eval_accuracy": 0.8082957231893402,
166
+ "eval_f1": 0.5285784074255008,
167
+ "eval_loss": 0.04308881610631943,
168
+ "eval_precision": 0.39460247994164843,
169
+ "eval_recall": 0.8002958579881657,
170
+ "eval_runtime": 1.6193,
171
+ "eval_samples_per_second": 210.585,
172
+ "eval_steps_per_second": 3.705,
173
+ "step": 300
174
+ },
175
+ {
176
+ "epoch": 3.7790697674418605,
177
+ "grad_norm": 1.0219486951828003,
178
+ "learning_rate": 4.821482816383218e-05,
179
+ "loss": 0.047760300636291504,
180
+ "step": 325
181
+ },
182
+ {
183
+ "epoch": 4.069767441860465,
184
+ "grad_norm": 0.509274959564209,
185
+ "learning_rate": 4.749312229587908e-05,
186
+ "loss": 0.03177810907363891,
187
+ "step": 350
188
+ },
189
+ {
190
+ "epoch": 4.069767441860465,
191
+ "eval_accuracy": 0.9196217494089834,
192
+ "eval_f1": 0.7152317880794702,
193
+ "eval_loss": 0.04378104954957962,
194
+ "eval_precision": 0.6474820143884892,
195
+ "eval_recall": 0.7988165680473372,
196
+ "eval_runtime": 1.6177,
197
+ "eval_samples_per_second": 210.792,
198
+ "eval_steps_per_second": 3.709,
199
+ "step": 350
200
+ },
201
+ {
202
+ "epoch": 4.3604651162790695,
203
+ "grad_norm": 0.47098585963249207,
204
+ "learning_rate": 4.6656588037260834e-05,
205
+ "loss": 0.020146708488464355,
206
+ "step": 375
207
+ },
208
+ {
209
+ "epoch": 4.651162790697675,
210
+ "grad_norm": 0.7534321546554565,
211
+ "learning_rate": 4.570949593260837e-05,
212
+ "loss": 0.018921481370925905,
213
+ "step": 400
214
+ },
215
+ {
216
+ "epoch": 4.651162790697675,
217
+ "eval_accuracy": 0.9097356544165055,
218
+ "eval_f1": 0.6987341772151898,
219
+ "eval_loss": 0.05498046055436134,
220
+ "eval_precision": 0.6106194690265486,
221
+ "eval_recall": 0.8165680473372781,
222
+ "eval_runtime": 1.6157,
223
+ "eval_samples_per_second": 211.05,
224
+ "eval_steps_per_second": 3.713,
225
+ "step": 400
226
+ },
227
+ {
228
+ "epoch": 4.941860465116279,
229
+ "grad_norm": 0.7499828934669495,
230
+ "learning_rate": 4.465668092927841e-05,
231
+ "loss": 0.01998784065246582,
232
+ "step": 425
233
+ },
234
+ {
235
+ "epoch": 5.232558139534884,
236
+ "grad_norm": 0.24809418618679047,
237
+ "learning_rate": 4.350351769473198e-05,
238
+ "loss": 0.01218403697013855,
239
+ "step": 450
240
+ },
241
+ {
242
+ "epoch": 5.232558139534884,
243
+ "eval_accuracy": 0.9084461637653127,
244
+ "eval_f1": 0.6831746031746032,
245
+ "eval_loss": 0.05535344406962395,
246
+ "eval_precision": 0.5984427141268076,
247
+ "eval_recall": 0.7958579881656804,
248
+ "eval_runtime": 1.6123,
249
+ "eval_samples_per_second": 211.498,
250
+ "eval_steps_per_second": 3.721,
251
+ "step": 450
252
+ },
253
+ {
254
+ "epoch": 5.523255813953488,
255
+ "grad_norm": 0.3144132196903229,
256
+ "learning_rate": 4.2255893178617745e-05,
257
+ "loss": 0.012306832075119019,
258
+ "step": 475
259
+ },
260
+ {
261
+ "epoch": 5.813953488372093,
262
+ "grad_norm": 0.1607646942138672,
263
+ "learning_rate": 4.092017655963198e-05,
264
+ "loss": 0.010539753437042236,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 5.813953488372093,
269
+ "eval_accuracy": 0.9527186761229315,
270
+ "eval_f1": 0.8059040590405904,
271
+ "eval_loss": 0.07191809266805649,
272
+ "eval_precision": 0.8041237113402062,
273
+ "eval_recall": 0.8076923076923077,
274
+ "eval_runtime": 1.6569,
275
+ "eval_samples_per_second": 205.806,
276
+ "eval_steps_per_second": 3.621,
277
+ "step": 500
278
+ },
279
+ {
280
+ "epoch": 6.104651162790698,
281
+ "grad_norm": 0.19801200926303864,
282
+ "learning_rate": 3.9503186730577816e-05,
283
+ "loss": 0.008691226243972778,
284
+ "step": 525
285
+ },
286
+ {
287
+ "epoch": 6.395348837209302,
288
+ "grad_norm": 0.4177681505680084,
289
+ "learning_rate": 3.801215748761385e-05,
290
+ "loss": 0.004750225245952606,
291
+ "step": 550
292
+ },
293
+ {
294
+ "epoch": 6.395348837209302,
295
+ "eval_accuracy": 0.9458413926499033,
296
+ "eval_f1": 0.7863866763215062,
297
+ "eval_loss": 0.07378304749727249,
298
+ "eval_precision": 0.7702127659574468,
299
+ "eval_recall": 0.8032544378698225,
300
+ "eval_runtime": 1.6214,
301
+ "eval_samples_per_second": 210.313,
302
+ "eval_steps_per_second": 3.701,
303
+ "step": 550
304
+ },
305
+ {
306
+ "epoch": 6.686046511627907,
307
+ "grad_norm": 0.30753573775291443,
308
+ "learning_rate": 3.645470060140278e-05,
309
+ "loss": 0.005743271708488464,
310
+ "step": 575
311
+ },
312
+ {
313
+ "epoch": 6.976744186046512,
314
+ "grad_norm": 0.13237181305885315,
315
+ "learning_rate": 3.4838766958683304e-05,
316
+ "loss": 0.006215065121650696,
317
+ "step": 600
318
+ },
319
+ {
320
+ "epoch": 6.976744186046512,
321
+ "eval_accuracy": 0.9447668171072426,
322
+ "eval_f1": 0.7789934354485777,
323
+ "eval_loss": 0.062308527529239655,
324
+ "eval_precision": 0.7683453237410072,
325
+ "eval_recall": 0.7899408284023669,
326
+ "eval_runtime": 1.6197,
327
+ "eval_samples_per_second": 210.528,
328
+ "eval_steps_per_second": 3.704,
329
+ "step": 600
330
+ },
331
+ {
332
+ "epoch": 7.267441860465116,
333
+ "grad_norm": 0.023809686303138733,
334
+ "learning_rate": 3.317260597263932e-05,
335
+ "loss": 0.002318141460418701,
336
+ "step": 625
337
+ },
338
+ {
339
+ "epoch": 7.558139534883721,
340
+ "grad_norm": 0.03782212734222412,
341
+ "learning_rate": 3.146472346927845e-05,
342
+ "loss": 0.003790220320224762,
343
+ "step": 650
344
+ },
345
+ {
346
+ "epoch": 7.558139534883721,
347
+ "eval_accuracy": 0.9529335912314636,
348
+ "eval_f1": 0.8062827225130891,
349
+ "eval_loss": 0.07683796435594559,
350
+ "eval_precision": 0.8154311649016641,
351
+ "eval_recall": 0.7973372781065089,
352
+ "eval_runtime": 1.6235,
353
+ "eval_samples_per_second": 210.043,
354
+ "eval_steps_per_second": 3.696,
355
+ "step": 650
356
+ },
357
+ {
358
+ "epoch": 7.848837209302325,
359
+ "grad_norm": 0.037971507757902145,
360
+ "learning_rate": 2.9723838264811545e-05,
361
+ "loss": 0.0018679146468639374,
362
+ "step": 675
363
+ },
364
+ {
365
+ "epoch": 8.13953488372093,
366
+ "grad_norm": 0.6083823442459106,
367
+ "learning_rate": 2.7958837655707814e-05,
368
+ "loss": 0.0019237904250621796,
369
+ "step": 700
370
+ },
371
+ {
372
+ "epoch": 8.13953488372093,
373
+ "eval_accuracy": 0.9565871480765098,
374
+ "eval_f1": 0.8152091254752851,
375
+ "eval_loss": 0.08732757717370987,
376
+ "eval_precision": 0.838810641627543,
377
+ "eval_recall": 0.7928994082840237,
378
+ "eval_runtime": 1.6124,
379
+ "eval_samples_per_second": 211.484,
380
+ "eval_steps_per_second": 3.721,
381
+ "step": 700
382
+ },
383
+ {
384
+ "epoch": 8.430232558139535,
385
+ "grad_norm": 0.022007286548614502,
386
+ "learning_rate": 2.6178732048650694e-05,
387
+ "loss": 0.0010710173845291137,
388
+ "step": 725
389
+ },
390
+ {
391
+ "epoch": 8.720930232558139,
392
+ "grad_norm": 0.09439104795455933,
393
+ "learning_rate": 2.4392608962010652e-05,
394
+ "loss": 0.0006907544285058976,
395
+ "step": 750
396
+ },
397
+ {
398
+ "epoch": 8.720930232558139,
399
+ "eval_accuracy": 0.9449817322157748,
400
+ "eval_f1": 0.7829848594087959,
401
+ "eval_loss": 0.08308640867471695,
402
+ "eval_precision": 0.7637130801687764,
403
+ "eval_recall": 0.8032544378698225,
404
+ "eval_runtime": 1.6359,
405
+ "eval_samples_per_second": 208.445,
406
+ "eval_steps_per_second": 3.668,
407
+ "step": 750
408
+ },
409
+ {
410
+ "epoch": 9.011627906976743,
411
+ "grad_norm": 0.018290311098098755,
412
+ "learning_rate": 2.2609586633659256e-05,
413
+ "loss": 0.0005397907271981239,
414
+ "step": 775
415
+ },
416
+ {
417
+ "epoch": 9.30232558139535,
418
+ "grad_norm": 0.002839206252247095,
419
+ "learning_rate": 2.0838767471959014e-05,
420
+ "loss": 0.0002632186934351921,
421
+ "step": 800
422
+ },
423
+ {
424
+ "epoch": 9.30232558139535,
425
+ "eval_accuracy": 0.9544379969911885,
426
+ "eval_f1": 0.8081880212282032,
427
+ "eval_loss": 0.09754534065723419,
428
+ "eval_precision": 0.8289269051321928,
429
+ "eval_recall": 0.7884615384615384,
430
+ "eval_runtime": 1.6188,
431
+ "eval_samples_per_second": 210.653,
432
+ "eval_steps_per_second": 3.706,
433
+ "step": 800
434
+ },
435
+ {
436
+ "epoch": 9.593023255813954,
437
+ "grad_norm": 0.04134448245167732,
438
+ "learning_rate": 1.9089191587563417e-05,
439
+ "loss": 0.0005076020956039428,
440
+ "step": 825
441
+ },
442
+ {
443
+ "epoch": 9.883720930232558,
444
+ "grad_norm": 0.08968573063611984,
445
+ "learning_rate": 1.7369790643249573e-05,
446
+ "loss": 0.0005874237418174743,
447
+ "step": 850
448
+ },
449
+ {
450
+ "epoch": 9.883720930232558,
451
+ "eval_accuracy": 0.9548678272082527,
452
+ "eval_f1": 0.8093797276853252,
453
+ "eval_loss": 0.09803693741559982,
454
+ "eval_precision": 0.8281733746130031,
455
+ "eval_recall": 0.7914201183431953,
456
+ "eval_runtime": 1.6209,
457
+ "eval_samples_per_second": 210.379,
458
+ "eval_steps_per_second": 3.702,
459
+ "step": 850
460
+ },
461
+ {
462
+ "epoch": 10.174418604651162,
463
+ "grad_norm": 0.02889181859791279,
464
+ "learning_rate": 1.5689342257382207e-05,
465
+ "loss": 0.0004838050529360771,
466
+ "step": 875
467
+ },
468
+ {
469
+ "epoch": 10.465116279069768,
470
+ "grad_norm": 0.020970497280359268,
471
+ "learning_rate": 1.4056425193781048e-05,
472
+ "loss": 0.0001906752586364746,
473
+ "step": 900
474
+ },
475
+ {
476
+ "epoch": 10.465116279069768,
477
+ "eval_accuracy": 0.9587362991618311,
478
+ "eval_f1": 0.8228043143297381,
479
+ "eval_loss": 0.10382715612649918,
480
+ "eval_precision": 0.8585209003215434,
481
+ "eval_recall": 0.7899408284023669,
482
+ "eval_runtime": 1.6341,
483
+ "eval_samples_per_second": 208.675,
484
+ "eval_steps_per_second": 3.672,
485
+ "step": 900
486
+ }
487
+ ],
488
+ "logging_steps": 25,
489
+ "max_steps": 1290,
490
+ "num_input_tokens_seen": 0,
491
+ "num_train_epochs": 15,
492
+ "save_steps": 50,
493
+ "stateful_callbacks": {
494
+ "EarlyStoppingCallback": {
495
+ "args": {
496
+ "early_stopping_patience": 10,
497
+ "early_stopping_threshold": 0.0
498
+ },
499
+ "attributes": {
500
+ "early_stopping_patience_counter": 0
501
+ }
502
+ },
503
+ "TrainerControl": {
504
+ "args": {
505
+ "should_epoch_stop": false,
506
+ "should_evaluate": false,
507
+ "should_log": false,
508
+ "should_save": true,
509
+ "should_training_stop": false
510
+ },
511
+ "attributes": {}
512
+ }
513
+ },
514
+ "total_flos": 4881457666944000.0,
515
+ "train_batch_size": 16,
516
+ "trial_name": null,
517
+ "trial_params": null
518
+ }
checkpoint-900/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5071855a54d36018bc5c30ca34d9fef42b69fb3deda057af4ffc70193237d5c4
3
+ size 5201
config.json ADDED
@@ -0,0 +1,93 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "ModernBertForTokenClassification"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50281,
8
+ "classifier_activation": "gelu",
9
+ "classifier_bias": false,
10
+ "classifier_dropout": 0.4,
11
+ "classifier_pooling": "mean",
12
+ "cls_token_id": 50281,
13
+ "decoder_bias": true,
14
+ "deterministic_flash_attn": false,
15
+ "dtype": "float32",
16
+ "embedding_dropout": 0.0,
17
+ "eos_token_id": 50282,
18
+ "global_attn_every_n_layers": 3,
19
+ "gradient_checkpointing": false,
20
+ "hidden_activation": "gelu",
21
+ "hidden_size": 768,
22
+ "id2label": {
23
+ "0": "O",
24
+ "1": "FP",
25
+ "2": "RP",
26
+ "3": "RV",
27
+ "4": "PW"
28
+ },
29
+ "initializer_cutoff_factor": 2.0,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 1152,
32
+ "label2id": {
33
+ "FP": 1,
34
+ "O": 0,
35
+ "PW": 4,
36
+ "RP": 2,
37
+ "RV": 3
38
+ },
39
+ "layer_norm_eps": 1e-05,
40
+ "layer_types": [
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "full_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "full_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "full_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "full_attention"
63
+ ],
64
+ "local_attention": 128,
65
+ "max_position_embeddings": 8192,
66
+ "mlp_bias": false,
67
+ "mlp_dropout": 0.0,
68
+ "model_type": "modernbert",
69
+ "norm_bias": false,
70
+ "norm_eps": 1e-05,
71
+ "num_attention_heads": 12,
72
+ "num_hidden_layers": 22,
73
+ "pad_token_id": 50283,
74
+ "position_embedding_type": "absolute",
75
+ "repad_logits_with_grad": false,
76
+ "rope_parameters": {
77
+ "full_attention": {
78
+ "rope_theta": 160000.0,
79
+ "rope_type": "default"
80
+ },
81
+ "sliding_attention": {
82
+ "rope_theta": 10000.0,
83
+ "rope_type": "default"
84
+ }
85
+ },
86
+ "sep_token_id": 50282,
87
+ "sparse_pred_ignore_index": -100,
88
+ "sparse_prediction": false,
89
+ "tie_word_embeddings": true,
90
+ "transformers_version": "5.0.0",
91
+ "use_cache": false,
92
+ "vocab_size": 50368
93
+ }
confusion_matrix.png ADDED

Git LFS Details

  • SHA256: a2ded646cc1d5f3f48632476c6a5367b9e0b48b733db5960d7e4a9f329e2b072
  • Pointer size: 131 Bytes
  • Size of remote file: 109 kB
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:21c65b89ca04d84973d10cf676f8e009915c6acb1626e669150301db7180e8ea
3
+ size 598449012