pankajrudra commited on
Commit
0d84a24
·
verified ·
1 Parent(s): 542f291

Auto-upload after training: banglabert (Context_Aware)

Browse files
checkpoint-1750/config.json ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "ElectraForSequenceClassification"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "embedding_size": 768,
11
+ "eos_token_id": null,
12
+ "hidden_act": "gelu",
13
+ "hidden_dropout_prob": 0.1,
14
+ "hidden_size": 768,
15
+ "initializer_range": 0.02,
16
+ "intermediate_size": 3072,
17
+ "is_decoder": false,
18
+ "layer_norm_eps": 1e-12,
19
+ "max_position_embeddings": 512,
20
+ "model_type": "electra",
21
+ "num_attention_heads": 12,
22
+ "num_hidden_layers": 12,
23
+ "pad_token_id": 0,
24
+ "problem_type": "single_label_classification",
25
+ "summary_activation": "gelu",
26
+ "summary_last_dropout": 0.1,
27
+ "summary_type": "first",
28
+ "summary_use_proj": true,
29
+ "tie_word_embeddings": true,
30
+ "transformers_version": "5.1.0",
31
+ "type_vocab_size": 2,
32
+ "use_cache": false,
33
+ "vocab_size": 32000
34
+ }
checkpoint-1750/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b27a7aec5e022c4001b4c11a0819c16e915eac1d8fed0a8e6c8361fe3672e5ff
3
+ size 442499648
checkpoint-1750/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6749f863972a9a9df0af506d7f46ba262edb905644ececadbbd8ce2c69e93cbc
3
+ size 885119627
checkpoint-1750/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e5cac8d383beba216270b3470591b15fc58262fd23813c01483517207f4d4ac3
3
+ size 14645
checkpoint-1750/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3d6f061aa3e353e1084490dd4f3ab83107c57063e7819e5f66b1ba45adc3005e
3
+ size 1465
checkpoint-1750/trainer_state.json ADDED
@@ -0,0 +1,232 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1750,
3
+ "best_metric": 0.9882060831781502,
4
+ "best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-1750",
5
+ "epoch": 1.9294377067254684,
6
+ "eval_steps": 250,
7
+ "global_step": 1750,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.11025358324145534,
14
+ "grad_norm": 7.18897819519043,
15
+ "learning_rate": 4.9315259921744e-05,
16
+ "loss": 0.9709719848632813,
17
+ "step": 100
18
+ },
19
+ {
20
+ "epoch": 0.2205071664829107,
21
+ "grad_norm": 24.766324996948242,
22
+ "learning_rate": 4.791783119060928e-05,
23
+ "loss": 0.29621694564819334,
24
+ "step": 200
25
+ },
26
+ {
27
+ "epoch": 0.2756339581036384,
28
+ "eval_accuracy": 0.9683426443202979,
29
+ "eval_f1": 0.9683463785279671,
30
+ "eval_loss": 0.20300516486167908,
31
+ "eval_runtime": 14.8466,
32
+ "eval_samples_per_second": 108.509,
33
+ "eval_steps_per_second": 0.876,
34
+ "step": 250
35
+ },
36
+ {
37
+ "epoch": 0.33076074972436603,
38
+ "grad_norm": 8.417747497558594,
39
+ "learning_rate": 4.652040245947457e-05,
40
+ "loss": 0.21852529525756836,
41
+ "step": 300
42
+ },
43
+ {
44
+ "epoch": 0.4410143329658214,
45
+ "grad_norm": 0.17437691986560822,
46
+ "learning_rate": 4.5122973728339854e-05,
47
+ "loss": 0.16434497833251954,
48
+ "step": 400
49
+ },
50
+ {
51
+ "epoch": 0.5512679162072768,
52
+ "grad_norm": 0.2854061424732208,
53
+ "learning_rate": 4.372554499720514e-05,
54
+ "loss": 0.1867336082458496,
55
+ "step": 500
56
+ },
57
+ {
58
+ "epoch": 0.5512679162072768,
59
+ "eval_accuracy": 0.9819987585350713,
60
+ "eval_f1": 0.981997092407178,
61
+ "eval_loss": 0.13372504711151123,
62
+ "eval_runtime": 14.7675,
63
+ "eval_samples_per_second": 109.091,
64
+ "eval_steps_per_second": 0.88,
65
+ "step": 500
66
+ },
67
+ {
68
+ "epoch": 0.6615214994487321,
69
+ "grad_norm": 6.816864967346191,
70
+ "learning_rate": 4.232811626607043e-05,
71
+ "loss": 0.1479694938659668,
72
+ "step": 600
73
+ },
74
+ {
75
+ "epoch": 0.7717750826901875,
76
+ "grad_norm": 3.9543874263763428,
77
+ "learning_rate": 4.093068753493572e-05,
78
+ "loss": 0.12706973075866698,
79
+ "step": 700
80
+ },
81
+ {
82
+ "epoch": 0.8269018743109151,
83
+ "eval_accuracy": 0.9757914338919925,
84
+ "eval_f1": 0.975795221254004,
85
+ "eval_loss": 0.1680639237165451,
86
+ "eval_runtime": 14.8766,
87
+ "eval_samples_per_second": 108.291,
88
+ "eval_steps_per_second": 0.874,
89
+ "step": 750
90
+ },
91
+ {
92
+ "epoch": 0.8820286659316428,
93
+ "grad_norm": 20.209442138671875,
94
+ "learning_rate": 3.953325880380101e-05,
95
+ "loss": 0.1331749153137207,
96
+ "step": 800
97
+ },
98
+ {
99
+ "epoch": 0.9922822491730982,
100
+ "grad_norm": 12.12065315246582,
101
+ "learning_rate": 3.8135830072666296e-05,
102
+ "loss": 0.11961593627929687,
103
+ "step": 900
104
+ },
105
+ {
106
+ "epoch": 1.1025358324145536,
107
+ "grad_norm": 12.230631828308105,
108
+ "learning_rate": 3.673840134153159e-05,
109
+ "loss": 0.07725512027740479,
110
+ "step": 1000
111
+ },
112
+ {
113
+ "epoch": 1.1025358324145536,
114
+ "eval_accuracy": 0.9869646182495344,
115
+ "eval_f1": 0.986966155864457,
116
+ "eval_loss": 0.12348104268312454,
117
+ "eval_runtime": 14.7668,
118
+ "eval_samples_per_second": 109.096,
119
+ "eval_steps_per_second": 0.88,
120
+ "step": 1000
121
+ },
122
+ {
123
+ "epoch": 1.2127894156560088,
124
+ "grad_norm": 0.5774375200271606,
125
+ "learning_rate": 3.5340972610396874e-05,
126
+ "loss": 0.09056113243103027,
127
+ "step": 1100
128
+ },
129
+ {
130
+ "epoch": 1.3230429988974641,
131
+ "grad_norm": 0.11910726875066757,
132
+ "learning_rate": 3.394354387926216e-05,
133
+ "loss": 0.042015490531921384,
134
+ "step": 1200
135
+ },
136
+ {
137
+ "epoch": 1.3781697905181918,
138
+ "eval_accuracy": 0.9807572936064556,
139
+ "eval_f1": 0.9807604085886992,
140
+ "eval_loss": 0.21958932280540466,
141
+ "eval_runtime": 14.8453,
142
+ "eval_samples_per_second": 108.519,
143
+ "eval_steps_per_second": 0.876,
144
+ "step": 1250
145
+ },
146
+ {
147
+ "epoch": 1.4332965821389196,
148
+ "grad_norm": 0.11699436604976654,
149
+ "learning_rate": 3.2546115148127446e-05,
150
+ "loss": 0.0719094467163086,
151
+ "step": 1300
152
+ },
153
+ {
154
+ "epoch": 1.543550165380375,
155
+ "grad_norm": 38.42552947998047,
156
+ "learning_rate": 3.114868641699273e-05,
157
+ "loss": 0.07558716773986816,
158
+ "step": 1400
159
+ },
160
+ {
161
+ "epoch": 1.6538037486218302,
162
+ "grad_norm": 0.032679472118616104,
163
+ "learning_rate": 2.9751257685858024e-05,
164
+ "loss": 0.06970895767211914,
165
+ "step": 1500
166
+ },
167
+ {
168
+ "epoch": 1.6538037486218302,
169
+ "eval_accuracy": 0.9875853507138423,
170
+ "eval_f1": 0.9875857432128944,
171
+ "eval_loss": 0.1186099499464035,
172
+ "eval_runtime": 14.8369,
173
+ "eval_samples_per_second": 108.581,
174
+ "eval_steps_per_second": 0.876,
175
+ "step": 1500
176
+ },
177
+ {
178
+ "epoch": 1.7640573318632855,
179
+ "grad_norm": 0.039428263902664185,
180
+ "learning_rate": 2.835382895472331e-05,
181
+ "loss": 0.0635060977935791,
182
+ "step": 1600
183
+ },
184
+ {
185
+ "epoch": 1.8743109151047408,
186
+ "grad_norm": 28.317384719848633,
187
+ "learning_rate": 2.6956400223588595e-05,
188
+ "loss": 0.06392403602600098,
189
+ "step": 1700
190
+ },
191
+ {
192
+ "epoch": 1.9294377067254684,
193
+ "eval_accuracy": 0.9882060831781502,
194
+ "eval_f1": 0.9882049915771167,
195
+ "eval_loss": 0.11401514708995819,
196
+ "eval_runtime": 14.8202,
197
+ "eval_samples_per_second": 108.703,
198
+ "eval_steps_per_second": 0.877,
199
+ "step": 1750
200
+ }
201
+ ],
202
+ "logging_steps": 100,
203
+ "max_steps": 3628,
204
+ "num_input_tokens_seen": 0,
205
+ "num_train_epochs": 4,
206
+ "save_steps": 250,
207
+ "stateful_callbacks": {
208
+ "EarlyStoppingCallback": {
209
+ "args": {
210
+ "early_stopping_patience": 2,
211
+ "early_stopping_threshold": 0.0
212
+ },
213
+ "attributes": {
214
+ "early_stopping_patience_counter": 0
215
+ }
216
+ },
217
+ "TrainerControl": {
218
+ "args": {
219
+ "should_epoch_stop": false,
220
+ "should_evaluate": false,
221
+ "should_log": false,
222
+ "should_save": true,
223
+ "should_training_stop": false
224
+ },
225
+ "attributes": {}
226
+ }
227
+ },
228
+ "total_flos": 7363294439777280.0,
229
+ "train_batch_size": 32,
230
+ "trial_name": null,
231
+ "trial_params": null
232
+ }
checkpoint-1750/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:091c440a8d33abfdfbcbac2a4a91b42706d63b94599ca5f05561876f34616d5a
3
+ size 5201
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7d71147ab5ad68915176f7c63b29479df1453476895e5e7628a9887e0881092c
3
  size 442499648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:75dc6d8724a70a0713bbd4507d7747cacb90c1adeae0d94ca047d6316242554c
3
  size 442499648
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c4a848e200a4e55efdb1961a0c4245c7376053c8db77f9d383934ed18507fc8b
3
  size 5201
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:091c440a8d33abfdfbcbac2a4a91b42706d63b94599ca5f05561876f34616d5a
3
  size 5201