SirMappel commited on
Commit
5e755cf
·
verified ·
1 Parent(s): 3f18ee9

Upload 9 files

Browse files
config.json ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "XLMRobertaForTokenClassification"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "eos_token_id": null,
11
+ "gradient_checkpointing": false,
12
+ "hidden_act": "gelu",
13
+ "hidden_dropout_prob": 0.1,
14
+ "hidden_size": 768,
15
+ "id2label": {
16
+ "0": "B-ADDRESS",
17
+ "1": "B-CITY",
18
+ "2": "B-LOC",
19
+ "3": "B-VERB",
20
+ "4": "I-ADDRESS",
21
+ "5": "I-CITY",
22
+ "6": "I-LOC",
23
+ "7": "I-VERB",
24
+ "8": "O"
25
+ },
26
+ "initializer_range": 0.02,
27
+ "intermediate_size": 3072,
28
+ "is_decoder": false,
29
+ "label2id": {
30
+ "B-ADDRESS": 0,
31
+ "B-CITY": 1,
32
+ "B-LOC": 2,
33
+ "B-VERB": 3,
34
+ "I-ADDRESS": 4,
35
+ "I-CITY": 5,
36
+ "I-LOC": 6,
37
+ "I-VERB": 7,
38
+ "O": 8
39
+ },
40
+ "layer_norm_eps": 1e-05,
41
+ "max_position_embeddings": 514,
42
+ "model_type": "xlm-roberta",
43
+ "num_attention_heads": 12,
44
+ "num_hidden_layers": 12,
45
+ "pad_token_id": 0,
46
+ "position_embedding_type": "absolute",
47
+ "tie_word_embeddings": true,
48
+ "transformers_version": "5.3.0",
49
+ "type_vocab_size": 1,
50
+ "use_cache": false,
51
+ "vocab_size": 50005
52
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:32f09b85972ea9edffc0da314d503403cce5451d7fa1010634776b9ca758f891
3
+ size 495473028
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fa1d96b93dec4edf5c86dd8ce14351f077a692aa85e9f3872adf229d803f069b
3
+ size 991059531
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:49a621c22a605faed1dad3e8d9875601985b4f4860f90f857334b69cb8a97bfb
3
+ size 14455
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b08f7c9ba5c511c1facdb7a11dbb826aa982554c16e441bdbd99c3b51d9063a3
3
+ size 1465
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "clean_up_tokenization_spaces": true,
4
+ "cls_token": "[CLS]",
5
+ "do_basic_tokenize": true,
6
+ "do_lower_case": true,
7
+ "is_local": false,
8
+ "mask_token": "[MASK]",
9
+ "max_length": 512,
10
+ "model_max_length": 1000000000000000019884624838656,
11
+ "never_split": null,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "stride": 256,
15
+ "strip_accents": null,
16
+ "tokenize_chinese_chars": true,
17
+ "tokenizer_class": "TokenizersBackend",
18
+ "truncation_side": "right",
19
+ "truncation_strategy": "longest_first",
20
+ "unk_token": "[UNK]"
21
+ }
trainer_state.json ADDED
@@ -0,0 +1,391 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 96,
3
+ "best_metric": 0.23231297731399536,
4
+ "best_model_checkpoint": "/work/Ccp-HERMOD/output/checkpoint-96",
5
+ "epoch": 29.0,
6
+ "eval_steps": 500,
7
+ "global_step": 116,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.8361204013377926,
15
+ "eval_f1": 0.004705882352941177,
16
+ "eval_loss": 0.7151198387145996,
17
+ "eval_precision": 1.0,
18
+ "eval_recall": 0.0023584905660377358,
19
+ "eval_runtime": 13.4495,
20
+ "eval_samples_per_second": 1.19,
21
+ "eval_steps_per_second": 0.074,
22
+ "step": 4
23
+ },
24
+ {
25
+ "epoch": 2.0,
26
+ "eval_accuracy": 0.8379784466740988,
27
+ "eval_f1": 0.02790697674418605,
28
+ "eval_loss": 0.5497016906738281,
29
+ "eval_precision": 1.0,
30
+ "eval_recall": 0.014150943396226415,
31
+ "eval_runtime": 13.2884,
32
+ "eval_samples_per_second": 1.204,
33
+ "eval_steps_per_second": 0.075,
34
+ "step": 8
35
+ },
36
+ {
37
+ "epoch": 3.0,
38
+ "eval_accuracy": 0.8963210702341137,
39
+ "eval_f1": 0.6404341926729987,
40
+ "eval_loss": 0.4771943986415863,
41
+ "eval_precision": 0.7539936102236422,
42
+ "eval_recall": 0.5566037735849056,
43
+ "eval_runtime": 13.3794,
44
+ "eval_samples_per_second": 1.196,
45
+ "eval_steps_per_second": 0.075,
46
+ "step": 12
47
+ },
48
+ {
49
+ "epoch": 4.0,
50
+ "eval_accuracy": 0.9000371609067261,
51
+ "eval_f1": 0.6586345381526104,
52
+ "eval_loss": 0.4278680682182312,
53
+ "eval_precision": 0.7616099071207431,
54
+ "eval_recall": 0.5801886792452831,
55
+ "eval_runtime": 13.2845,
56
+ "eval_samples_per_second": 1.204,
57
+ "eval_steps_per_second": 0.075,
58
+ "step": 16
59
+ },
60
+ {
61
+ "epoch": 5.0,
62
+ "eval_accuracy": 0.9004087699739873,
63
+ "eval_f1": 0.653950953678474,
64
+ "eval_loss": 0.37871769070625305,
65
+ "eval_precision": 0.7741935483870968,
66
+ "eval_recall": 0.5660377358490566,
67
+ "eval_runtime": 13.4787,
68
+ "eval_samples_per_second": 1.187,
69
+ "eval_steps_per_second": 0.074,
70
+ "step": 20
71
+ },
72
+ {
73
+ "epoch": 6.0,
74
+ "eval_accuracy": 0.9000371609067261,
75
+ "eval_f1": 0.6521145975443383,
76
+ "eval_loss": 0.3332737684249878,
77
+ "eval_precision": 0.7734627831715211,
78
+ "eval_recall": 0.5636792452830188,
79
+ "eval_runtime": 13.303,
80
+ "eval_samples_per_second": 1.203,
81
+ "eval_steps_per_second": 0.075,
82
+ "step": 24
83
+ },
84
+ {
85
+ "epoch": 7.0,
86
+ "eval_accuracy": 0.919732441471572,
87
+ "eval_f1": 0.7064676616915423,
88
+ "eval_loss": 0.29833075404167175,
89
+ "eval_precision": 0.7473684210526316,
90
+ "eval_recall": 0.6698113207547169,
91
+ "eval_runtime": 13.2964,
92
+ "eval_samples_per_second": 1.203,
93
+ "eval_steps_per_second": 0.075,
94
+ "step": 28
95
+ },
96
+ {
97
+ "epoch": 8.0,
98
+ "eval_accuracy": 0.929022668153103,
99
+ "eval_f1": 0.7114716106604868,
100
+ "eval_loss": 0.2743655741214752,
101
+ "eval_precision": 0.6993166287015945,
102
+ "eval_recall": 0.7240566037735849,
103
+ "eval_runtime": 13.3825,
104
+ "eval_samples_per_second": 1.196,
105
+ "eval_steps_per_second": 0.075,
106
+ "step": 32
107
+ },
108
+ {
109
+ "epoch": 9.0,
110
+ "eval_accuracy": 0.9256781865477518,
111
+ "eval_f1": 0.6946902654867256,
112
+ "eval_loss": 0.26543402671813965,
113
+ "eval_precision": 0.6541666666666667,
114
+ "eval_recall": 0.7405660377358491,
115
+ "eval_runtime": 13.2666,
116
+ "eval_samples_per_second": 1.206,
117
+ "eval_steps_per_second": 0.075,
118
+ "step": 36
119
+ },
120
+ {
121
+ "epoch": 10.0,
122
+ "eval_accuracy": 0.9267930137495355,
123
+ "eval_f1": 0.6977777777777777,
124
+ "eval_loss": 0.2558903992176056,
125
+ "eval_precision": 0.6596638655462185,
126
+ "eval_recall": 0.7405660377358491,
127
+ "eval_runtime": 13.2905,
128
+ "eval_samples_per_second": 1.204,
129
+ "eval_steps_per_second": 0.075,
130
+ "step": 40
131
+ },
132
+ {
133
+ "epoch": 11.0,
134
+ "eval_accuracy": 0.929022668153103,
135
+ "eval_f1": 0.7112597547380156,
136
+ "eval_loss": 0.25086769461631775,
137
+ "eval_precision": 0.6744186046511628,
138
+ "eval_recall": 0.7523584905660378,
139
+ "eval_runtime": 13.3975,
140
+ "eval_samples_per_second": 1.194,
141
+ "eval_steps_per_second": 0.075,
142
+ "step": 44
143
+ },
144
+ {
145
+ "epoch": 12.0,
146
+ "eval_accuracy": 0.9271646228167967,
147
+ "eval_f1": 0.7041942604856511,
148
+ "eval_loss": 0.2514660656452179,
149
+ "eval_precision": 0.6618257261410788,
150
+ "eval_recall": 0.7523584905660378,
151
+ "eval_runtime": 13.4847,
152
+ "eval_samples_per_second": 1.187,
153
+ "eval_steps_per_second": 0.074,
154
+ "step": 48
155
+ },
156
+ {
157
+ "epoch": 13.0,
158
+ "eval_accuracy": 0.9264214046822743,
159
+ "eval_f1": 0.6977777777777777,
160
+ "eval_loss": 0.24668167531490326,
161
+ "eval_precision": 0.6596638655462185,
162
+ "eval_recall": 0.7405660377358491,
163
+ "eval_runtime": 13.3955,
164
+ "eval_samples_per_second": 1.194,
165
+ "eval_steps_per_second": 0.075,
166
+ "step": 52
167
+ },
168
+ {
169
+ "epoch": 14.0,
170
+ "eval_accuracy": 0.9256781865477518,
171
+ "eval_f1": 0.695364238410596,
172
+ "eval_loss": 0.24763518571853638,
173
+ "eval_precision": 0.6535269709543569,
174
+ "eval_recall": 0.7429245283018868,
175
+ "eval_runtime": 13.3935,
176
+ "eval_samples_per_second": 1.195,
177
+ "eval_steps_per_second": 0.075,
178
+ "step": 56
179
+ },
180
+ {
181
+ "epoch": 15.0,
182
+ "eval_accuracy": 0.9271646228167967,
183
+ "eval_f1": 0.6991150442477875,
184
+ "eval_loss": 0.24238130450248718,
185
+ "eval_precision": 0.6583333333333333,
186
+ "eval_recall": 0.7452830188679245,
187
+ "eval_runtime": 13.3707,
188
+ "eval_samples_per_second": 1.197,
189
+ "eval_steps_per_second": 0.075,
190
+ "step": 60
191
+ },
192
+ {
193
+ "epoch": 16.0,
194
+ "eval_accuracy": 0.927536231884058,
195
+ "eval_f1": 0.7021040974529346,
196
+ "eval_loss": 0.2429044097661972,
197
+ "eval_precision": 0.6617954070981211,
198
+ "eval_recall": 0.7476415094339622,
199
+ "eval_runtime": 13.4028,
200
+ "eval_samples_per_second": 1.194,
201
+ "eval_steps_per_second": 0.075,
202
+ "step": 64
203
+ },
204
+ {
205
+ "epoch": 17.0,
206
+ "eval_accuracy": 0.9282794500185805,
207
+ "eval_f1": 0.7065337763012183,
208
+ "eval_loss": 0.24402368068695068,
209
+ "eval_precision": 0.6659707724425887,
210
+ "eval_recall": 0.7523584905660378,
211
+ "eval_runtime": 13.3903,
212
+ "eval_samples_per_second": 1.195,
213
+ "eval_steps_per_second": 0.075,
214
+ "step": 68
215
+ },
216
+ {
217
+ "epoch": 18.0,
218
+ "eval_accuracy": 0.929022668153103,
219
+ "eval_f1": 0.7088888888888888,
220
+ "eval_loss": 0.23910246789455414,
221
+ "eval_precision": 0.6701680672268907,
222
+ "eval_recall": 0.7523584905660378,
223
+ "eval_runtime": 13.4843,
224
+ "eval_samples_per_second": 1.187,
225
+ "eval_steps_per_second": 0.074,
226
+ "step": 72
227
+ },
228
+ {
229
+ "epoch": 19.0,
230
+ "eval_accuracy": 0.9286510590858417,
231
+ "eval_f1": 0.7122381477398014,
232
+ "eval_loss": 0.23814627528190613,
233
+ "eval_precision": 0.6687370600414079,
234
+ "eval_recall": 0.7617924528301887,
235
+ "eval_runtime": 13.5199,
236
+ "eval_samples_per_second": 1.183,
237
+ "eval_steps_per_second": 0.074,
238
+ "step": 76
239
+ },
240
+ {
241
+ "epoch": 20.0,
242
+ "eval_accuracy": 0.9323671497584541,
243
+ "eval_f1": 0.7189249720044792,
244
+ "eval_loss": 0.23503288626670837,
245
+ "eval_precision": 0.6844349680170576,
246
+ "eval_recall": 0.7570754716981132,
247
+ "eval_runtime": 13.3797,
248
+ "eval_samples_per_second": 1.196,
249
+ "eval_steps_per_second": 0.075,
250
+ "step": 80
251
+ },
252
+ {
253
+ "epoch": 21.0,
254
+ "eval_accuracy": 0.9334819769602378,
255
+ "eval_f1": 0.7355555555555556,
256
+ "eval_loss": 0.2409704029560089,
257
+ "eval_precision": 0.6953781512605042,
258
+ "eval_recall": 0.7806603773584906,
259
+ "eval_runtime": 13.3361,
260
+ "eval_samples_per_second": 1.2,
261
+ "eval_steps_per_second": 0.075,
262
+ "step": 84
263
+ },
264
+ {
265
+ "epoch": 22.0,
266
+ "eval_accuracy": 0.9360832404310665,
267
+ "eval_f1": 0.7468785471055619,
268
+ "eval_loss": 0.23444412648677826,
269
+ "eval_precision": 0.7199124726477024,
270
+ "eval_recall": 0.7759433962264151,
271
+ "eval_runtime": 13.3693,
272
+ "eval_samples_per_second": 1.197,
273
+ "eval_steps_per_second": 0.075,
274
+ "step": 88
275
+ },
276
+ {
277
+ "epoch": 23.0,
278
+ "eval_accuracy": 0.936826458565589,
279
+ "eval_f1": 0.7545045045045046,
280
+ "eval_loss": 0.23746801912784576,
281
+ "eval_precision": 0.7219827586206896,
282
+ "eval_recall": 0.7900943396226415,
283
+ "eval_runtime": 13.2922,
284
+ "eval_samples_per_second": 1.204,
285
+ "eval_steps_per_second": 0.075,
286
+ "step": 92
287
+ },
288
+ {
289
+ "epoch": 24.0,
290
+ "eval_accuracy": 0.9360832404310665,
291
+ "eval_f1": 0.7550561797752808,
292
+ "eval_loss": 0.23231297731399536,
293
+ "eval_precision": 0.721030042918455,
294
+ "eval_recall": 0.7924528301886793,
295
+ "eval_runtime": 13.1678,
296
+ "eval_samples_per_second": 1.215,
297
+ "eval_steps_per_second": 0.076,
298
+ "step": 96
299
+ },
300
+ {
301
+ "epoch": 25.0,
302
+ "eval_accuracy": 0.9360832404310665,
303
+ "eval_f1": 0.753393665158371,
304
+ "eval_loss": 0.23396730422973633,
305
+ "eval_precision": 0.7239130434782609,
306
+ "eval_recall": 0.785377358490566,
307
+ "eval_runtime": 13.2825,
308
+ "eval_samples_per_second": 1.205,
309
+ "eval_steps_per_second": 0.075,
310
+ "step": 100
311
+ },
312
+ {
313
+ "epoch": 26.0,
314
+ "eval_accuracy": 0.9342251950947603,
315
+ "eval_f1": 0.7508379888268155,
316
+ "eval_loss": 0.2425457239151001,
317
+ "eval_precision": 0.7133757961783439,
318
+ "eval_recall": 0.7924528301886793,
319
+ "eval_runtime": 13.2954,
320
+ "eval_samples_per_second": 1.203,
321
+ "eval_steps_per_second": 0.075,
322
+ "step": 104
323
+ },
324
+ {
325
+ "epoch": 27.0,
326
+ "eval_accuracy": 0.936826458565589,
327
+ "eval_f1": 0.7582292849035186,
328
+ "eval_loss": 0.23761555552482605,
329
+ "eval_precision": 0.7308533916849015,
330
+ "eval_recall": 0.7877358490566038,
331
+ "eval_runtime": 13.271,
332
+ "eval_samples_per_second": 1.206,
333
+ "eval_steps_per_second": 0.075,
334
+ "step": 108
335
+ },
336
+ {
337
+ "epoch": 28.0,
338
+ "eval_accuracy": 0.9371980676328503,
339
+ "eval_f1": 0.7587768969422425,
340
+ "eval_loss": 0.23595334589481354,
341
+ "eval_precision": 0.7298474945533769,
342
+ "eval_recall": 0.7900943396226415,
343
+ "eval_runtime": 13.2785,
344
+ "eval_samples_per_second": 1.205,
345
+ "eval_steps_per_second": 0.075,
346
+ "step": 112
347
+ },
348
+ {
349
+ "epoch": 29.0,
350
+ "eval_accuracy": 0.936826458565589,
351
+ "eval_f1": 0.760942760942761,
352
+ "eval_loss": 0.237918421626091,
353
+ "eval_precision": 0.7259100642398287,
354
+ "eval_recall": 0.7995283018867925,
355
+ "eval_runtime": 13.2875,
356
+ "eval_samples_per_second": 1.204,
357
+ "eval_steps_per_second": 0.075,
358
+ "step": 116
359
+ }
360
+ ],
361
+ "logging_steps": 500,
362
+ "max_steps": 200,
363
+ "num_input_tokens_seen": 0,
364
+ "num_train_epochs": 50,
365
+ "save_steps": 1000000000,
366
+ "stateful_callbacks": {
367
+ "EarlyStoppingCallback": {
368
+ "args": {
369
+ "early_stopping_patience": 5,
370
+ "early_stopping_threshold": 0.0
371
+ },
372
+ "attributes": {
373
+ "early_stopping_patience_counter": 5
374
+ }
375
+ },
376
+ "TrainerControl": {
377
+ "args": {
378
+ "should_epoch_stop": false,
379
+ "should_evaluate": false,
380
+ "should_log": false,
381
+ "should_save": true,
382
+ "should_training_stop": true
383
+ },
384
+ "attributes": {}
385
+ }
386
+ },
387
+ "total_flos": 311391536163120.0,
388
+ "train_batch_size": 16,
389
+ "trial_name": null,
390
+ "trial_params": null
391
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:84ff8ca4618195917f03ff61265024f69e6fb8a4f9fd1409efd9f2b6a9445d5b
3
+ size 5201