neopolita commited on
Commit
ca15668
·
verified ·
1 Parent(s): 23fa5f6

Checkpoint at step 500

Browse files
checkpoint-500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f623eb8c6ca44bd3b3c5b06da23368e055e678bc6c898fe57534528803facfc1
3
+ size 2881913146
checkpoint-500/pytorch_model.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:714ceccab20326e227ccc287fea81eae7cade86febb4f033fb5852adc7905fa9
3
+ size 1440963006
checkpoint-500/rng_state_0.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f55e650c250114ef4681b2223e2fad5466c441991422b6607c9df4336c615c99
3
+ size 15024
checkpoint-500/rng_state_1.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7bb288e3e8ba63d946c7838dea4208e94a0bd49c7b0a81499c9d235b3fd6288b
3
+ size 15024
checkpoint-500/rng_state_2.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e87ee5242eae62c304cb6176116afbd965625118ed11de2d334c16536e26f3f
3
+ size 15024
checkpoint-500/rng_state_3.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:44613088dd8b5a1c424af6ffc27097fb6733c70fef43c3d92cc2b43d4e616ef5
3
+ size 15024
checkpoint-500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b45fdf68346e4fe3cb00c6a3584da4aea53ef46fe33fe8a391b16d9818821a02
3
+ size 1064
checkpoint-500/trainer_state.json ADDED
@@ -0,0 +1,364 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 2.040962621607783,
6
+ "eval_steps": 1000,
7
+ "global_step": 500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0,
14
+ "gen_lora_l1_norm": 0.0009450324578210711,
15
+ "kl_loss": 1.9670246839523315,
16
+ "step": 0
17
+ },
18
+ {
19
+ "epoch": 0,
20
+ "gen_lora_l1_norm": 0.0008100018021650612,
21
+ "kl_loss": 1.4670418500900269,
22
+ "step": 0
23
+ },
24
+ {
25
+ "epoch": 0,
26
+ "gen_lora_l1_norm": 0.0006749311578460038,
27
+ "kl_loss": 1.3484277725219727,
28
+ "step": 0
29
+ },
30
+ {
31
+ "epoch": 0,
32
+ "gen_lora_l1_norm": 0.000944959232583642,
33
+ "kl_loss": 1.4987092018127441,
34
+ "step": 0
35
+ },
36
+ {
37
+ "epoch": 0,
38
+ "gen_lora_l1_norm": 0.0006748694577254355,
39
+ "kl_loss": 1.4152668714523315,
40
+ "step": 0
41
+ },
42
+ {
43
+ "epoch": 0,
44
+ "gen_lora_l1_norm": 0.0012147949310019612,
45
+ "kl_loss": 2.2377562522888184,
46
+ "step": 0
47
+ },
48
+ {
49
+ "epoch": 0,
50
+ "gen_lora_l1_norm": 0.001215127413161099,
51
+ "kl_loss": 2.319751501083374,
52
+ "step": 0
53
+ },
54
+ {
55
+ "epoch": 0,
56
+ "gen_lora_l1_norm": 0.0009449576027691364,
57
+ "kl_loss": 1.9499444961547852,
58
+ "step": 0
59
+ },
60
+ {
61
+ "epoch": 0.00409626216077829,
62
+ "grad_norm": 5.8849639892578125,
63
+ "learning_rate": 0.0,
64
+ "loss": 1.6322,
65
+ "step": 1
66
+ },
67
+ {
68
+ "epoch": 0.00409626216077829,
69
+ "gen_lora_l1_norm": 0.0006627951515838504,
70
+ "kl_loss": 0.882428765296936,
71
+ "step": 1
72
+ },
73
+ {
74
+ "epoch": 0.00409626216077829,
75
+ "gen_lora_l1_norm": 0.0010608765296638012,
76
+ "kl_loss": 1.6865953207015991,
77
+ "step": 1
78
+ },
79
+ {
80
+ "epoch": 0.00409626216077829,
81
+ "gen_lora_l1_norm": 0.0010608312441036105,
82
+ "kl_loss": 2.0317649841308594,
83
+ "step": 1
84
+ },
85
+ {
86
+ "epoch": 0.00409626216077829,
87
+ "gen_lora_l1_norm": 0.0006628527189604938,
88
+ "kl_loss": 1.4127317667007446,
89
+ "step": 1
90
+ },
91
+ {
92
+ "epoch": 0.00409626216077829,
93
+ "gen_lora_l1_norm": 0.0007955919136293232,
94
+ "kl_loss": 1.2892097234725952,
95
+ "step": 1
96
+ },
97
+ {
98
+ "epoch": 0.00409626216077829,
99
+ "gen_lora_l1_norm": 0.0011936043156310916,
100
+ "kl_loss": 2.073559045791626,
101
+ "step": 1
102
+ },
103
+ {
104
+ "epoch": 0.00409626216077829,
105
+ "gen_lora_l1_norm": 0.0011929516913369298,
106
+ "kl_loss": 2.040735960006714,
107
+ "step": 1
108
+ },
109
+ {
110
+ "epoch": 0.00409626216077829,
111
+ "gen_lora_l1_norm": 0.000795479747466743,
112
+ "kl_loss": 1.4581172466278076,
113
+ "step": 1
114
+ },
115
+ {
116
+ "epoch": 0.409626216077829,
117
+ "grad_norm": 1.5062122344970703,
118
+ "learning_rate": 3.96e-05,
119
+ "loss": 1.3549,
120
+ "step": 100
121
+ },
122
+ {
123
+ "epoch": 0.409626216077829,
124
+ "gen_lora_l1_norm": 0.0024223378859460354,
125
+ "kl_loss": 1.1542384624481201,
126
+ "step": 100
127
+ },
128
+ {
129
+ "epoch": 0.409626216077829,
130
+ "gen_lora_l1_norm": 0.003727049333974719,
131
+ "kl_loss": 1.4517877101898193,
132
+ "step": 100
133
+ },
134
+ {
135
+ "epoch": 0.409626216077829,
136
+ "gen_lora_l1_norm": 0.0023780318442732096,
137
+ "kl_loss": 1.0488699674606323,
138
+ "step": 100
139
+ },
140
+ {
141
+ "epoch": 0.409626216077829,
142
+ "gen_lora_l1_norm": 0.002320361090824008,
143
+ "kl_loss": 0.9093623161315918,
144
+ "step": 100
145
+ },
146
+ {
147
+ "epoch": 0.409626216077829,
148
+ "gen_lora_l1_norm": 0.0022675672080367804,
149
+ "kl_loss": 1.0960808992385864,
150
+ "step": 100
151
+ },
152
+ {
153
+ "epoch": 0.409626216077829,
154
+ "gen_lora_l1_norm": 0.003854497103020549,
155
+ "kl_loss": 1.54759681224823,
156
+ "step": 100
157
+ },
158
+ {
159
+ "epoch": 0.409626216077829,
160
+ "gen_lora_l1_norm": 0.0023134942166507244,
161
+ "kl_loss": 1.0374772548675537,
162
+ "step": 100
163
+ },
164
+ {
165
+ "epoch": 0.409626216077829,
166
+ "gen_lora_l1_norm": 0.002758321352303028,
167
+ "kl_loss": 1.3237308263778687,
168
+ "step": 100
169
+ },
170
+ {
171
+ "epoch": 0.819252432155658,
172
+ "grad_norm": 0.8856369256973267,
173
+ "learning_rate": 3.993659497980699e-05,
174
+ "loss": 1.1874,
175
+ "step": 200
176
+ },
177
+ {
178
+ "epoch": 0.819252432155658,
179
+ "gen_lora_l1_norm": 0.003160437336191535,
180
+ "kl_loss": 1.0348540544509888,
181
+ "step": 200
182
+ },
183
+ {
184
+ "epoch": 0.819252432155658,
185
+ "gen_lora_l1_norm": 0.005650285631418228,
186
+ "kl_loss": 1.4363867044448853,
187
+ "step": 200
188
+ },
189
+ {
190
+ "epoch": 0.819252432155658,
191
+ "gen_lora_l1_norm": 0.0029608134645968676,
192
+ "kl_loss": 1.00709867477417,
193
+ "step": 200
194
+ },
195
+ {
196
+ "epoch": 0.819252432155658,
197
+ "gen_lora_l1_norm": 0.0032552958000451326,
198
+ "kl_loss": 0.9060482978820801,
199
+ "step": 200
200
+ },
201
+ {
202
+ "epoch": 0.819252432155658,
203
+ "gen_lora_l1_norm": 0.003243665909394622,
204
+ "kl_loss": 1.1517314910888672,
205
+ "step": 200
206
+ },
207
+ {
208
+ "epoch": 0.819252432155658,
209
+ "gen_lora_l1_norm": 0.0019695493392646313,
210
+ "kl_loss": 0.7201811671257019,
211
+ "step": 200
212
+ },
213
+ {
214
+ "epoch": 0.819252432155658,
215
+ "gen_lora_l1_norm": 0.00634480407461524,
216
+ "kl_loss": 1.8689466714859009,
217
+ "step": 200
218
+ },
219
+ {
220
+ "epoch": 0.819252432155658,
221
+ "gen_lora_l1_norm": 0.003726382739841938,
222
+ "kl_loss": 1.060623288154602,
223
+ "step": 200
224
+ },
225
+ {
226
+ "epoch": 1.2252944188428059,
227
+ "grad_norm": 0.9404332637786865,
228
+ "learning_rate": 3.974422423272462e-05,
229
+ "loss": 1.1436,
230
+ "step": 300
231
+ },
232
+ {
233
+ "epoch": 1.2252944188428059,
234
+ "gen_lora_l1_norm": 0.0036873684730380774,
235
+ "kl_loss": 0.8932405710220337,
236
+ "step": 300
237
+ },
238
+ {
239
+ "epoch": 1.2252944188428059,
240
+ "gen_lora_l1_norm": 0.0060583981685340405,
241
+ "kl_loss": 1.7955601215362549,
242
+ "step": 300
243
+ },
244
+ {
245
+ "epoch": 1.2252944188428059,
246
+ "gen_lora_l1_norm": 0.0036672591231763363,
247
+ "kl_loss": 0.9144486784934998,
248
+ "step": 300
249
+ },
250
+ {
251
+ "epoch": 1.2252944188428059,
252
+ "gen_lora_l1_norm": 0.0036556844133883715,
253
+ "kl_loss": 1.1638795137405396,
254
+ "step": 300
255
+ },
256
+ {
257
+ "epoch": 1.2252944188428059,
258
+ "gen_lora_l1_norm": 0.0037340312264859676,
259
+ "kl_loss": 1.0955017805099487,
260
+ "step": 300
261
+ },
262
+ {
263
+ "epoch": 1.2252944188428059,
264
+ "gen_lora_l1_norm": 0.0036459672264754772,
265
+ "kl_loss": 1.0169063806533813,
266
+ "step": 300
267
+ },
268
+ {
269
+ "epoch": 1.2252944188428059,
270
+ "gen_lora_l1_norm": 0.00370018114335835,
271
+ "kl_loss": 0.9743473529815674,
272
+ "step": 300
273
+ },
274
+ {
275
+ "epoch": 1.2252944188428059,
276
+ "gen_lora_l1_norm": 0.006841503549367189,
277
+ "kl_loss": 1.3890433311462402,
278
+ "step": 300
279
+ },
280
+ {
281
+ "epoch": 1.6349206349206349,
282
+ "grad_norm": 0.9483956694602966,
283
+ "learning_rate": 3.942412888419724e-05,
284
+ "loss": 1.1035,
285
+ "step": 400
286
+ },
287
+ {
288
+ "epoch": 1.6349206349206349,
289
+ "gen_lora_l1_norm": 0.004309813026338816,
290
+ "kl_loss": 0.96443772315979,
291
+ "step": 400
292
+ },
293
+ {
294
+ "epoch": 1.6349206349206349,
295
+ "gen_lora_l1_norm": 0.006539575755596161,
296
+ "kl_loss": 1.54787278175354,
297
+ "step": 400
298
+ },
299
+ {
300
+ "epoch": 1.6349206349206349,
301
+ "gen_lora_l1_norm": 0.004349768161773682,
302
+ "kl_loss": 1.1423686742782593,
303
+ "step": 400
304
+ },
305
+ {
306
+ "epoch": 1.6349206349206349,
307
+ "gen_lora_l1_norm": 0.005183862056583166,
308
+ "kl_loss": 1.3069700002670288,
309
+ "step": 400
310
+ },
311
+ {
312
+ "epoch": 1.6349206349206349,
313
+ "gen_lora_l1_norm": 0.004366028122603893,
314
+ "kl_loss": 0.9700032472610474,
315
+ "step": 400
316
+ },
317
+ {
318
+ "epoch": 1.6349206349206349,
319
+ "gen_lora_l1_norm": 0.004371432587504387,
320
+ "kl_loss": 0.8293535113334656,
321
+ "step": 400
322
+ },
323
+ {
324
+ "epoch": 1.6349206349206349,
325
+ "gen_lora_l1_norm": 0.0036595307756215334,
326
+ "kl_loss": 1.2910619974136353,
327
+ "step": 400
328
+ },
329
+ {
330
+ "epoch": 1.6349206349206349,
331
+ "gen_lora_l1_norm": 0.004372357856482267,
332
+ "kl_loss": 0.9109727740287781,
333
+ "step": 400
334
+ },
335
+ {
336
+ "epoch": 2.040962621607783,
337
+ "grad_norm": 0.913838803768158,
338
+ "learning_rate": 3.8978384875390766e-05,
339
+ "loss": 1.0673,
340
+ "step": 500
341
+ }
342
+ ],
343
+ "logging_steps": 100,
344
+ "max_steps": 4000,
345
+ "num_input_tokens_seen": 0,
346
+ "num_train_epochs": 17,
347
+ "save_steps": 250,
348
+ "stateful_callbacks": {
349
+ "TrainerControl": {
350
+ "args": {
351
+ "should_epoch_stop": false,
352
+ "should_evaluate": false,
353
+ "should_log": false,
354
+ "should_save": true,
355
+ "should_training_stop": false
356
+ },
357
+ "attributes": {}
358
+ }
359
+ },
360
+ "total_flos": 0.0,
361
+ "train_batch_size": 1,
362
+ "trial_name": null,
363
+ "trial_params": null
364
+ }
checkpoint-500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:82bfa23cfa703dfd984caf3ec0567ad70c88e206a8ae4381d28bfed0bd0da4d0
3
+ size 5496
debug.log CHANGED
@@ -2825,3 +2825,10 @@ Device: cuda:3
2825
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "POST /api/models/neopolita/doc-to-lora-ministral-3b-2512/preupload/main HTTP/1.1" 200 1155
2826
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/revision/main?expand=xetEnabled HTTP/1.1" 200 99
2827
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/xet-write-token/main HTTP/1.1" 200 386
 
 
 
 
 
 
 
 
2825
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "POST /api/models/neopolita/doc-to-lora-ministral-3b-2512/preupload/main HTTP/1.1" 200 1155
2826
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/revision/main?expand=xetEnabled HTTP/1.1" 200 99
2827
  2026-03-01 08:07:52 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/xet-write-token/main HTTP/1.1" 200 386
2828
+ 2026-03-01 08:08:09 DEBUG: https://huggingface.co:443 "POST /api/models/neopolita/doc-to-lora-ministral-3b-2512/commit/main HTTP/1.1" 200 212
2829
+ 2026-03-01 08:08:09 INFO: Checkpoint uploaded to https://huggingface.co/neopolita/doc-to-lora-ministral-3b-2512
2830
+ 2026-03-01 08:37:46 INFO: Uploading checkpoint at step 500 to neopolita/doc-to-lora-ministral-3b-2512...
2831
+ 2026-03-01 08:38:05 DEBUG: Resetting dropped connection: huggingface.co
2832
+ 2026-03-01 08:38:05 DEBUG: https://huggingface.co:443 "POST /api/models/neopolita/doc-to-lora-ministral-3b-2512/preupload/main HTTP/1.1" 200 2751
2833
+ 2026-03-01 08:38:06 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/revision/main?expand=xetEnabled HTTP/1.1" 200 99
2834
+ 2026-03-01 08:38:06 DEBUG: https://huggingface.co:443 "GET /api/models/neopolita/doc-to-lora-ministral-3b-2512/xet-write-token/main HTTP/1.1" 200 386
events.out.tfevents.1772350684.j-neopolita-69a3e406dfb316ac3f7c0a80-tuu1470p-784b1-cr29x.5286.0 CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f9541e35c29398878b60336dd7b2d3ccba2f197e16c244851403060699e002e3
3
- size 11261
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:16d51980739fda7db442b95ffa9362607a74557f328b820e3e64da0bcfc4549b
3
+ size 14502